Бенчмарки AI-моделей / SWE-bench Pro

SWE-bench Pro: что измеряет бенчмарк

SWE-bench Pro оценивает не короткую функцию, а полный процесс исправления issue в существующей кодовой базе: поиск контекста, изменение файлов и прохождение тестов.

Что проверяет SWE-bench Pro

Публикуется доля решённых задач. На результат влияют модель, агентный harness, доступные инструменты, лимит времени, контекст и правила запуска тестов.

Как читать результат

Корректно сравнивать результаты только на одной ревизии набора и при близких условиях. Название модели без описания scaffold недостаточно для воспроизводимости.

Ограничения бенчмарка

Бенчмарк покрывает ограниченный набор языков и проектов. Он не измеряет продуктовые решения, безопасность патча и стоимость многошагового запуска.

Первичный источник: SWE-bench Pro leaderboard.

Вопросы о SWE-bench Pro

Нужно понять большой репозиторий и подготовить рабочий патч, поэтому задачи существенно сложнее изолированных функций.

Это агентная оболочка: набор команд, редактор файлов, промпты, лимиты и логика повторных попыток.