Бенчмарки AI-моделей / SWE-bench Pro
SWE-bench Pro: что измеряет бенчмарк
SWE-bench Pro оценивает не короткую функцию, а полный процесс исправления issue в существующей кодовой базе: поиск контекста, изменение файлов и прохождение тестов.
Что проверяет SWE-bench Pro
Публикуется доля решённых задач. На результат влияют модель, агентный harness, доступные инструменты, лимит времени, контекст и правила запуска тестов.
Как читать результат
Корректно сравнивать результаты только на одной ревизии набора и при близких условиях. Название модели без описания scaffold недостаточно для воспроизводимости.
Ограничения бенчмарка
Бенчмарк покрывает ограниченный набор языков и проектов. Он не измеряет продуктовые решения, безопасность патча и стоимость многошагового запуска.
Первичный источник: SWE-bench Pro leaderboard.
Вопросы о SWE-bench Pro
Нужно понять большой репозиторий и подготовить рабочий патч, поэтому задачи существенно сложнее изолированных функций.
Это агентная оболочка: набор команд, редактор файлов, промпты, лимиты и логика повторных попыток.