Бенчмарки AI-моделей / Terminal-Bench
Terminal-Bench: что измеряет бенчмарк
Terminal-Bench проверяет, может ли агент использовать shell, файлы, пакеты и другие инструменты для достижения проверяемого результата.
Что проверяет Terminal-Bench
Итоговая доля успешных задач отражает связку модели и агентного harness. Версии 2.0 и 2.1 — разные срезы, поэтому в каталоге они хранятся отдельно.
Как читать результат
При сравнении нужны точная версия, образ окружения, таймаут, вычислительные ресурсы, число прогонов и настройки reasoning.
Ограничения бенчмарка
Высокий балл не означает, что агент безопасен для реальной машины. Production-система всё равно требует sandbox, allowlist действий и подтверждения опасных операций.
Первичный источник: Terminal-Bench.
Вопросы о Terminal-Bench
Нет напрямую: состав задач и методика различаются, поэтому это отдельные метрики.
Нет, результат зависит от модели, промпта, инструментов, агента и ресурсов среды.