Бенчмарки AI-моделей / Terminal-Bench

Terminal-Bench: что измеряет бенчмарк

Terminal-Bench проверяет, может ли агент использовать shell, файлы, пакеты и другие инструменты для достижения проверяемого результата.

Что проверяет Terminal-Bench

Итоговая доля успешных задач отражает связку модели и агентного harness. Версии 2.0 и 2.1 — разные срезы, поэтому в каталоге они хранятся отдельно.

Как читать результат

При сравнении нужны точная версия, образ окружения, таймаут, вычислительные ресурсы, число прогонов и настройки reasoning.

Ограничения бенчмарка

Высокий балл не означает, что агент безопасен для реальной машины. Production-система всё равно требует sandbox, allowlist действий и подтверждения опасных операций.

Первичный источник: Terminal-Bench.

Вопросы о Terminal-Bench

Нет напрямую: состав задач и методика различаются, поэтому это отдельные метрики.

Нет, результат зависит от модели, промпта, инструментов, агента и ресурсов среды.