Бенчмарки AI-моделей / HumanEval

HumanEval: что измеряет бенчмарк

HumanEval оценивает способность модели дописать функцию по условию и пройти скрытые unit-тесты. Обычно публикуется pass@1 или pass@k.

Что проверяет HumanEval

Бенчмарк хорошо показывает генерацию небольших изолированных алгоритмов. Он не моделирует навигацию по большому репозиторию, запуск терминала и исправление связанных файлов.

Как читать результат

Перед сравнением проверьте pass@k, температуру, число сэмплов и разрешено ли выполнение кода. Одинаковый процент при разных настройках не является одинаковым экспериментом.

Ограничения бенчмарка

Набор невелик, широко известен и мог попасть в обучающие данные. Для production coding полезнее дополнять его SWE-bench, Terminal-Bench и тестами на собственном проекте.

Первичный источник: Официальный репозиторий HumanEval.

Вопросы о HumanEval

pass@1 оценивает первое решение, а pass@10 — вероятность получить хотя бы одно верное среди десяти вариантов.

Он проверяет прохождение тестов, но почти не оценивает архитектуру, безопасность, читаемость и поддержку кода.