Бенчмарки AI-моделей / HumanEval
HumanEval: что измеряет бенчмарк
HumanEval оценивает способность модели дописать функцию по условию и пройти скрытые unit-тесты. Обычно публикуется pass@1 или pass@k.
Что проверяет HumanEval
Бенчмарк хорошо показывает генерацию небольших изолированных алгоритмов. Он не моделирует навигацию по большому репозиторию, запуск терминала и исправление связанных файлов.
Как читать результат
Перед сравнением проверьте pass@k, температуру, число сэмплов и разрешено ли выполнение кода. Одинаковый процент при разных настройках не является одинаковым экспериментом.
Ограничения бенчмарка
Набор невелик, широко известен и мог попасть в обучающие данные. Для production coding полезнее дополнять его SWE-bench, Terminal-Bench и тестами на собственном проекте.
Первичный источник: Официальный репозиторий HumanEval.
Вопросы о HumanEval
pass@1 оценивает первое решение, а pass@10 — вероятность получить хотя бы одно верное среди десяти вариантов.
Он проверяет прохождение тестов, но почти не оценивает архитектуру, безопасность, читаемость и поддержку кода.