Каталог AI-моделей / Бенчмарки
Бенчмарки AI-моделей
Краткие разборы объясняют, что измеряет каждый тест, как читать результат и почему одинаковое название без версии и условий запуска ещё не делает цифры сопоставимыми.
Справочник тестов
Arena Elo (LMSYS)
Рейтинг по слепым попарным голосованиям пользователей за ответы моделей.
MMLU
Академический тест общих знаний и решения задач по 57 дисциплинам.
HumanEval
Набор коротких Python-задач с автоматической проверкой решения тестами.
MATH
Сложные школьные и олимпиадные математические задачи с проверяемым ответом.
SWE-bench Pro
Сложные задачи разработки в реальных репозиториях с проверкой патча.
Terminal-Bench
Оценка автономного выполнения практических задач в терминальной среде.
GPQA Diamond
Сложные вопросы уровня graduate по биологии, физике и химии.
OSWorld-Verified
Проверяемые задачи управления реальными приложениями в desktop-среде.
GDPval-AA v2
Elo-оценка качества выполнения экономически значимых профессиональных задач.
MRCR v2
Проверка извлечения нескольких скрытых фактов из очень длинного контекста.