Бенчмарки AI-моделей / MMLU
MMLU: что измеряет бенчмарк
MMLU проверяет ответы с выбором варианта по школьным, университетским и профессиональным дисциплинам — от математики до права и медицины.
Что проверяет MMLU
Основная метрика — доля правильных ответов. Бенчмарк полезен как широкий срез знаний, но не показывает качество длинного диалога, работы с инструментами и современных событий.
Как читать результат
Сравнивать следует одинаковые версии MMLU и одинаковый режим prompting. Разница между zero-shot, few-shot и chain-of-thought прогоном может быть существенной.
Ограничения бенчмарка
Набор появился до многих современных моделей, частично насыщен и подвержен загрязнению обучающих данных. Высокий MMLU не гарантирует отсутствие галлюцинаций.
Первичный источник: Официальный репозиторий MMLU.
Вопросы о MMLU
В заявленной конфигурации модель правильно ответила примерно на 90% выбранных вопросов, но это не 90% точности на любых пользовательских задачах.
Нет, оригинальный набор англоязычный; для русского нужны MMLU-RU, MERA и собственные примеры.