Бенчмарки AI-моделей / MMLU

MMLU: что измеряет бенчмарк

MMLU проверяет ответы с выбором варианта по школьным, университетским и профессиональным дисциплинам — от математики до права и медицины.

Что проверяет MMLU

Основная метрика — доля правильных ответов. Бенчмарк полезен как широкий срез знаний, но не показывает качество длинного диалога, работы с инструментами и современных событий.

Как читать результат

Сравнивать следует одинаковые версии MMLU и одинаковый режим prompting. Разница между zero-shot, few-shot и chain-of-thought прогоном может быть существенной.

Ограничения бенчмарка

Набор появился до многих современных моделей, частично насыщен и подвержен загрязнению обучающих данных. Высокий MMLU не гарантирует отсутствие галлюцинаций.

Первичный источник: Официальный репозиторий MMLU.

Вопросы о MMLU

В заявленной конфигурации модель правильно ответила примерно на 90% выбранных вопросов, но это не 90% точности на любых пользовательских задачах.

Нет, оригинальный набор англоязычный; для русского нужны MMLU-RU, MERA и собственные примеры.