Бенчмарки AI-моделей / MATH
MATH: что измеряет бенчмарк
MATH содержит задачи по алгебре, геометрии, теории чисел, комбинаторике и другим разделам с несколькими уровнями сложности.
Что проверяет MATH
Метрика показывает долю задач с корректным финальным ответом при заданном prompting. Для reasoning-моделей режим вычислений и лимит токенов особенно сильно влияют на результат.
Как читать результат
Сравнивайте одну версию набора и одинаковые правила извлечения ответа. Нельзя смешивать результаты с инструментами, Python и без них.
Ограничения бенчмарка
Успех на формализованной математике не гарантирует точных расчётов в бизнес-документах или устойчивого объяснения на русском языке.
Первичный источник: Официальный репозиторий MATH.
Вопросы о MATH
Нет. Это разные наборы и уровни задач; их результаты нельзя складывать или напрямую заменять друг другом.
Модель может проверять вычисления кодом, поэтому такой прогон измеряет связку модели и инструмента.