Бенчмарки AI-моделей / MATH

MATH: что измеряет бенчмарк

MATH содержит задачи по алгебре, геометрии, теории чисел, комбинаторике и другим разделам с несколькими уровнями сложности.

Что проверяет MATH

Метрика показывает долю задач с корректным финальным ответом при заданном prompting. Для reasoning-моделей режим вычислений и лимит токенов особенно сильно влияют на результат.

Как читать результат

Сравнивайте одну версию набора и одинаковые правила извлечения ответа. Нельзя смешивать результаты с инструментами, Python и без них.

Ограничения бенчмарка

Успех на формализованной математике не гарантирует точных расчётов в бизнес-документах или устойчивого объяснения на русском языке.

Первичный источник: Официальный репозиторий MATH.

Вопросы о MATH

Нет. Это разные наборы и уровни задач; их результаты нельзя складывать или напрямую заменять друг другом.

Модель может проверять вычисления кодом, поэтому такой прогон измеряет связку модели и инструмента.