Бенчмарки AI-моделей / MRCR v2

MRCR v2: что измеряет бенчмарк

MRCR v2 измеряет, насколько точно модель находит и связывает нужные элементы среди большого количества похожего контента.

Что проверяет MRCR v2

Результат показывает практическую устойчивость long-context retrieval. Указанное в паспорте окно 1M само по себе не гарантирует высокий балл.

Как читать результат

Важно сравнивать одинаковую длину контекста, число needles и версию набора. Срез 128K и полный прогон являются разными экспериментами.

Ограничения бенчмарка

Синтетическое извлечение фактов не полностью моделирует анализ юридического архива, репозитория или пакета PDF со сложной структурой.

Первичный источник: Google DeepMind Eval Hub.

Вопросы о MRCR v2

Нет. Размер окна показывает допустимый объём ввода, а MRCR — насколько хорошо модель реально извлекает сведения из него.

Это целевой фрагмент, скрытый среди большого объёма отвлекающего текста.