Бенчмарки AI-моделей / MRCR v2
MRCR v2: что измеряет бенчмарк
MRCR v2 измеряет, насколько точно модель находит и связывает нужные элементы среди большого количества похожего контента.
Что проверяет MRCR v2
Результат показывает практическую устойчивость long-context retrieval. Указанное в паспорте окно 1M само по себе не гарантирует высокий балл.
Как читать результат
Важно сравнивать одинаковую длину контекста, число needles и версию набора. Срез 128K и полный прогон являются разными экспериментами.
Ограничения бенчмарка
Синтетическое извлечение фактов не полностью моделирует анализ юридического архива, репозитория или пакета PDF со сложной структурой.
Первичный источник: Google DeepMind Eval Hub.
Вопросы о MRCR v2
Нет. Размер окна показывает допустимый объём ввода, а MRCR — насколько хорошо модель реально извлекает сведения из него.
Это целевой фрагмент, скрытый среди большого объёма отвлекающего текста.