Каталог AI-моделей

Методология G-Score и бенчмарков

Каталог отделяет измеренное качество от уверенности в данных. G-Score помогает сортировать модели по нескольким направлениям, а отдельная метка уверенности показывает ширину покрытия и происхождение результатов.

Факт

Число хранится вместе с названием теста; для новых данных добавляются источник, дата и вариант модели.

Сравнение

Для каждого бенчмарка считается процентиль модели среди карточек с результатом той же версии теста. Процентили сначала усредняются внутри девяти компетенций, затем собираются в G-Score по опубликованным весам: код 18%, рассуждения 16%, агенты 15%, зрение 11%, общее качество, знания и математика по 10%, следование инструкциям и языки по 5%. Вес отсутствующей компетенции перераспределяется между доступными, а пропуск не становится нулём. Уверенность показывается отдельно и зависит от числа тестов, числа покрытых компетенций и происхождения данных.

Доверие

Результаты разработчика и внутренние тесты помечаются отдельно от независимых измерений.

Как считается G-Score

  1. Для каждого теста берётся только числовой результат и сравнивается с результатами той же версии теста в каталоге.
  2. Позиция переводится в процентиль: 80 означает, что модель находится выше примерно 80% карточек с сопоставимым результатом.
  3. Процентили усредняются внутри направления, чтобы тесты разных единиц измерения не складывались напрямую.
  4. Направления объединяются по весам ниже. Если у модели нет направления, его вес перераспределяется между доступными, а пропуск не превращается в ноль.
НаправлениеВес
Общее качество10%
Код18%
Рассуждения16%
Агенты15%
Зрение11%
Знания10%
Математика10%
Следование инструкциям5%
Языки и русский5%

Что означает уверенность

Уверенность не повышает и не понижает сам G-Score. Она рассчитывается отдельно по числу сопоставимых тестов, числу покрытых направлений и происхождению данных. Независимый источник даёт более сильный сигнал, результат разработчика помечается как такой, а запись без закреплённого источника не может получить высокую уверенность.

Поэтому модель может иметь высокий G-Score и среднюю либо низкую уверенность. Это сигнал проверить первичные таблицы и собственный набор задач, а не скрывать модель из каталога.

Справочник бенчмарков

Для основных тестов подготовлены отдельные разборы: что измеряется, как читать значение и какие ограничения есть у методики. Открыть справочник бенчмарков →

Что нельзя заключить из рейтинга

Бенчмарк не гарантирует качество на конкретном проекте. Результат зависит от версии модели, промпта, reasoning-режима, доступных инструментов, лимита токенов и evaluation harness.

Как выбирается модель

  1. Выберите профиль задачи: код, рассуждения, агенты, зрение или русский язык.
  2. Сравните несколько тестов внутри одного профиля.
  3. Проверьте цену полного запроса, контекст, лицензию и место размещения данных.
  4. Запустите собственный набор реальных и граничных примеров.

Как сообщить об ошибке

Если значение устарело или относится к другой версии модели, создайте обсуждение из карточки модели и приложите первичный источник.