Методология G-Score и бенчмарков
Каталог отделяет измеренное качество от уверенности в данных. G-Score помогает сортировать модели по нескольким направлениям, а отдельная метка уверенности показывает ширину покрытия и происхождение результатов.
Факт
Число хранится вместе с названием теста; для новых данных добавляются источник, дата и вариант модели.
Сравнение
Для каждого бенчмарка считается процентиль модели среди карточек с результатом той же версии теста. Процентили сначала усредняются внутри девяти компетенций, затем собираются в G-Score по опубликованным весам: код 18%, рассуждения 16%, агенты 15%, зрение 11%, общее качество, знания и математика по 10%, следование инструкциям и языки по 5%. Вес отсутствующей компетенции перераспределяется между доступными, а пропуск не становится нулём. Уверенность показывается отдельно и зависит от числа тестов, числа покрытых компетенций и происхождения данных.
Доверие
Результаты разработчика и внутренние тесты помечаются отдельно от независимых измерений.
Как считается G-Score
- Для каждого теста берётся только числовой результат и сравнивается с результатами той же версии теста в каталоге.
- Позиция переводится в процентиль: 80 означает, что модель находится выше примерно 80% карточек с сопоставимым результатом.
- Процентили усредняются внутри направления, чтобы тесты разных единиц измерения не складывались напрямую.
- Направления объединяются по весам ниже. Если у модели нет направления, его вес перераспределяется между доступными, а пропуск не превращается в ноль.
| Направление | Вес |
|---|---|
| Общее качество | 10% |
| Код | 18% |
| Рассуждения | 16% |
| Агенты | 15% |
| Зрение | 11% |
| Знания | 10% |
| Математика | 10% |
| Следование инструкциям | 5% |
| Языки и русский | 5% |
Что означает уверенность
Уверенность не повышает и не понижает сам G-Score. Она рассчитывается отдельно по числу сопоставимых тестов, числу покрытых направлений и происхождению данных. Независимый источник даёт более сильный сигнал, результат разработчика помечается как такой, а запись без закреплённого источника не может получить высокую уверенность.
Поэтому модель может иметь высокий G-Score и среднюю либо низкую уверенность. Это сигнал проверить первичные таблицы и собственный набор задач, а не скрывать модель из каталога.
Справочник бенчмарков
Для основных тестов подготовлены отдельные разборы: что измеряется, как читать значение и какие ограничения есть у методики. Открыть справочник бенчмарков →
Что нельзя заключить из рейтинга
Бенчмарк не гарантирует качество на конкретном проекте. Результат зависит от версии модели, промпта, reasoning-режима, доступных инструментов, лимита токенов и evaluation harness.
Как выбирается модель
- Выберите профиль задачи: код, рассуждения, агенты, зрение или русский язык.
- Сравните несколько тестов внутри одного профиля.
- Проверьте цену полного запроса, контекст, лицензию и место размещения данных.
- Запустите собственный набор реальных и граничных примеров.
Как сообщить об ошибке
Если значение устарело или относится к другой версии модели, создайте обсуждение из карточки модели и приложите первичный источник.