Методология G-Score и бенчмарков
G-Score использует массовые таблицы независимых площадок, полученные через Jina Reader. Исходные значения карточек без подтверждения не участвуют в оценке.
Факт
Для каждого значения сохраняются площадка, URL, дата сбора и точное имя варианта модели в исходной таблице.
Сравнение
Сборщик через Jina Reader читает массовые таблицы LiveBench, Artificial Analysis и LMArena, затем сопоставляет названия с карточками каталога. Каждая исходная метрика переводится в процентиль внутри своего лидерборда. G-Код, G-Рассуждения, G-Агенты и другие направления используют среднее доступных процентилей, а общий G-Score — текущие веса направлений с перераспределением веса отсутствующих данных. Старые неподтверждённые числа из ai-models.json в G-Score не входят.
Доверие
Результаты разработчика и внутренние тесты помечаются отдельно от независимых измерений.
Как считается G-Score
- Сборщик читает полные таблицы LiveBench, Artificial Analysis и LMArena через Jina Reader.
- Название варианта из лидерборда сопоставляется с одной карточкой каталога; неоднозначные строки пропускаются.
- Каждая метрика переводится в процентиль внутри своей исходной таблицы.
- Направления используют доступные процентили: код, рассуждения и agentic coding — LiveBench, зрение — LMArena Vision, общее качество — LiveBench Overall и Artificial Analysis Intelligence.
- Направления объединяются по весам ниже. Вес отсутствующего направления перераспределяется, пропуск не превращается в ноль.
| Направление | Вес |
|---|---|
| Общее качество | 10% |
| Код | 18% |
| Рассуждения | 16% |
| Агенты | 15% |
| Зрение | 11% |
| Работа с данными | 10% |
| Математика | 10% |
| Следование инструкциям | 5% |
| Язык | 5% |
Что означают профильные G-оценки
G-Код, G-Рассуждения, G-Агенты и G-Зрение — оценки Gruzdevv.ru по отдельным направлениям. Это не новые бенчмарки: они показывают место модели внутри подключённой публичной таблицы.
В подсказке перечислены площадка, имя варианта, исходное значение, процентиль P и размер таблицы n. Если совпадения нет, каталог выводит «н/д».
Что означает уверенность
Уверенность не повышает и не понижает G-Score. Она рассчитывается отдельно по числу найденных показателей, покрытых направлений и размеру исходных таблиц.
Поэтому модель может иметь высокий G-Score и среднюю либо низкую уверенность. Это сигнал проверить первичные таблицы и собственный набор задач, а не скрывать модель из каталога.
Справочник бенчмарков
Для основных тестов подготовлены отдельные разборы: что измеряется, как читать значение и какие ограничения есть у методики. Открыть справочник бенчмарков →
Что нельзя заключить из рейтинга
Бенчмарк не гарантирует качество на конкретном проекте. Результат зависит от версии модели, промпта, reasoning-режима, доступных инструментов, лимита токенов и evaluation harness.
Как выбирается модель
- Выберите профиль задачи: код, рассуждения, агенты, зрение или русский язык.
- Сравните несколько тестов внутри одного профиля.
- Проверьте цену полного запроса, контекст, лицензию и место размещения данных.
- Запустите собственный набор реальных и граничных примеров.
Как сообщить об ошибке
Если значение устарело или относится к другой версии модели, создайте обсуждение из карточки модели и приложите первичный источник.