Каталог AI-моделей

Методология G-Score и бенчмарков

G-Score использует массовые таблицы независимых площадок, полученные через Jina Reader. Исходные значения карточек без подтверждения не участвуют в оценке.

Факт

Для каждого значения сохраняются площадка, URL, дата сбора и точное имя варианта модели в исходной таблице.

Сравнение

Сборщик через Jina Reader читает массовые таблицы LiveBench, Artificial Analysis и LMArena, затем сопоставляет названия с карточками каталога. Каждая исходная метрика переводится в процентиль внутри своего лидерборда. G-Код, G-Рассуждения, G-Агенты и другие направления используют среднее доступных процентилей, а общий G-Score — текущие веса направлений с перераспределением веса отсутствующих данных. Старые неподтверждённые числа из ai-models.json в G-Score не входят.

Доверие

Результаты разработчика и внутренние тесты помечаются отдельно от независимых измерений.

Как считается G-Score

  1. Сборщик читает полные таблицы LiveBench, Artificial Analysis и LMArena через Jina Reader.
  2. Название варианта из лидерборда сопоставляется с одной карточкой каталога; неоднозначные строки пропускаются.
  3. Каждая метрика переводится в процентиль внутри своей исходной таблицы.
  4. Направления используют доступные процентили: код, рассуждения и agentic coding — LiveBench, зрение — LMArena Vision, общее качество — LiveBench Overall и Artificial Analysis Intelligence.
  5. Направления объединяются по весам ниже. Вес отсутствующего направления перераспределяется, пропуск не превращается в ноль.
НаправлениеВес
Общее качество10%
Код18%
Рассуждения16%
Агенты15%
Зрение11%
Работа с данными10%
Математика10%
Следование инструкциям5%
Язык5%

Что означают профильные G-оценки

G-Код, G-Рассуждения, G-Агенты и G-Зрение — оценки Gruzdevv.ru по отдельным направлениям. Это не новые бенчмарки: они показывают место модели внутри подключённой публичной таблицы.

В подсказке перечислены площадка, имя варианта, исходное значение, процентиль P и размер таблицы n. Если совпадения нет, каталог выводит «н/д».

Что означает уверенность

Уверенность не повышает и не понижает G-Score. Она рассчитывается отдельно по числу найденных показателей, покрытых направлений и размеру исходных таблиц.

Поэтому модель может иметь высокий G-Score и среднюю либо низкую уверенность. Это сигнал проверить первичные таблицы и собственный набор задач, а не скрывать модель из каталога.

Справочник бенчмарков

Для основных тестов подготовлены отдельные разборы: что измеряется, как читать значение и какие ограничения есть у методики. Открыть справочник бенчмарков →

Что нельзя заключить из рейтинга

Бенчмарк не гарантирует качество на конкретном проекте. Результат зависит от версии модели, промпта, reasoning-режима, доступных инструментов, лимита токенов и evaluation harness.

Как выбирается модель

  1. Выберите профиль задачи: код, рассуждения, агенты, зрение или русский язык.
  2. Сравните несколько тестов внутри одного профиля.
  3. Проверьте цену полного запроса, контекст, лицензию и место размещения данных.
  4. Запустите собственный набор реальных и граничных примеров.

Как сообщить об ошибке

Если значение устарело или относится к другой версии модели, создайте обсуждение из карточки модели и приложите первичный источник.