Каталог AI-моделей

Методология бенчмарков AI-моделей

Каталог отделяет измеренные значения от редакционного вывода. Мы показываем источник, вариант модели и дату получения там, где эти сведения доступны, и не считаем результаты разных тестов напрямую взаимозаменяемыми.

Факт

Число хранится вместе с названием теста; для новых данных добавляются источник, дата и вариант модели.

Сравнение

Для каждого бенчмарка считается процентиль модели среди карточек с результатом того же теста. Затем процентили усредняются внутри отдельной компетенции. Тесты разных компетенций, версии и единицы измерения не складываются в единый «магический» балл; при числе сопоставимых тестов меньше трёх показатель не рассчитывается.

Доверие

Результаты разработчика и внутренние тесты помечаются отдельно от независимых измерений.

Справочник бенчмарков

Для основных тестов подготовлены отдельные разборы: что измеряется, как читать значение и какие ограничения есть у методики. Открыть справочник бенчмарков →

Что нельзя заключить из рейтинга

Бенчмарк не гарантирует качество на конкретном проекте. Результат зависит от версии модели, промпта, reasoning-режима, доступных инструментов, лимита токенов и evaluation harness.

Как выбирается модель

  1. Выберите профиль задачи: код, рассуждения, агенты, зрение или русский язык.
  2. Сравните несколько тестов внутри одного профиля.
  3. Проверьте цену полного запроса, контекст, лицензию и место размещения данных.
  4. Запустите собственный набор реальных и граничных примеров.

Как сообщить об ошибке

Если значение устарело или относится к другой версии модели, создайте обсуждение из карточки модели и приложите первичный источник.