Методология бенчмарков AI-моделей
Каталог отделяет измеренные значения от редакционного вывода. Мы показываем источник, вариант модели и дату получения там, где эти сведения доступны, и не считаем результаты разных тестов напрямую взаимозаменяемыми.
Факт
Число хранится вместе с названием теста; для новых данных добавляются источник, дата и вариант модели.
Сравнение
Для каждого бенчмарка считается процентиль модели среди карточек с результатом того же теста. Затем процентили усредняются внутри отдельной компетенции. Тесты разных компетенций, версии и единицы измерения не складываются в единый «магический» балл; при числе сопоставимых тестов меньше трёх показатель не рассчитывается.
Доверие
Результаты разработчика и внутренние тесты помечаются отдельно от независимых измерений.
Справочник бенчмарков
Для основных тестов подготовлены отдельные разборы: что измеряется, как читать значение и какие ограничения есть у методики. Открыть справочник бенчмарков →
Что нельзя заключить из рейтинга
Бенчмарк не гарантирует качество на конкретном проекте. Результат зависит от версии модели, промпта, reasoning-режима, доступных инструментов, лимита токенов и evaluation harness.
Как выбирается модель
- Выберите профиль задачи: код, рассуждения, агенты, зрение или русский язык.
- Сравните несколько тестов внутри одного профиля.
- Проверьте цену полного запроса, контекст, лицензию и место размещения данных.
- Запустите собственный набор реальных и граничных примеров.
Как сообщить об ошибке
Если значение устарело или относится к другой версии модели, создайте обсуждение из карточки модели и приложите первичный источник.