Загружаем каталог…

Вопросы о каталоге AI-моделей

Сначала выберите интент — код, рассуждения, документы, изображения или агенты. Затем сравните профильные бенчмарки, цену полного запроса, контекст, инструменты и лицензию.

Универсального победителя нет: лидер теста по программированию может уступать в рассуждениях, знаниях, скорости или цене. Сравнивайте несколько профильных тестов и проверяйте финалистов на собственных запросах.

В каталоге вынесены популярные показатели LiveCodeBench, HumanEval, SWE-bench, GPQA, MMLU и Arena Elo. Каждый столбец показывает результат конкретного теста, а не сводную внутреннюю оценку.

Для этой модели в каталоге нет результата конкретного теста. Значения разных бенчмарков не смешиваются и не подставляются вместо отсутствующих данных.

Приоритет имеют официальные model cards, API-документация, технические отчёты и лидерборды. В карточке новой модели указываются источник, дата и характер оценки.

Это размер нейросети, но для MoE важны общие и активные параметры. Большее число само по себе не гарантирует лучшее качество или скорость.