
Gemini 3.1 Pro Preview
от Google
Gemini
Proprietary
CTX1M
PARНе раскрыто
ProGeneralText
HumanEval 95%SWE-bench 55.7%GPQA 82%MMLU 98.9%
Для программирования сравнивайте не один общий рейтинг, а профиль модели: HumanEval и MBPP показывают решение коротких задач, SWE-bench — работу с реальными репозиториями, TerminalBench — действия в терминале. Для продакшена дополнительно учитывайте цену, контекст и поддержку инструментов. Телеграм-бот fLLMs мониторит бесплатные API-ключи в роутерах.
Значение показывается только там, где для модели есть результат конкретного теста · Методология и источники
Подборка моделей для генерации кода, работы с репозиториями, терминалом и автономной разработки.























