
AI-модели для автономных агентов
Для агента важны не только знания модели, но и устойчивость tool calling, работа с длинным контекстом и восстановление после ошибок. Смотрите MCP Atlas, Toolathlon, BrowseComp и OSWorld, а затем проверяйте модель в реальном наборе инструментов. Телеграм-бот fLLMs мониторит бесплатные API-ключи в роутерах.
Значение показывается только там, где для модели есть результат конкретного теста · Методология и источники
Подборка моделей для браузерных агентов, MCP, tool calling и длинных автономных сценариев.
Модели: Для AI-агентов
Найдено: 41 моделейСтраница 2 из 2









SWE-1.7
от Cognition
SWE
Proprietary
CTX500K (xAI API); 256K (Cursor)
PARНе раскрыто
CodingReasoningAgentic

Claude Sonnet 5
от Anthropic
Claude
Proprietary
CTX1M
PARНе раскрыто
TextAgenticCoding
HumanEval 94.8%SWE-bench 63.2%GPQA 76%MMLU 94.2%
Seed 2.1
от ByteDance
Seed
Proprietary
CTX128K
PARНе раскрыто
TextProductivityAgentic
HumanEval 88%GPQA 68%MMLU 91.5%Arena Elo 1410

GLM-5.2
от Z.ai
GLM
Open Weight
CTX1M
PARНе раскрыто
TextCodingAgentic
HumanEval 93.5%SWE-bench 62.1%GPQA 74%MMLU 93.8%

Claude Fable 5
от Anthropic
Claude
Proprietary
CTX1M
PARНе раскрыто
TextAgenticReasoning
HumanEval 97.2%SWE-bench 80.3%GPQA 82%MMLU 96.1%



Grok 4.20 Multi-Agent
от xAI
Grok
Proprietary
CTX2M
PARНе раскрыто
StandardGeneralText
HumanEval 90.9%SWE-bench 58%GPQA 68.8%MMLU 88.9%

GLM 5 Turbo
от Z.ai
Other
Proprietary
CTX203K
PARНе раскрыто
StandardGeneralText
HumanEval 91.9%SWE-bench 64%GPQA 58.6%MMLU 82.1%