
AI-модели для рассуждений
Для сложных рассуждений ориентируйтесь на GPQA и Humanity’s Last Exam, для математики — на MATH и AIME. Высокий балл не гарантирует точность на ваших данных, поэтому важные ответы необходимо проверять и тестировать на собственной выборке. Телеграм-бот fLLMs мониторит бесплатные API-ключи в роутерах.
Значение показывается только там, где для модели есть результат конкретного теста · Методология и источники
Модели для многошагового анализа, математики, науки и задач, где важна проверяемая цепочка рассуждений.
Модели: Для рассуждений
Найдено: 162 моделейСтраница 2 из 7







SWE-1.7
от Cognition
SWE
Proprietary
CTX500K (xAI API); 256K (Cursor)
PARНе раскрыто
CodingReasoningAgentic

GigaChat 3.5 Ultra
от Sber
GigaChat
Open Source
CTX128K
PAR432B (28B активных)
FlagshipRussianMoE
HumanEval 80.49%SWE-bench 42.6%GPQA 30.81%MMLU 85.28%

Claude Sonnet 5
от Anthropic
Claude
Proprietary
CTX1M
PARНе раскрыто
TextAgenticCoding
HumanEval 94.8%SWE-bench 63.2%GPQA 76%MMLU 94.2%

GLM-5.2
от Z.ai
GLM
Open Weight
CTX1M
PARНе раскрыто
TextCodingAgentic
HumanEval 93.5%SWE-bench 62.1%GPQA 74%MMLU 93.8%

Claude Fable 5
от Anthropic
Claude
Proprietary
CTX1M
PARНе раскрыто
TextAgenticReasoning
HumanEval 97.2%SWE-bench 80.3%GPQA 82%MMLU 96.1%


Claude Opus 4.8
от Anthropic
Claude
Proprietary
CTX1M
PARНе раскрыто
ProGeneralMultimodal
HumanEval 88.4%SWE-bench 69.2%GPQA 78.5%MMLU 96.5%


Laguna M.1 (free)
от Poolside
Other
Proprietary
CTX131K
PARНе раскрыто
StandardGeneralText
HumanEval 93.2%SWE-bench 66.1%GPQA 69.9%MMLU 87.1%

Nemotron 3 Nano Omni (free)
от NVIDIA
NVIDIA
Proprietary
CTX256K
PARНе раскрыто
StandardReasoningText
HumanEval 88.6%SWE-bench 61.3%GPQA 63.5%MMLU 83.6%

Google Gemini Pro Latest
от Google
Gemini
Proprietary
CTX1M
PARНе раскрыто
ProGeneralText
HumanEval 97.7%SWE-bench 59.6%GPQA 71.1%MMLU 91.3%

MoonshotAI Kimi Latest
от Moonshot AI
Kimi
Proprietary
CTX262K
PARНе раскрыто
StandardGeneralMultimodal
HumanEval 82%SWE-bench 51.1%GPQA 65.6%MMLU 84.7%

GPT-5.5 Pro
от OpenAI
GPT
Proprietary
CTX1M
PARНе раскрыто
ProGeneralText
HumanEval 99%SWE-bench 72.6%GPQA 84.6%MMLU 99.9%

MiMo-V2.5-Pro
от Xiaomi
Other
Proprietary
CTX1M
PARНе раскрыто
ProGeneralText
HumanEval 99%SWE-bench 69.6%GPQA 68.5%MMLU 91.7%

GPT-5.4 Image 2
от OpenAI
GPT
Proprietary
CTX272K
PARНе раскрыто
StandardGeneralText
HumanEval 89.5%SWE-bench 50.5%GPQA 71%MMLU 90.3%

Claude Opus 4.6 (Fast)
от Anthropic
Claude
Proprietary
CTX1M
PARНе раскрыто
ProGeneralMultimodal
HumanEval 99%SWE-bench 73.3%GPQA 70.9%MMLU 94.9%

Gemma 4 31B
от Google
Other
Proprietary
CTX262K
PAR31B
StandardGeneralText
HumanEval 90.8%SWE-bench 51.9%GPQA 68.5%MMLU 89.2%

Trinity Large Thinking
от Arcee AI
Other
Proprietary
CTX262K
PARНе раскрыто
ProReasoningText
HumanEval 95.2%SWE-bench 63.3%GPQA 65.5%MMLU 88.2%