
o1
от OpenAI
Other
Proprietary
CTX200K
PARНе раскрыто
StandardReasoningText
HumanEval 92%SWE-bench 56.8%GPQA 60.6%MMLU 85.1%
Для сложных рассуждений ориентируйтесь на GPQA и Humanity’s Last Exam, для математики — на MATH и AIME. Высокий балл не гарантирует точность на ваших данных, поэтому важные ответы необходимо проверять и тестировать на собственной выборке. Телеграм-бот fLLMs мониторит бесплатные API-ключи в роутерах.
Значение показывается только там, где для модели есть результат конкретного теста · Методология и источники
Модели для многошагового анализа, математики, науки и задач, где важна проверяемая цепочка рассуждений.












