Текущая2025-02-24

От Anthropic
Claude 3.7 Sonnet — это усовершенствованная модель большого языка с улучшенными возможностями рассуждения, кодирования и решения проблем. Он представляет гибридный подход к рассуждению, позволяющий пользователям выбирать между быстрым ответом и...
Для Claude 3.7 Sonnet пока нет совпавших результатов в подключённых публичных лидербордах. Исходные значения карточки не используются для G‑Score.
Показатели G‑Код, G‑Рассуждения, G‑Агенты и G‑Зрение рассчитаны по массовым таблицам LiveBench, Artificial Analysis и LMArena. Наведите или нажмите на значок рядом с оценкой, чтобы увидеть исходный лидерборд, вариант модели, значение и размер выборки.
Уверенность данных
низкая
Покрытие
0 тестов · 0 направлений
Происхождение
нет данных лидербордов
Место исходного бенчмарка показывается только при закреплённом source record и среди других карточек с источником. Эти старые значения не участвуют в G-Score лидербордов.
| Бенчмарк | Результат | Место | Доказательство |
|---|---|---|---|
| GPQA (Экспертные знания) | 75.4% | н/д | Источник не указан |
| MATH (Математика) | 85.8% | н/д | Источник не указан |
| MMLU (Общие знания) | 90.5% | н/д | Источник не указан |
| Arena Elo (LMSYS) | 1466 | н/д | Источник не указан |
| HumanEval (Кодинг) | 92.7% | н/д | Источник не указан |
| SWE-bench (Разработка) | 52.8% | н/д | Источник не указан |
Claude 3.7 Sonnet, представленная в феврале 2025 года, стала первой моделью от Anthropic, объединившей мгновенную генерацию с возможностью глубокого рассуждения. Это превратило Sonnet из простого чат-бота в мощнейший движок для автономных агентов.
Главная новинка — режим «Extended Thinking» (Расширенное мышление). Пользователь может сам устанавливать «бюджет на раздумья», позволяя модели тратить больше времени на планирование и верификацию ответов.
В режиме расширенного мышления Claude 3.7 Sonnet показывает результаты, ранее казавшиеся недостижимыми для моделей такого класса.
| Бенчмарк | Показатель | Описание |
|---|---|---|
| SWE-bench Verified | 70.3% | Мировой рекорд в решении задач на GitHub |
| GPQA Diamond | 84.8% | Глубокое понимание научной литературы |
| AIME 2024 | 80.0% | Олимпиадная математика |
| IFEval | 93.2% | Безупречное следование сложным промптам |
Anthropic сохранила агрессивную ценовую политику, делая Sonnet 3.7 доступной для широкого круга задач.
Плюсы:
Минусы:
Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.
История семейства
Последовательность собрана по датам релиза моделей Anthropic в каталоге. Она показывает соседние поколения, но не приписывает им совместимость или наследование архитектуры без отдельного источника.
Сервисы, инструменты, материалы и обсуждения, связанные с моделью.
Откройте результаты по названию модели и проверьте актуальную интеграцию.
Точных связей пока нет. Искать по разработчику.
Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.