Текущая2026-09-01

От Anthropic
Claude Fable 5.1 — самая мощная широко доступная модель Anthropic для сложного рассуждения, многошаговых исследований и длительной агентной разработки. Она принимает текст и изображения, возвращает текст, имеет контекст 1M, вывод до 128K и всегда включённое adaptive thinking. Для рискованных кибер- и биозапросов действуют дополнительные классификаторы и fallback на другие модели.
Для Claude Fable 5.1 пока нет совпавших результатов в подключённых публичных лидербордах. Исходные значения карточки не используются для G‑Score.
Показатели G‑Код, G‑Рассуждения, G‑Агенты и G‑Зрение рассчитаны по массовым таблицам LiveBench, Artificial Analysis и LMArena. Наведите или нажмите на значок рядом с оценкой, чтобы увидеть исходный лидерборд, вариант модели, значение и размер выборки.
Уверенность данных
низкая
Покрытие
0 тестов · 0 направлений
Происхождение
нет данных лидербордов
Место исходного бенчмарка показывается только при закреплённом source record и среди других карточек с источником. Эти старые значения не участвуют в G-Score лидербордов.
| Бенчмарк | Результат | Место | Доказательство |
|---|---|---|---|
| Humanity's Last Exam | 60.9% | 1 из 7 | Результат разработчика |
| OSWorld 2.0 (Компьютер) | 77.9% | 1 из 4 | Результат разработчика |
| Humanity's Last Exam с инструментами | 65% | 1 из 7 | Результат разработчика |
| Automation Bench | 31.4% | 4 из 5 | Внутренний тест разработчика |
| GDPval-AA v2 (Elo) | 1853 | 1 из 8 | Результат разработчика |
| OSWorld 2.0 strict pass rate | 41.7% | 1 из 1 | Результат разработчика |
| CursorBench 3.2.0 | 73.4% | 1 из 1 | Результат разработчика |
| Terminal-Bench 4.0 | 55.8% | 3 из 4 | Результат разработчика |
| Terminal-Bench-Science 0.1 | 52.6% | 1 из 1 | Результат разработчика |
Происхождение результатов
Terminal-Bench, OSWorld и HLE зависят от точной версии набора, tools, agent harness и stopping rules. OSWorld partial и strict — разные метрики; GDPval-AA v2 — Elo, а не процент точности. Вмешательства safeguards учитывались в опубликованных результатах.
Вариант: claude-fable-5-1, adaptive thinking max; production safeguards enabled · получено 2026-09-07
Claude Fable 5.1 стоит выбирать, когда агент должен часами исследовать данные, менять большой кодовый проект или доводить сложный документ до результата. Это самая способная общедоступная модель Anthropic, но она медленнее и вдвое дороже Claude Opus 5 по базовым токенам. Сначала стоит проверить Opus 5, а Fable 5.1 подключать при измеримом выигрыше.
Anthropic выпустила модель 1 сентября 2026 года. Идентификатор в Claude API — claude-fable-5-1; в Amazon Bedrock используется anthropic.claude-fable-5-1. Модель также доступна через Google Cloud, Microsoft Foundry и Claude Platform on AWS.
Fable 5.1 принимает текст и изображения, а возвращает текст. Она рассчитана на агентное программирование, многошаговый поиск, анализ документов, таблиц и презентаций. Надёжная граница знаний и граница обучающих данных — июнь 2026 года, но актуальные факты всё равно требуют поиска и цитат.
| Параметр | Значение |
|---|---|
| Контекст | 1 000 000 токенов по умолчанию |
| Максимальный вывод | 128 000 токенов |
| Вход → выход | текст и изображения → текст |
| Thinking | adaptive, всегда включён |
| Effort | low, medium, high, xhigh, max |
| Effort по умолчанию в API | high |
| Сравнительная задержка | slower |
| Статус | active, latest |
Миллион токенов позволяет передать крупный репозиторий или массив документов без отдельного beta-заголовка и без надбавки за длинный контекст. В это окно входят ввод, вывод и thinking-токены. Лимит 128K — жёсткий предел всего вывода: на xhigh и max часть бюджета может уйти на рассуждение до финального текста.
Отключить thinking или задать ручной budget_tokens нельзя: оба варианта вернут ошибку 400. Глубина работы регулируется через output_config.effort. high — разумная отправная точка; low и medium подходят для рутинных или чувствительных к задержке операций, xhigh и max — для наиболее сложного кодинга и длинных агентных запусков. Effort — поведенческий сигнал, а не гарантированный лимит токенов, поэтому уровни нужно сравнивать на собственном наборе задач.
Fable 5.1 поддерживает функции, structured outputs, web search и fetch, code execution, computer use, tool search и MCP. В Claude Code модель может читать репозиторий, запускать тесты и проверять визуальный результат. OpenRouter даёт единый API нескольких провайдеров, но наличие модели, цену и параметры посредника следует проверять перед запуском.
Есть важное несовместимое изменение: tool_choice со значениями any и tool не поддерживается. Остаются auto и none; для гарантии корректной JSON-схемы Anthropic рекомендует strict tool use или structured outputs. Перемещать thinking-блоки между моделями тоже нельзя без оговорок: Fable 5.1 читает блоки прежних Claude, но более ранние модели не читают её блоки. Редактирование старой истории может инвалидировать последующие thinking-блоки, поэтому длинный диалог лучше вести как append-only.
| Категория | Цена за 1 млн токенов |
|---|---|
| Обычный ввод | $10 |
| Вывод | $50 |
| Запись кэша на 5 минут | $12,50 |
| Запись кэша на 1 час | $20 |
| Чтение и обновление кэша | $0,25 |
Базовые ставки совпадают с Fable 5, но чтение кэша подешевело с $1 до $0,25 за миллион токенов. На длинных циклах это существенно: агент многократно перечитывает системный промпт, инструменты и историю. Оценка Anthropic — примерно на 25% дешевле Fable 5 для типичной нагрузки и до 45% для особенно насыщенных контекстом и инструментами процессов. Это расчёт поставщика по фактическому использованию с effort по умолчанию, а не гарантия для каждого приложения.
Message Batches API даёт скидку 50% на вход и выход и подходит для несрочной массовой обработки. US-only inference включается параметром inference_geo: "us" и добавляет коэффициент 1,1 ко всем токенным категориям, включая кэш. Глобальная маршрутизация остаётся вариантом по умолчанию. Цены партнёрских облаков могут отличаться.
| Тест и версия | Результат Fable 5.1 | Что важно знать |
|---|---|---|
| Terminal-Bench-Science 0.1 | 52,6% | 70 задач, Claude Code --bare, max effort |
| Terminal-Bench 4.0 | 55,8% | 66 задач, 15 прогонов на задачу, max effort |
| GDPval-AA v2 | 1853 Elo | 220 профессиональных задач, независимый прогон Artificial Analysis |
| OSWorld 2.0 | 77,9% partial; 41,7% strict | августовский набор 2026 года, 108 задач, пять прогонов |
| Humanity's Last Exam | 60,9% без tools; 65,0% с tools | 2500 вопросов, общий лимит 1M, без compaction |
| AutomationBench | 31,4% | max effort, закрытый held-out набор Zapier |
| CursorBench 3.2.0 | 73,4% | max effort, производственный harness Cursor |
Цифры нельзя читать как единый рейтинг. Terminal-Bench 4.0 получен в Claude Code: 990 запусков, стандартная ошибка ±1,6–2 пункта. У Terminal-Bench-Science ошибка выше — ±3,5–4,5 пункта при 700 запусках. CursorBench измерял модель внутри Cursor; старые версии теста несопоставимы.
OSWorld использовал разрешение 1080p, до 500 действий и набор задач августа 2026 года с последующими исправлениями. Поэтому его нельзя напрямую сравнивать с прежними публикациями OSWorld 2.0. В Humanity's Last Exam инструментальная конфигурация включала поиск, fetch, программные вызовы и исполнение кода, а ответы оценивал Claude Opus 4.6. Производственные safeguards были включены: в части тестов срабатывание защиты давало ноль или переводило задачу на Opus. Бенчмарки не измеряют качество русского текста, стабильность вашего окружения и стоимость человеческой проверки.
Fable 5.1 уместна для изменений через несколько сервисов, сложного рефакторинга, поиска первопричины редкой ошибки и автономных прогонов с тестами. Но высокий effort может расширять объём работы: в FrontierCode 1.1 модель на medium получила 50,9%, а более высокие уровни чаще добавляли полезные, но формально лишние изменения вне заданного scope. Нужны точные границы, проверки diff и запрет незапрошенных правок.
Модель сильна там, где нужно собрать источники, проанализировать файлы и выпустить документ, таблицу или презентацию. Контекст 1M снижает число разбиений, но не отменяет проверку цитат, формул и чисел. Для повторяющихся корпоративных задач выгодно кэшировать неизменный пакет инструкций и справочных материалов.
Результаты OSWorld и AutomationBench показывают прогресс, но строгий успех заметно ниже частичного. Агенту следует выдавать изолированную среду, минимальные права, allowlist доменов и явные точки подтверждения перед оплатой, отправкой сообщения или удалением данных.
Классификаторы Fable 5.1 могут остановить запрос по категориям cyber, bio, frontier LLM, извлечение внутреннего reasoning и общие риски. Отказ приходит как успешный HTTP 200 с stop_reason: "refusal"; частичный поток после такого события нужно считать незавершённым. Для защитной кибербезопасности ложных срабатываний стало меньше, но penetration testing, генерация эксплойтов и бинарный поиск уязвимостей могут перенаправляться на Opus.
В Claude API доступен beta-fallback: сервер или SDK повторяет отказанный запрос на разрешённой модели, для Fable 5.1 — Opus 4.8 либо Opus 5. Fallback credit компенсирует повторную запись prompt cache. В Batch server-side fallback и такой кредит не работают, поэтому отказы нужно собирать и отправлять новой партией.
Fable 5.1 относится к Covered Models и требует 30-дневного хранения данных. Zero Data Retention недоступен без отдельного письменного разрешения Anthropic; несовместимая конфигурация Claude API возвращает 400. Enterprise Frontier Safeguards должны дать подходящим корпоративным клиентам эквивалент ZDR в управляемой ими облачной инфраструктуре, но развёртывание идёт поэтапно. До передачи закрытого кода, персональных или медицинских данных нужно проверить договор и фактическую конфигурацию workspace.
Начинайте с Sonnet 5 для массовых быстрых операций ($2/$10 за миллион входных/выходных токенов), с Opus 5 — для сложного агентного кодинга и корпоративной работы ($5/$25), а Fable 5.1 оставляйте для задач, где качество Opus 5 уже не проходит ваш порог. Сравнивайте не один ответ, а долю полностью принятых результатов, стоимость всех повторов, задержку и время ревью. Для Fable проведите sweep medium → high → xhigh; max оправдан лишь измеримым приростом.
Нет. Adaptive thinking всегда включён. Управлять глубиной можно через пять уровней effort, но thinking: disabled и ручной budget_tokens вызывают ошибку.
Начните с high, затем проверьте medium на своих задачах. xhigh и max нужны, когда дополнительное качество окупает задержку и выходные токены.
Да. Окно 1M доступно по умолчанию и оплачивается по обычной ставке. Оно включает вход, thinking и вывод.
Через tool_choice: tool или any — нет. Опишите обязательность вызова в промпте, оставьте auto, а схему защитите strict tool use или structured outputs.
Стандартно нет: модель требует хранения данных 30 дней. Исключение возможно только после явного разрешения Anthropic или через доступную вашей организации корпоративную схему.
На него влияют effort, инструменты, harness, лимиты действий, версия набора, защитные классификаторы и оценщик. Повторяйте условия или создайте собственный eval на реальных задачах.
Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.
$10.00 / $50.00 за 1M токенов; cache read $0.25, 5m cache write $12.50, 1h cache write $20
Рассчитать сценарий →Для диаграммы пока недостаточно сопоставимых тестов.
История семейства
Последовательность собрана по датам релиза моделей Anthropic в каталоге. Она показывает соседние поколения, но не приписывает им совместимость или наследование архитектуры без отдельного источника.
Сервисы, инструменты, материалы и обсуждения, связанные с моделью.
Точных связей пока нет. Искать по разработчику.
Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.