
Оркестрация моделей Codex: задачи для Sol, Terra и Luna
Короткий ответ: Luna стоит назначать чётким массовым операциям с автоматической проверкой, Terra — основной повседневной разработке и анализу, Sol — неоднозначным многошаговым задачам и решениям с высокой ценой ошибки.

Короткий ответ: Luna стоит назначать чётким массовым операциям с автоматической проверкой, Terra — основной повседневной разработке и анализу, Sol — неоднозначным многошаговым задачам и решениям с высокой ценой ошибки. Оркестрация в этом контексте — явные правила выбора модели, делегирования подзадач, эскалации и проверки результата. Это не название подтверждённого скрытого маршрутизатора OpenAI, который якобы сам гарантированно подбирает лучший вариант для каждого запроса.
Все характеристики и условия ниже проверены 6 сентября 2026 года. Доступность отдельных переключателей зависит от плана, клиента, способа входа, политики рабочего пространства и этапа раскатки.
Что именно оркестрировать
У оркестратора пять обязанностей: определить класс задачи, выбрать модель и уровень рассуждения, выдать только нужные инструменты, проверить результат и решить, завершить работу или передать её более сильной модели. Оркестратором может быть сам человек, главный агент Codex, правила проекта, subagent-конфигурация или код вокруг OpenAI API.
Официально описаны ручной выбор модели, отдельная модель для subagent, наследование настроек и автоматическая делегация в режиме Ultra для подходящих аккаунтов. Политика вида «Luna обрабатывает извлечение, Terra пишет патч, Sol принимает архитектурное решение» остаётся вашей схемой. Её нужно записать и измерить.
| Механизм | Где задаётся | Что контролирует | Что нужно фиксировать |
|---|---|---|---|
| Ручной выбор | переключатель под полем ввода, /model, --model или -m |
модель текущей задачи | model ID, reasoning effort, цель запуска |
| Делегирование subagent | прямой запрос, проектная инструкция или custom agent | модель и роль отдельной подзадачи | владелец, вход, ожидаемый артефакт, срок |
| Правила маршрутизации | task manifest, код приложения, AGENTS.md или skill | соответствие класса задачи модели | версия правил и причина выбора |
| Эскалация | quality gate или решение reviewer | повтор с уточнённым контрактом либо переход к Terra/Sol | ошибка, прошлые попытки, новый критерий |
| Fallback | обработчик timeout, rate limit или недоступности | допустимая замена модели | причина, предел повторов, влияние на качество |
Sol, Terra и Luna: сравнение на одной странице
Все три модели принимают текст и изображения, возвращают текст, поддерживают reasoning tokens, streaming, function calling и Structured Outputs. В Responses API для них заявлены web search, file search, code interpreter, hosted shell, apply patch, skills, computer use, MCP и tool search. Наличие возможности у модели ещё не даёт агенту право применить её: набор инструментов и побочные эффекты ограничивают клиент, sandbox, approval policy и настройки рабочего пространства.
| Параметр | GPT-5.6 Sol | GPT-5.6 Terra | GPT-5.6 Luna |
|---|---|---|---|
| Model ID | gpt-5.6-sol; alias gpt-5.6 |
gpt-5.6-terra |
gpt-5.6-luna |
| Позиционирование | flagship для complex professional work | баланс intelligence и cost, уровень прежнего mini | cost-sensitive high-volume, уровень прежнего nano |
| Основная роль | сложное планирование, отладка, архитектура, финальная проверка | повседневная разработка, исследование, ревью, документы | классификация, извлечение, форматирование, короткие патчи |
| API reasoning effort | none, low, medium, high, xhigh, max |
тот же набор | тот же набор |
| Default effort в API model card | medium |
medium |
medium |
| Контекст | 1 050 000 токенов | 1 050 000 токенов | 1 050 000 токенов |
| Максимальный output | 128 000 токенов | 128 000 токенов | 128 000 токенов |
| Knowledge cutoff | 16 февраля 2026 года | 16 февраля 2026 года | 16 февраля 2026 года |
| API input / cached / output за 1 млн токенов | $4 / $0,40 / $20 | $2 / $0,20 / $12 | $0,20 / $0,02 / $1,20 |
Параметры сверены с каталогом моделей OpenAI. Для запросов с входом более 272 000 токенов у каждой из трёх моделей весь запрос тарифицируется по повышенной схеме: input в 2 раза, output в 1,5 раза. Запись в cache стоит 1,25 от ставки uncached input. У Sol текущая цена обозначена как промо как минимум до 21 ноября 2026 года.
Когда выбирать Luna
Luna выгодна, когда вход, выход и проверка заранее формализованы. Подходящие примеры: распределить тикеты по десяти категориям, извлечь поля в JSON Schema, переименовать однотипные ключи, проверить ссылки, свести результаты тестов, подготовить краткие карточки по готовым фактам. Ошибку должен ловить код: schema validator, unit test, контрольная сумма, обязательный список полей.
Большое контекстное окно не превращает Luna в лучший вариант для любой большой задачи. Миллион токенов исходников можно технически передать одной модели, но неопределённые требования, противоречия и высокий радиус изменений всё равно требуют более сильного рассуждения. Кроме того, вход свыше 272 000 токенов меняет тарификацию. Часто дешевле передать Luna небольшие независимые пакеты, а не один шумный репозиторий целиком.
Когда выбирать Terra
Terra — рабочая модель по умолчанию для большинства контролируемых задач: изучить несколько модулей, реализовать обычную функцию, написать тесты, найти причину локальной ошибки, сравнить документы, подготовить техническое резюме, проверить большой набор файлов. Она подходит и для параллельных исследователей, которые возвращают главному агенту не сырые логи, а короткие выводы со ссылками на артефакты.
Выбирайте Terra, если Luna уже требует длинных инструкций, нескольких повторов или постоянного ручного исправления. Экономия на цене токена исчезает, когда дешёвый запуск приходится трижды переделывать.
Когда выбирать Sol
Sol нужен там, где ошибку трудно обнаружить автоматически: неоднозначная архитектура, сложная отладка, миграция с несколькими системами, конфликтующие требования, большой радиус регрессии, план с внешними инструментами, security review или итоговое решение после нескольких ветвей исследования. Sol также полезен как reviewer, если исполнители работали параллельно и нужно проверить согласованность общего результата.
Sol не обязательно выполнять всю рутину. Хорошая схема оставляет ему постановку, спорные решения и финальный quality gate, а повторяемые части отдаёт Terra и Luna.
Где доступны модели и как считается расход
В ChatGPT desktop и ChatGPT Work на вебе модель и глубину рассуждения выбирают под полем ввода. В интерактивном Codex CLI доступны /model и запуск с -m; та же опция работает в codex exec. В IDE и поддерживаемых интерфейсах Codex есть переключатель модели. Конкретный список может отличаться у двух пользователей с одинаковым названием плана. Читать полный обзор сервиса ChatGPT.
| Поверхность | Что подтверждено на 6 сентября 2026 года | Важное ограничение |
|---|---|---|
| ChatGPT desktop | ручной выбор доступной модели и reasoning; видна работа subagents | набор зависит от аккаунта и rollout |
| ChatGPT Work web | model/reasoning control; subagents для подходящих аккаунтов | Ultra и отдельные tiers доступны не всем |
| Codex CLI | /model, --model и -m; можно указать точный model ID |
доступ следует способу входа и аккаунту |
| IDE extension | выбор модели и subagent workflows | UI и список зависят от версии клиента |
| Codex cloud | cloud chats на ChatGPT plans сейчас используют Sol | могут расходовать allowance быстрее local message |
| OpenAI API | Sol, Terra и Luna документированы для Responses и Chat Completions | у API key отдельный доступ, rate limits и долларовый биллинг |
Plus включает семейство GPT-5.6, в том числе Sol, Terra и Luna. Pro добавляет исследовательский preview GPT-5.3-Codex-Spark. Для Enterprise набор может ограничивать администратор. Страница цен ChatGPT Work и Codex подчёркивает, что видимая модель зависит также от клиента и этапа раскатки.
Подписка ChatGPT, credits и API — разные контуры
Плата за ChatGPT-план даёт включённый объём Codex/ChatGPT Work. После его исчерпания подходящие планы могут расходовать ChatGPT credits. API key оплачивается по API-тарифу в долларах и не превращает подписочный allowance в API-баланс. И наоборот, API-баланс не увеличивает лимит облачных функций ChatGPT: с API key доступны локальные CLI, SDK и IDE, но не облачный code review или Slack-интеграция.
Оценки локальных сообщений за скользящее пятиичасовое окно показывают порядок величин, а не обещанный лимит:
| Модель | Plus / Standard Business | Pro 5x | Pro 20x | API key |
|---|---|---|---|---|
| Sol | 10–100 | 50–500 | 200–2 000 | по токенам |
| Terra | 25–200 | 125–1 000 | 500–4 000 | по токенам |
| Luna | 250–2 000 | 1 250–10 000 | 5 000–40 000 | по токенам |
Local messages и cloud chats делят allowance; могут действовать недельные ограничения. Реальный расход меняют контекст, reasoning, вызовы инструментов, retrieval и кэширование. Поэтому две внешне похожие задачи могут списать разный объём.
На credit-based планах ставки за 1 млн input / cached input / output токенов составляют:
| Модель | Input credits | Cached input credits | Output credits |
|---|---|---|---|
| Sol | 100 | 10 | 500 |
| Terra | 50 | 5 | 300 |
| Luna | 5 | 0,5 | 30 |
Среднее для сообщения семейства GPT-5.6 указано широким диапазоном 5–30 credits. Планируйте бюджет по токенам собственного корпуса и сверяйте текущий dashboard, а не умножайте «число сообщений» на одну постоянную.
Дерево выбора модели
Начинайте с цены ошибки и проверяемости результата:
- Вход и выход заданы схемой, задача повторяется, результат проверяет код? Берите Luna с
lowилиmedium. - Нужно изучить несколько файлов, применить обычный патч, написать тесты или свести источники? Берите Terra с
medium; повышайте доhigh, если есть ветвящаяся логика и крайние случаи. - Требования конфликтуют, план состоит из многих зависимых шагов, решение влияет на архитектуру, безопасность или production? Берите Sol с
highилиxhigh. - Ошибка прошла quality gate? Сначала улучшите входной контракт и приложите доказательства сбоя. Затем повторите один раз или поднимите tier: Luna → Terra → Sol.
- Даже Sol не даёт стабильного результата на контрольном корпусе? Разделите задачу, добавьте внешний validator или эскалируйте отдельное сложнейшее решение в Astra.
Не повышайте reasoning только «для надёжности». Более высокий effort увеличивает время и расход токенов. medium — разумная отправная точка; high полезен для сложной логики и проверки допущений; xhigh и max требуют измеримого выигрыша на eval. В интерфейсах Codex может появляться Ultra: этот режим использует максимальное рассуждение и subagents для параллельной работы, поэтому его расход нельзя сравнивать с одиночным max как с одинаковым запуском.
Где заканчивается основная тройка
Astra — вариант эскалации для самых сложных end-to-end задач, где Sol не проходит контрольный набор или требуется более сильное суждение при работе с кодом, приложениями и исследованием. У неё выше цена, а доступ зависит от rollout и плана.
GPT-5.3-Codex-Spark решает другую проблему: почти мгновенная интерактивная итерация кода. Это text-only research preview для Pro с отдельным лимитом; на старте он не доступен через API. Spark может ускорить короткий цикл «попросил — увидел», но не заменяет Luna как массовую бюджетную модель и Sol как глубокого reviewer.
Архитектурные шаблоны оркестрации
Planner, executor, reviewer
Сильный planner превращает запрос в независимые работы, назначает owner и формулирует критерии приёмки. Исполнители получают только относящиеся к ним файлы и ограничения. Reviewer проверяет общий результат, а не пересказывает ответы исполнителей.
| Роль | Типичная модель | Вход | Выход | Gate |
|---|---|---|---|---|
| Planner | Sol | цель, ограничения, карта системы | task manifest с владельцами и зависимостями | нет пересечений и «ничейных» требований |
| Explorer | Terra | конкретные модули или источники, read-only tools | краткие выводы, пути, доказательства | все существенные тезисы имеют опору |
| Bounded executor | Luna | узкий контракт, schema, тест | один артефакт или структурированный результат | schema/test/checksum |
| General executor | Terra | ограниченный набор файлов и acceptance criteria | патч, документ или анализ | targeted tests и scope check |
| Reviewer | Sol | manifest, diff, результаты gates, открытые вопросы | accept, точечная доработка или escalation | нет critical failures |
Если вся работа мала и последовательна, отдельный planner и reviewer могут стоить дороже самой задачи. Оркестрация окупается на повторяемом потоке, дорогих ошибках и независимых ветвях.
Параллельное исследование
Fan-out подходит для независимых областей: один агент читает API, второй изучает безопасность, третий проверяет тарифы. Каждый возвращает одинаковый evidence contract: тезис, источник, дата, статус verified/conflicted/unknown, короткая цитируемая опора. Главный агент объединяет повторы и разрешает противоречия.
Не выдавайте нескольким агентам один и тот же вопрос без причины. Для снижения вариативности независимое повторение полезно на рискованном выводе; для обычного сбора оно только дублирует токены. У каждой ветви должны быть уникальный ID, owner и границы.
Последовательный конвейер
Некоторые стадии зависят друг от друга и должны идти строго по очереди:
intake → classify → research → implement → validate → review → external-action gate
Luna может классифицировать вход и нормализовать данные, Terra — исследовать и реализовать, Sol — разобрать конфликт и проверить высокий риск. Переход на следующую стадию разрешает артефакт, а не уверенный тон модели. Например, implementation завершается только после тестов, research — после таблицы источников, публикация — после отдельного разрешения.
Модель на инструмент и уровень риска
Модель выбирают по сложности мысли, permissions — по допустимому действию. Luna с доступом к production остаётся опаснее Sol в read-only sandbox. Разделяйте роли:
| Роль | Разрешённые инструменты | Запрещённое действие без gate |
|---|---|---|
| Researcher | поиск, чтение URL, read-only repo | запись в БД, отправка формы, изменение файла |
| Executor | чтение и scoped workspace write | deploy, push, purchase, удаление данных |
| Reviewer | чтение diff, тестов и артефактов | исправление собственного вывода без новой проверки |
| Operator | один конкретный side-effecting tool | действие вне точной цели и одобренных аргументов |
Для API-интеграции проверяйте аргументы инструмента на сервере. Описание tool и промпт помогают модели выбрать вызов, но не заменяют авторизацию, проверку tenant, лимит суммы, idempotency key и allowlist ресурсов.
Retry, fallback и quality gate
Повтор нужен при временном timeout, сетевом сбое или rate limit. Ошибка в логике требует другого действия: уточнить контракт, сократить контекст, добавить validator либо повысить tier. Бесконечный retry обычно воспроизводит ту же ошибку и создаёт retry storm.
Практичная политика выглядит так:
- не более одного автоматического повтора на transient error с exponential backoff;
- ни одного автоматического повтора side effect без idempotency key и read-back;
- один ремонтный запуск после validation failure с приложенным отчётом проверки;
- эскалация в следующий tier после повторного содержательного сбоя;
- остановка и запрос человеку при исчерпанном бюджете, конфликте требований или необратимом действии.
Fallback должен быть направленным. Если Luna недоступна, безопасная массовая операция может перейти на Terra с новым cost cap. Если Sol недоступен, нельзя молча поручить Terra архитектурное решение, заявить прежний уровень проверки и продолжить production-операцию. Верните статус degraded или отложите критический gate.
Передача контекста без дублирования работы
Subagent не нужен полный transcript. Ему нужен task packet: цель, входные файлы, ограничения, уже принятые решения, критерии готовности, запреты, путь для результата и формат краткого отчёта. Сырые логи остаются в отдельном артефакте.
Для команды полезен manifest:
task_id: api-rate-limit-audit
owner: explorer-2
model: gpt-5.6-terra
reasoning: medium
inputs:
- docs/rate-limits.md
output: work/api-rate-limit-audit.md
acceptance:
- every claim has a source and date
- unknown limits stay unknown
permissions: read-only
status: in_progress
До запуска проверяйте task_id, input hash и status. Один файл должен иметь одного writer. Параллельные агенты хорошо читают разные области, но одновременная запись в общий модуль создаёт конфликты и непредсказуемый итог.
AGENTS.md хранит стабильные правила проекта: команды тестирования, области ответственности, требования к секретам и условия внешних действий. Codex собирает инструкции от глобального уровня к текущей папке; более близкие правила перекрывают общие. Этот файл не заменяет handoff: текущий status, уже выполненные попытки и конкретный output path должны находиться в manifest или рабочем артефакте.
Сколько может стоить один и тот же корпус
Возьмём 100 одинаковых задач. Каждая использует 20 000 uncached input и 4 000 output токенов. Общий объём — 2 млн input и 0,4 млн output. Расчёт ниже не включает инструменты, cache writes, retries и long-context multiplier.
| Политика | Распределение задач | Расчёт API | Стоимость |
|---|---|---|---|
| Только Sol | 100 Sol | 2 × 4 + 0,4 × 20 |
$16,00 |
| Только Terra | 100 Terra | 2 × 2 + 0,4 × 12 |
$8,80 |
| Только Luna | 100 Luna | 2 × 0,2 + 0,4 × 1,2 |
$0,88 |
| Маршрутизация | 70 Luna, 25 Terra, 5 Sol | 0,616 + 2,20 + 0,80 |
$3,62 |
Последняя строка дешевле all-Terra только при условии, что routing верно распознаёт задачи и Luna проходит quality gate. Если 20 дешёвых запусков приходится повторить на Terra, стоимость и задержка растут. Поэтому оптимизируют не цену вызова, а стоимость успешно принятой задачи:
cost_per_accepted_task = total_model_and_tool_cost / accepted_tasks
Параллельность сокращает wall-clock time для независимых ветвей, но сама по себе не уменьшает токены. Установите предел concurrent threads, общий credit cap, per-task token cap и очередь. Неизвестное default-значение concurrency нельзя подменять выдуманным числом.
Безопасность: prompt injection, permissions и секреты
Внешняя страница, README, issue, tool output и даже файл репозитория могут содержать инструкцию, которая конфликтует с целью пользователя. Считайте такие данные недоверенными. Исследователь извлекает факты, но не получает право менять конфигурацию, отправлять данные или расширять сеть из-за текста внутри источника.
| Риск | Как проявляется | Защита |
|---|---|---|
| Prompt injection | страница просит игнорировать правила или раскрыть данные | разделить instructions и data, allowlist источников, read-only researcher, проверка перед tool call |
| Избыточные tools | агент может вызвать deploy, delete или send без необходимости | минимальный набор tools на роль, approval для side effects |
| Утечка секрета | ключ попадает в prompt, transcript, артефакт или trace | scoped credential, redaction, отдельное хранилище, secret не передаётся модели |
| Наследование прав | subagent получает permissions parent | выбирать permission mode до делегирования, отдельный read-only agent |
| Повтор внешнего действия | timeout скрывает успешную отправку, retry создаёт дубль | idempotency key, read-back, статус unknown_outcome |
| Общая рабочая папка | два агента перезаписывают один файл | один writer, отдельные пути или worktree, merge через reviewer |
Локально sandbox определяет, что процесс технически может сделать, а approval policy — когда нужно остановиться и запросить разрешение. Subagents наследуют текущий permission mode. В cloud secrets доступны setup script и удаляются до agent phase, тогда как обычные environment variables остаются на весь chat. Поэтому API keys и пароли не следует маскировать под env vars, если агенту они не нужны.
Кэшированный web search снижает контакт с произвольным live-контентом, но результаты всё равно остаются недоверенными. При включённой сети ограничивайте домены и проверяйте источник. Модель более высокого tier не отменяет prompt injection.
Типичные сбои оркестрации
| Сбой | Ранний признак | Исправление |
|---|---|---|
| Неверная классификация | Luna получает неоднозначную архитектурную задачу | добавить признаки риска и preflight classifier confidence |
| Context pollution | главный чат заполнен логами и сырыми страницами | хранить детали в артефактах, возвращать краткую сводку |
| Потеря решений при handoff | новый агент повторяет исследование | передавать decision log, evidence и completed steps |
| Дублирование | два owner выполняют один task ID | атомарный claim, status и input hash |
| Конфликт записей | параллельные агенты меняют общий файл | сериализовать writes, разделить пути, финальный merge |
| Коррелированная ошибка | executor и reviewer повторяют одно допущение | независимый reviewer, внешний test и первичный источник |
| Retry storm | число попыток растёт без нового входа | hard cap, классификация transient/content failure |
| Бюджет исчерпан в середине | очередь запущена без reserve | per-stage budget, reserve для reviewer и critical retry |
| Alias изменил поведение | качество дрейфует без изменения кода | логировать model ID/дату, держать regression corpus |
| Fallback скрывает деградацию | отчёт не показывает замену Sol на Terra | status degraded, причина и повторный high-risk gate |
Воспроизводимый eval harness
Не выбирайте модель по одному удачному демо. Соберите 20–50 реальных задач нескольких классов: извлечение, небольшой патч, исследование репозитория, отладка, архитектурное решение и security review. Заморозьте вход, prompt, tools, permissions, reasoning effort и acceptance criteria. Для оценки вариативности выполните 3–5 повторов каждой конфигурации в случайном порядке.
Измеряйте:
- долю задач, прошедших tests и schema validation;
- critical error rate и нарушения scope;
- p50 и p95 end-to-end latency;
- input, cached input, output и reasoning tokens;
- стоимость принятой задачи и число retries;
- успешность tool calls и дубли side effects;
- долю ручных эскалаций и решений reviewer, отменивших результат.
Результаты ниже намеренно пусты: публичные model cards не дают чисел для вашего корпуса, а перенос чужого benchmark создаст ложную точность.
| Класс задачи | Модель / effort | Запусков | Pass rate | Critical errors | p50 latency | p95 latency | Cost/task | Escalations |
|---|---|---|---|---|---|---|---|---|
| Извлечение в JSON | Luna / medium | — | — | — | — | — | — | — |
| Обычный патч | Terra / medium | — | — | — | — | — | — | — |
| Repo exploration | Terra / medium | — | — | — | — | — | — | — |
| Сложная отладка | Sol / high | — | — | — | — | — | — | — |
| Архитектурное решение | Sol / xhigh | — | — | — | — | — | — | — |
| Mixed route | Luna → Terra → Sol | — | — | — | — | — | — | — |
Сначала сравните all-Terra baseline с маршрутизацией. Затем меняйте только один фактор: model tier, effort, prompt или gate. Иначе станет непонятно, что улучшило результат. Человек должен вслепую оценить спорные примеры; модель не должна быть единственным судьёй собственного ответа.
Вывод
Рабочая отправная точка проста: Luna для узких и проверяемых операций, Terra для основной очереди, Sol для неопределённости и дорогих ошибок. Экономия появляется, когда дешёвые ветви имеют жёсткий контракт, а Sol включается по явному триггеру. Параллельность используйте для независимого чтения и анализа; общие записи и внешние действия сериализуйте.
Хорошая оркестрация видна в журнале: почему выбрана модель, какой effort применён, что было передано, чем проверен результат, сколько стоил принятый ответ и почему случилась эскалация. Если эти поля отсутствуют, у команды есть набор моделей, но ещё нет управляемой системы.
Автор статьи

Контент-менеджер AI-раздела
Отвечает за каталог нейросетей и AI-инструментов. Следит за обновлениями LLM-моделей, тестирует новые сервисы и ведёт раздел бесплатных инструментов.
Вопросы и ответы
Пользователь может выбрать модель вручную, а subagent — получить модель из явного запроса, project defaults, custom agent или наследования от parent. Ultra умеет проактивно делегировать подходящую параллельную работу. Универсальный документированный hidden router, автоматически оптимизирующий каждую локальную задачу между тремя моделями, не описан.
В OpenAI API alias gpt-5.6 направляет запросы к GPT-5.6 Sol. Для воспроизводимости записывайте фактический model ID и дату запуска; alias может быть удобнее для автоматического обновления, точный идентификатор — для контроля изменений.
Да. В Codex модель и reasoning effort subagent можно задать явно, через defaults секции [agents] или в project/personal custom agent. Если настройки отсутствуют, subagent наследует parent model и effort.
Нет единого общего баланса. ChatGPT-план включает allowance Codex/ChatGPT Work и может поддерживать ChatGPT credits. API key оплачивает usage по отдельным долларовым API-тарифам. Дополнительный локальный запуск с API key не увеличивает подписочный лимит.
Model card заявляет image input, function calling, Structured Outputs и набор инструментов Responses API, включая search, code interpreter, shell, MCP и computer use. Доступ в конкретном клиенте ограничивают план, политика workspace, sandbox и выданный список tools.
Нет. Контекст определяет вместимость запроса, но не устраняет шум, конфликт записей и стоимость повторного чтения. Subagents полезны для независимых ветвей, когда возвращают компактные сводки и отдельные артефакты.
Нет. Более высокий effort увеличивает время и токены, а Ultra может добавить subagent calls. Повышайте уровень, если контрольный корпус показывает выигрыш в pass rate или снижение критических ошибок, достаточное для дополнительной стоимости.
Обычно он уменьшает календарное время, но добавляет отдельные model/tool calls. Стоимость снизится только при лучшей специализации, меньшем контексте на ветвь или меньшем числе переделок.
Дайте ему read-only tools, очищенный task packet и только нужные источники. Не помещайте ключи в prompt, общий transcript, manifest и trace. Для cloud используйте secrets по назначению: они доступны setup script и удаляются до agent phase.
Сначала классифицируйте сбой и проверьте, не завершилось ли side effect фактически. Для transient error допустим ограниченный retry с backoff. Для недоступной модели примените явный fallback с новым бюджетом и статусом degraded; high-risk gate не понижайте молча.
Astra — эскалация для самых трудных end-to-end задач и решений, на которых Sol не проходит eval. Spark — быстрый text-only preview для интерактивного кодинга на подходящем Pro-аккаунте. Основной бюджетный поток по-прежнему удобно строить вокруг Luna, Terra и Sol.




Комментарии(0)
Оставьте комментарий
Войдите, чтобы присоединиться к обсуждению