Опубликовано: 21 июля 2026 г.

**Заголовок:** Самодистиллированные рассуждения (SDR) при тонкой настройке Amazon Nova: как сохранить общие способности и повысить точность

AWS предложила метод SDR для самостоятельной генерации цепочек мыслей, предотвращающий катастрофическое забывание при тонкой настройке.

**Текст:**
Тонкая настройка моделей на специфических наборах данных часто приводит к катастрофическому забыванию: модель теряет способность рассуждать, даже если вы явно включаете режим reasoning. Это происходит, когда в тренировочных данных нет цепочек мыслей (CoT-трасс). Компания AWS предложила простое и бесплатное решение — самодистиллированные рассуждения (Self-Distilled Reasoning, SDR). Метод заключается в том, что модель сама генерирует для себя же reasoning-трассы на этапе предобработки, после чего дообучение идёт с включённым режимом рассуждений. Такой подход не требует ручной разметки, совместим с любыми датасетами и одинаково эффективен на разных предметных областях.

### Проблема: когда модель перестаёт думать
Стандартное обучение с учителем (SFT) на наборах данных без reasoning-трасс приводит к тому, что модель «срезает путь» и перестаёт генерировать промежуточные рассуждения. Это не только снижает точность, но и ведёт к полной потере общих навыков (например, счёт падает с 70% до 6% на математике). Ранее проблему частично решали слиянием моделей (model merging), но он требует ручной настройки весов и всегда компромисс между целевой метрикой и сохранением общих способностей.

### Как работает SDR
Процесс состоит из трёх этапов:
1. Для каждого примера из SFT-датасета базовая модель (Amazon Nova 2 Lite) генерирует reasoning-трассу.
2. Трасса добавляется в данные как токены рассуждений перед ответом.
3. Модель дообучается с включённым режимом reasoning.

При этом можно использовать как прямое рассуждение («основной» режим), так и так называемое guided reasoning, когда модель восстанавливает правдоподобную цепочку мыслей на основе верного ответа. Во втором случае накладывается дополнительный фильтр, чтобы ответ не «протекал» в саму трассу. Для генерации используется Amazon Bedrock Converse API с параметрами: температура 0,3, topP 0,9, topK 50.

### Результаты экспериментов
Исследователи AWS протестировали SDR на трёх непересекающихся бенчмарках: MedMCQA (медицинские вопросы), CoCoHD (извлечение структурированных данных из стенограмм конгресса) и Invoice-OCR (распознавание счетов). На каждом наборе сравнивали чистый SFT, SFT со слиянием моделей и SDR.

**Ключевые цифры:**
- На MedMCQA SFT без reasoning и без слияния даёт 63,8% точности на целевой задаче и 0% на математике (потеря способности). SDR с трассами от Nova 2 Lite — 66,6% и 67,9% соответственно. Эффект сравним со слиянием, но без ручного подбора весов.
- На CoCoHD SDR с «руководящим» типом трасс даёт 61,3% целевой точности против 61,3% у чистого SFT и 59,3% у слияния, при этом математика сохраняется на уровне 65,8% (vs 6,3% и 70% соответственно).
- На Invoice-OCR SDR немного уступает чистому SFT по целевой метрике (86,1% vs 88,1%), зато математика остаётся на 67,1% вместо 9,6%.

То есть SDR позволяет удерживать общую способность к рассуждению (math ~68%) и одновременно прибавлять к целевой задаче в среднем 6,5% относительно лучшего слияния.

### Частичное наличие reasoning: когда данных с трассами мало
В реальных проектах часто только часть SFT-набора содержит цепочки мыслей — остальные примеры это просто пары «вопрос–ответ». Абляция на датасете LLaVA CoT (задача MathVista) показала: если доля примеров с трассами падает ниже 75%, метрика Math (контроль) обрушивается с 66,6% до 3,3%, а при 0% — до 2,5%. SDR полностью предотвращает этот коллапс: математика остаётся в диапазоне 65–71% независимо от доли трасс. Более того, модель обучается активнее использовать reasoning на инференсе: с SDR даже при нулевом количестве человеческих трасс модель генерирует в среднем 859 токенов рассуждения (без SDR — 0). При включении режима reasoning на инференсе точность MathVista примерно удваивается (с ~20% до ~40–47%).

### Рекомендации для практиков
AWS предлагает таблицу решений: если у вас стандартный новый SFT и вы замечаете регресс по общим способностям, выбирайте SDR с трассами от Amazon Nova 2 Lite (при возможности держать reasoning на инференсе) — это даёт лучший баланс. Когда базовая модель слаба в целевой области, используйте guided reasoning. Если датасет уже содержит не менее 50% reasoning-трасс, можно включать reasoning при тренировке и обойтись без SDR. При доле менее 50% потеря общих навыков неминуема, если не заполнить пропуски предсгенерированными трассами. При этом более сильный учитель (Amazon Nova 2 Pro) может дать больший прирост на целевой задаче, но ценой заметного падения общих метрик — поэтому основной вариант именно Lite. SDR также хорошо подходит для сценариев continual learning, когда модель доучивается на новых навыках, не забывая старые.

Метод не требует человеческой аннотации, легко встраивается в существующий пайплайн и позволяет обойтись без пост-обработки (слияния). Учитывая нулевую стоимость и стабильный эффект на нескольких бенчмарках, самодистилляция становится полезным инструментом при тонкой настройке моделей Amazon Nova.

Источник: https://aws.amazon.com/blogs/machine-learning/exploring-self-distilled-reasoning-for-supervised-fine-tuning-with-amazon-nova/

Поделиться

Обсудить с ИИ

Комментарии(0)

Оставьте комментарий

Войдите, чтобы присоединиться к обсуждению

Читайте также