Анастасия ПетроваАнастасия Петрова
Опубликовано: 9 октября 2026 г.3 мин

Яндекс открыл веса AliceAI-Foundation — базовой модели на 80 млрд параметров, обученной с нуля

AliceAI-Foundation-80B-A3B-Base — MoE на 80 млрд параметров с 3 млрд активных и контекстом 262K. Яндекс обучил её полностью с нуля и выложил под Apache 2.0 вместе с подробным техническим отчётом и двумя русскоязычными бенчмарками.

21 сентября 2026 года Яндекс открыл веса AliceAI-Foundation-80B-A3B-Base — базовой языковой модели, которую компания обучила полностью с нуля, без весов сторонних открытых моделей. Это MoE на 80 млрд параметров, из которых на токен активны 3 млрд, с контекстом 262 144 токена. Модель выложена на Hugging Face под лицензией Apache 2.0 вместе с подробным техническим отчётом на Хабре.

Что нового

  • Обучение с нуля. Предыдущую закрытую Alice AI LLM на 235 млрд параметров Яндекс обучал от весов Qwen3-235B-A22B. Новую модель компания сделала самостоятельно: пересобрала корпус, выбрала архитектуру и гиперпараметры, проверяя ключевые решения на отдельных обучениях по 2 трлн токенов. Весь путь до релиза занял около полугода.
  • Гибридная архитектура. В 36 из 48 слоёв работает линейное внимание Kimi Delta Attention, в 12 — Gated Attention. MoE-блоки содержат 512 экспертов, из которых активны 10 плюс один общий.
  • Сильные русскоязычные знания. В претрейн-замерах Яндекса модель первая на 8 из 10 тестов на факты, образование и экспертные знания: 86,5 на WikiWebFacts, 67,9 на HardMultiQA, 49,6 на юридическом ExpertFactsQA Law.
  • Математика и код. 91,1 на MATH-500, 88,7 на IMO-AnswerBench (pass@8) и 60,4 на LiveCodeBench v5-6 (pass@1) — лучшие результаты среди сравниваемых открытых базовых моделей.
  • Агентные данные в претрейне. Яндекс выяснил, что одного обучения рассуждениям недостаточно для агентских навыков, и добавил в предобучение взаимодействия с инструментами — это улучшило агентные бенчмарки после дообучения.

Бенчмарки

ТестAliceAI-FoundationAlice AI LLM 235B BaseDeepSeek-V4-Flash-Base
WikiWebFacts (RU)86.586.283.2
HardMultiQA (RU)67.965.965.4
EduBench Russian74.271.167.7
MATH-50091.172.680.7
LiveCodeBench v5-6, CoT50.515.438.1
FinQA 128K74.144.674.1

Все замеры Яндекс провёл в своей инфраструктуре на базовых моделях, few-shot, поэтому сравнивать их с результатами готовых ассистентов нельзя. Новая модель почти втрое меньше Alice AI LLM 235B и примерно в семь раз меньше по активным параметрам, но сильнее её в фактах, математике, коде и длинном контексте. Слабее она на англоязычных знаниях: на TriviaQA — 79,0 против 89,4 у DeepSeek-V4-Flash-Base.

Как использовать

Это претрейн без post-training и alignment: у модели нет единого формата диалога, и Яндекс прямо называет её основой для исследований и дообучения, а не готовым продуктом. Вместе с весами компания выложила шаблон данных для SFT и RL, пример LoRA-дообучения на четырёх GPU по 80 ГБ и Docker-образ для vLLM. Также Яндекс открыл два фактологических бенчмарка на русском — WikiWebFacts и HardMultiQA. По словам компании, AliceAI-Foundation — шаг к единой рассуждающей модели, на которой будут развиваться агентские возможности Алисы AI.

Где посмотреть все характеристики

Архитектура, полные таблицы бенчмарков и сравнение с другими открытыми моделями собраны в карточке AliceAI-Foundation-80B-A3B-Base в каталоге нейросетей. Полный список актуальных моделей — в каталоге ИИ-моделей Gruzdevv.ru.

Источник: технический отчёт Яндекса на Хабре.

Вопросы и ответы

Базовая языковая модель Яндекса: MoE на 80 млрд параметров, из которых на токен активны 3 млрд, с контекстом 262 144 токена. Она прошла только предобучение, без post-training, поэтому это основа для дообучения, а не готовый ассистент.

Под Apache 2.0. Веса доступны на Hugging Face, их можно дообучать и использовать в коммерческих проектах на условиях этой лицензии.

Alice AI LLM 235B, вышедшую в октябре 2025 года, Яндекс обучал от весов Qwen3-235B-A22B. AliceAI-Foundation обучена с нуля, у неё почти втрое меньше параметров и примерно в семь раз меньше активных, но в претрейн-замерах она сильнее в фактах, математике, коде и длинном контексте.

Яндекс приводит пример запуска в vLLM на четырёх GPU с тензорным параллелизмом; для LoRA-дообучения с FSDP2 — четыре GPU по 80 ГБ.

Автор новости

Анастасия Петрова — Контент-менеджер AI-раздела
Анастасия Петрова

Контент-менеджер AI-раздела

Отвечает за каталог нейросетей и AI-инструментов. Следит за обновлениями LLM-моделей, тестирует новые сервисы и ведёт раздел бесплатных инструментов.

Поделиться

Обсудить с ИИ

Комментарии(0)

Оставьте комментарий

Войдите, чтобы присоединиться к обсуждению

Читайте также