Mixture of Experts (MoE)
Mixture of Experts (MoE) — архитектура нейросети с несколькими специализированными блоками, которые называют экспертами. Для каждого входного фрагмента отдельный маршрутизатор выбирает только часть экспертов. Поэтому модель может содержать очень много параметров, но при одном запросе активировать сравнительно небольшую их долю.
MoE помогает масштабировать языковые и мультимодальные модели при ограниченном бюджете вычислений. Эксперты не обязательно получают понятные человеку специализации: распределение формируется во время обучения. Качество зависит не только от их числа, но и от маршрутизации, балансировки нагрузки, объёма активных параметров и обучающих данных.
При сравнении MoE-моделей важно различать общее и активное число параметров. Большой общий объём не означает, что все параметры используются для каждого токена. Архитектура также усложняет обучение и развёртывание: отдельные эксперты могут получать неравномерную нагрузку, а передача данных между ускорителями создаёт дополнительные задержки.
Вопросы и ответы
В плотной модели для каждого токена обычно задействуется одна и та же основная сеть. В MoE маршрутизатор выбирает несколько экспертов, поэтому активируется только часть общего набора параметров.
Нет. Обычно для одного токена выбирается один или несколько экспертов. Конкретное число зависит от архитектуры и настроек маршрутизации.
Не само по себе. Важны активные параметры, данные, обучение, балансировка экспертов, контекст и результаты на подходящих задачах.