Текущая2026-03-18

От Xiaomi
MiMo-V2-Omni — это передовая омнимодальная модель, которая естественным образом обрабатывает входные изображения, видео и аудио в рамках унифицированной архитектуры. Он сочетает в себе сильное мультимодальное восприятие с агентными способностями – визуальное заземление, многоэтапность...
MiMo-V2-Omni сильнее всего выглядит в категории «общее качество». Профиль рассчитан по процентилям LiveBench, Artificial Analysis и LMArena; пропуски не считаются нулём.
Показатели G‑Код, G‑Рассуждения, G‑Агенты и G‑Зрение рассчитаны по массовым таблицам LiveBench, Artificial Analysis и LMArena. Наведите или нажмите на значок рядом с оценкой, чтобы увидеть исходный лидерборд, вариант модели, значение и размер выборки.
Уверенность данных
средняя
Покрытие
1 тест · 1 направление
Происхождение
artificialAnalysis
1 тест · уверенность: средняя
Место исходного бенчмарка показывается только при закреплённом source record и среди других карточек с источником. Эти старые значения не участвуют в G-Score лидербордов.
| Бенчмарк | Результат | Место | Доказательство |
|---|---|---|---|
| GPQA (Экспертные знания) | 72.6% | н/д | Источник не указан |
| MATH (Математика) | 78.8% | н/д | Источник не указан |
| MMLU (Общие знания) | 89.1% | н/д | Источник не указан |
| Arena Elo (LMSYS) | 1449 | н/д | Источник не указан |
| HumanEval (Кодинг) | 87.6% | н/д | Источник не указан |
| SWE-bench (Разработка) | 51.2% | н/д | Источник не указан |
MiMo-V2-Omni — это передовая «омни-модальная» модель от Xiaomi, представленная в марте 2026 года. Её ключевая особенность — нативная поддержка и одновременная обработка текстовых, графических, видео и аудио входных данных в рамках единой унифицированной архитектуры. Это делает MiMo-V2-Omni идеальным «мозгом» для комплексных мультимедийных систем и умных ассистентов нового поколения.
В отличие от гибридных систем, MiMo-V2-Omni обрабатывает все типы данных (звук, картинка, видео) нативно. Модель способна одновременно смотреть видео, слышать комментарии к нему и анализировать текст на экране, формируя единое, контекстуально точное понимание ситуации.
Модель была оптимизирована для выполнения многошаговых задач с опорой на визуальный контекст (Visual Grounding). Она отлично справляется с ролью автономного агента, способного управлять интерфейсами приложений и анализировать динамически меняющуюся информацию на экране.
Поддержка контекстного окна в 262 000 токенов позволяет модели удерживать в памяти длительные мультимедийные сессии. Это критически важно для анализа полнометражных видео или работы с большими архивами документов и аудиозаписей в рамках одного запроса.
| Бенчмарк | Результат MiMo-V2-Omni | Категория |
|---|---|---|
| Arena Elo | 1449 | Лидер омни-модальных систем |
| MMLU | 89.1% | Общие знания |
| HumanEval | 87.6% | Написание кода |
| MATH | 78.8% | Математические рассуждения |
| GPQA | 72.6% | Научные вопросы |
| SWE_bench | 51.2% | Решение инженерных задач |
MiMo-V2-Omni доступна через API по цене $0.40 за 1M входных токенов. Это делает её одним из самых технологически продвинутых и доступных решений для создания систем с глубоким мультимодальным пониманием.
Статья подготовлена для Gruzdevv.ru. Все данные актуальны на май 2026 года.
Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.
История семейства
Последовательность собрана по датам релиза моделей Xiaomi в каталоге. Она показывает соседние поколения, но не приписывает им совместимость или наследование архитектуры без отдельного источника.

2025-12-14

2026-03-18
Текущая2026-03-18

2026-04-22

2026-04-22
Сервисы, инструменты, материалы и обсуждения, связанные с моделью.
Откройте результаты по названию модели и проверьте актуальную интеграцию.
Точных связей пока нет. Искать по разработчику.
Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.