К списку моделей
Логотип Google, разработчика Gemini Omni 1.1 Flash

Gemini Omni 1.1 Flash

G-Score: н/д

От Google

Proprietary
FAMGemini
CTXНе применяется
PARНе раскрыто
Релиз: 2026-08-27
FlashMultimodalVision

Краткое описание

Gemini Omni 1.1 Flash — production-ready модель Google для генерации и разговорного редактирования видео с нативным аудио. Она принимает текст, изображения и видео, умеет продлевать сцену, строить переход между первым и последним кадром и выдавать 360p, 720p, 1080p или 4K. Отдельный аудиофайл как референс API не принимает; продление работает шагами по 10 секунд до суммарных 40 секунд.

G-Score и профиль

G-Score: н/д

Для Gemini Omni 1.1 Flash пока нет совпавших результатов в подключённых публичных лидербордах. Исходные значения карточки не используются для G‑Score.

Показатели G‑Код, G‑Рассуждения, G‑Агенты и G‑Зрение рассчитаны по массовым таблицам LiveBench, Artificial Analysis и LMArena. Наведите или нажмите на значок рядом с оценкой, чтобы увидеть исходный лидерборд, вариант модели, значение и размер выборки.

Уверенность данных

низкая

Покрытие

0 тестов · 0 направлений

Происхождение

нет данных лидербордов

Как рассчитан профиль →

Место модели в каталоге

Место исходного бенчмарка показывается только при закреплённом source record и среди других карточек с источником. Эти старые значения не участвуют в G-Score лидербордов.

БенчмаркРезультатМестоДоказательство
Omni Text-to-Video fast motion Elo10501 из 1Внутренний тест разработчика
Omni Text-to-Video overall preference Elo11131 из 1Внутренний тест разработчика
Omni Image-to-Video overall preference Elo10571 из 1Внутренний тест разработчика
Omni Video Editing overall preference Elo10871 из 1Внутренний тест разработчика
Omni Reference-to-Video speech adherence Elo10281 из 1Внутренний тест разработчика
Omni Text-to-Video instruction following Elo11081 из 1Внутренний тест разработчика
Omni Video Editing instruction following Elo10821 из 1Внутренний тест разработчика
Omni Reference-to-Video overall preference Elo10041 из 1Внутренний тест разработчика
Omni Reference-to-Video reference adherence Elo9621 из 1Внутренний тест разработчика

Происхождение результатов

Elo-оценки получены в попарных сравнениях людей для video editing, text-to-video, image-to-video и reference-to-video. Google не указывает, что таблица измеряет именно stable checkpoint 1.1, поэтому значения не доказывают отдельный прирост версии 1.1.

Вариант: Gemini Omni Flash family; exact stable 1.1 checkpoint not identified in evaluation charts · получено 2026-09-07

Подробный обзор модели

Gemini Omni 1.1 Flash — стабильная модель Google для создания и разговорного редактирования коротких видео со звуком. Она принимает текст, изображения и видео, умеет продолжать сцену, строить переход между первой и последней картинкой и выдавать ролики от 3 до 10 секунд в 360p, 720p, 1080p или 4K при 24 кадрах в секунду. Сильная сторона Omni — итерации: можно попросить поменять фон, свет, персонажа или движение камеры, сохранив остальную сцену. Для длинного монтажа и точного редактирования речи ограничения пока существенны.

Что умеет Gemini Omni 1.1 Flash

В Gemini API модель вызывается по идентификатору gemini-omni-1.1-flash. Версия стала общедоступной 27 августа 2026 года и заменила preview-модель, отключение которой назначено на 30 сентября 2026 года.

ПараметрВозможность
Вход APIтекст, изображения, видео до 10 секунд для загрузки и редактирования
ВыходMP4-видео со сгенерированным звуком
Длительность результата3–10 секунд
Формат кадра16:9 или 9:16
Частота24 кадра/с
Разрешения360p, 720p по умолчанию, 1080p и 4K через апскейлинг
ИнтерфейсInteractions API, Python/JavaScript SDK или REST

Текстовый запрос может описывать сцену, освещение, движение камеры, реплики, музыку и события по времени. Изображение служит первым кадром, ориентиром внешности, предмета или стиля. Видео можно загрузить для трансформации: например, заменить фон, освещение или объект, перенести движение на другого персонажа. Результат каждого запроса — новый ролик, поэтому исходник следует хранить отдельно.

Разговорное редактирование и референсы

Interactions API связывает шаги через previous_interaction_id. На втором ходе достаточно написать «сделай скрипку невидимой» или «поменяй камеру на вид из-за плеча»: модель использует состояние предыдущей генерации. Чтобы продолжить такой процесс, запрос должен храниться на стороне Google; режим store=false ускоряет одиночную генерацию, но лишает следующий ход этого состояния.

В одном запросе можно задать несколько изображений и пометить их ролями: первый кадр, последний кадр или референс. Для видео-референсов API принимает до трёх клипов продолжительностью до трёх секунд каждый, однако их звук игнорируется. Отдельный аудиофайл загрузить как референс пока нельзя, хотя сама модель мультимодальна и итоговое видео создаётся со звуковой дорожкой.

Интерполяция и продление сцены

Интерполяция строит плавный ролик между двумя заданными изображениями. Она подходит для управляемого движения камеры, превращений и переходов, но промежуточная траектория остаётся генеративной: её нужно проверять покадрово.

Продление добавляет 3–10 секунд в конец. Omni анализирует последние 10 секунд, может слегка изменить финальные кадры исходника ради незаметной склейки и позволяет довести цепочку до 40 секунд. Загруженный файл должен быть не длиннее 10 секунд; вставка в середину и добавление начала не поддерживаются. В многошаговой генерации можно продолжать речь персонажа, а у загруженного ролика с говорящим человеком добавить новую реплику нельзя.

API и стоимость

Первый прототип удобно собрать в Google AI Studio, затем перенести тот же ID в приложение. Бесплатного уровня для Omni 1.1 Flash нет. Платный тариф считает ввод и вывод в токенах, но для видео понятнее пересчитать цену в секунды.

ВыходТокенов за секундуЦена за секундуЦена 10 секунд
360p1 931около $0,034около $0,338
720p5 792около $0,101около $1,014
1080p, апскейлинг8 688около $0,152около $1,520
4K, апскейлинг17 376около $0,304около $3,041

Расчёт использует ставку $17,50 за миллион выходных видеотокенов; звук включён. Ввод стоит $1,50 за миллион токенов. Google начисляет 1 120 токенов за изображение, 32 за секунду аудио и 5 792 за секунду входного видео. Это примерно $0,00168 за картинку и $0,00869 за секунду видео. Тарифная единица аудио не отменяет ограничение API на загрузку аудиореференсов.

Для черновиков разумно использовать 360p, отбраковывать композицию и движение, затем повторять удачный вариант в 720p. 1080p и 4K создаются апскейлингом, поэтому большее разрешение не исправит неверную анатомию, текст или логику движения.

Практические рабочие процессы

  • Рекламные варианты. Создать вертикальные 360p-черновики, выбрать сцены по удержанию и брендовым требованиям, финальные клипы вывести в 720p или выше.
  • Локальное изменение видео. Загрузить короткий исходник, сформулировать одно изменение и добавить указание сохранить всё остальное. Несколько небольших ходов обычно управляемее одного перегруженного запроса.
  • Анимация продукта или иллюстрации. Передать качественное изображение, отдельно описать движение объекта, камеры и среды, затем проверить форму логотипа и надписи.
  • Сюжет до 40 секунд. Генерировать десятисекундные фрагменты и продлевать сцену, сохраняя персонажей, звук и направление действия. Монтажные точки и запасные дубли всё равно нужны.

Что показывают официальные оценки

Страница DeepMind публикует Elo по парным оценкам людей. В графиках модель названа Gemini Omni Flash без отдельного указания версии 1.1, поэтому числа характеризуют семейство и не доказывают прирост стабильного релиза над preview.

ЗадачаGemini Omni FlashЛучший соперник в графике
Редактирование: общая предпочтительность1087HappyHorse — 1044
Редактирование: следование инструкции1082HappyHorse — 1036
Text-to-video: общая предпочтительность1113Seedance 2.0 — 1070
Text-to-video: следование инструкции1108Seedance 2.0 — 1051
Быстрое движение1050Seedance 2.0 — 1112
Image-to-video1057Grok-Imagine-Video — 1054
Reference-to-video: речь1028Seedance 2.0 — 972
Reference-to-video: соответствие референсу962Seedance 2.0 — 1038

Редактирование оценивали на 504 внутренних примерах, text-to-video — на 1 003 запросах MovieGenBench, быстрое движение — на 500 промптах, image-to-video — на 355 парах VBench I2V, reference-to-video — на 468 мультимодальных примерах. Люди сравнивали по одному ролику от каждой модели. Доверительные интервалы не опубликованы; близкие 1057, 1054 и 1053 DeepMind описывает как ничью. Итог практичный: Omni силён в редактировании и речи, но Seedance лидирует на быстром движении и точности референса.

Ограничения и безопасность

Сложное движение, неизменность персонажа после многих правок и безошибочный текст всё ещё проблемны. Полностью проверен только английский; качество других языков может меняться. API не принимает YouTube как источник, не поддерживает system instructions, temperature, top_p, stop sequences, negative prompt и provisioned throughput. Редактирование загруженных видео недоступно в Европейской экономической зоне, Швейцарии и Великобритании; существуют дополнительные ограничения для изображений несовершеннолетних и узнаваемых людей.

Вход и результат проходят фильтры безопасности. Все созданные через API ролики получают невидимый SynthID. На потребительских поверхностях Google также указывает C2PA Content Credentials. Возможность менять речь людей ограничена; SynthID помогает установить происхождение, но не заменяет согласие человека, проверку прав на исходники и редакционный контроль.

Когда выбирать Omni, а когда Veo

Omni 1.1 Flash подходит, если важны редактирование своими словами, несколько референсов, преобразование загруженного клипа и последовательные правки. Veo 3.1 Fast стоит сравнить для генерации и длинного продолжения роликов Veo: он добавляет по 7 секунд до 20 раз и достигает 148 секунд, но Developer API оставляет его в preview. Цена Veo Fast близка: $0,10/с за 720p, $0,12 за 1080p и $0,30 за 4K. Veo 3.1 Standard Google позиционирует для максимальной кинематографичности и сложной камеры; он дороже — $0,40/с за 720p/1080p и $0,60 за 4K.

Если нужен диалоговый монтаж короткого исходника, начните с Omni. Если нужен длинный полностью сгенерированный эпизод, сравните его с Veo. Финальный выбор делайте на собственных сценах: считайте стоимость принятого дубля, число перегенераций, стабильность героя, синхронизацию речи и ручное время монтажа. Пользовательскую версию можно сначала оценить через Google Gemini, но доступные функции, лимиты и качество могут отличаться от API.

Частые вопросы

Gemini Omni 1.1 Flash генерирует звук?

Да. Ролик создаётся со звуковой дорожкой; в промпте можно описать музыку, эффекты, речь и время события.

Можно ли загрузить отдельную музыку как референс?

Нет, текущий Gemini API не поддерживает загрузку аудиореференса. Звук внутри короткого видеореференса также игнорируется.

4K генерируется нативно?

Нет. 1080p и 4K помечены как апскейлинг. Они повышают разрешение готового результата, но не устраняют содержательные дефекты.

Можно ли отредактировать минутное видео?

Нет. Загружаемый исходник для редактирования или продления ограничен 10 секундами. Многошаговое продление созданного Omni ролика достигает 40 секунд.

Сколько стоит десятисекундный ролик?

Примерно $0,34 в 360p, $1,01 в 720p, $1,52 в 1080p и $3,04 в 4K без учёта входа и неудачных повторов.

Поддерживает ли API вертикальное видео?

Да. Можно выбрать 9:16; по умолчанию используется 16:9.

Можно ли убрать SynthID?

Документация указывает, что все сгенерированные видео содержат невидимый SynthID. Отключаемый параметр не описан.

Источники

Где запустить модель

Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.

Обновляем провайдеров и цены…

Стоимость API

$1.50 за 1M входных токенов; $9.00 за текстовый и $17.50 за видео-вывод, около $0.10 за секунду 720p

Рассчитать сценарий →

Профиль модели

Для диаграммы пока недостаточно сопоставимых тестов.

Бенчмарки

Omni Text-to-Video fast motion Elo1050
Omni Text-to-Video overall preference Elo1113
Omni Image-to-Video overall preference Elo1057
Omni Video Editing overall preference Elo1087
Omni Reference-to-Video speech adherence Elo1028
Omni Text-to-Video instruction following Elo1108
Omni Video Editing instruction following Elo1082
Omni Reference-to-Video overall preference Elo1004
Omni Reference-to-Video reference adherence Elo962

История семейства

Линейка Gemini

Последовательность собрана по датам релиза моделей Google в каталоге. Она показывает соседние поколения, но не приписывает им совместимость или наследование архитектуры без отдельного источника.

Экосистема Gemini Omni 1.1 Flash

Сервисы, инструменты, материалы и обсуждения, связанные с моделью.

MCP и инструменты

Весь каталог

Обсуждения о Gemini Omni 1.1 Flash

Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.

Создать обсуждение