Текущая2026-08-27

От Google
Gemini Omni 1.1 Flash — production-ready модель Google для генерации и разговорного редактирования видео с нативным аудио. Она принимает текст, изображения и видео, умеет продлевать сцену, строить переход между первым и последним кадром и выдавать 360p, 720p, 1080p или 4K. Отдельный аудиофайл как референс API не принимает; продление работает шагами по 10 секунд до суммарных 40 секунд.
Для Gemini Omni 1.1 Flash пока нет совпавших результатов в подключённых публичных лидербордах. Исходные значения карточки не используются для G‑Score.
Показатели G‑Код, G‑Рассуждения, G‑Агенты и G‑Зрение рассчитаны по массовым таблицам LiveBench, Artificial Analysis и LMArena. Наведите или нажмите на значок рядом с оценкой, чтобы увидеть исходный лидерборд, вариант модели, значение и размер выборки.
Уверенность данных
низкая
Покрытие
0 тестов · 0 направлений
Происхождение
нет данных лидербордов
Место исходного бенчмарка показывается только при закреплённом source record и среди других карточек с источником. Эти старые значения не участвуют в G-Score лидербордов.
| Бенчмарк | Результат | Место | Доказательство |
|---|---|---|---|
| Omni Text-to-Video fast motion Elo | 1050 | 1 из 1 | Внутренний тест разработчика |
| Omni Text-to-Video overall preference Elo | 1113 | 1 из 1 | Внутренний тест разработчика |
| Omni Image-to-Video overall preference Elo | 1057 | 1 из 1 | Внутренний тест разработчика |
| Omni Video Editing overall preference Elo | 1087 | 1 из 1 | Внутренний тест разработчика |
| Omni Reference-to-Video speech adherence Elo | 1028 | 1 из 1 | Внутренний тест разработчика |
| Omni Text-to-Video instruction following Elo | 1108 | 1 из 1 | Внутренний тест разработчика |
| Omni Video Editing instruction following Elo | 1082 | 1 из 1 | Внутренний тест разработчика |
| Omni Reference-to-Video overall preference Elo | 1004 | 1 из 1 | Внутренний тест разработчика |
| Omni Reference-to-Video reference adherence Elo | 962 | 1 из 1 | Внутренний тест разработчика |
Происхождение результатов
Elo-оценки получены в попарных сравнениях людей для video editing, text-to-video, image-to-video и reference-to-video. Google не указывает, что таблица измеряет именно stable checkpoint 1.1, поэтому значения не доказывают отдельный прирост версии 1.1.
Вариант: Gemini Omni Flash family; exact stable 1.1 checkpoint not identified in evaluation charts · получено 2026-09-07
Gemini Omni 1.1 Flash — стабильная модель Google для создания и разговорного редактирования коротких видео со звуком. Она принимает текст, изображения и видео, умеет продолжать сцену, строить переход между первой и последней картинкой и выдавать ролики от 3 до 10 секунд в 360p, 720p, 1080p или 4K при 24 кадрах в секунду. Сильная сторона Omni — итерации: можно попросить поменять фон, свет, персонажа или движение камеры, сохранив остальную сцену. Для длинного монтажа и точного редактирования речи ограничения пока существенны.
В Gemini API модель вызывается по идентификатору gemini-omni-1.1-flash. Версия стала общедоступной 27 августа 2026 года и заменила preview-модель, отключение которой назначено на 30 сентября 2026 года.
| Параметр | Возможность |
|---|---|
| Вход API | текст, изображения, видео до 10 секунд для загрузки и редактирования |
| Выход | MP4-видео со сгенерированным звуком |
| Длительность результата | 3–10 секунд |
| Формат кадра | 16:9 или 9:16 |
| Частота | 24 кадра/с |
| Разрешения | 360p, 720p по умолчанию, 1080p и 4K через апскейлинг |
| Интерфейс | Interactions API, Python/JavaScript SDK или REST |
Текстовый запрос может описывать сцену, освещение, движение камеры, реплики, музыку и события по времени. Изображение служит первым кадром, ориентиром внешности, предмета или стиля. Видео можно загрузить для трансформации: например, заменить фон, освещение или объект, перенести движение на другого персонажа. Результат каждого запроса — новый ролик, поэтому исходник следует хранить отдельно.
Interactions API связывает шаги через previous_interaction_id. На втором ходе достаточно написать «сделай скрипку невидимой» или «поменяй камеру на вид из-за плеча»: модель использует состояние предыдущей генерации. Чтобы продолжить такой процесс, запрос должен храниться на стороне Google; режим store=false ускоряет одиночную генерацию, но лишает следующий ход этого состояния.
В одном запросе можно задать несколько изображений и пометить их ролями: первый кадр, последний кадр или референс. Для видео-референсов API принимает до трёх клипов продолжительностью до трёх секунд каждый, однако их звук игнорируется. Отдельный аудиофайл загрузить как референс пока нельзя, хотя сама модель мультимодальна и итоговое видео создаётся со звуковой дорожкой.
Интерполяция строит плавный ролик между двумя заданными изображениями. Она подходит для управляемого движения камеры, превращений и переходов, но промежуточная траектория остаётся генеративной: её нужно проверять покадрово.
Продление добавляет 3–10 секунд в конец. Omni анализирует последние 10 секунд, может слегка изменить финальные кадры исходника ради незаметной склейки и позволяет довести цепочку до 40 секунд. Загруженный файл должен быть не длиннее 10 секунд; вставка в середину и добавление начала не поддерживаются. В многошаговой генерации можно продолжать речь персонажа, а у загруженного ролика с говорящим человеком добавить новую реплику нельзя.
Первый прототип удобно собрать в Google AI Studio, затем перенести тот же ID в приложение. Бесплатного уровня для Omni 1.1 Flash нет. Платный тариф считает ввод и вывод в токенах, но для видео понятнее пересчитать цену в секунды.
| Выход | Токенов за секунду | Цена за секунду | Цена 10 секунд |
|---|---|---|---|
| 360p | 1 931 | около $0,034 | около $0,338 |
| 720p | 5 792 | около $0,101 | около $1,014 |
| 1080p, апскейлинг | 8 688 | около $0,152 | около $1,520 |
| 4K, апскейлинг | 17 376 | около $0,304 | около $3,041 |
Расчёт использует ставку $17,50 за миллион выходных видеотокенов; звук включён. Ввод стоит $1,50 за миллион токенов. Google начисляет 1 120 токенов за изображение, 32 за секунду аудио и 5 792 за секунду входного видео. Это примерно $0,00168 за картинку и $0,00869 за секунду видео. Тарифная единица аудио не отменяет ограничение API на загрузку аудиореференсов.
Для черновиков разумно использовать 360p, отбраковывать композицию и движение, затем повторять удачный вариант в 720p. 1080p и 4K создаются апскейлингом, поэтому большее разрешение не исправит неверную анатомию, текст или логику движения.
Страница DeepMind публикует Elo по парным оценкам людей. В графиках модель названа Gemini Omni Flash без отдельного указания версии 1.1, поэтому числа характеризуют семейство и не доказывают прирост стабильного релиза над preview.
| Задача | Gemini Omni Flash | Лучший соперник в графике |
|---|---|---|
| Редактирование: общая предпочтительность | 1087 | HappyHorse — 1044 |
| Редактирование: следование инструкции | 1082 | HappyHorse — 1036 |
| Text-to-video: общая предпочтительность | 1113 | Seedance 2.0 — 1070 |
| Text-to-video: следование инструкции | 1108 | Seedance 2.0 — 1051 |
| Быстрое движение | 1050 | Seedance 2.0 — 1112 |
| Image-to-video | 1057 | Grok-Imagine-Video — 1054 |
| Reference-to-video: речь | 1028 | Seedance 2.0 — 972 |
| Reference-to-video: соответствие референсу | 962 | Seedance 2.0 — 1038 |
Редактирование оценивали на 504 внутренних примерах, text-to-video — на 1 003 запросах MovieGenBench, быстрое движение — на 500 промптах, image-to-video — на 355 парах VBench I2V, reference-to-video — на 468 мультимодальных примерах. Люди сравнивали по одному ролику от каждой модели. Доверительные интервалы не опубликованы; близкие 1057, 1054 и 1053 DeepMind описывает как ничью. Итог практичный: Omni силён в редактировании и речи, но Seedance лидирует на быстром движении и точности референса.
Сложное движение, неизменность персонажа после многих правок и безошибочный текст всё ещё проблемны. Полностью проверен только английский; качество других языков может меняться. API не принимает YouTube как источник, не поддерживает system instructions, temperature, top_p, stop sequences, negative prompt и provisioned throughput. Редактирование загруженных видео недоступно в Европейской экономической зоне, Швейцарии и Великобритании; существуют дополнительные ограничения для изображений несовершеннолетних и узнаваемых людей.
Вход и результат проходят фильтры безопасности. Все созданные через API ролики получают невидимый SynthID. На потребительских поверхностях Google также указывает C2PA Content Credentials. Возможность менять речь людей ограничена; SynthID помогает установить происхождение, но не заменяет согласие человека, проверку прав на исходники и редакционный контроль.
Omni 1.1 Flash подходит, если важны редактирование своими словами, несколько референсов, преобразование загруженного клипа и последовательные правки. Veo 3.1 Fast стоит сравнить для генерации и длинного продолжения роликов Veo: он добавляет по 7 секунд до 20 раз и достигает 148 секунд, но Developer API оставляет его в preview. Цена Veo Fast близка: $0,10/с за 720p, $0,12 за 1080p и $0,30 за 4K. Veo 3.1 Standard Google позиционирует для максимальной кинематографичности и сложной камеры; он дороже — $0,40/с за 720p/1080p и $0,60 за 4K.
Если нужен диалоговый монтаж короткого исходника, начните с Omni. Если нужен длинный полностью сгенерированный эпизод, сравните его с Veo. Финальный выбор делайте на собственных сценах: считайте стоимость принятого дубля, число перегенераций, стабильность героя, синхронизацию речи и ручное время монтажа. Пользовательскую версию можно сначала оценить через Google Gemini, но доступные функции, лимиты и качество могут отличаться от API.
Да. Ролик создаётся со звуковой дорожкой; в промпте можно описать музыку, эффекты, речь и время события.
Нет, текущий Gemini API не поддерживает загрузку аудиореференса. Звук внутри короткого видеореференса также игнорируется.
Нет. 1080p и 4K помечены как апскейлинг. Они повышают разрешение готового результата, но не устраняют содержательные дефекты.
Нет. Загружаемый исходник для редактирования или продления ограничен 10 секундами. Многошаговое продление созданного Omni ролика достигает 40 секунд.
Примерно $0,34 в 360p, $1,01 в 720p, $1,52 в 1080p и $3,04 в 4K без учёта входа и неудачных повторов.
Да. Можно выбрать 9:16; по умолчанию используется 16:9.
Документация указывает, что все сгенерированные видео содержат невидимый SynthID. Отключаемый параметр не описан.
Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.
$1.50 за 1M входных токенов; $9.00 за текстовый и $17.50 за видео-вывод, около $0.10 за секунду 720p
Рассчитать сценарий →Для диаграммы пока недостаточно сопоставимых тестов.
История семейства
Последовательность собрана по датам релиза моделей Google в каталоге. Она показывает соседние поколения, но не приписывает им совместимость или наследование архитектуры без отдельного источника.
Сервисы, инструменты, материалы и обсуждения, связанные с моделью.
Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.