Текущая2026-08-26

От Google
Gemini 3.5 Transcribe — специализированная speech-to-text модель Google для файлов и потокового аудио. Она автоматически определяет более 85 языков, поддерживает переключение языков, до восьми спикеров, отметки времени по словам, словарь до 1 000 терминов и smart-режим с очисткой оговорок. Для файлов используется `gemini-3.5-transcribe`, для WebSocket-потока — `gemini-3.5-transcribe-live`.
Для Gemini 3.5 Transcribe пока нет совпавших результатов в подключённых публичных лидербордах. Исходные значения карточки не используются для G‑Score.
Показатели G‑Код, G‑Рассуждения, G‑Агенты и G‑Зрение рассчитаны по массовым таблицам LiveBench, Artificial Analysis и LMArena. Наведите или нажмите на значок рядом с оценкой, чтобы увидеть исходный лидерборд, вариант модели, значение и размер выборки.
Уверенность данных
низкая
Покрытие
0 тестов · 0 направлений
Происхождение
нет данных лидербордов
Gemini 3.5 Transcribe — специализированная модель автоматического распознавания речи (ASR), а не универсальный чат-бот. Она переводит запись или живой аудиопоток в текст, сама определяет язык, понимает переключения между языками и умеет приводить устную речь к читаемому виду. Для выбора важнее всего различать два endpoint: обычный gemini-3.5-transcribe точнее подходит для готовых файлов и разметки, а gemini-3.5-transcribe-live — для субтитров, диктовки и других интерфейсов с минимальной задержкой.
У моделей разные API-контракты. Unary-вариант принимает файл через Interactions API и возвращает завершённый результат. Это удобный путь для интервью, звонков, подкастов, лекций и архивной обработки. Один запрос поддерживает до часа аудио; при включённых таймкодах слов или диаризации лимит сокращается до 30 минут.
Live-вариант использует двунаправленное WebSocket-соединение Gemini Live API. Клиент передаёт небольшие куски необработанного 16-битного PCM-аудио, обычно mono 16 кГц и порциями около 100 мс. Сервер сначала присылает interim_input_transcription — быстро меняющуюся гипотезу для живых субтитров, затем input_transcription — финальный фрагмент после паузы или сигнала завершения речи. Сессия ограничена 10 минутами, поэтому длительную трансляцию придётся разбивать и аккуратно склеивать.
| Возможность | Unary gemini-3.5-transcribe | Live gemini-3.5-transcribe-live |
|---|---|---|
| Основной сценарий | готовые записи | микрофон и прямой эфир |
| Транспорт | Interactions API | Live API, WebSocket |
| Максимальная длительность | 60 минут; 30 минут с таймкодами или диаризацией | 10 минут на сессию |
| Промежуточный текст | нет | есть |
| Диаризация | до 8 голосов; 3+ экспериментально | нет |
| Таймкоды каждого слова | есть | нет |
| Custom vocabulary | до 1000 фраз | до 1000 фраз |
| Smart transcription | есть | есть |
Live API умеет автоматически определять начало и конец реплики. Для более быстрой финализации можно совместить серверное определение начала речи с локальным детектором конца, а для push-to-talk — полностью задавать границы реплики на клиенте. Это полезно, когда задержка важнее простоты интеграции.
Оба endpoint автоматически определяют 85+ языков и поддерживают code-switching — смену языка внутри разговора или даже одной реплики. Русский заявлен с кодом ru-RU. Если язык известен заранее, BCP-47-подсказка уменьшает пространство выбора и может повысить точность. Общая цифра 85+ не означает одинаковое качество для всех языков, акцентов и акустических условий.
Unary API принимает WAV, MP3, AIFF, AAC, OGG, FLAC, MPEG, M4A, L16, Opus, ALAW, MULAW и WebM. Для длинной записи Google советует Files API: до 2 ГБ на файл, до 20 ГБ на проект, автоматическое удаление через 48 часов. Live-поток нужно заранее привести к PCM, рекомендованный профиль — 16 кГц, mono, little-endian.
Полный текст unary-ответа доступен в interaction.output_text. При включённых таймкодах или диаризации в аннотациях word_info появляются слово, метка spk_1, начало и конец. У модели указано окно входного контекста 96K токенов и максимум 32K выходных токенов, но практический предел аудио всё равно задают лимиты длительности. Кэширование контекста и Batch API не поддерживаются.
Диаризация разделяет голоса, но не устанавливает личности: spk_1 — техническая метка, а не подтверждение, что говорил конкретный человек. Документация разрешает до восьми говорящих, однако качество для трёх и более помечено как экспериментальное. Для стенограммы совещания с юридическими последствиями результат нужно сверять с записью.
Таймкоды дают начало и конец каждого распознанного слова. Их можно сочетать с диаризацией в режиме verbatim, хотя Google предупреждает о возможном снижении общей точности. Это хороший вариант для субтитров, поиска фрагментов и синхронизации редактора.
Custom vocabulary смещает распознавание в пользу терминов, аббревиатур, брендов и имён. API принимает до 1000 фраз, но типичный лучший результат заявлен для списка до 100. На unary-endpoint словарь несовместим и с диаризацией, и с таймкодами: запрос с такой комбинацией будет отклонён. Значит, для звонка с редкими медицинскими терминами приходится выбирать между словарной подсказкой и подробной разметкой либо строить двухпроходный процесс.
verbatim сохраняет слова-паразиты, повторы, запинки и самокоррекции. Это основной режим для исследований, разбирательств, контроля качества и монтажа, где важна близость к записи.
smart удаляет заполнители пауз, разрешает самокоррекции, добавляет пунктуацию и преобразует устный перечень в список, а произнесённые даты, валюты и числа — в привычную запись. Для заметки или диктовки такой текст удобнее, но он уже интерпретирован моделью. Smart нельзя объединять с диаризацией и таймкодами. Документация описывает custom vocabulary и Smart для Live отдельно, но не обещает качество их совместной работы: критичные термины стоит проверить собственным набором записей.
Важно отделять API от приложений Google. В анонсе упоминается function calling через другие Gemini-модели в приложении Gemini для macOS. У самого API-endpoint gemini-3.5-transcribe function calling, thinking, поиск по файлам и генерация изображений отмечены как неподдерживаемые. Если после стенограммы нужен анализ, его следует передать отдельной модели Google Gemini.
Платный unary-тариф составляет $2 за миллион входных аудиотокенов и $12 за миллион выходных текстовых токенов. Google оценивает это примерно в $0,003 за минуту входа и $0,002 за минуту текста, то есть около $0,005 за минуту вместе.
Live стоит $3,50 за миллион входных и $21 за миллион выходных токенов — ориентировочно $0,005 и $0,004 за минуту, всего около $0,009. Расчёт основан на 25 аудиотокенах в секунду и 175 текстовых токенах в минуту; фактический счёт зависит от потребления токенов.
В таблице есть бесплатный уровень для обеих моделей, но это не безлимитный тариф: доступ и квоты зависят от проекта и отображаются в Google AI Studio. Ещё важнее режим данных: для Free Tier Google указывает использование контента для улучшения продуктов, для Paid Tier — отсутствие такого использования. Конфиденциальные звонки нельзя отправлять в бесплатный проект только ради экономии.
WER, или Word Error Rate, — доля заменённых, удалённых и добавленных слов; чем ниже WER, тем лучше. В официальной методологии FLEURS охватывает 26 ведущих локалей. Gemini 3.5 Transcribe показал 5,50% WER в streaming и 5,04% в non-streaming режиме. Это сопоставимые агрегаты одного набора, но не отдельная оценка русского языка.
В индексе Artificial Analysis, объединяющем разные наборы и реальные шумные условия, Google приводит 4,0% для Live и 2,6% для unary. Оценка выполнена независимой площадкой, но опубликованный Google документ не раскрывает в таблице этой статьи состав каждого поднабора и доверительные интервалы. Заявленное улучшение времени до финального текста на 70% также не заменяет абсолютное измерение задержки на вашей сети.
| Проверка | Live | Unary | Как читать |
|---|---|---|---|
| FLEURS, 26 top locales | 5,50% WER | 5,04% WER | ниже лучше |
| Artificial Analysis AA-WER | 4,0% | 2,6% | ниже лучше |
Для выбора соберите записи со своими микрофонами, шумом, русско-английскими терминами и числовыми кодами. Считайте WER на дословной эталонной расшифровке, ошибки сущностей отдельно, задержку до interim и final, долю перепутанных спикеров и стоимость минуты.
Unary стоит выбрать для постобработки звонков, интервью, подкастов и лекций, особенно когда нужны таймкоды или разделение голосов. Live лучше для субтитров, голосового ввода, операторских подсказок и интерфейсов push-to-talk. Smart полезен для заметок, но для аудита и цитирования безопаснее verbatim.
Модель хуже подходит, если сессия должна длиться без переподключения более 10 минут, нужны живые таймкоды или онлайн-диаризация, одновременно обязательны редкий словарь и speaker labels либо данные нельзя передавать облачному сервису. Модельная карточка также предупреждает о возможных галлюцинациях, замедлениях и тайм-аутах. Наконец, официальные страницы расходятся по статусу: changelog называет релиз GA, а анонс и model card — public preview. Для production разумно считать интерфейс изменяемым, закреплять версию SDK и перепроверять статус перед запуском.
Да, русский есть в официальном списке как ru-RU. Публичного отдельного WER для русского нет, поэтому качество нужно измерять на своих записях.
Да, в unary-режиме verbatim можно включить оба параметра. Максимальная запись тогда сокращается до 30 минут, а три и более спикера считаются экспериментальным случаем.
Нет. Unary API отклоняет сочетание custom_vocabulary с диаризацией или таймкодами. Для сложной задачи потребуется выбрать приоритет или сделать два прохода.
Обычно нет: Smart удаляет запинки и исправляет формулировки. Для точной фиксации речи используйте verbatim и сверяйте важные места с аудио.
Ориентир Google для unary — около $0,005 за минуту, то есть примерно $0,30 за час. Итог зависит от токенизации выхода и действующего тарифа.
Live Transcribe непрерывно переводит входной звук в текст. Голосовой агент ведёт диалог, рассуждает и отвечает; для этих задач нужен другой endpoint и отдельная логика.
В опубликованной тарифной таблице Free Tier помечен как используемый для улучшения продуктов. Для Paid Tier указано обратное; дополнительно проверьте условия региона и требования вашей организации.
Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.
Файлы: около $0.005/мин ($2 input / $12 output за 1M токенов); Live: около $0.009/мин ($3.50 / $21.00)
Рассчитать сценарий →Для диаграммы пока недостаточно сопоставимых тестов.
Сопоставимые числовые результаты пока не опубликованы. В каталоге они отмечены знаком «?», без оценочных значений.
История семейства
Последовательность собрана по датам релиза моделей Google в каталоге. Она показывает соседние поколения, но не приписывает им совместимость или наследование архитектуры без отдельного источника.
Сервисы, инструменты, материалы и обсуждения, связанные с моделью.
Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.