К списку моделей
Логотип Google, разработчика Gemini 3.5 Transcribe

Gemini 3.5 Transcribe

G-Score: н/д

От Google

Proprietary
FAMGemini
CTX96K
PARНе раскрыто
Релиз: 2026-08-26
Text

Краткое описание

Gemini 3.5 Transcribe — специализированная speech-to-text модель Google для файлов и потокового аудио. Она автоматически определяет более 85 языков, поддерживает переключение языков, до восьми спикеров, отметки времени по словам, словарь до 1 000 терминов и smart-режим с очисткой оговорок. Для файлов используется `gemini-3.5-transcribe`, для WebSocket-потока — `gemini-3.5-transcribe-live`.

G-Score и профиль

G-Score: н/д

Для Gemini 3.5 Transcribe пока нет совпавших результатов в подключённых публичных лидербордах. Исходные значения карточки не используются для G‑Score.

Показатели G‑Код, G‑Рассуждения, G‑Агенты и G‑Зрение рассчитаны по массовым таблицам LiveBench, Artificial Analysis и LMArena. Наведите или нажмите на значок рядом с оценкой, чтобы увидеть исходный лидерборд, вариант модели, значение и размер выборки.

Уверенность данных

низкая

Покрытие

0 тестов · 0 направлений

Происхождение

нет данных лидербордов

Как рассчитан профиль →

Подробный обзор модели

Gemini 3.5 Transcribe — специализированная модель автоматического распознавания речи (ASR), а не универсальный чат-бот. Она переводит запись или живой аудиопоток в текст, сама определяет язык, понимает переключения между языками и умеет приводить устную речь к читаемому виду. Для выбора важнее всего различать два endpoint: обычный gemini-3.5-transcribe точнее подходит для готовых файлов и разметки, а gemini-3.5-transcribe-live — для субтитров, диктовки и других интерфейсов с минимальной задержкой.

Два режима доступа: unary и Live

У моделей разные API-контракты. Unary-вариант принимает файл через Interactions API и возвращает завершённый результат. Это удобный путь для интервью, звонков, подкастов, лекций и архивной обработки. Один запрос поддерживает до часа аудио; при включённых таймкодах слов или диаризации лимит сокращается до 30 минут.

Live-вариант использует двунаправленное WebSocket-соединение Gemini Live API. Клиент передаёт небольшие куски необработанного 16-битного PCM-аудио, обычно mono 16 кГц и порциями около 100 мс. Сервер сначала присылает interim_input_transcription — быстро меняющуюся гипотезу для живых субтитров, затем input_transcription — финальный фрагмент после паузы или сигнала завершения речи. Сессия ограничена 10 минутами, поэтому длительную трансляцию придётся разбивать и аккуратно склеивать.

ВозможностьUnary gemini-3.5-transcribeLive gemini-3.5-transcribe-live
Основной сценарийготовые записимикрофон и прямой эфир
ТранспортInteractions APILive API, WebSocket
Максимальная длительность60 минут; 30 минут с таймкодами или диаризацией10 минут на сессию
Промежуточный текстнетесть
Диаризациядо 8 голосов; 3+ экспериментальнонет
Таймкоды каждого словаестьнет
Custom vocabularyдо 1000 фраздо 1000 фраз
Smart transcriptionестьесть

Live API умеет автоматически определять начало и конец реплики. Для более быстрой финализации можно совместить серверное определение начала речи с локальным детектором конца, а для push-to-talk — полностью задавать границы реплики на клиенте. Это полезно, когда задержка важнее простоты интеграции.

Языки, форматы и структура результата

Оба endpoint автоматически определяют 85+ языков и поддерживают code-switching — смену языка внутри разговора или даже одной реплики. Русский заявлен с кодом ru-RU. Если язык известен заранее, BCP-47-подсказка уменьшает пространство выбора и может повысить точность. Общая цифра 85+ не означает одинаковое качество для всех языков, акцентов и акустических условий.

Unary API принимает WAV, MP3, AIFF, AAC, OGG, FLAC, MPEG, M4A, L16, Opus, ALAW, MULAW и WebM. Для длинной записи Google советует Files API: до 2 ГБ на файл, до 20 ГБ на проект, автоматическое удаление через 48 часов. Live-поток нужно заранее привести к PCM, рекомендованный профиль — 16 кГц, mono, little-endian.

Полный текст unary-ответа доступен в interaction.output_text. При включённых таймкодах или диаризации в аннотациях word_info появляются слово, метка spk_1, начало и конец. У модели указано окно входного контекста 96K токенов и максимум 32K выходных токенов, но практический предел аудио всё равно задают лимиты длительности. Кэширование контекста и Batch API не поддерживаются.

Диаризация, таймкоды и словарь: что нельзя сочетать

Диаризация разделяет голоса, но не устанавливает личности: spk_1 — техническая метка, а не подтверждение, что говорил конкретный человек. Документация разрешает до восьми говорящих, однако качество для трёх и более помечено как экспериментальное. Для стенограммы совещания с юридическими последствиями результат нужно сверять с записью.

Таймкоды дают начало и конец каждого распознанного слова. Их можно сочетать с диаризацией в режиме verbatim, хотя Google предупреждает о возможном снижении общей точности. Это хороший вариант для субтитров, поиска фрагментов и синхронизации редактора.

Custom vocabulary смещает распознавание в пользу терминов, аббревиатур, брендов и имён. API принимает до 1000 фраз, но типичный лучший результат заявлен для списка до 100. На unary-endpoint словарь несовместим и с диаризацией, и с таймкодами: запрос с такой комбинацией будет отклонён. Значит, для звонка с редкими медицинскими терминами приходится выбирать между словарной подсказкой и подробной разметкой либо строить двухпроходный процесс.

Verbatim или Smart transcription

verbatim сохраняет слова-паразиты, повторы, запинки и самокоррекции. Это основной режим для исследований, разбирательств, контроля качества и монтажа, где важна близость к записи.

smart удаляет заполнители пауз, разрешает самокоррекции, добавляет пунктуацию и преобразует устный перечень в список, а произнесённые даты, валюты и числа — в привычную запись. Для заметки или диктовки такой текст удобнее, но он уже интерпретирован моделью. Smart нельзя объединять с диаризацией и таймкодами. Документация описывает custom vocabulary и Smart для Live отдельно, но не обещает качество их совместной работы: критичные термины стоит проверить собственным набором записей.

Важно отделять API от приложений Google. В анонсе упоминается function calling через другие Gemini-модели в приложении Gemini для macOS. У самого API-endpoint gemini-3.5-transcribe function calling, thinking, поиск по файлам и генерация изображений отмечены как неподдерживаемые. Если после стенограммы нужен анализ, его следует передать отдельной модели Google Gemini.

Цена и бесплатный уровень

Платный unary-тариф составляет $2 за миллион входных аудиотокенов и $12 за миллион выходных текстовых токенов. Google оценивает это примерно в $0,003 за минуту входа и $0,002 за минуту текста, то есть около $0,005 за минуту вместе.

Live стоит $3,50 за миллион входных и $21 за миллион выходных токенов — ориентировочно $0,005 и $0,004 за минуту, всего около $0,009. Расчёт основан на 25 аудиотокенах в секунду и 175 текстовых токенах в минуту; фактический счёт зависит от потребления токенов.

В таблице есть бесплатный уровень для обеих моделей, но это не безлимитный тариф: доступ и квоты зависят от проекта и отображаются в Google AI Studio. Ещё важнее режим данных: для Free Tier Google указывает использование контента для улучшения продуктов, для Paid Tier — отсутствие такого использования. Конфиденциальные звонки нельзя отправлять в бесплатный проект только ради экономии.

Точность и бенчмарки

WER, или Word Error Rate, — доля заменённых, удалённых и добавленных слов; чем ниже WER, тем лучше. В официальной методологии FLEURS охватывает 26 ведущих локалей. Gemini 3.5 Transcribe показал 5,50% WER в streaming и 5,04% в non-streaming режиме. Это сопоставимые агрегаты одного набора, но не отдельная оценка русского языка.

В индексе Artificial Analysis, объединяющем разные наборы и реальные шумные условия, Google приводит 4,0% для Live и 2,6% для unary. Оценка выполнена независимой площадкой, но опубликованный Google документ не раскрывает в таблице этой статьи состав каждого поднабора и доверительные интервалы. Заявленное улучшение времени до финального текста на 70% также не заменяет абсолютное измерение задержки на вашей сети.

ПроверкаLiveUnaryКак читать
FLEURS, 26 top locales5,50% WER5,04% WERниже лучше
Artificial Analysis AA-WER4,0%2,6%ниже лучше

Для выбора соберите записи со своими микрофонами, шумом, русско-английскими терминами и числовыми кодами. Считайте WER на дословной эталонной расшифровке, ошибки сущностей отдельно, задержку до interim и final, долю перепутанных спикеров и стоимость минуты.

Кому подходит Gemini 3.5 Transcribe

Unary стоит выбрать для постобработки звонков, интервью, подкастов и лекций, особенно когда нужны таймкоды или разделение голосов. Live лучше для субтитров, голосового ввода, операторских подсказок и интерфейсов push-to-talk. Smart полезен для заметок, но для аудита и цитирования безопаснее verbatim.

Модель хуже подходит, если сессия должна длиться без переподключения более 10 минут, нужны живые таймкоды или онлайн-диаризация, одновременно обязательны редкий словарь и speaker labels либо данные нельзя передавать облачному сервису. Модельная карточка также предупреждает о возможных галлюцинациях, замедлениях и тайм-аутах. Наконец, официальные страницы расходятся по статусу: changelog называет релиз GA, а анонс и model card — public preview. Для production разумно считать интерфейс изменяемым, закреплять версию SDK и перепроверять статус перед запуском.

FAQ

Поддерживает ли Gemini 3.5 Transcribe русский язык?

Да, русский есть в официальном списке как ru-RU. Публичного отдельного WER для русского нет, поэтому качество нужно измерять на своих записях.

Можно ли получить спикеров и таймкоды одновременно?

Да, в unary-режиме verbatim можно включить оба параметра. Максимальная запись тогда сокращается до 30 минут, а три и более спикера считаются экспериментальным случаем.

Можно ли добавить словарь терминов к диаризации?

Нет. Unary API отклоняет сочетание custom_vocabulary с диаризацией или таймкодами. Для сложной задачи потребуется выбрать приоритет или сделать два прохода.

Smart transcription подходит для юридической стенограммы?

Обычно нет: Smart удаляет запинки и исправляет формулировки. Для точной фиксации речи используйте verbatim и сверяйте важные места с аудио.

Сколько стоит расшифровка часа записи?

Ориентир Google для unary — около $0,005 за минуту, то есть примерно $0,30 за час. Итог зависит от токенизации выхода и действующего тарифа.

Чем Live отличается от голосового агента Gemini?

Live Transcribe непрерывно переводит входной звук в текст. Голосовой агент ведёт диалог, рассуждает и отвечает; для этих задач нужен другой endpoint и отдельная логика.

Есть ли полностью конфиденциальный бесплатный режим?

В опубликованной тарифной таблице Free Tier помечен как используемый для улучшения продуктов. Для Paid Tier указано обратное; дополнительно проверьте условия региона и требования вашей организации.

Источники

Где запустить модель

Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.

Обновляем провайдеров и цены…

Стоимость API

Файлы: около $0.005/мин ($2 input / $12 output за 1M токенов); Live: около $0.009/мин ($3.50 / $21.00)

Рассчитать сценарий →

Профиль модели

Для диаграммы пока недостаточно сопоставимых тестов.

Бенчмарки

Сопоставимые числовые результаты пока не опубликованы. В каталоге они отмечены знаком «?», без оценочных значений.

История семейства

Линейка Gemini

Последовательность собрана по датам релиза моделей Google в каталоге. Она показывает соседние поколения, но не приписывает им совместимость или наследование архитектуры без отдельного источника.

Экосистема Gemini 3.5 Transcribe

Сервисы, инструменты, материалы и обсуждения, связанные с моделью.

MCP и инструменты

Весь каталог

Статьи и термины

Все статьи

Обсуждения о Gemini 3.5 Transcribe

Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.

Создать обсуждение