Текущая2026-09-02

От Google
Gemini 3.8 Flash — стабильная мультимодальная модель Google для длительной разработки, автономных агентов и сложных рабочих процессов. Она принимает текст, изображения, видео, аудио и PDF, возвращает текст, поддерживает контекст 1 048 576 токенов и вывод до 65 536 токенов. Уровни thinking — low, medium и high; параметр minimal не поддерживается.
Для Gemini 3.8 Flash пока нет совпавших результатов в подключённых публичных лидербордах. Исходные значения карточки не используются для G‑Score.
Показатели G‑Код, G‑Рассуждения, G‑Агенты и G‑Зрение рассчитаны по массовым таблицам LiveBench, Artificial Analysis и LMArena. Наведите или нажмите на значок рядом с оценкой, чтобы увидеть исходный лидерборд, вариант модели, значение и размер выборки.
Уверенность данных
низкая
Покрытие
0 тестов · 0 направлений
Происхождение
нет данных лидербордов
Место исходного бенчмарка показывается только при закреплённом source record и среди других карточек с источником. Эти старые значения не участвуют в G-Score лидербордов.
| Бенчмарк | Результат | Место | Доказательство |
|---|---|---|---|
| OSWorld 2.0 (Компьютер) | 59% | 4 из 4 | Результат разработчика |
| CharXiv RQ | 86.2% | 1 из 3 | Результат разработчика |
| DeepSWE 1.1 | 73.7% | 3 из 7 | Результат разработчика |
| HLE-Verified | 54.9% | 1 из 1 | Результат разработчика |
| SWE Bench Pro | 61.6% | 4 из 8 | Результат разработчика |
| GDP.PDF all-pass | 35% | 1 из 1 | Внутренний тест разработчика |
| GDPval-AA v2 (Elo) | 1545 | 6 из 8 | Результат разработчика |
| Terminal-Bench 2.1 | 89.4% | 1 из 9 | Результат разработчика |
| Terminal-Bench 4.0 | 19.1% | 4 из 4 | Результат разработчика |
| Vals Finance Agent v2 | 61.4% | 1 из 1 | Внутренний тест разработчика |
| Harvey Legal Agent all-pass | 10% | 1 из 1 | Внутренний тест разработчика |
Происхождение результатов
Значения собраны из официальных таблиц Google и DeepMind. Terminal-Bench 2.1 в разных публикациях запускался в разных harness и дал 89,4 и 90,8; в каталоге сохранён вариант 89,4 из основной таблицы DeepMind. HLE и HLE-Verified не смешиваются.
Вариант: gemini-3.8-flash; benchmark-specific high/default thinking and agent harness · получено 2026-09-07
Gemini 3.8 Flash — стабильная производственная модель Google для агентного программирования, обработки больших документов и многошаговых рабочих процессов. Её главные преимущества — контекст на 1 048 576 токенов, мультимодальный ввод, большой набор встроенных инструментов и цена Flash-класса. Модель стоит выбирать, когда важны длинные автономные сессии и стоимость одного успешно выполненного задания; для простой массовой обработки выгоднее проверить Gemini 3.7 Flash или Flash-Lite, а для задач реального времени 3.8 Flash не подходит из-за отсутствия Live API.
Google выпустила Gemini 3.8 Flash 2 сентября 2026 года сразу в статусе General Availability (GA). Это следующая итерация Gemini 3.7 Flash, ориентированная на длительную разработку, автономных агентов и сложные корпоративные процессы. В линейке Gemini модель занимает место рабочего универсального движка: Flash-Lite рассчитан на более дешёвые массовые операции, а Pro — на задачи предельной сложности.
Доступ открыт через Gemini API, Google AI Studio и Enterprise Agent Platform. Модель используется в Google Gemini и стала базовой для агента Google Antigravity. С репозиториями из терминала работает Gemini CLI, где доступность и лимиты зависят от тарифа.
| Параметр | Gemini 3.8 Flash |
|---|---|
| Идентификатор API | gemini-3.8-flash |
| Статус | GA, стабильная версия |
| Вход | текст, изображения, видео, аудио, PDF |
| Выход | текст |
| Контекст | 1 048 576 токенов |
| Максимальный вывод | 65 536 токенов |
| Thinking | low, medium, high; по умолчанию medium |
| Локальный запуск | нет, веса не опубликованы |
| Дата среза знаний | март 2026 года, в отдельных областях знания могут ограничиваться январём 2025 года |
Контекст на миллион токенов вмещает крупную кодовую базу, комплект договоров или длинное видео. Качество поиска детали внутри такого объёма следует проверять на собственных данных. Вывод до 65 536 токенов полезен для больших отчётов и многофайловых изменений, но увеличивает стоимость и задержку.
API поддерживает function calling, структурированный JSON-вывод, выполнение кода, File Search, URL Context, контекстное кэширование и grounding через Google Search и Google Maps. Computer Use доступен в Preview. Генерация изображений, генерация аудио и Live API у этой модели не поддерживаются: изображение, звук и видео можно анализировать, но результат возвращается текстом.
low уменьшает задержку и расход в чатах, классификации и извлечении данных. medium подходит для большинства задач с кодом и инструментами. high рассчитан на математику, сложную отладку и длинные цепочки действий. minimal вызывает ошибку.
На сложных заданиях модель делает дополнительные шаги и повторно вызывает инструменты. Это помогает закончить длинный процесс, но увеличивает оплачиваемые thinking-токены. Полезная маршрутизация: low для дешёвых шагов, medium для основной работы, high — когда ошибка дороже дополнительного расхода.
При миграции замените thinking_budget на thinking_level. temperature, top_p и top_k игнорируются, а frequency_penalty, presence_penalty и candidate_count вызывают ошибку. FunctionResponse должен совпадать с предыдущим вызовом по идентификатору, имени и количеству. Предзаполненные ответы роли model не поддерживаются.
До 31 декабря 2026 года действует вводная цена. С 1 января 2027 года основные ставки удваиваются.
| Режим | Ввод до 31.12.2026 | Вывод до 31.12.2026 | Ввод с 01.01.2027 | Вывод с 01.01.2027 |
|---|---|---|---|---|
| Standard | $0,75 | $3,75 | $1,50 | $7,50 |
| Batch | $0,375 | $1,875 | $0,75 | $3,75 |
Цены указаны за миллион токенов; thinking входит в вывод. Flex стоит как Batch. Кэшированный ввод в Standard — $0,075 до конца 2026 года и $0,15 после, хранение — $0,50 и $1 за миллион токенов в час соответственно.
Миллион входных и 200 тысяч выходных токенов стоят $1,50 в Standard по вводной цене и $3 с 1 января 2027 года. Кэш и grounding считаются отдельно. Для Google Search и Maps предусмотрено 5 000 бесплатных запросов в месяц, общих для Gemini 3.x, затем — $14 за 1 000; один вызов может породить несколько поисковых запросов.
Google публикует результаты Gemini 3.8 Flash на разных стендах. Основная таблица DeepMind использует gemini-3.8-flash через Gemini API, настройки сэмплирования по умолчанию и pass@1, если не указано иное. Для небольших наборов усредняются несколько прогонов.
| Тест и версия | Результат | Условия |
|---|---|---|
| DeepSWE v1.1 | 73,7% | mini-swe agent, high thinking; результат Google |
| Terminal-Bench 2.1 | 89,4% | Terminus 2, стандартный агентный стенд |
| GDPVal-AA v2 | 1545 Elo | публичный лидерборд Artificial Analysis |
| Vals Finance Agent v2 | 61,4% | результат Vals.AI |
| Harvey’s Legal Agent Benchmark | 10,0% | all-pass: засчитывается полностью пройденный процесс |
| OSWorld 2.0 | 59,0% | partial score, максимум из трёх одиночных прогонов, 1080p, до 500 шагов |
| HLE-Verified | 54,9% | точность на 1 811 проверенных заданиях; 689 спорных заданий исходного HLE исключены |
Результаты не гарантируют такой же процент на частном репозитории или русскоязычных документах. Terminal-Bench 4.0 даёт 19,1% и не сопоставим с 89,4% на версии 2.1. В отдельном Google Cloud developer evaluation указаны 90,8% на Terminal-Bench 2.1 и 45,4% на обычном HLE; смешивать эти стенды с основной таблицей и HLE-Verified нельзя.
Модель разумно тестировать, когда:
На собственном наборе считайте стоимость принятого результата: повторные попытки, ошибки инструментов, задержку, thinking и долю ответов, прошедших проверку. Ответственные решения требуют контроля человеком.
Модель может выдумывать факты, ошибаться в длинных цепочках и попадать в тайм-ауты. Новые данные нужно получать через поиск или свой источник. Computer Use остаётся Preview, поэтому интерфейсным агентам нужны ограниченные разрешения, журналирование и подтверждение необратимых действий.
Выбирайте 3.8 Flash, если длинные процессы часто ломаются на поздних шагах и выигрыш покрывает дополнительные thinking-токены. 3.7 Flash выгоднее для короткого стабильного процесса, Flash-Lite — для классификации и извлечения полей, Pro — для редких задач предельной сложности. Сравнивайте варианты на одинаковых промптах, инструментах и лимитах.
На странице Gemini Developer API указан бесплатный уровень с ограниченными лимитами. Данные бесплатного уровня могут использоваться для улучшения продуктов Google; в платном уровне — нет.
Да, модель принимает изображения, видео, аудио и PDF вместе с текстом. Она возвращает только текст и не генерирует изображения или звук.
Начните с medium. Переводите простые и чувствительные к задержке операции на low, а high включайте после измерения выигрыша на сложных заданиях.
Модельный идентификатор нужно обновить, thinking_budget заменить на thinking_level, а устаревшие параметры сэмплирования и предзаполненные model-turn удалить. Вызовы функций требуют строгого соответствия ответа предыдущему вызову.
HLE-Verified — очищенный набор из 1 811 проверенных заданий с исключением 689 спорных вопросов. Обычный HLE в developer evaluations — другая строка и другой результат; сравнивать 54,9% и 45,4% как изменение качества нельзя.
Нет. Она умеет анализировать аудио, но Live API и генерация аудио не поддерживаются. Для двустороннего потокового голоса нужна специализированная Live-модель.
Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.
$0.75 / $3.75 за 1M токенов до 31.12.2026; с 01.01.2027 — $1.50 / $7.50
Рассчитать сценарий →История семейства
Последовательность собрана по датам релиза моделей Google в каталоге. Она показывает соседние поколения, но не приписывает им совместимость или наследование архитектуры без отдельного источника.
Сервисы, инструменты, материалы и обсуждения, связанные с моделью.
Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.