Текущая2026-09-02

От Google
Gemini 3.8 Flash Cyber — специализированный вариант для автономного поиска уязвимостей и подготовки исправлений. Google связывает его с общей интеллектуальной основой Gemini 3.8, но не публикует отдельные лимиты контекста, API ID или токенный тариф Cyber. Доступ выдаётся доверенным государственным организациям, операторам критической инфраструктуры и сопровождающим ПО через Fairwind Program.
Для Gemini 3.8 Flash Cyber пока нет совпавших результатов в подключённых публичных лидербордах. Исходные значения карточки не используются для G‑Score.
Показатели G‑Код, G‑Рассуждения, G‑Агенты и G‑Зрение рассчитаны по массовым таблицам LiveBench, Artificial Analysis и LMArena. Наведите или нажмите на значок рядом с оценкой, чтобы увидеть исходный лидерборд, вариант модели, значение и размер выборки.
Уверенность данных
низкая
Покрытие
0 тестов · 0 направлений
Происхождение
нет данных лидербордов
Место исходного бенчмарка показывается только при закреплённом source record и среди других карточек с источником. Эти старые значения не участвуют в G-Score лидербордов.
| Бенчмарк | Результат | Место | Доказательство |
|---|---|---|---|
| CyberGym pass@1 | 86.2% | 1 из 1 | Результат разработчика |
| CWE-Bench pass@1 | 47.2% | 1 из 1 | Результат разработчика |
| Real-world vulnerability discovery | 71% | 1 из 1 | Внутренний тест разработчика |
Происхождение результатов
CyberGym и внутренний real-world набор не раскрывают полный публичный task list; CWE-Bench использует закрытый набор из 100 задач. У модели нет опубликованного общего API ID, тарифа или отдельного лимита контекста.
Вариант: Gemini 3.8 Flash Cyber, limited Fairwind access; benchmark-specific Antigravity harness · получено 2026-09-07
Gemini 3.8 Flash Cyber — специализированная модель Google DeepMind для защитного анализа кода: автономного поиска уязвимостей, проверки находок и подготовки исправлений. Она использует ту же базовую интеллектуальную основу, что и обычная Gemini 3.8 Flash, но имеет более разрешающие настройки для легитимных киберзадач. Из-за двойного назначения этих возможностей модель не выведена в общий Gemini API: доступ получают одобренные организации через Fairwind Program.
Обычная Gemini 3.8 Flash — публичная универсальная модель для программирования, агентов, работы с документами и мультимодальными данными. У неё есть стабильный API ID gemini-3.8-flash, контекст 1 048 576 токенов, вывод до 65 536 токенов и публичная цена. Её можно использовать через Google AI Studio и в агентной среде Google Antigravity.
Cyber-вариант унаследовал общую reasoning- и coding-основу, но дообучен для поиска и устранения уязвимостей. Google разрешает ему более широкий круг киберопераций и ограничивает пользователей и цели. Публичный model ID, тариф, лимиты контекста и форматы Cyber отдельно не опубликованы. Характеристики обычной 3.8 Flash нельзя автоматически переносить на Cyber; наличие AI Studio или Antigravity также не открывает к нему доступ.
| Критерий | Gemini 3.8 Flash | Gemini 3.8 Flash Cyber |
|---|---|---|
| Основная задача | Универсальные агенты, код, reasoning, мультимодальная работа | Поиск уязвимостей и подготовка проверяемых патчей |
| Доступ | Общедоступные продукты и Gemini API | Только одобренные участники Fairwind |
| Защитные ограничения | Стандартные cyber- и CBRN-safeguards | Более разрешающие cyber-настройки плюс организационный контроль |
| Цена | Публичная токенная тарификация | Публичного тарифа нет |
| Публичные спецификации | API ID, контекст, форматы и инструменты раскрыты | Отдельные технические лимиты не опубликованы |
Fairwind — программа управляемого доступа для защитников общественно значимых систем. Приоритет получают государственные киберведомства, критическая инфраструктура, медицина, телеком, энергетика, финансы и базовые технологические платформы. Защитные академические лаборатории также могут подать заявку. Google указывает более 650 партнёров по всему миру.
Заявка не гарантирует доступ и не имеет опубликованного срока рассмотрения. Google проверяет историю безопасности и этичность работы организации. Одобренный партнёр может использовать модель отдельно либо вместе с CodeMender — агентом для поиска и исправления уязвимостей.
Участники обязуются применять пользовательскую аутентификацию, устойчивую к фишингу MFA, права доступа и учёт действий. Cyber разрешено выдавать только внутренним cyber-, incident response- и pentest-командам; делиться или продавать доступ нельзя. Допустимы авторизованное моделирование угроз, реверс-инжиниринг и анализ вредоносного ПО для защиты или исследований. Создание malware запрещено. Для прямого managed-доступа через Gemini Enterprise Agent Platform заявлен zero data retention.
Модель рассчитана на длинный цикл работы с репозиторием: изучить архитектуру и потоки данных, найти подозрительный участок, подтвердить проблему в контролируемой среде, предложить изменение и проверить, что существующие тесты не сломаны. Приоритет отдан исправлению, а не эксплуатации уязвимостей.
Google сообщает о защите от злоупотреблений в киберсфере и областях CBRN — химических, биологических, радиологических и ядерных рисков. Более мягкие киберограничения Cyber компенсируют проверкой организаций, ролями, журналированием и условиями использования.
На Gray Swan IPI Benchmark Cyber получил 6,0% ASR@15 — долю успешных косвенных prompt injection за 15 попыток, где меньше лучше. Обычная 3.8 Flash показала 5,5%, Claude Opus — 4,8%: Cyber здесь не лидирует. Тест охватывал переносимые атаки без computer use, поэтому не гарантирует безопасность агента с терминалом, сетью и секретами.
| Тест | Результат Gemini 3.8 Flash Cyber | Что измеряет | Важное ограничение |
|---|---|---|---|
| CyberGym, Final-submission | 86,2% pass@1 | Автономный поиск уязвимостей в C/C++ | Google использовал внутренний неспециализированный Antigravity-harness; конкуренты тестировались владельцами на других стендах |
| Внутренний Real-world vulnerability discovery | 71,0% | Recall по более чем 1200 подтверждённым историческим уязвимостям в популярных open-source-проектах на 20 языках | Закрытый набор без публичной версии и независимого воспроизведения |
| CWE-Bench | 47,2% pass@1 | Найти и исправить неизвестную заранее уязвимость, сохранив старые тесты | 100 закрытых задач и 54 типа CWE; запуск Collinear AI в Antigravity с high thinking |
| Gray Swan IPI | 6,0% ASR@15 | Успех косвенной prompt injection за 15 попыток | Только переносимые атаки, без computer use; меньше — лучше |
На CyberGym ближайший результат — 85,6% у GPT-5.5-Cyber; Mythos 5 набрал 83,8%, GPT-5.6 Sol — 83,6%, Gemini 3.5 Flash Cyber — 77,5%. Версия теста не указана. Google считает свой pass@1 в режиме Final-submission без голосования и параллельных попыток, но конкуренты использовали собственные harness-системы, что ослабляет прямое сравнение.
В закрытом многоязычном тесте Cyber набрал 71,0% против 58,9% у Gemini 3.7 Flash и 46,6% у Gemini 3.5 Flash Cyber. Набор включает более 1200 подтверждённых исторических уязвимостей, но задачи и разбивка по языкам не раскрыты.
CWE-Bench содержит 100 скрытых задач и 54 типа CWE. Исправление засчитывается, только если программный проверяющий подтверждает блокировку проблемы и прохождение старых тестов. Cyber набрал 47,2% при 47,8% у Claude Fable 5. Средняя стоимость прогона — $3,64 против $10,27 у лидера; это цена теста, а не тариф Fairwind. Версия не названа, срез — сентябрь 2026 года.
Chrome Security сообщил о 2,6 раза большем числе корректных патчей, Wiz — о приросте recall на 7,5–9,7 п.п. при стоимости в 2,3–5,2 раза ниже. Без состава выборок это полевые заявления, не универсальный рейтинг.
Основной сценарий — аудит большого репозитория после статического анализа: связать сигнал с потоком данных и контекстом модулей, затем подготовить патч для проверки.
Другие варианты — повторный анализ критичных компонентов перед релизом, поиск похожих дефектов после инцидента и ускорение triage. CodeMender подходит организациям, которым нужен готовый агентный контур.
В производстве модели нужны минимальные права и изолированная среда. Она работает с копией репозитория, создаёт отдельный pull request, а человек проверяет обоснование, тесты и область изменений. Автоматическое слияние или развёртывание патчей неоправданно.
Pass@1 47,2% на CWE-Bench означает, что более половины одиночных попыток не прошли строгую проверку. Модель может пропустить уязвимость, неверно оценить достижимость кода, создать регрессию или исправить симптом вместо причины. Высокий CyberGym не отменяет различия языков, сборочных систем и агентных стендов.
Репозиторий может нести prompt injection через документацию или тестовые данные. Секреты, сеть, терминал и запись в ветку следует ограничивать. Zero data retention заявлен только для конкретного корпоративного подключения, а не любой интеграции.
Наконец, Fairwind подходит не любой компании. Если организация не проходит отбор, разумный выбор — обычная Gemini 3.8 Flash или CodeMender с публичными моделями, дополненные статическим анализом, сканерами зависимостей и ручным review. Для универсальной разработки публичная 3.8 Flash проще: спецификации, цена и каналы доступа прозрачны. Cyber оправдан, когда есть крупный защищаемый код, зрелая security-команда, формальные полномочия и процесс проверки патчей.
Нет для обычного аккаунта. Google AI Studio публично предоставляет Gemini 3.8 Flash, а Cyber выдаётся только одобренным участникам Fairwind.
Общий API ID и публичный токенный тариф не опубликованы. Стоимость $3,64 в CWE-Bench относится к среднему тестовому прогону, а не к коммерческому тарифу.
Организация заполняет форму Google DeepMind и проходит проверку истории безопасности и этичности работы. Фиксированный срок ответа не заявлен, а соответствие категории партнёров не гарантирует одобрение.
Только после допуска в Fairwind и в рамках разрешённых целей. Программа приоритизирует государственные структуры, критическую инфраструктуру и базовые технологические платформы; доступ нельзя передавать внешним исследователям.
Нет. Модель расширяет покрытие и ускоряет подготовку исправлений, но бенчмарки показывают заметную долю неуспешных попыток. Её выводы нужно подтверждать тестами, специализированными сканерами и review специалиста.
Нет, особенно в критичных системах. Патч следует изолировать в отдельной ветке, прогнать функциональные и security-тесты, проверить область влияния и только затем передавать на контролируемое слияние.
Для общих задач разработки и доступного API — Gemini 3.8 Flash. Cyber имеет смысл для одобренной защитной организации, которой нужны автономный поиск уязвимостей и патчинг в управляемом контуре.
Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.
Публичный тариф не заявлен; доступ только для участников Fairwind Program
Рассчитать сценарий →Для диаграммы пока недостаточно сопоставимых тестов.
История семейства
Последовательность собрана по датам релиза моделей Google в каталоге. Она показывает соседние поколения, но не приписывает им совместимость или наследование архитектуры без отдельного источника.
Сервисы, инструменты, материалы и обсуждения, связанные с моделью.
Откройте результаты по названию модели и проверьте актуальную интеграцию.
Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.