Текущая2026-08-21

От DeepSeek
DeepSeek V4 Flash Vision Exp — экспериментальная мультимодальная версия V4 Flash для текста, изображений и агентных сценариев. Она сохраняет текстовые возможности V4 Flash и добавляет визуальное понимание; изображения тарифицируются как входные токены, до 384 токенов за изображение. Модель доступна по отдельному API ID и не является открытым весовым релизом.
Для DeepSeek V4 Flash Vision Exp пока нет совпавших результатов в подключённых публичных лидербордах. Исходные значения карточки не используются для G‑Score.
Показатели G‑Код, G‑Рассуждения, G‑Агенты и G‑Зрение рассчитаны по массовым таблицам LiveBench, Artificial Analysis и LMArena. Наведите или нажмите на значок рядом с оценкой, чтобы увидеть исходный лидерборд, вариант модели, значение и размер выборки.
Уверенность данных
низкая
Покрытие
0 тестов · 0 направлений
Происхождение
нет данных лидербордов
Место исходного бенчмарка показывается только при закреплённом source record и среди других карточек с источником. Эти старые значения не участвуют в G-Score лидербордов.
| Бенчмарк | Результат | Место | Доказательство |
|---|---|---|---|
| DeepSWE | 59.3% | 3 из 5 | Результат разработчика |
| NL2Repo | 57.7% | 3 из 8 | Результат разработчика |
| CyberGym | 75.3% | 2 из 2 | Результат разработчика |
| ApexBench pass@1 | 36.5% | 1 из 1 | Результат разработчика |
| ZeroBench (pass@5) | 35% | 1 из 2 | Результат разработчика |
| Chartography | 64.3% | 1 из 1 | Результат разработчика |
| DSBench-Hard | 63.6% | 1 из 1 | Внутренний тест разработчика |
| Agents' Last Exam | 27.3% | 2 из 3 | Результат разработчика |
| Terminal-Bench 2.1 | 83.9% | 7 из 9 | Результат разработчика |
| Toolathlon Verified | 75.9% | 2 из 8 | Результат разработчика |
| AutomationBench Public | 25.7% | 2 из 3 | Результат разработчика |
Происхождение результатов
Все значения опубликованы DeepSeek. Для text-based Code Agent указаны max tokens, top_p 0,95 и temperature 1,0, но нет pinned harness version, run counts или error bars. В ApexBench и Agents' Last Exam текстовый V4 Flash baseline игнорирует мультимодальные элементы.
Вариант: deepseek-v4-flash-vision-exp, DeepSeek Harness Minimal Mode for public text-agent tasks · получено 2026-09-07
DeepSeek V4 Flash Vision Exp — экспериментальная API-модель для агентов, которые понимают текст, изображения и результаты инструментов. Она сохраняет заявленный уровень текстовой DeepSeek V4 Flash, но добавляет работу со скриншотами, схемами и графиками. Цена Flash и контекст 1 млн токенов привлекательны, однако для production нужны собственные тесты, безопасный tool-контур и fallback: датированный checkpoint Vision Exp пока не заявлен.
Модель вышла 21 августа 2026 года под API ID deepseek-v4-flash-vision-exp. DeepSeek называет её экспериментальной и по текстовым агентам, рассуждению и знаниям сопоставляет с официальной V4 Flash. Это не переносит автоматически все свойства текстового checkpoint на Vision Exp.
Model card V4 описывает текстовую Flash как Mixture-of-Experts-модель на 285 млрд параметров с 13 млрд активных, гибридным attention и MIT-лицензией весов. Документ предшествует Vision Exp и указывает только текстовую модальность. Параметры, визуальный энкодер, веса и лицензия Vision Exp не раскрыты. Подтверждена связь с V4 Flash, но не 285B, открытые веса или локальный запуск.
Прямой доступ идет через DeepSeek. Поддерживаются OpenAI-совместимые Chat Completions и Responses на https://api.deepseek.com, а также Anthropic Messages на /anthropic. Картинку передают как base64, публичный URL или file_id после POST /files. Форматы — JPEG, PNG, GIF и WebP; сервер проверяет содержимое, а не расширение.
| Ограничение | Значение |
|---|---|
| Тело запроса | 48 MiB |
| Одно inline-изображение или внешний URL | 32 MiB |
Одно изображение через file_id | 64 MiB |
| Количество изображений | до 600 |
| Общий размер | 64 MiB без file_id, до 200 MiB с ним |
| Размер стороны | 8192 px; 4096 px при 15+ изображениях |
Внешний URL ограничен 8192 символами и 60 секундами загрузки. Files API хранит до 10 000 файлов и 25 GiB; срок — от часа до 30 дней либо постоянный. Хранилище объявлено бесплатным, обработка картинки оплачивается как входные токены. Anthropic Files требует заголовок anthropic-beta: files-api-2025-04-14.
Картинка после масштабирования занимает не более 384 токенов. Малые изображения увеличиваются примерно до площади 384×384, большие уменьшаются до 800×800; высокое разрешение не гарантирует чтения мелких деталей. detail=low дает 512×512, а high, original и нынешний auto сохраняют исходную детализацию до общего preprocessing.
Контекст составляет 1 млн токенов, максимальный ответ — 384K; вход и генерация вместе помещаются в окно. Thinking включен по умолчанию на high; доступны low, high, max и отключение. В нем temperature, top_p и penalties не влияют на результат. При tool calls клиент обязан возвращать reasoning_content прошлых ходов, иначе получит 400.
| 1 млн токенов | Вне пика | В пик |
|---|---|---|
| Вход, cache hit | $0,007 | $0,014 |
| Вход, cache miss | $0,22 | $0,44 |
| Выход | $0,66 | $1,32 |
Пик: 01:00–04:00 и 06:00–10:00 UTC по будням. Максимальные 384 image-токена при cache miss стоят около $0,000084 вне пика или $0,000169 в пик без текста и ответа. Тариф перепроверяют перед расчетом бюджета. Лимит — 2500 параллельных запросов на аккаунт; превышение дает 429.
| Тест | Vision Exp | V4 Flash 0731 | Opus 4.8 |
|---|---|---|---|
| Terminal Bench 2.1 | 83,9 | 82,7 | 85,0 |
| NL2Repo | 57,7 | 54,2 | 69,7 |
| Cybergym | 75,3 | 76,7 | 78,3 |
| DeepSWE | 59,3 | 54,4 | 58,0 |
| Toolathlon-Verified | 75,9 | 70,3 | 76,2 |
| DSBench-Hard | 63,6 | 59,6 | 71,7 |
| AutomationBench Public | 25,7 | 25,1 | 27,2 |
| ApexBench, Pass@1 | 36,5 | 26,2 | 39,4 |
| Agents’ Last Exam | 27,3 | 25,2 | 25,7 |
| Chartography | 64,3 | — | 65,0 |
| ZeroBench, Pass@5 | 35,0 | — | 34,0 |
Это результаты DeepSeek, не независимый прогон. Для публичных текстовых Code Agent-наборов указаны Harness Minimal Mode, максимальный max_tokens, top_p=0.95 и temperature=1.0. Выпущенный тогда Harness 0.1.1 не подтвержден как версия оценки. Полные prompts, число прогонов и интервалы не опубликованы; DSBench-Hard ранее обозначен как внутренний. В ApexBench и Agents’ Last Exam V4 Flash игнорировала изображения, поэтому это не полноценный multimodal baseline.
Vision Exp уместна для анализа интерфейса по скриншоту, диаграмм, фотографий, сканов и визуального результата инструмента. Responses API принимает картинку из function_call_output, поддерживая цикл «снимок — анализ — действие».
PDF не поддерживается: страницы преобразуют в изображения или извлекают текст. Модель не заменяет OCR — суммы, подписи и мелкий текст нужно перепроверять. В Chat Completions и Messages изображения допустимы только в user; в Responses — также в developer и output инструмента, но не в system или assistant.
Responses API остается stateless: нет previous_response_id, conversations, background mode и хранения. file_search, Code Interpreter, computer use и MCP игнорируются; из custom tools поддержан только apply_patch. Несовместимые параметры игнорируются молча, поэтому тестируйте поведение, не только HTTP 200.
Отдельная safety-оценка Vision Exp не опубликована. Изображение может содержать prompt injection. Tool-контур должен отделять данные от инструкций, ограничивать команды и домены, скрывать секреты и подтверждать необратимые действия. user_id изолирует safety-обработку и KV-кэш, но не должен содержать персональные данные.
Для чистого текста разумнее стабильная deepseek-v4-flash: цена та же, а экспериментальная vision-ветка не дает подтвержденной пользы. V4 Pro стоит втрое дороже и не принимает изображения, зато остается кандидатом для самых трудных текстовых агентов. Vision Exp выбирают, когда изображение действительно влияет на решение и модель прошла закрытый набор скриншотов, документов и отказов.
Модель доступна и через OpenRouter, где подтверждены несколько провайдеров, но цена, retention и поддержка полей могут отличаться от прямого API. DeepSeek Coder CLI — сторонний, не официальный клиент: наличие слова DeepSeek в названии не подтверждает поддержку image input, поэтому модель и формат нужно проверять отдельно.
Технически да, но только после canary-тестов, фиксации API-контракта, мониторинга качества и настройки fallback: DeepSeek прямо помечает модель как экспериментальную.
Напрямую нет. Поддерживаются JPEG, PNG, GIF и WebP; PDF нужно разбить на изображения или предварительно извлечь текст.
Картинка занимает до 384 входных токенов. При cache miss это максимум около $0,000084 вне пика или $0,000169 в пик, плюс текст, reasoning и ответ.
Да, до 600 за запрос с учетом лимитов общего размера и уменьшенного максимума стороны при 15 и более изображениях.
Официальный релиз этого не заявляет. MIT-лицензия и параметры опубликованы для текстовой V4, но отдельная model card Vision Exp отсутствует.
Проверьте точный model ID, роль сообщения, MIME-содержимое и взаимоисключающие image_url/file_id. Обычные V4 Flash и V4 Pro изображения не принимают.
Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.
$0.22 / $0.66 за 1M токенов по базовому off-peak тарифу V4 Flash; cache hit $0.007, peak-тариф выше
Рассчитать сценарий →Для диаграммы пока недостаточно сопоставимых тестов.
История семейства
Последовательность собрана по датам релиза моделей DeepSeek в каталоге. Она показывает соседние поколения, но не приписывает им совместимость или наследование архитектуры без отдельного источника.
Сервисы, инструменты, материалы и обсуждения, связанные с моделью.
Точных связей пока нет. Искать по разработчику.
Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.