
Где дешевле DeepSeek V4 Flash и V4 Pro — API, подписки и альтернативы
На 6 сентября 2026 года для нерегулярной нагрузки выгоднее PAYG: Flash дешевле всего в проверенном прямом API DeepInfra Flex — $0,064 за миллион новых входных и $0,144 за миллион выходных токенов, но запрос получает медленное best-effort scheduling; обычный real-time tier стоит…

На 6 сентября 2026 года для нерегулярной нагрузки выгоднее PAYG: Flash дешевле всего в проверенном прямом API DeepInfra Flex — $0,064 за миллион новых входных и $0,144 за миллион выходных токенов, но запрос получает медленное best-effort scheduling; обычный real-time tier стоит $0,08/$0,18. На OpenRouter есть ещё более дешёвый временный маршрут от $0,04998/$0,09996, но его цена и провайдер могут измениться. Для Pro самый понятный минимум — официальный DeepSeek вне пика: $0,66 за вход и $1,98 за выход. При постоянном кодинге OpenCode Go за $10 в месяц начинает окупаться после примерно $10 сопоставимого PAYG-расхода, однако модельные потолки ограничивают выгоду: около $30 usage для Flash и $15 для Pro. Бесплатный чат DeepSeek подходит для ручной работы, но не заменяет API.
Цены ниже проверены в один день и приведены в долларах за 1 млн токенов. Для оценки в рублях использован курс Банка России 86,5857 ₽ за $1, действующий на 6 сентября. Налог, комиссия карты и конвертация банка в расчёты не входят.
Какие модели сравниваются
На официальном endpoint короткие названия являются обновляемыми псевдонимами. Сейчас deepseek-v4-flash ведёт на DeepSeek-V4-Flash-0731, а deepseek-v4-pro — на DeepSeek-V4-Pro-0813. Обе модели принимают до 1 млн токенов контекста и могут выдать до 384 000 токенов. Они поддерживают обычный и thinking-режимы, JSON, вызов инструментов, Chat Completions, Responses API и Anthropic API. Актуальный маппинг и тарифы собраны в таблице моделей DeepSeek. Читать полный обзор сервиса DeepSeek
| Что указывает клиент | Какая ревизия ожидается | Контекст / max output | Насколько идентичность воспроизводима |
|---|---|---|---|
DeepSeek deepseek-v4-flash |
V4-Flash-0731 | 1M / 384K | официальный alias, сегодня указывает на 0731, позже может обновиться |
DeepSeek deepseek-v4-pro |
V4-Pro-0813 | 1M / 384K | официальный alias, сегодня указывает на 0813, позже может обновиться |
OpenRouter deepseek/deepseek-v4-flash-0731 |
V4-Flash-0731 | карточка endpoint: около 1,31M / 131K | версия закреплена, но лимиты отличаются от direct API и зависят от хоста |
Together или DeepInfra с суффиксом -0731/-0813 |
указанная ревизия | задаёт конкретный endpoint | проще повторить результат, но остаются различия serving stack и квантизации |
| OpenCode Zen/Go, ClinePass с именем без даты | публичная ревизия не закреплена | нужно читать metadata конкретного endpoint | маркетинговое имя не доказывает идентичную ревизию и max output |
Ollama deepseek-v4-flash:0731-cloud |
Flash-0731 | 1M на карточке | versioned tag надёжнее общего :cloud |
У V4 Flash и V4 Pro только текстовый вход. Для скриншотов, графиков и других изображений DeepSeek выпустил отдельную экспериментальную модель deepseek-v4-flash-vision-exp. Одинаковое слово Flash в названии не делает текстовую и vision-версию взаимозаменяемыми.
Сколько стоит официальный DeepSeek API
У DeepSeek действует почасовой тариф. Peak приходится на 01:00–04:00 и 06:00–10:00 UTC с понедельника по пятницу. В Москве это 04:00–07:00 и 09:00–13:00. Всё остальное время, включая выходные, оплачивается по ставке off-peak.
| Модель | Период | Cache hit input | Cache miss input | Output | 1M miss input + 1M output |
|---|---|---|---|---|---|
| V4 Flash | off-peak | $0,007 | $0,22 | $0,66 | $0,88 |
| V4 Flash | peak | $0,014 | $0,44 | $1,32 | $1,76 |
| V4 Pro | off-peak | $0,022 | $0,66 | $1,98 | $2,64 |
| V4 Pro | peak | $0,044 | $1,32 | $3,96 | $5,28 |
При одинаковом составе токенов Pro стоит ровно втрое дороже Flash. Thinking-токены включаются в output, поэтому высокий reasoning_effort, длинные tool loops и повторные попытки увеличивают счёт. По умолчанию thinking включён с effort high; доступны low, high и max.
Кэш DeepSeek создаётся автоматически. Повторный запрос получает льготную цену только для полностью совпавшего сохранённого префикса. Кэш работает best effort, строится несколько секунд и обычно очищается через несколько часов или дней. Поэтому нельзя заранее считать всю историю агента кэшированной: реальную долю видно в usage-полях ответа.
Где дешевле купить те же модели по API
Один прайс не описывает весь сервис. Стоимость посредника нужно читать вместе с точной ревизией, cache rate, комиссией пополнения, output limit, регионом и политикой хранения.
V4 Flash
| Провайдер | Model ID | Input miss | Output | Cache read | Что учесть |
|---|---|---|---|---|---|
| DeepSeek off-peak | deepseek-v4-flash |
$0,22 | $0,66 | $0,007 | первый источник модели; цена удваивается в peak |
| DeepInfra real-time | deepseek-ai/DeepSeek-V4-Flash-0731 |
$0,08 | $0,18 | $0,016 | обычный serverless tier |
| DeepInfra Flex | тот же | $0,064 | $0,144 | $0,0128 | на 20% дешевле real-time в обмен на медленное best-effort scheduling |
| Together | deepseek-ai/DeepSeek-V4-Flash-0731 |
$0,14 | $0,28 | $0,03 | versioned serverless endpoint; кэш дороже direct DeepSeek |
| Fireworks | accounts/fireworks/models/deepseek-v4-flash-0731 |
$0,22 | $0,66 | $0,007 | 1040K context, function calling; цена совпадает с direct off-peak |
| OpenCode Zen | deepseek-v4-flash |
$0,14 | $0,28 | $0,028 | удобный единый шлюз; публичный ID не фиксирует 0731 |
| OpenRouter | deepseek/deepseek-v4-flash-0731 |
от $0,04998 | от $0,09996 | от $0,009996 | нижняя строка — промо Baidu Qianfan на дату проверки; route и цена динамические |
Для запроса без кэша OpenRouter/Baidu дешевле официального off-peak Flash примерно в 5,9 раза: $0,14994 против $0,88 за 1M input + 1M output. Однако к покупке credits OpenRouter добавляет 5,5%, минимум $0,80. Пополнение на $10 обходится в $10,80, то есть эффективная комиссия равна 8%. Срок промо Baidu на карточке не указан.
DeepInfra real-time — более спокойный ценовой ориентир: $0,26 за тот же объём против $0,88 у DeepSeek off-peak. Flex снижает сумму до $0,208, если задача терпит ожидание свободной мощности. Cache read в real-time tier стоит $0,016, более чем вдвое дороже official $0,007. Чем выше реальный cache ratio, тем меньше преимущество дешёвого нового input.
V4 Pro
| Провайдер | Model ID | Input miss | Output | Cache read | Что учесть |
|---|---|---|---|---|---|
| DeepSeek off-peak | deepseek-v4-pro |
$0,66 | $1,98 | $0,022 | лучший воспроизводимый direct PAYG из проверенных вариантов |
| DeepSeek peak | тот же | $1,32 | $3,96 | $0,044 | вдвое дороже off-peak |
| DeepInfra | deepseek-ai/DeepSeek-V4-Pro-0813 |
$1,30 | $2,60 | $0,10 | versioned, но дороже official off-peak |
| Together | deepseek-ai/DeepSeek-V4-Pro-0813 |
$1,32 | $3,96 | $0,13 | versioned; близко к official peak |
| OpenCode Zen | deepseek-v4-pro |
$1,74 | $3,48 | $0,145 | новый input и cache дороже official даже в peak; output немного дешевле peak |
| OpenRouter | deepseek/deepseek-v4-pro-0813 |
карточка от $0,66 | от $1,98 | от $0,022 | верхняя цена совпадает с direct off-peak; апстримы и скидки меняются |
Для Pro посредник не даёт столь же очевидной постоянной экономии, как для Flash. Если задачу можно поставить в off-peak, direct DeepSeek дешевле проверенных фиксированных ставок DeepInfra, Together и Zen. OpenRouter полезен маршрутизацией и отказоустойчивостью, но после комиссии за credits route по $0,66/$1,98 уже не дешевле прямого аккаунта.
Калькулятор: как посчитать собственный счёт
Разделите input на кэшированный и новый, затем примените формулу:
стоимость = uncached input × input rate + cached input × cache rate + output × output rate.
Все объёмы в формуле измеряются в миллионах токенов. Например, 1M input при 80% cache hit и 1M output у official Flash off-peak стоит 0,2 × 0,22 + 0,8 × 0,007 + 1 × 0,66 = $0,7096. Без кэша тот же запрос стоил бы $0,88.
| Route/model | 1M input + 1M output, кэш 0% | То же, input cached на 80% |
|---|---|---|
| DeepSeek Flash off-peak | $0,8800 | $0,7096 |
| DeepSeek Flash peak | $1,7600 | $1,4192 |
| DeepSeek Pro off-peak | $2,6400 | $2,1296 |
| DeepSeek Pro peak | $5,2800 | $4,2592 |
| DeepInfra Flash | $0,2600 | $0,1960 |
| DeepInfra Flash Flex | $0,2080 | $0,1670 |
| OpenCode Zen Flash | $0,4200 | $0,3304 |
| OpenCode Zen Pro | $5,2200 | $3,9440 |
| OpenRouter/Baidu Flash, промо | $0,14994 | $0,11795 |
В строку OpenRouter не включена комиссия покупки credits. В production также появятся повторы после ошибок, служебные заголовки, результаты инструментов и reasoning output.
Три сценария для direct DeepSeek
| Нагрузка за месяц | Состав | Flash off-peak / peak | Pro off-peak / peak |
|---|---|---|---|
| Небольшой помощник | 5M input, 1M output, cache hit 20% | $1,55 / $3,09 | $4,64 / $9,28 |
| Кодинг-агент | 100M input, 10M output, cache hit 90% | $9,43 / $18,86 | $28,38 / $56,76 |
| Пакетный анализ базы знаний | 1B input, 50M output, cache hit 80% | $82,60 / $165,20 | $248,60 / $497,20 |
По курсу ЦБ первый сценарий стоит примерно 134 ₽ для Flash off-peak и 402 ₽ для Pro. Кодинг-сценарий — около 817 ₽ и 2 457 ₽, пакетный — 7 152 ₽ и 21 525 ₽. Это математические модели, а не обещание итогового списания.
Когда подписка дешевле API
Подписка выгодна в диапазоне между точкой окупаемости и самым ранним лимитом. Надпись «$10 в месяц» не означает безлимит, а рекламное число запросов зависит от длины истории, кэша и output.
| Подписка | Цена | Включённый объём | Окна и ограничения | Честная точка окупаемости |
|---|---|---|---|---|
| OpenCode Go | $10/мес | model Usage: Flash $30, Pro $15 | базово $12/5 ч, $30/нед, $60/мес; эффективный cap модели ниже; overage можно списывать с Zen | после $10 сопоставимого PAYG, пока не сработало окно или model cap |
| Ollama Pro | $20/мес или $200/год | $60 usage credits | 3 одновременных запроса, остаток не переносится | после $20 usage; максимум bundle value $60 |
| Ollama Max | $100/мес | $300 usage credits | 10 одновременных запросов | после $100 usage; максимум $300 |
| ClinePass | $9,99/мес | заявлено 2–5× standard API usage | есть 5-часовое, недельное и месячное окна, точные суммы не опубликованы | точный порог и потолок проверить нельзя |
OpenCode Go: break-even с учётом cap
Для 1M нового input и 1M output official Flash off-peak стоит $0,88. Подписка за $10 догоняет такой PAYG примерно после 11,36 условных порций; при 80% cache hit — после 14,09. Для Pro пороги равны 3,79 и 4,70 порции. В peak они наступают примерно вдвое раньше.
Текущие оценки OpenCode для типичного coding-request составляют 7 600/18 900/37 800 запросов Flash за 5 часов/неделю/месяц и 1 050/2 600/5 200 для Pro. Это расчётные запросы, а не гарантированное количество сообщений. Модельный monthly Usage равен $30 для Flash и $15 для Pro. Значит максимальная номинальная экономия до других лимитов — около $20 на Flash и $5 на Pro.
В нашем сценарии кодинг-агента Flash off-peak стоит $9,43 direct, поэтому Go пока на $0,57 дороже. Если та же работа проходит в peak за $18,86, Go уже выглядит выгоднее — при условии, что пятичасовое и недельное окна не сработают раньше. Сценарий Pro стоит $28,38 off-peak и превышает модельный cap $15: одной подписки на весь месяц не хватит. После лимита лучше явно переключить агента на выбранный PAYG-key; автоматический overage через Zen для Pro дороже direct off-peak.
Ollama: credits без недельного окна
Ollama Pro продаёт $60 токенного usage за $20 и даёт три concurrent requests. Для равномерной нагрузки от $20 до $60 это понятнее Go: нет отдельного недельного cap, а лишний usage можно докупить. При расходе ниже $20 PAYG дешевле. Неиспользованные credits сгорают при месячном reset.
У Ollama своё расписание DeepSeek: peak действует 12:00–18:00 UTC по будням, а не в часы official DeepSeek. Маршрут может выполняться в США, Европе или Сингапуре. Основной tag deepseek-v4-flash:cloud лучше заменить на :0731-cloud, если важна закреплённая ревизия.
ClinePass: дешёвый вход с непрозрачным потолком
ClinePass за $9,99 включает Flash и Pro и разрешает использовать модели через OpenAI-compatible API вне интерфейса Cline. Документация обещает 2–5× usage по сравнению со стандартным API и перечисляет три окна, но не публикует точные долларовые caps. Поэтому нельзя честно вычислить, сколько миллионов токенов или законченных задач войдёт в месяц.
Flash или Pro: когда переплата возвращается качеством
По опубликованным DeepSeek GA-to-GA тестам Pro сильнее в агентных задачах. Terminal Bench 2.1: 87,9 против 82,7 у Flash; NL2Repo: 61,5 против 54,2; DeepSWE: 62,7 против 54,4; Toolathlon-Verified: 74,1 против 70,3. Это тесты поставщика модели, часть наборов внутренняя, поэтому переносить разницу процентов прямо в экономию нельзя.
При одинаковых токенах Pro стоит втрое дороже. Он окупится по чистой цене инференса, если сократит суммарный объём и число повторных циклов примерно на две трети. Более реалистичная причина выбрать Pro — дорогая ошибка или час инженера: сложный рефакторинг, миграция схемы, неоднозначный production-инцидент, финальное ревью большого патча.
Flash разумнее поставить по умолчанию для:
- локальных правок и коротких edit-test loops;
- классификации, извлечения данных и массовых резюме;
- рутинного поиска по репозиторию;
- чернового плана и дешёвых tool-routing шагов;
- потоков, где важнее throughput и предсказуемый бюджет.
Pro стоит подключать точечно для:
- изменения контракта через несколько слоёв приложения;
- длинного анализа зависимостей и конфликтующих требований;
- сложной отладки, где Flash повторяет неудачный путь;
- проверки безопасности и риска потери данных;
- финального решения после дешёвого сбора контекста Flash.
Лучший показатель — cost per accepted task: стоимость всех токенов, retries и ручного исправления до принятого результата. Недельный A/B-тест на одинаковых задачах полезнее чужой общей оценки «модель умнее».
Задержка, лимиты и совместимость
Официальный DeepSeek разрешает до 2 500 одновременных запросов Flash и 500 Pro на аккаунт. Превышение возвращает HTTP 429. Если запрос не начал inference за 10 минут, соединение закрывается. Публичного SLA на странице условий нет.
На OpenRouter в момент проверки Flash endpoints показывали примерно 0,45–3,73 секунды latency и 22–168 токенов в секунду; Pro — около 0,47–3,64 секунды и 20–97 токенов в секунду. Метрики меняются по времени и региону. Для интерактивного агента важны отдельно time to first token, throughput, end-to-end time и tool-call error rate. Читать полный обзор сервиса OpenRouter
Точные account rate limits DeepInfra, Together и Fireworks не подтверждены их публичными model cards. Их нужно читать в dashboard или договоре конкретного аккаунта; переносить concurrency DeepSeek direct на сторонний endpoint нельзя.
OpenRouter умеет сортировать endpoints по цене, latency или throughput. Самый дешёвый route можно совместить с минимальным throughput, но fallback способен отправить следующий запрос другому хосту. Для повторяемого production-профиля закрепите versioned slug, provider, max price, требуемые параметры и правило fallback.
Совместимость «OpenAI-compatible» тоже неполна. DeepSeek Responses API остаётся stateless: previous_response_id, conversations, background mode и управляемый prompt cache не поддерживаются, переполнение контекста даёт 400. Часть неподдерживаемых параметров молча игнорируется. В thinking-mode агент должен возвращать reasoning_content на каждом шаге с tools, иначе API ответит ошибкой.
Пользователи Cline сообщали о 128K context вместо настроенного 1M и о сбоях разбора DeepSeek DSML tool calls. Эти issue не доказывают общий дефект модели, но показывают, зачем перед миграцией прогнать собственный harness: длинный контекст, streaming и non-streaming, JSON, параллельные инструменты, retry и recovery после 429.
Где будут храниться промпты
Прямой DeepSeek нельзя считать Zero Data Retention. Политика конфиденциальности DeepSeek включает prompts, файлы и историю чата в собираемые данные, допускает их использование для улучшения технологий и говорит об обработке и хранении в КНР. Срок зависит от цели; для части данных приведён пример хранения, пока существует аккаунт. Автоматический disk cache живёт часы или дни, поэтому store:false в Responses API не превращает endpoint в ZDR.
OpenCode заявляет хостинг моделей в США, отсутствие обучения и нулевое хранение у провайдеров, кроме перечисленных исключений. Для DeepSeek есть важная сноска: текущее ZDR-соглашение действительно до 30 сентября 2026 года и обновляется ежемесячно. После этой даты условие нужно перепроверить.
OpenRouter сам не сохраняет содержание prompts и responses без opt-in, но хранит metadata запроса. Политика upstream-провайдера отличается для каждого endpoint. Для чувствительного кода включите zdr: true и data_collection: "deny"; eligible pool станет меньше, а цена или скорость могут измениться.
Ollama пишет, что prompts и responses не логируются и не используются для обучения, а партнёры обязаны соблюдать no logging, no training и ZDR. DeepInfra, Together и Fireworks в публичных model cards подтверждают модель и цену, но эти карточки сами по себе не устанавливают account-specific retention, регион и договор обработки данных. Для закрытого репозитория нужен отдельный DPA или enterprise agreement.
Альтернативы DeepSeek по задаче
Смена кассы сохраняет модельные сильные и слабые стороны. Если Flash не проходит ваши тесты, иногда дешевле заменить модель для части шагов, чем многократно повторять запрос.
| Задача | Что проверить | Текущая цена в OpenCode Zen: input / output / cache, $ за 1M | Почему кандидат может быть полезен |
|---|---|---|---|
| Быстрые короткие циклы | GLM-5.3-Flash | 0,15 / 0,50 / 0,03 | резервный быстрый маршрут; сравнить tool accuracy и latency на своём harness |
| Универсальный агент средней цены | MiniMax M3 | 0,30 / 1,20 / 0,06 | альтернатива, если Flash застревает; оценить число принятых задач |
| Сложная работа по коду | Kimi K2.7 Code | 0,95 / 4,00 / 0,19 | специализированный кандидат для многофайловых изменений; output заметно дороже |
| Недорогой proprietary comparator | GPT-5.6 Luna | 0,20 / 1,20 / 0,02 | полезен как контроль качества; у маршрута OpenAI через Zen указано хранение 30 дней |
| Изображения и UI | DeepSeek V4 Flash Vision Exp | 0,14 / 0,28 / 0,028 в Zen | отдельная experimental vision-модель, текстовый Flash изображения не принимает |
| Резидентность и офлайн | собственный inference | платы за токены нет | данные остаются в своей инфраструктуре, но появляется стоимость GPU, памяти, электричества и SRE |
Официальные веса Flash и Pro доступны по MIT-лицензии. Flash содержит 284 млрд параметров, из которых активируются 13 млрд; Pro — 1,6 трлн и 49 млрд. Даже Flash требует серьёзной multi-GPU инфраструктуры, особенно при длинном контексте. Self-host следует выбирать ради контроля и стабильной большой нагрузки, а не из предположения, что «локально всегда бесплатно».
Как выбрать за один вечер
- Выгрузите из usage историю input, cached input, output, reasoning и retries хотя бы за неделю.
- Пересчитайте её по direct off-peak, direct peak, лучшему фиксированному стороннему API и подписке.
- Возьмите 20–50 реальных задач и измерьте accepted-task rate Flash и Pro, время человека и tool-call failures.
- Для посредника закрепите versioned model ID, provider, region, max price и privacy flags.
- Проверьте оплату и итоговую сумму на checkout отдельно. На 6 сентября $10 равны примерно 866 ₽ по курсу Банка России, но российская карта, VAT и банковская комиссия публично не подтверждены.
- Поставьте бюджетный лимит и alert. Не включайте auto-reload или дорогой fallback, пока не проверили, куда уйдёт запрос после cap.
Вывод
Для Flash минимальную цену сейчас даёт динамический OpenRouter route, а более воспроизводимый дешёвый direct-вариант — DeepInfra Flex для фоновых задач или его real-time tier для интерактивных. Для Pro официальный DeepSeek off-peak остаётся самым понятным низким PAYG среди проверенных фиксированных предложений. OpenCode Zen удобен единым ключом, но его Pro дорог, а у Flash кэш стоит больше, чем direct.
OpenCode Go выгоден регулярному кодингу в узком диапазоне: выше $10 прямого расхода, но ниже пятичасового, недельного и модельного cap. Ollama Pro подходит более ровной нагрузке до $60 usage без недельного окна. ClinePass выглядит недорого на входе, однако точный break-even невозможен без опубликованных caps.
Сначала выберите модель по стоимости принятой задачи, затем провайдера по цене, задержке и данным. Flash закрывает большую часть массовых и рутинных шагов. Pro стоит включать там, где его дополнительное качество уменьшает дорогие повторы или риск ошибки. Все цены, промо и ZDR-сноски нужно перепроверять перед пополнением баланса. Для более широкого выбора инструментов разработки полезен обзор ИИ-сервисов для программирования.
Автор статьи

Обозреватель SaaS-сервисов
Тестирует и анализирует облачные решения для маркетинга, продаж и аналитики. За плечами 8 лет работы в B2B-продуктах и более 120 детальных обзоров.
Вопросы и ответы
На 6 сентября 2026 года минимальная видимая ставка — OpenRouter/Baidu Qianfan: $0,04998 input и $0,09996 output за 1 млн токенов. Это промо без указанного срока, а покупка credits облагается комиссией. Среди проверенных фиксированных прямых сторонних API дешевле всего DeepInfra Flex: $0,064/$0,144 с best-effort scheduling; обычный real-time tier стоит $0,08/$0,18.
Для воспроизводимого PAYG — в official DeepSeek off-peak: $0,66 input, $0,022 cache hit и $1,98 output. Проверенные фиксированные ставки DeepInfra, Together и OpenCode Zen выше. Динамические OpenRouter endpoints могут меняться, поэтому сравнивайте checkout и provider route в день покупки.
При расходе меньше $10 в месяц прямой API дешевле. Go начинает окупаться выше этой суммы, но Flash ограничен примерно $30 model Usage в месяц, Pro — $15, плюс действуют пятичасовое и недельное окна. Нерегулярные лёгкие задачи удобнее PAYG, постоянные coding-сессии внутри caps — Go.
Go — подписка $10 с включённой квотой и окнами. Zen — PAYG-баланс по токенам без подписочного model cap. После исчерпания Go можно разрешить списание из Zen, но перед этим стоит сравнить его ставки: Pro в Zen дороже official DeepSeek off-peak.
Нет. Сайт предлагает бесплатный ручной чат, но не публикует численный лимит и не выдаёт API-трафик для агента или приложения. Для автоматизации нужен API-аккаунт, подписка с endpoint либо локальный inference.
У direct DeepSeek — 1M с max output 384K. Посредник может установить другой input/output cap: карточка OpenRouter Flash, например, показывает около 1,31M context и 131K max completion. Проверяйте metadata конкретного endpoint и реальный long-context тест.
Ставьте неизменяемые инструкции, справочные документы и раннюю историю в начало запроса. Кэш DeepSeek совпадает по полным префиксам и работает best effort. Не оценивайте экономию по желаемому cache ratio — сверяйте promptcachehittokens в usage.
Нет. Текстовые Flash и Pro не принимают изображения. Для них выпущен отдельный experimental deepseek-v4-flash-vision-exp; изображения преобразуются в input tokens и оплачиваются вместе с текстом.
Технически API его примет, но public privacy policy не обещает ZDR и указывает обработку данных в КНР. Для конфиденциального репозитория нужен договорный анализ. У OpenCode, OpenRouter с принудительным ZDR или Ollama условия выглядят строже, но их срок, endpoint и DPA также нужно проверить.
Публичные страницы не гарантируют работу российской карты и доступность во всех юрисдикциях. DeepSeek перечисляет банковскую карту, PayPal, Alipay и WeChat Pay, но фактический checkout, VAT, конвертация и комиссия зависят от аккаунта и платёжного инструмента. Не рассчитывайте бюджет только по курсу ЦБ.
Когда резидентность данных, офлайн-режим или очень большая постоянная нагрузка оправдывают собственную multi-GPU инфраструктуру. MIT-лицензия разрешает self-host, но 284B-параметровый Flash и 1,6T-параметровый Pro требуют дорогого железа и обслуживания. Для малого объёма API почти всегда проще посчитать и поддерживать.
Смотрите также

OpenCode Go: лимиты DeepSeek V4 Flash и Pro
26 сентября 2026 г.

GPT-5.3-Codex-Spark: что это за модель, где использовать и какие есть аналоги
26 сентября 2026 г.

Что такое Cursor CLI: как использовать и сравнение с конкурентами
25 сентября 2026 г.

Роутинг MCP и плагинов в ChatGPT/Codex, Claude Code, Cursor и Antigravity
25 сентября 2026 г.
Комментарии(0)
Оставьте комментарий
Войдите, чтобы присоединиться к обсуждению