Перейти к содержимому

Тарифы DeepSeek в 2026: цены API, веб-чат, KV Cache и off-peak

Автор: Silvana · Дата: 02.08.2026 · Verified: 01.09.2026 · Reading time: 11 минут · Prerequisite: 032

Тарифы DeepSeek в 2026 — самые низкие среди крупных AI-платформ: веб-чат работает без подписки, API стартует с $0.14 за миллион входных токенов и $0.28 за выходные у модели deepseek-v4-flash. Никаких Plus/Pro на chat.deepseek.com нет — интерфейс, обе модели, Thinking Mode и веб-поиск доступны без денег. Монетизация — только через platform.deepseek.com по pay-as-you-go. Ключевая механика — KV Cache: повторяющийся префикс промпта тарифицируется в 50 раз дешевле обычного input, off-peak по Пекину даёт ещё минус 50%. Оплата из РФ — через посредников или карту зарубежного банка.

  • DeepSeek в 2026 году — самая дешёвая крупная AI-платформа: веб-чат chat.deepseek.com бесплатный целиком, API стартует от $0.14 за миллион input токенов и $0.28 за миллион output (модель deepseek-v4-flash).
  • Никаких Plus / Pro подписок на веб-чат не существует. В отличие от ChatGPT ($20/мес), Claude ($20/мес) и Gemini ($20/мес) — DeepSeek не берёт денег с физлиц за интерфейс. Бесплатно доступны обе модели, Thinking Mode и веб-поиск.
  • Монетизация DeepSeek — только через platform.deepseek.com (пополняешь баланс, платишь по факту потребления токенов). Модель pay-as-you-go, без ежемесячных фиксов.
  • Ключевая фишка — KV Cache (Context Caching). Повторяющийся префикс промпта (system prompt, длинный документ, few-shot примеры) при повторном запросе тарифицируется в 50 раз дешевле обычного input: $0.0028/MTok вместо $0.14/MTok для deepseek-v4-flash.
  • Peak / off-peak. С 2026 года DeepSeek ввёл наценку 2x в пиковые часы (09:00–12:00 и 14:00–18:00 UTC+8, Beijing Time). Считай это скидкой 50% на off-peak, если запускаешь batch-задачи ночью по Пекину.
  • Rate limits — только по concurrency (одновременным подключениям): 2500 для flash, 500 для pro. RPM / TPM порогов формально нет — DeepSeek не публикует.
  • Оплата из РФ на platform.deepseek.com не работает картой Мир напрямую (китайский эквайринг Alipay / WeChat Pay + international Visa/Mastercard). Обходные пути — посредники или карта зарубежного банка.
  • Для рынка «цена/качество» на массовых задачах (кодогенерация, суммаризация, извлечение JSON) DeepSeek в 2026 году занял первое место — китайская лаборатория держит цены на 3-10x ниже OpenAI и Anthropic.

DeepSeek — китайская AI-лаборатория (Deepseek AI Ltd., Ханчжоу), которая с 2024 года выпускает мощные open-source модели и держит цены API на порядок ниже OpenAI, Anthropic и Google. В 2026 году это уже не «дешёвая альтернатива для тестов», а полноценный рабочий инструмент, который используют команды по всему миру для production-нагрузок.

Тарифная модель DeepSeek принципиально отличается от западных платформ. Там ты платишь $20/месяц за интерфейс (ChatGPT Plus, Claude Pro, Gemini Advanced), а API — отдельно. У DeepSeek веб-чат бесплатный — без лимитов на дневные сообщения, без «reasoning-квоты», без ограничений на длину диалога. Компания зарабатывает только на API-платформе, куда идут разработчики и команды с продуктовой нагрузкой.

Второе отличие — pay-as-you-go без обязательств. У Anthropic и OpenAI есть tiered billing, где нужно вручную выбирать лимит трат в месяц. У DeepSeek — просто пополняешь баланс (стартовый минимум обычно $2–10), и токены списываются по факту. Кончился баланс — API отдаёт 402 (Payment Required), пополнил — снова работает. Никаких invoicing, договоров, привязок.

Третье — уникальная механика peak / off-peak цен и KV-кэша, которая при правильной архитектуре снижает счёт в 5–20 раз. Ниже разбираем детально.

Веб-интерфейс chat.deepseek.com — точка входа для физлиц. Никакой платной версии не существует. Регистрация — email / Google / Apple / WeChat. После входа доступны обе флагманские модели, Thinking Mode и поиск по интернету.

Что доступно бесплатно в веб-чате (по состоянию на август 2026):

  • Обе модели — DeepSeek V4 Flash и DeepSeek V4 Pro (в интерфейсе переключаются кнопкой у поля ввода)
  • Thinking Mode — расширенное рассуждение через отдельную кнопку (аналог Extended thinking у Claude или Sol у ChatGPT). Работает без квот
  • Search (веб-поиск) — модель может обращаться к интернету при ответе. Отдельная кнопка
  • Загрузка файлов — до 50 файлов на диалог (PDF, txt, docx, изображения)
  • Длинные диалоги — контекст сохраняется в пределах сессии, без принудительного «Слишком длинный диалог, начни новый»
  • Экспорт диалога — копирование, шэринг ссылкой на конкретный ответ

Практических лимитов алгоритма пользователи в 2026 году не встречают — DeepSeek публично не декларирует «X сообщений в день». Есть anti-abuse throttling (при явных скрапинг-паттернах — 429), но обычный пользователь до него не доходит.

Чего нет в веб-чате:

  • Аналога Projects (ChatGPT) / Projects (Claude) — тред-организации по проектам. Всё в общем списке диалогов
  • Memory между сессиями (в отличие от ChatGPT / Claude памяти о предыдущих разговорах модель не имеет — каждый чат чистый)
  • Custom bots / GPTs — нельзя создать «своего» бота с preset-инструкцией
  • Voice Mode — только текст (ни Advanced Voice как у ChatGPT, ни Voice conversation как у Gemini)
  • Image generation — DeepSeek специализируется на текстовых моделях, картинки не рисует
  • Mobile app с полным функционалом — есть Android/iOS app, но фичи повторяют веб-версию

Кому этого достаточно: студент, копирайтер, аналитик, программист-любитель. Всё что нужно от «умного чат-ассистента» — есть. Reasoning-модель, поиск, длинный контекст, файлы — работают бесплатно, безлимитно.

Кому мало — команды с shared workspace, продуктовая интеграция, автоматизация. Для этого — API-платформа ниже.

DeepSeek API — pay-as-you-go, самые низкие цены в индустрии

Заголовок раздела «DeepSeek API — pay-as-you-go, самые низкие цены в индустрии»

API-платформа platform.deepseek.com — коммерческий продукт DeepSeek. Регистрация email + пополнение баланса. Дальше — обращения к endpointapi.deepseek.com/v1/chat/completions (OpenAI-совместимый) или api.deepseek.com/anthropic/messages (Anthropic-совместимый, работает из Claude Code / Codex / OpenCode).

Официальный прайс из api-docs.deepseek.com/quick_start/pricing (verified 02.08.2026):

МодельInput (Cache Hit)Input (Cache Miss)Output
deepseek-v4-flash$0.0028 / MTok$0.14 / MTok$0.28 / MTok
deepseek-v4-pro$0.003625 / MTok$0.435 / MTok$0.87 / MTok

MTok = 1 миллион токенов. Разбор колонок:

  • Input Cache Hit — цена за токены, которые попали в KV Cache при повторном запросе (совпадающий префикс). Дешевле в 50 раз.
  • Input Cache Miss — обычная цена за input токены (первичный запрос или без префикса).
  • Output — цена за токены ответа модели. Как правило output включает reasoning-токены Thinking Mode (когда включён).

Обе модели поддерживают:

  • Контекст 1M токенов (примерно 1600 страниц текста) — verified в api-docs
  • Максимальный output — 384K токенов (примерно 600 страниц) — verified в api-docs
  • Thinking Mode через параметр "thinking": {"type": "enabled"}
  • Reasoning effort через параметр "reasoning_effort": "high" (или low / medium)
  • Streaming ответов ("stream": true)

Разница между flash и pro:

  • flash — лёгкая, быстрая, для массовых задач (кодогенерация, извлечение JSON, суммаризация). Concurrency limit — 2500 одновременных запросов. Автообновление модели (сейчас DeepSeek-V4-Flash-0731)
  • pro — тяжёлая, для сложного reasoning, длинного анализа, специализированных задач (математика, юридический разбор, научный анализ). Concurrency limit — 500.

Peak / Off-Peak наценка (verified 02.08.2026):

DeepSeek применяет удвоенную цену в пиковые часы — 09:00–12:00 и 14:00–18:00 по Пекину (UTC+8), ежедневно. То есть в пиковые окна (примерно 4:00–7:00 и 9:00–13:00 UTC) все цены выше указанных в 2 раза.

Обратная сторона: в off-peak (все остальные часы, включая ночь по Пекину, вечер по Москве, день по Америке) — базовая цена. Если ты платишь только в off-peak — фактически получаешь скидку 50% относительно peak. Некоторые пользователи описывают это как «-75%» относительно peak-tier — считать надо от конкретного baseline.

Практически: batch-задачи (аналитика, обработка датасета, генерация тысяч описаний) в 2026 году имеет смысл запускать по московскому расписанию вечером 20:00–00:00 МСК (это off-peak по Пекину) или ночью 00:00–04:00 МСК — счёт снижается в 2 раза относительно дневного окна.

Ключевая инженерная особенность DeepSeek — автоматический on-disk KV Cache, включённый по умолчанию для всех пользователей. Механика (verbatim из api-docs.deepseek.com/guides/kv_cache):

  • Система выделяет cache prefix units на границах — в конце user input и в конце model output
  • При повторном запросе с тем же префиксом — cache hit, DeepSeek не пересчитывает эти токены, а достаёт из кэша
  • Long inputs / outputs режутся на cache prefix units через фиксированные интервалы
  • Cache persistence — «usually within a few hours to a few days» после последнего использования
  • Best-effort — 100% гарантии кэш-хита нет

Что это даёт по деньгам. Если у тебя чат-бот с длинным system prompt (например 3000 токенов), и он вызывается 10000 раз за день:

  • Без кэша: 10000 × 3000 × $0.14/MTok = $4.20/день за system prompt
  • С кэшем (2 из 10000 запросов будут cache miss, остальные — hit): ~$0.09/день (эконом. 98%)

Практический совет — держать стабильный префикс в начале каждого запроса (system message, few-shot примеры) и менять только последнее сообщение пользователя. Тогда KV Cache срабатывает почти всегда. Если менять что-то в system prompt — кэш инвалидируется, и все токены после точки различия — cache miss.

DeepSeek не публикует RPM (requests per minute) или TPM (tokens per minute) пороги, в отличие от OpenAI и Anthropic. Ограничение — concurrency (одновременные подключения), verified в api-docs.deepseek.com/quick_start/rate_limit:

МодельConcurrency limit
deepseek-v4-pro500
deepseek-v4-flash2500

«A request counts as one concurrent connection from the time it is sent until the model response is complete» (verbatim). Превышение — HTTP 429. Timeout: «If the request has not started inference after 10 minutes, the server will close the connection».

Практически: 2500 одновременных запросов к flash — это очень много. Обычные продуктовые нагрузки (10–100 rps) до лимита не дойдут. Batch-обработка (по 500–1000 параллельных worker-ов) — тоже нормально, если очередь построена правильно.

Аккаунты с большим historic-объёмом получают expanded quotas — «Accounts with expanded quotas receive individual per-user_id concurrency limits matching the base model limits». То есть если у тебя многопользовательский продукт — можно попросить DeepSeek выделить per-user лимиты, тогда один активный пользователь не съедает concurrency у другого.

Формула:

Cost = (input_cache_miss_tokens / 1M) × input_miss_price
+ (input_cache_hit_tokens / 1M) × input_hit_price
+ (output_tokens / 1M) × output_price

Пример 1 — чат-бот на flash, без кэша:

  • 1000 сообщений в день, средняя длина: input 1500 токенов, output 800 токенов
  • Cost = 1000 × (1500/1M × $0.14 + 800/1M × $0.28)
  • = 1000 × ($0.00021 + $0.000224)
  • = $0.43/день = ~$13/месяц

Пример 2 — тот же бот, с KV Cache (стабильный 1200-токенный system prompt):

  • 1000 сообщений: input = 1200 cached + 300 uncached, output 800
  • Cost = 1000 × (1200/1M × $0.0028 + 300/1M × $0.14 + 800/1M × $0.28)
  • = 1000 × ($0.0000034 + $0.000042 + $0.000224)
  • = $0.27/день = ~$8/месяц (экономия 38%)

Пример 3 — тот же бот, только в off-peak окне (по расписанию batch), с кэшем:

  • Все цены × 0.5 относительно приведённых выше (off-peak = base, но условно считаем как «скидка»)
  • Реально: те же ~$8/месяц. Off-peak — не «скидка», а отсутствие наценки peak. Если работаешь в peak — счёт станет $16/месяц.

Как включить caching — ничего не нужно. Включён по умолчанию. Единственное условие — держать длинный стабильный префикс в запросе, чтобы было что кэшировать. Если каждый запрос уникальный от первого токена — кэш не поможет.

Платформа platform.deepseek.com принимает:

  • Alipay и WeChat Pay — китайские платёжные системы. Работают только с китайским счётом или через посредника
  • International Visa/Mastercard — карты зарубежных банков (не РФ). Работают из ЕС, США, ОАЭ, Казахстана, Армении, Грузии, Турции
  • Card issued in Hong Kong — как отдельный canonical способ (в help-центре DeepSeek указано отдельно)

Российские Visa / Mastercard / Мир не проходят — китайский эквайринг блокирует BIN российских банков с 2022 года.

Обходные пути (по эффективности убывания):

Зарубежная карта банка Казахстана / Армении / Грузии / ОАЭ / Турции. Карта Visa / Mastercard, оформленная лично при визите в отделение. Работает как обычный клиентский платёж. Комиссии сверху нет, аккаунт нативный. Подходит тем, кто может физически открыть счёт в стране.

Wise / Revolut USD-баланс. Если есть счёт Wise или Revolut, привязанный к USD-балансу — работает как international Visa. Пополнение баланса через SWIFT-перевод или крипту.

Посредники (VLPay, EasyPay, PayPro Global). Российский пользователь переводит рубли посреднику, он списывает с своей зарубежной карты и пополняет ваш аккаунт DeepSeek. Комиссия 5–15% сверху. Атрибуция аккаунта нативная (за подписку платит «американская» карта).

Криптовалюта через посредника. Часть посредников принимает USDT / USDC / BTC и оплачивает подписку со своей зарубежной карты. Комиссия 5–10%. Работает для тех, кто уже держит крипту в некастодиальном кошельке.

Практически нужно пополнить баланс всего на $5–20 для старта — этого хватает на месяцы легкой продуктовой нагрузки. Не нужно ежемесячно проводить платежи (в отличие от подписок ChatGPT / Claude).

Off-peak trick — как экономить 50% на batch-нагрузках

Заголовок раздела «Off-peak trick — как экономить 50% на batch-нагрузках»

Это, пожалуй, самый простой и практичный «трюк» на DeepSeek в 2026 году. Если у тебя batch-задача (обработка датасета, генерация N карточек товаров, перевод статей, аналитика логов) — не запускай её в дневное время по Пекину.

Peak по UTC+8: 09:00–12:00 + 14:00–18:00. Пересчёт по МСК (UTC+3):

  • Peak-1: 04:00–07:00 МСК (утро в РФ, ночь в США)
  • Peak-2: 09:00–13:00 МСК (день в РФ)
  • Off-peak (все остальные часы): 07:00–09:00 МСК, 13:00–04:00 МСК следующего дня

Практический совет: запускать batch по расписанию в 20:00 МСК (вечер в РФ = ночь в Пекине). Счёт снижается на 50% относительно peak-часов.

Для real-time продукта (чат-бот, где пользователь ждёт ответ секунды) — off-peak не применим, работать по graphик пользователей. Для offline-batch (генерация 100000 SEO-описаний, разметка датасета, суммаризация архива) — вопрос архитектуры очереди.

Реализация: cron-job на 20:00 МСК → запускает Python-worker → потребляет очередь задач до 04:00 МСК (перед пиком). Сохраняет 50% счёта, потому что в peak-часы задачи не запускаются.

Прямое сравнение API-цен основных платформ (verified август 2026, в $ за 1M токенов):

Платформа / модельInput (miss)Input (cached)Output
DeepSeek V4 Flash$0.14$0.0028$0.28
DeepSeek V4 Pro$0.435$0.003625$0.87
OpenAI GPT-5.6 Sol$3.00$0.30$15.00
OpenAI GPT-5.6 Terra$0.30$0.03$2.40
OpenAI GPT-5.5 Instant$0.25$0.025$2.00
Anthropic Claude 4.7 Sonnet$3.00$0.30$15.00
Anthropic Claude 4.7 Haiku$0.80$0.08$4.00
Google Gemini 3.5 Pro$1.25$0.125$10.00
Google Gemini 3.5 Flash$0.10$0.01$0.40

Соотношения для input miss (за миллион токенов):

  • flash-класс: DeepSeek Flash ($0.14) ≈ Gemini Flash ($0.10) — конкурент только Google
  • Средний класс: DeepSeek Pro ($0.435) vs OpenAI Terra ($0.30) vs Gemini Pro ($1.25). DeepSeek Pro дороже Terra, но берёт лучшим reasoning
  • Флагман-класс reasoning: DeepSeek Pro ($0.435) vs GPT-5.6 Sol ($3.00) vs Claude Sonnet 5 ($3.00). Разница в 7 раз в пользу DeepSeek

Соотношения для output:

  • DeepSeek Flash $0.28 vs GPT-5.6 Sol $15 — разница в 53 раза для генерации ответов
  • DeepSeek Pro $0.87 vs Claude 4.7 Sonnet $15 — разница в 17 раз

Практически это значит: если задача требует много output-токенов (генерация статей, длинные ответы, кодогенерация — задачи, где output преобладает над input) — DeepSeek снижает счёт кардинально. На массовой продуктовой нагрузке экономия — тысячи долларов в месяц.

Оговорка про качество. DeepSeek V4 Pro на benchmarks reasoning (MMLU, HumanEval, MATH) в 2026 году показывает результаты близкие к GPT-5.6 Terra и Claude 4.7 Sonnet, но не всегда обгоняет GPT-5.6 Sol и Claude Opus. Для 90% продуктовых задач разница качества либо неощутима, либо в пределах 5%, а разница цены — 10-50x. Для критичных задач (юридический разбор, медицина, финансы с высокой ставкой ошибки) — тестировать в A/B на своих данных перед миграцией.

Три реальных сценария выбора между DeepSeek и западными платформами.

Сценарий 1. Стартап, генерирующий SEO-описания товаров для Wildberries / Ozon. 50000 карточек в месяц, каждая = запрос input ~500 токенов + output ~300 токенов.

Расчёт на GPT-5.6 Sol: 50000 × ($0.0015 + $0.0045) = $300/месяц.

Расчёт на DeepSeek V4 Flash: 50000 × ($0.00007 + $0.000084) = $7.7/месяц.

Экономия: $292/месяц (97%). Качество на этой задаче (генерация описания по данным карточки) — сопоставимое. При этом можно ещё применить KV Cache для стабильного system prompt (общий формат «Напиши SEO-описание для WB, соблюдай TOV, длина X»), тогда счёт снижается ещё на 30–50%.

Сценарий 2. Чат-бот поддержки клиентов на сайте (real-time, RU-язык). 3000 диалогов в день, среднее input 1500 токенов (RAG-контекст из базы знаний), output 400 токенов.

Расчёт на Claude 4.7 Sonnet: 3000 × 30 × (1500/1M × $3 + 400/1M × $15) = 90000 × ($0.0045 + $0.006) = $945/месяц.

Расчёт на DeepSeek V4 Flash с KV Cache (RAG-документы кэшируются): 90000 × (1500/1M × ~$0.007 + 400/1M × $0.28) ≈ 90000 × ($0.0000105 + $0.000112) = $11/месяц.

Экономия: $934/месяц (99%). Качество разговорного взаимодействия — сравнимое для типового FAQ / product support. Для сложных случаев (эмоциональный клиент, специфические юридические вопросы) — routing на Claude / GPT.

Сценарий 3. Массовая обработка датасета — извлечение JSON-полей из 200000 email писем клиентов для CRM. Batch-задача, запускается вечером в пятницу за выходные.

Расчёт на GPT-5.6 Sol: 200000 × (2000/1M × $3 + 500/1M × $15) = $1200 за batch.

Расчёт на DeepSeek V4 Flash в off-peak с KV Cache стабильного экстракт-инструкции 500 токенов: 200000 × ((500/1M × $0.0028) + (1500/1M × $0.14) + (500/1M × $0.28)) = 200000 × ($0.0000014 + $0.00021 + $0.00014) = $70 за batch.

Экономия: $1130 за batch (94%). При регулярной batch-обработке (еженедельно) — годовая экономия $58000.

Есть ли платная подписка на веб-чат DeepSeek?

Нет. В отличие от ChatGPT Plus ($20/мес), Claude Pro ($20/мес) и Gemini Advanced ($20/мес), у DeepSeek chat.deepseek.com — полностью бесплатный. Обе флагманские модели (V4 Flash и V4 Pro), Thinking Mode, поиск по интернету, загрузка файлов — доступны без карты.

Как отличается DeepSeek V4 Flash от V4 Pro?

Flash — быстрая и лёгкая модель для массовых задач (генерация описаний, извлечение JSON, суммаризация, диалоги в чат-боте). Pro — тяжёлая модель для сложного рассуждения (математика, длинный анализ документов, специализированные задачи). Обе поддерживают контекст 1M токенов и Thinking Mode. Concurrency limit — 2500 для flash, 500 для pro. Цена pro в 3,1x выше flash на input, 3,1x на output.

Работает ли DeepSeek API из России?

Технически — да, API endpoint api.deepseek.com доступен без блокировок. Оплата — сложнее: карты российских банков (Visa / Mastercard / Мир) не принимаются. Пути: карта зарубежного банка, Wise / Revolut, посредники (VLPay / EasyPay), крипта через посредника. Пополнение баланса — от $5–10.

Что такое peak / off-peak и как это работает?

DeepSeek применяет удвоенную цену в пиковые часы: 09:00–12:00 и 14:00–18:00 по Пекину (UTC+8). Остальные часы — базовая цена. По МСК (UTC+3) peak — это 04:00–07:00 и 09:00–13:00. Если запускать batch-задачи вечером или ночью по МСК — счёт в 2 раза ниже. Real-time продукт (чат-бот) работает по графику пользователей, эта фишка не применима.

Что такое KV Cache и как его использовать?

KV Cache — автоматическое кэширование одинаковых префиксов запросов. Если у тебя стабильный system prompt (или длинный документ, few-shot примеры), который повторяется в запросах — DeepSeek запоминает его и не пересчитывает при повторе. Цена cached токенов в 50 раз ниже: $0.0028/MTok vs $0.14/MTok. Ничего настраивать не нужно — включён по умолчанию. Условие — держать стабильный префикс.

Насколько DeepSeek дешевле OpenAI и Anthropic?

Ordinal — в 10–50 раз на большинстве задач. Точный коэффициент зависит от задачи (доля output vs input, использование Thinking Mode, применение caching). Пример: чат-бот на V4 Flash с KV Cache стоит ~$11/месяц против ~$945/месяц на Claude 4.7 Sonnet с той же нагрузкой (99% экономии).

Использует ли DeepSeek мои данные для обучения?

По ToS DeepSeek (в редакции 2026 года) API-запросы могут использоваться для улучшения моделей по умолчанию. Opt-out доступен в настройках аккаунта на platform.deepseek.com. На веб-чате — данные тоже используются для обучения по умолчанию. Для чувствительных данных (клиентские PII, коммерческие тайны, медицинские / юридические документы) — либо opt-out, либо использовать API OpenAI / Anthropic с более строгим корпоративным policy (Business / Enterprise). Отдельно: китайская юрисдикция DeepSeek означает, что данные потенциально доступны китайским госорганам по запросу — это должно быть отдельным compliance-соображением.

Есть ли Anthropic-совместимый endpoint?

Да. DeepSeek API работает как через OpenAI SDK (api.deepseek.com/v1/chat/completions), так и через Anthropic SDK (api.deepseek.com/anthropic/messages). Это значит, что Claude Code, GitHub Copilot, OpenCode и другие агентские инструменты можно направить на DeepSeek через смену base URL и API-ключа — без переписывания кода. Экономия для агентов, где Anthropic Claude Sonnet стоит десятки долларов в час активной работы, — кардинальная.

Как работает Thinking Mode на API?

Через параметр "thinking": {"type": "enabled"} в теле запроса. Reasoning-эффорт настраивается через "reasoning_effort": "high" / "medium" / "low". Reasoning-токены включаются в output-счёт. То есть если модель «размышляет» 5000 токенов и выдаёт итоговый ответ 500 токенов — счёт за 5500 output-токенов. Практический совет: для простых задач Thinking выключать (экономит output), для сложных — включать.

Какой context window у DeepSeek?

1 миллион токенов input, 384 тысячи токенов output. Это порядок больше чем у GPT-5.6 Sol (256K) и Claude 4.7 Sonnet (200K, extended до 1M только по запросу). На длинных документах (юридические договоры, тех-документация 500+ страниц) DeepSeek выигрывает.

Можно ли использовать DeepSeek коммерчески?

Да. API DeepSeek — полностью коммерческий продукт без ограничений на использование в SaaS-продуктах, автоматизации, генерации контента для клиентов. Веса некоторых моделей (не самые свежие) выложены на Hugging Face под MIT-лицензией — можно self-hostить. Но продуктовое качество (последняя версия, thinking mode, инфраструктура) — только через API-платформу.

Что если DeepSeek заблокируют в РФ?

Технически API доступен через прямой домен api.deepseek.com. Если РКН заблокирует — потребуется прокси / self-hosted инстанс через open-source веса. На август 2026 явных сигналов блокировки нет. Резервный сценарий: держать fallback на локальные модели через Ollama / vLLM или на Yandex GPT / GigaChat для критичных нагрузок.

Разобрались с ценами — теперь глубже в экосистему DeepSeek:

  • «DeepSeek V4 Flash vs V4 Pro: когда какая модель» (статья 036). Practical guide по выбору модели под задачу.
  • «KV Cache: как экономить 50-98% на API-нагрузках» (статья 037). Архитектурный разбор с примерами кода — не только для DeepSeek, но и для OpenAI / Anthropic caching.
  • «Как оплачивать AI-подписки и API из РФ в 2026» (статья 016). Полный гайд по посредникам, зарубежным картам, крипте.
  • «Тарифы Claude в 2026: подписка, API, Claude Code» (статья 034). Прямой конкурент DeepSeek по качеству — сравниваем детально.
  • «Локальные LLM: Ollama + open-source альтернатива API» (статья 041). Когда self-hosting дешевле API — критерии перехода.
  1. DeepSeek API Docs. Pricing — api-docs.deepseek.com/quick_start/pricing — verified 02.08.2026 (verbatim table: V4 Flash $0.14 / $0.0028 / $0.28, V4 Pro $0.435 / $0.003625 / $0.87 per MTok; peak hours 09:00–12:00 and 14:00–18:00 UTC+8 with 2x multiplier).
  2. DeepSeek API Docs. Rate Limit — api-docs.deepseek.com/quick_start/rate_limit — verified 02.08.2026 (verbatim concurrency limits: 2500 for flash, 500 for pro; 10-min timeout; HTTP 429 on excess).
  3. DeepSeek API Docs. Models — api-docs.deepseek.com/quick_start/model — verified 02.08.2026 (V4 Flash updated to DeepSeek-V4-Flash-0731; thinking mode via parameter).
  4. DeepSeek API Docs. Token Usage — api-docs.deepseek.com/quick_start/token_usage — verified 02.08.2026 (~0.3 tokens per English char, ~0.6 per Chinese char; official offline tokenizer available).
  5. DeepSeek API Docs. Context Caching (KV Cache) — api-docs.deepseek.com/guides/kv_cache — verified 02.08.2026 (on-disk caching enabled by default; cache prefix units at input/output boundaries; persistence «few hours to few days»; best-effort).
  6. DeepSeek Chat — chat.deepseek.com — verified 02.08.2026 (web chat free, both V4 models + Thinking Mode + Search accessible without paid tier).
  7. DeepSeek Platform — platform.deepseek.com — verified 02.08.2026 (pay-as-you-go API access, balance top-up, OpenAI + Anthropic SDK compatible endpoints).

Актуально на 02.08.2026. Модели, цены и условия доступа меняются часто. Перед бизнес-решением всегда сверяйся с первоисточником — все ссылки в разделе Sources выше.