Тарифы DeepSeek в 2026: цены API, веб-чат, KV Cache и off-peak
Автор: Silvana · Дата: 02.08.2026 · Verified: 01.09.2026 · Reading time: 11 минут · Prerequisite: 032
Тарифы DeepSeek в 2026 — самые низкие среди крупных AI-платформ: веб-чат работает без подписки, API стартует с $0.14 за миллион входных токенов и $0.28 за выходные у модели deepseek-v4-flash. Никаких Plus/Pro на chat.deepseek.com нет — интерфейс, обе модели, Thinking Mode и веб-поиск доступны без денег. Монетизация — только через platform.deepseek.com по pay-as-you-go. Ключевая механика — KV Cache: повторяющийся префикс промпта тарифицируется в 50 раз дешевле обычного input, off-peak по Пекину даёт ещё минус 50%. Оплата из РФ — через посредников или карту зарубежного банка.
- DeepSeek в 2026 году — самая дешёвая крупная AI-платформа: веб-чат chat.deepseek.com бесплатный целиком, API стартует от $0.14 за миллион input токенов и $0.28 за миллион output (модель
deepseek-v4-flash). - Никаких Plus / Pro подписок на веб-чат не существует. В отличие от ChatGPT ($20/мес), Claude ($20/мес) и Gemini ($20/мес) — DeepSeek не берёт денег с физлиц за интерфейс. Бесплатно доступны обе модели, Thinking Mode и веб-поиск.
- Монетизация DeepSeek — только через platform.deepseek.com (пополняешь баланс, платишь по факту потребления токенов). Модель pay-as-you-go, без ежемесячных фиксов.
- Ключевая фишка — KV Cache (Context Caching). Повторяющийся префикс промпта (system prompt, длинный документ, few-shot примеры) при повторном запросе тарифицируется в 50 раз дешевле обычного input:
$0.0028/MTokвместо$0.14/MTokдляdeepseek-v4-flash. - Peak / off-peak. С 2026 года DeepSeek ввёл наценку 2x в пиковые часы (09:00–12:00 и 14:00–18:00 UTC+8, Beijing Time). Считай это скидкой 50% на off-peak, если запускаешь batch-задачи ночью по Пекину.
- Rate limits — только по concurrency (одновременным подключениям): 2500 для flash, 500 для pro. RPM / TPM порогов формально нет — DeepSeek не публикует.
- Оплата из РФ на platform.deepseek.com не работает картой Мир напрямую (китайский эквайринг Alipay / WeChat Pay + international Visa/Mastercard). Обходные пути — посредники или карта зарубежного банка.
- Для рынка «цена/качество» на массовых задачах (кодогенерация, суммаризация, извлечение JSON) DeepSeek в 2026 году занял первое место — китайская лаборатория держит цены на 3-10x ниже OpenAI и Anthropic.
Что это и зачем
Заголовок раздела «Что это и зачем»DeepSeek — китайская AI-лаборатория (Deepseek AI Ltd., Ханчжоу), которая с 2024 года выпускает мощные open-source модели и держит цены API на порядок ниже OpenAI, Anthropic и Google. В 2026 году это уже не «дешёвая альтернатива для тестов», а полноценный рабочий инструмент, который используют команды по всему миру для production-нагрузок.
Тарифная модель DeepSeek принципиально отличается от западных платформ. Там ты платишь $20/месяц за интерфейс (ChatGPT Plus, Claude Pro, Gemini Advanced), а API — отдельно. У DeepSeek веб-чат бесплатный — без лимитов на дневные сообщения, без «reasoning-квоты», без ограничений на длину диалога. Компания зарабатывает только на API-платформе, куда идут разработчики и команды с продуктовой нагрузкой.
Второе отличие — pay-as-you-go без обязательств. У Anthropic и OpenAI есть tiered billing, где нужно вручную выбирать лимит трат в месяц. У DeepSeek — просто пополняешь баланс (стартовый минимум обычно $2–10), и токены списываются по факту. Кончился баланс — API отдаёт 402 (Payment Required), пополнил — снова работает. Никаких invoicing, договоров, привязок.
Третье — уникальная механика peak / off-peak цен и KV-кэша, которая при правильной архитектуре снижает счёт в 5–20 раз. Ниже разбираем детально.
Основной разбор
Заголовок раздела «Основной разбор»DeepSeek Chat (веб-чат) — бесплатно целиком
Заголовок раздела «DeepSeek Chat (веб-чат) — бесплатно целиком»Веб-интерфейс chat.deepseek.com — точка входа для физлиц. Никакой платной версии не существует. Регистрация — email / Google / Apple / WeChat. После входа доступны обе флагманские модели, Thinking Mode и поиск по интернету.
Что доступно бесплатно в веб-чате (по состоянию на август 2026):
- Обе модели — DeepSeek V4 Flash и DeepSeek V4 Pro (в интерфейсе переключаются кнопкой у поля ввода)
- Thinking Mode — расширенное рассуждение через отдельную кнопку (аналог Extended thinking у Claude или Sol у ChatGPT). Работает без квот
- Search (веб-поиск) — модель может обращаться к интернету при ответе. Отдельная кнопка
- Загрузка файлов — до 50 файлов на диалог (PDF, txt, docx, изображения)
- Длинные диалоги — контекст сохраняется в пределах сессии, без принудительного «Слишком длинный диалог, начни новый»
- Экспорт диалога — копирование, шэринг ссылкой на конкретный ответ
Практических лимитов алгоритма пользователи в 2026 году не встречают — DeepSeek публично не декларирует «X сообщений в день». Есть anti-abuse throttling (при явных скрапинг-паттернах — 429), но обычный пользователь до него не доходит.
Чего нет в веб-чате:
- Аналога Projects (ChatGPT) / Projects (Claude) — тред-организации по проектам. Всё в общем списке диалогов
- Memory между сессиями (в отличие от ChatGPT / Claude памяти о предыдущих разговорах модель не имеет — каждый чат чистый)
- Custom bots / GPTs — нельзя создать «своего» бота с preset-инструкцией
- Voice Mode — только текст (ни Advanced Voice как у ChatGPT, ни Voice conversation как у Gemini)
- Image generation — DeepSeek специализируется на текстовых моделях, картинки не рисует
- Mobile app с полным функционалом — есть Android/iOS app, но фичи повторяют веб-версию
Кому этого достаточно: студент, копирайтер, аналитик, программист-любитель. Всё что нужно от «умного чат-ассистента» — есть. Reasoning-модель, поиск, длинный контекст, файлы — работают бесплатно, безлимитно.
Кому мало — команды с shared workspace, продуктовая интеграция, автоматизация. Для этого — API-платформа ниже.
DeepSeek API — pay-as-you-go, самые низкие цены в индустрии
Заголовок раздела «DeepSeek API — pay-as-you-go, самые низкие цены в индустрии»API-платформа platform.deepseek.com — коммерческий продукт DeepSeek. Регистрация email + пополнение баланса. Дальше — обращения к endpointapi.deepseek.com/v1/chat/completions (OpenAI-совместимый) или api.deepseek.com/anthropic/messages (Anthropic-совместимый, работает из Claude Code / Codex / OpenCode).
Официальный прайс из api-docs.deepseek.com/quick_start/pricing (verified 02.08.2026):
| Модель | Input (Cache Hit) | Input (Cache Miss) | Output |
|---|---|---|---|
deepseek-v4-flash | $0.0028 / MTok | $0.14 / MTok | $0.28 / MTok |
deepseek-v4-pro | $0.003625 / MTok | $0.435 / MTok | $0.87 / MTok |
MTok = 1 миллион токенов. Разбор колонок:
- Input Cache Hit — цена за токены, которые попали в KV Cache при повторном запросе (совпадающий префикс). Дешевле в 50 раз.
- Input Cache Miss — обычная цена за input токены (первичный запрос или без префикса).
- Output — цена за токены ответа модели. Как правило output включает reasoning-токены Thinking Mode (когда включён).
Обе модели поддерживают:
- Контекст 1M токенов (примерно 1600 страниц текста) — verified в api-docs
- Максимальный output — 384K токенов (примерно 600 страниц) — verified в api-docs
- Thinking Mode через параметр
"thinking": {"type": "enabled"} - Reasoning effort через параметр
"reasoning_effort": "high"(илиlow/medium) - Streaming ответов (
"stream": true)
Разница между flash и pro:
- flash — лёгкая, быстрая, для массовых задач (кодогенерация, извлечение JSON, суммаризация). Concurrency limit — 2500 одновременных запросов. Автообновление модели (сейчас
DeepSeek-V4-Flash-0731) - pro — тяжёлая, для сложного reasoning, длинного анализа, специализированных задач (математика, юридический разбор, научный анализ). Concurrency limit — 500.
Peak / Off-Peak наценка (verified 02.08.2026):
DeepSeek применяет удвоенную цену в пиковые часы — 09:00–12:00 и 14:00–18:00 по Пекину (UTC+8), ежедневно. То есть в пиковые окна (примерно 4:00–7:00 и 9:00–13:00 UTC) все цены выше указанных в 2 раза.
Обратная сторона: в off-peak (все остальные часы, включая ночь по Пекину, вечер по Москве, день по Америке) — базовая цена. Если ты платишь только в off-peak — фактически получаешь скидку 50% относительно peak. Некоторые пользователи описывают это как «-75%» относительно peak-tier — считать надо от конкретного baseline.
Практически: batch-задачи (аналитика, обработка датасета, генерация тысяч описаний) в 2026 году имеет смысл запускать по московскому расписанию вечером 20:00–00:00 МСК (это off-peak по Пекину) или ночью 00:00–04:00 МСК — счёт снижается в 2 раза относительно дневного окна.
KV Cache — фишка, снижающая счёт в 5-50 раз
Заголовок раздела «KV Cache — фишка, снижающая счёт в 5-50 раз»Ключевая инженерная особенность DeepSeek — автоматический on-disk KV Cache, включённый по умолчанию для всех пользователей. Механика (verbatim из api-docs.deepseek.com/guides/kv_cache):
- Система выделяет cache prefix units на границах — в конце user input и в конце model output
- При повторном запросе с тем же префиксом — cache hit, DeepSeek не пересчитывает эти токены, а достаёт из кэша
- Long inputs / outputs режутся на cache prefix units через фиксированные интервалы
- Cache persistence — «usually within a few hours to a few days» после последнего использования
- Best-effort — 100% гарантии кэш-хита нет
Что это даёт по деньгам. Если у тебя чат-бот с длинным system prompt (например 3000 токенов), и он вызывается 10000 раз за день:
- Без кэша: 10000 × 3000 × $0.14/MTok = $4.20/день за system prompt
- С кэшем (2 из 10000 запросов будут cache miss, остальные — hit): ~$0.09/день (эконом. 98%)
Практический совет — держать стабильный префикс в начале каждого запроса (system message, few-shot примеры) и менять только последнее сообщение пользователя. Тогда KV Cache срабатывает почти всегда. Если менять что-то в system prompt — кэш инвалидируется, и все токены после точки различия — cache miss.
Rate limits — только concurrency
Заголовок раздела «Rate limits — только concurrency»DeepSeek не публикует RPM (requests per minute) или TPM (tokens per minute) пороги, в отличие от OpenAI и Anthropic. Ограничение — concurrency (одновременные подключения), verified в api-docs.deepseek.com/quick_start/rate_limit:
| Модель | Concurrency limit |
|---|---|
deepseek-v4-pro | 500 |
deepseek-v4-flash | 2500 |
«A request counts as one concurrent connection from the time it is sent until the model response is complete» (verbatim). Превышение — HTTP 429. Timeout: «If the request has not started inference after 10 minutes, the server will close the connection».
Практически: 2500 одновременных запросов к flash — это очень много. Обычные продуктовые нагрузки (10–100 rps) до лимита не дойдут. Batch-обработка (по 500–1000 параллельных worker-ов) — тоже нормально, если очередь построена правильно.
Аккаунты с большим historic-объёмом получают expanded quotas — «Accounts with expanded quotas receive individual per-user_id concurrency limits matching the base model limits». То есть если у тебя многопользовательский продукт — можно попросить DeepSeek выделить per-user лимиты, тогда один активный пользователь не съедает concurrency у другого.
Как считать стоимость запроса
Заголовок раздела «Как считать стоимость запроса»Формула:
Cost = (input_cache_miss_tokens / 1M) × input_miss_price + (input_cache_hit_tokens / 1M) × input_hit_price + (output_tokens / 1M) × output_priceПример 1 — чат-бот на flash, без кэша:
- 1000 сообщений в день, средняя длина: input 1500 токенов, output 800 токенов
- Cost = 1000 × (1500/1M × $0.14 + 800/1M × $0.28)
- = 1000 × ($0.00021 + $0.000224)
- = $0.43/день = ~$13/месяц
Пример 2 — тот же бот, с KV Cache (стабильный 1200-токенный system prompt):
- 1000 сообщений: input = 1200 cached + 300 uncached, output 800
- Cost = 1000 × (1200/1M × $0.0028 + 300/1M × $0.14 + 800/1M × $0.28)
- = 1000 × ($0.0000034 + $0.000042 + $0.000224)
- = $0.27/день = ~$8/месяц (экономия 38%)
Пример 3 — тот же бот, только в off-peak окне (по расписанию batch), с кэшем:
- Все цены × 0.5 относительно приведённых выше (off-peak = base, но условно считаем как «скидка»)
- Реально: те же ~$8/месяц. Off-peak — не «скидка», а отсутствие наценки peak. Если работаешь в peak — счёт станет $16/месяц.
Как включить caching — ничего не нужно. Включён по умолчанию. Единственное условие — держать длинный стабильный префикс в запросе, чтобы было что кэшировать. Если каждый запрос уникальный от первого токена — кэш не поможет.
Оплата DeepSeek из РФ
Заголовок раздела «Оплата DeepSeek из РФ»Платформа platform.deepseek.com принимает:
- Alipay и WeChat Pay — китайские платёжные системы. Работают только с китайским счётом или через посредника
- International Visa/Mastercard — карты зарубежных банков (не РФ). Работают из ЕС, США, ОАЭ, Казахстана, Армении, Грузии, Турции
- Card issued in Hong Kong — как отдельный canonical способ (в help-центре DeepSeek указано отдельно)
Российские Visa / Mastercard / Мир не проходят — китайский эквайринг блокирует BIN российских банков с 2022 года.
Обходные пути (по эффективности убывания):
Зарубежная карта банка Казахстана / Армении / Грузии / ОАЭ / Турции. Карта Visa / Mastercard, оформленная лично при визите в отделение. Работает как обычный клиентский платёж. Комиссии сверху нет, аккаунт нативный. Подходит тем, кто может физически открыть счёт в стране.
Wise / Revolut USD-баланс. Если есть счёт Wise или Revolut, привязанный к USD-балансу — работает как international Visa. Пополнение баланса через SWIFT-перевод или крипту.
Посредники (VLPay, EasyPay, PayPro Global). Российский пользователь переводит рубли посреднику, он списывает с своей зарубежной карты и пополняет ваш аккаунт DeepSeek. Комиссия 5–15% сверху. Атрибуция аккаунта нативная (за подписку платит «американская» карта).
Криптовалюта через посредника. Часть посредников принимает USDT / USDC / BTC и оплачивает подписку со своей зарубежной карты. Комиссия 5–10%. Работает для тех, кто уже держит крипту в некастодиальном кошельке.
Практически нужно пополнить баланс всего на $5–20 для старта — этого хватает на месяцы легкой продуктовой нагрузки. Не нужно ежемесячно проводить платежи (в отличие от подписок ChatGPT / Claude).
Off-peak trick — как экономить 50% на batch-нагрузках
Заголовок раздела «Off-peak trick — как экономить 50% на batch-нагрузках»Это, пожалуй, самый простой и практичный «трюк» на DeepSeek в 2026 году. Если у тебя batch-задача (обработка датасета, генерация N карточек товаров, перевод статей, аналитика логов) — не запускай её в дневное время по Пекину.
Peak по UTC+8: 09:00–12:00 + 14:00–18:00. Пересчёт по МСК (UTC+3):
- Peak-1: 04:00–07:00 МСК (утро в РФ, ночь в США)
- Peak-2: 09:00–13:00 МСК (день в РФ)
- Off-peak (все остальные часы): 07:00–09:00 МСК, 13:00–04:00 МСК следующего дня
Практический совет: запускать batch по расписанию в 20:00 МСК (вечер в РФ = ночь в Пекине). Счёт снижается на 50% относительно peak-часов.
Для real-time продукта (чат-бот, где пользователь ждёт ответ секунды) — off-peak не применим, работать по graphик пользователей. Для offline-batch (генерация 100000 SEO-описаний, разметка датасета, суммаризация архива) — вопрос архитектуры очереди.
Реализация: cron-job на 20:00 МСК → запускает Python-worker → потребляет очередь задач до 04:00 МСК (перед пиком). Сохраняет 50% счёта, потому что в peak-часы задачи не запускаются.
Сравнение с OpenAI / Anthropic / Google (август 2026)
Заголовок раздела «Сравнение с OpenAI / Anthropic / Google (август 2026)»Прямое сравнение API-цен основных платформ (verified август 2026, в $ за 1M токенов):
| Платформа / модель | Input (miss) | Input (cached) | Output |
|---|---|---|---|
| DeepSeek V4 Flash | $0.14 | $0.0028 | $0.28 |
| DeepSeek V4 Pro | $0.435 | $0.003625 | $0.87 |
| OpenAI GPT-5.6 Sol | $3.00 | $0.30 | $15.00 |
| OpenAI GPT-5.6 Terra | $0.30 | $0.03 | $2.40 |
| OpenAI GPT-5.5 Instant | $0.25 | $0.025 | $2.00 |
| Anthropic Claude 4.7 Sonnet | $3.00 | $0.30 | $15.00 |
| Anthropic Claude 4.7 Haiku | $0.80 | $0.08 | $4.00 |
| Google Gemini 3.5 Pro | $1.25 | $0.125 | $10.00 |
| Google Gemini 3.5 Flash | $0.10 | $0.01 | $0.40 |
Соотношения для input miss (за миллион токенов):
- flash-класс: DeepSeek Flash ($0.14) ≈ Gemini Flash ($0.10) — конкурент только Google
- Средний класс: DeepSeek Pro ($0.435) vs OpenAI Terra ($0.30) vs Gemini Pro ($1.25). DeepSeek Pro дороже Terra, но берёт лучшим reasoning
- Флагман-класс reasoning: DeepSeek Pro ($0.435) vs GPT-5.6 Sol ($3.00) vs Claude Sonnet 5 ($3.00). Разница в 7 раз в пользу DeepSeek
Соотношения для output:
- DeepSeek Flash $0.28 vs GPT-5.6 Sol $15 — разница в 53 раза для генерации ответов
- DeepSeek Pro $0.87 vs Claude 4.7 Sonnet $15 — разница в 17 раз
Практически это значит: если задача требует много output-токенов (генерация статей, длинные ответы, кодогенерация — задачи, где output преобладает над input) — DeepSeek снижает счёт кардинально. На массовой продуктовой нагрузке экономия — тысячи долларов в месяц.
Оговорка про качество. DeepSeek V4 Pro на benchmarks reasoning (MMLU, HumanEval, MATH) в 2026 году показывает результаты близкие к GPT-5.6 Terra и Claude 4.7 Sonnet, но не всегда обгоняет GPT-5.6 Sol и Claude Opus. Для 90% продуктовых задач разница качества либо неощутима, либо в пределах 5%, а разница цены — 10-50x. Для критичных задач (юридический разбор, медицина, финансы с высокой ставкой ошибки) — тестировать в A/B на своих данных перед миграцией.
Практика
Заголовок раздела «Практика»Три реальных сценария выбора между DeepSeek и западными платформами.
Сценарий 1. Стартап, генерирующий SEO-описания товаров для Wildberries / Ozon. 50000 карточек в месяц, каждая = запрос input ~500 токенов + output ~300 токенов.
Расчёт на GPT-5.6 Sol: 50000 × ($0.0015 + $0.0045) = $300/месяц.
Расчёт на DeepSeek V4 Flash: 50000 × ($0.00007 + $0.000084) = $7.7/месяц.
Экономия: $292/месяц (97%). Качество на этой задаче (генерация описания по данным карточки) — сопоставимое. При этом можно ещё применить KV Cache для стабильного system prompt (общий формат «Напиши SEO-описание для WB, соблюдай TOV, длина X»), тогда счёт снижается ещё на 30–50%.
Сценарий 2. Чат-бот поддержки клиентов на сайте (real-time, RU-язык). 3000 диалогов в день, среднее input 1500 токенов (RAG-контекст из базы знаний), output 400 токенов.
Расчёт на Claude 4.7 Sonnet: 3000 × 30 × (1500/1M × $3 + 400/1M × $15) = 90000 × ($0.0045 + $0.006) = $945/месяц.
Расчёт на DeepSeek V4 Flash с KV Cache (RAG-документы кэшируются): 90000 × (1500/1M × ~$0.007 + 400/1M × $0.28) ≈ 90000 × ($0.0000105 + $0.000112) = $11/месяц.
Экономия: $934/месяц (99%). Качество разговорного взаимодействия — сравнимое для типового FAQ / product support. Для сложных случаев (эмоциональный клиент, специфические юридические вопросы) — routing на Claude / GPT.
Сценарий 3. Массовая обработка датасета — извлечение JSON-полей из 200000 email писем клиентов для CRM. Batch-задача, запускается вечером в пятницу за выходные.
Расчёт на GPT-5.6 Sol: 200000 × (2000/1M × $3 + 500/1M × $15) = $1200 за batch.
Расчёт на DeepSeek V4 Flash в off-peak с KV Cache стабильного экстракт-инструкции 500 токенов: 200000 × ((500/1M × $0.0028) + (1500/1M × $0.14) + (500/1M × $0.28)) = 200000 × ($0.0000014 + $0.00021 + $0.00014) = $70 за batch.
Экономия: $1130 за batch (94%). При регулярной batch-обработке (еженедельно) — годовая экономия $58000.
Есть ли платная подписка на веб-чат DeepSeek?
Нет. В отличие от ChatGPT Plus ($20/мес), Claude Pro ($20/мес) и Gemini Advanced ($20/мес), у DeepSeek chat.deepseek.com — полностью бесплатный. Обе флагманские модели (V4 Flash и V4 Pro), Thinking Mode, поиск по интернету, загрузка файлов — доступны без карты.
Как отличается DeepSeek V4 Flash от V4 Pro?
Flash — быстрая и лёгкая модель для массовых задач (генерация описаний, извлечение JSON, суммаризация, диалоги в чат-боте). Pro — тяжёлая модель для сложного рассуждения (математика, длинный анализ документов, специализированные задачи). Обе поддерживают контекст 1M токенов и Thinking Mode. Concurrency limit — 2500 для flash, 500 для pro. Цена pro в 3,1x выше flash на input, 3,1x на output.
Работает ли DeepSeek API из России?
Технически — да, API endpoint api.deepseek.com доступен без блокировок. Оплата — сложнее: карты российских банков (Visa / Mastercard / Мир) не принимаются. Пути: карта зарубежного банка, Wise / Revolut, посредники (VLPay / EasyPay), крипта через посредника. Пополнение баланса — от $5–10.
Что такое peak / off-peak и как это работает?
DeepSeek применяет удвоенную цену в пиковые часы: 09:00–12:00 и 14:00–18:00 по Пекину (UTC+8). Остальные часы — базовая цена. По МСК (UTC+3) peak — это 04:00–07:00 и 09:00–13:00. Если запускать batch-задачи вечером или ночью по МСК — счёт в 2 раза ниже. Real-time продукт (чат-бот) работает по графику пользователей, эта фишка не применима.
Что такое KV Cache и как его использовать?
KV Cache — автоматическое кэширование одинаковых префиксов запросов. Если у тебя стабильный system prompt (или длинный документ, few-shot примеры), который повторяется в запросах — DeepSeek запоминает его и не пересчитывает при повторе. Цена cached токенов в 50 раз ниже: $0.0028/MTok vs $0.14/MTok. Ничего настраивать не нужно — включён по умолчанию. Условие — держать стабильный префикс.
Насколько DeepSeek дешевле OpenAI и Anthropic?
Ordinal — в 10–50 раз на большинстве задач. Точный коэффициент зависит от задачи (доля output vs input, использование Thinking Mode, применение caching). Пример: чат-бот на V4 Flash с KV Cache стоит ~$11/месяц против ~$945/месяц на Claude 4.7 Sonnet с той же нагрузкой (99% экономии).
Использует ли DeepSeek мои данные для обучения?
По ToS DeepSeek (в редакции 2026 года) API-запросы могут использоваться для улучшения моделей по умолчанию. Opt-out доступен в настройках аккаунта на platform.deepseek.com. На веб-чате — данные тоже используются для обучения по умолчанию. Для чувствительных данных (клиентские PII, коммерческие тайны, медицинские / юридические документы) — либо opt-out, либо использовать API OpenAI / Anthropic с более строгим корпоративным policy (Business / Enterprise). Отдельно: китайская юрисдикция DeepSeek означает, что данные потенциально доступны китайским госорганам по запросу — это должно быть отдельным compliance-соображением.
Есть ли Anthropic-совместимый endpoint?
Да. DeepSeek API работает как через OpenAI SDK (api.deepseek.com/v1/chat/completions), так и через Anthropic SDK (api.deepseek.com/anthropic/messages). Это значит, что Claude Code, GitHub Copilot, OpenCode и другие агентские инструменты можно направить на DeepSeek через смену base URL и API-ключа — без переписывания кода. Экономия для агентов, где Anthropic Claude Sonnet стоит десятки долларов в час активной работы, — кардинальная.
Как работает Thinking Mode на API?
Через параметр "thinking": {"type": "enabled"} в теле запроса. Reasoning-эффорт настраивается через "reasoning_effort": "high" / "medium" / "low". Reasoning-токены включаются в output-счёт. То есть если модель «размышляет» 5000 токенов и выдаёт итоговый ответ 500 токенов — счёт за 5500 output-токенов. Практический совет: для простых задач Thinking выключать (экономит output), для сложных — включать.
Какой context window у DeepSeek?
1 миллион токенов input, 384 тысячи токенов output. Это порядок больше чем у GPT-5.6 Sol (256K) и Claude 4.7 Sonnet (200K, extended до 1M только по запросу). На длинных документах (юридические договоры, тех-документация 500+ страниц) DeepSeek выигрывает.
Можно ли использовать DeepSeek коммерчески?
Да. API DeepSeek — полностью коммерческий продукт без ограничений на использование в SaaS-продуктах, автоматизации, генерации контента для клиентов. Веса некоторых моделей (не самые свежие) выложены на Hugging Face под MIT-лицензией — можно self-hostить. Но продуктовое качество (последняя версия, thinking mode, инфраструктура) — только через API-платформу.
Что если DeepSeek заблокируют в РФ?
Технически API доступен через прямой домен api.deepseek.com. Если РКН заблокирует — потребуется прокси / self-hosted инстанс через open-source веса. На август 2026 явных сигналов блокировки нет. Резервный сценарий: держать fallback на локальные модели через Ollama / vLLM или на Yandex GPT / GigaChat для критичных нагрузок.
Что дальше
Заголовок раздела «Что дальше»Разобрались с ценами — теперь глубже в экосистему DeepSeek:
- «DeepSeek V4 Flash vs V4 Pro: когда какая модель» (статья 036). Practical guide по выбору модели под задачу.
- «KV Cache: как экономить 50-98% на API-нагрузках» (статья 037). Архитектурный разбор с примерами кода — не только для DeepSeek, но и для OpenAI / Anthropic caching.
- «Как оплачивать AI-подписки и API из РФ в 2026» (статья 016). Полный гайд по посредникам, зарубежным картам, крипте.
- «Тарифы Claude в 2026: подписка, API, Claude Code» (статья 034). Прямой конкурент DeepSeek по качеству — сравниваем детально.
- «Локальные LLM: Ollama + open-source альтернатива API» (статья 041). Когда self-hosting дешевле API — критерии перехода.
Sources
Заголовок раздела «Sources»- DeepSeek API Docs. Pricing — api-docs.deepseek.com/quick_start/pricing — verified 02.08.2026 (verbatim table: V4 Flash $0.14 / $0.0028 / $0.28, V4 Pro $0.435 / $0.003625 / $0.87 per MTok; peak hours 09:00–12:00 and 14:00–18:00 UTC+8 with 2x multiplier).
- DeepSeek API Docs. Rate Limit — api-docs.deepseek.com/quick_start/rate_limit — verified 02.08.2026 (verbatim concurrency limits: 2500 for flash, 500 for pro; 10-min timeout; HTTP 429 on excess).
- DeepSeek API Docs. Models — api-docs.deepseek.com/quick_start/model — verified 02.08.2026 (V4 Flash updated to
DeepSeek-V4-Flash-0731; thinking mode via parameter). - DeepSeek API Docs. Token Usage — api-docs.deepseek.com/quick_start/token_usage — verified 02.08.2026 (~0.3 tokens per English char, ~0.6 per Chinese char; official offline tokenizer available).
- DeepSeek API Docs. Context Caching (KV Cache) — api-docs.deepseek.com/guides/kv_cache — verified 02.08.2026 (on-disk caching enabled by default; cache prefix units at input/output boundaries; persistence «few hours to few days»; best-effort).
- DeepSeek Chat — chat.deepseek.com — verified 02.08.2026 (web chat free, both V4 models + Thinking Mode + Search accessible without paid tier).
- DeepSeek Platform — platform.deepseek.com — verified 02.08.2026 (pay-as-you-go API access, balance top-up, OpenAI + Anthropic SDK compatible endpoints).
Актуальность
Заголовок раздела «Актуальность»Актуально на 02.08.2026. Модели, цены и условия доступа меняются часто. Перед бизнес-решением всегда сверяйся с первоисточником — все ссылки в разделе Sources выше.