Перейти к содержимому

DeepSeek V4, V3.2 и R1 в 2026: какую модель дипсик выбрать под задачу

Автор: Silvana · Дата: 02.08.2026 · Verified: 01.09.2026 · Reading time: 12 минут · Prerequisite: 002, 011

DeepSeek в 2026 — это две API-модели (deepseek-v4-flash и deepseek-v4-pro) плюс open-weight V3.2, R1-distill, Math-V2 и OCR под MIT-лицензией для self-hosting. Flash — рабочая лошадка за $0.14/$0.28 за миллион токенов, Pro — флагман за $0.435/$0.87. Контекст обоих — 1 миллион токенов, cache-hit практически бесплатен ($0.0028 у Flash). API совместим и с OpenAI, и с Anthropic SDK — миграция сводится к смене base_url. Оплата из РФ работает через посредников.

  • DeepSeek к августу 2026 выпустила четыре крупных семейства: V3.1, V3.2, V4 и специализированные (Math, OCR, R1-distill). API-сервис отдаёт две модели: deepseek-v4-flash и deepseek-v4-pro. Остальные — open-weight на HuggingFace для self-hosting.
  • DeepSeek-V4-Pro — флагман. 1.6T параметров всего, 49B активных (MoE). Контекст 1M токенов. Цена: $0.435/MTok input non-cached, $0.87/MTok output.
  • DeepSeek-V4-Flash — рабочая лошадка. 284B/13B (MoE). Контекст 1M. Цена: $0.14/MTok input non-cached, $0.28/MTok output. В 3× дешевле Pro.
  • Cache hit input обоих моделей — практически бесплатно: $0.0028 для Flash и $0.003625 для Pro за миллион токенов. Это самое агрессивное prompt-caching среди больших провайдеров.
  • DeepSeek-V3.2 и V3.2-Speciale — открытые веса на MIT-лицензии, 685B MoE. Speciale — reasoning-версия для сложной математики и научных задач, без tool-calling. Base V3.2 умеет tool-use.
  • DeepSeek-R1-0528-Qwen3-8B — маленькая дистилляция R1 в Qwen3-8B, MIT. На AIME 2024 набирает 86%, сопоставимо с Qwen3-235B-thinking. Для self-hosted reasoning.
  • DeepSeek-Math-V2 — специализированная математическая модель на базе V3.2-Exp-Base. Золото на IMO 2025, 118/120 на Putnam 2024. Apache 2.0.
  • API DeepSeek поддерживает как OpenAI-совместимый формат (https://api.deepseek.com), так и Anthropic-совместимый (https://api.deepseek.com/anthropic). Прямая оплата из РФ работает через посредников.

DeepSeek — китайская лаборатория, которая с 2024 года двигает open-weight фронт. То, что западные лабы (OpenAI, Anthropic, Google) держат закрытым, DeepSeek выкладывает под MIT-лицензией: скачивай веса, ставь на свои GPU, крути без API-платежей.

Мысленный образ: если OpenAI и Anthropic — это премиум-облако с прайсом за секунду, то DeepSeek — это одновременно «дешёвый качественный API» и «весы под замок для тех, кто не хочет облако». Одна и та же модель работает и как SaaS, и как self-hosted.

К августу 2026 внутри DeepSeek живут параллельно три поколения — V3.1, V3.2 и V4. API-сервис давно съехал на V4, а V3.2 остаётся хитом в open-source комьюнити, потому что уже отработан под vLLM, llama.cpp, ollama и десятки продакшн-стеков. Для российского разработчика это значит одно: если облачный API не устраивает — можно поднять DeepSeek у себя без ограничений по лицензии.

Ключевые вехи по опубликованным моделям и датам:

ПоколениеПример моделиДатаОсобенность
V2DeepSeek-V2Май 2024Первая MoE, привлекла внимание
V2.5DeepSeek-V2.5Сентябрь 2024Улучшенная V2
V3DeepSeek-V3Декабрь 2024671B MoE, 37B активных, первый прорыв в топ
R1DeepSeek-R1Январь 2025Chain-of-Thought, обучение через RL
R1-0528R1-0528-Qwen3-8BМай 2025Distill в маленькую модель
V3.1DeepSeek-V3.1, V3.1-Terminus2025Уточнённая V3
V3.2DeepSeek-V3.2, V3.2-Speciale, V3.2-ExpДекабрь 2025DSA (Sparse Attention), крупные бенчмарки
Math-V2DeepSeek-Math-V22025Специализация на теоремах
OCRDeepSeek-OCR, OCR-22025Визуальное сжатие для OCR
V4DeepSeek-V4-Flash, V4-Pro26 апреля 2026Hybrid Attention (CSA + HCA), 1M контекст

Для российского разработчика в 2026 году главный практический выбор идёт между: API (V4-Flash/V4-Pro) для облака и open-weight (V3.2, R1-distill, Math-V2) для self-hosting.

Verified specs из huggingface.co/deepseek-ai/DeepSeek-V4-Flash и api-docs.deepseek.com/quick_start/pricing:

ПараметрЗначение
Model ID (API)deepseek-v4-flash
Total parameters284B
Active parameters (MoE)13B
Контекст1 000 000 токенов
Максимум выхода384 000 токенов
АрхитектураHybrid Attention (CSA + HCA)
Точность весовFP4 (MoE) + FP8 (base)
Reasoning3 уровня: non-think, think-high, think-max
Цена input (cache hit)$0.0028 за 1M токенов
Цена input (cache miss)$0.14 за 1M токенов
Цена output$0.28 за 1M токенов
API endpointsChat Completions, Responses
Лицензия весовMIT

Ключевая фишка V4-Flash — гибридная архитектура внимания: Compressed Sparse Attention плюс Heavily Compressed Attention. По официальному техотчёту это даёт 27% от FLOPs V3.2 на один токен и 10% KV-кэша при контексте 1M. То есть та же длинная задача обходится в разы дешевле по инфраструктуре.

Три режима reasoning дают тонкий контроль:

  • Non-Think — быстрые интуитивные ответы, для рутины.
  • Think High — осознанный логический анализ, для стандартных сложных задач.
  • Think Max — полное развёртывание reasoning, для граничных случаев (олимпиадная математика, длинные логические цепочки).

Когда брать V4-Flash: любой продакшн, где нужен большой контекст, честная цена и приличное качество на русском. Дефолт по классу.

Verified specs из huggingface.co/deepseek-ai/DeepSeek-V4-Pro и api-docs.deepseek.com/quick_start/pricing:

ПараметрЗначение
Model ID (API)deepseek-v4-pro
Total parameters1.6T
Active parameters (MoE)49B
Контекст1 000 000 токенов
Максимум выхода384 000 токенов
Точность весовFP4 (MoE) + FP8 (base)
Reasoningпока high и max (полная поддержка ожидается)
Цена input (cache hit)$0.003625 за 1M токенов
Цена input (cache miss)$0.435 за 1M токенов
Цена output$0.87 за 1M токенов
API endpointsChat Completions (Responses — планируется)
Лицензия весовMIT

По бенчмаркам V4-Pro в режиме Max доходит до 93,5% на LiveCodeBench Pass@1, 3206 Codeforces rating и 89,8% на IMOAnswerBench — цифры одного уровня с закрытыми фронтир-моделями GPT-5.4 и Gemini-3.1-Pro.

Разница с Flash по цене: 3× дороже на входе, 3× дороже на выходе. Разница по качеству — заметна на сложных задачах: длинный код, глубокие математические выкладки, многошаговый reasoning на 20+ шагов. На повседневных задачах Flash часто «не отличишь на глаз».

Когда брать V4-Pro: сложная разработка, где ошибка стоит дорого; научный и математический разбор; сложные агенты на 50+ инструментов.

Verified specs из huggingface.co/deepseek-ai/DeepSeek-V3.2 и huggingface.co/deepseek-ai/DeepSeek-V3.2-Speciale:

ПараметрV3.2 (base)V3.2-Speciale
Total parameters685B685B
Active parameters (MoE)~37B~37B
АрхитектураDeepSeek Sparse Attention (DSA)То же + reasoning tuning
Tool callingДаНет
GPQA Diamond82,4%87,88%
SWE-bench Verified70%
AIME 202694,17%
MMLU-Pro85%
ЛицензияMITMIT
ДатаДекабрь 2025Декабрь 2025

Что уникально: DSA (Deep Sparse Attention) — эффективный механизм внимания, оптимизированный под длинный контекст. По внутренним замерам DeepSeek — сопоставимо с GPT-5 общего назначения, а Speciale-версия обходит GPT-5 в reasoning на уровне Gemini-3.0-Pro.

Speciale — отдельная ветка. Она не поддерживает tool-calling, только reasoning. Если вам нужен агент с вызовом функций — используйте базовый V3.2. Если нужен разбор олимпиадной задачи или доказательство теоремы — Speciale.

Когда брать V3.2 open-weight: когда нужен self-hosting на своих GPU (типично H100/H200 или ниже с квантизацией), когда данные не должны уходить в облако, когда хочется MIT-лицензию для коммерческого продукта без API-платежей.

Практическое замечание: 685B требует минимум 8×H100 в BF16 или 4×H100 при FP8. Для команд с бюджетом на инфраструктуру — оправдано. Для одиночных разработчиков — дешевле идти через API V4-Flash.

Verified specs из huggingface.co/deepseek-ai/DeepSeek-R1-0528-Qwen3-8B:

ПараметрЗначение
Параметры8B
BaseQwen3-8B
ТипDistill (R1-0528 → Qwen3-8B)
ЛицензияMIT (коммерция + дистилляция разрешены)
Дата релиза28 мая 2025
AIME 202486,0%
AIME 202576,3%
GPQA Diamond61,1%
LiveCodeBench60,5%

Что это: DeepSeek взяли большую R1-0528 (reasoning-модель на 671B), сгенерировали ей длинные цепочки рассуждений на математике/науке/коде, и на этих данных дообучили маленький Qwen3-8B. Получилась 8B-модель с reasoning-навыками, которые обычно требуют 200B+.

Ключевая цифра: 86% на AIME 2024 у модели в 8B. Это сопоставимо с Qwen3-235B-thinking, которая в 30 раз больше. Для локальной работы — прорыв.

Когда брать: локальный агент на одном GPU или даже CPU с квантизацией; edge-развёртывание; продукты, где нужен reasoning без облачных костов; исследование распределённых агентских систем без API-бюджета.

Ограничения: 8B — маленькая модель. Знаний она меньше знает, длинные документы держит слабее, генерализация ниже V4-Flash. Reasoning — да, эрудиция — нет.

Оригинальный R1 (671B) больше не имеет прямого API-endpoint у DeepSeek: обновлённая линия V3.2 и V4 вобрала его reasoning-возможности. Веса R1 остаются доступны для скачивания.

DeepSeek-Math-V2 (специализированная математическая)

Заголовок раздела «DeepSeek-Math-V2 (специализированная математическая)»

Verified specs из huggingface.co/deepseek-ai/DeepSeek-Math-V2:

ПараметрЗначение
Параметры685B
BaseDeepSeek-V3.2-Exp-Base
СпециализацияТеоремы, математический reasoning
ЛицензияApache 2.0
IMO 2025Gold
CMO 2024Gold
Putnam 2024118 из 120 (при масштабировании test-time compute)

Отличие от V3.2-Speciale: Math-V2 доводит reasoning до предела в математике, включая self-verifiable proofs — модель сама проверяет свои доказательства перед выдачей ответа. Это редкая архитектурная фича.

Когда брать: научные задачи, академические исследования, продукты для образования (олимпиадное решение, доказательства). Для типового бизнеса — избыточно.

Небольшие 3B-модели, специализированные на OCR через новую технику Contexts Optical Compression. Не альтернатива основным LLM, а инструмент для распознавания документов и таблиц из изображений. Открытые веса, MIT.

Для маркетолога это полезно: превратить PDF-каталог WB в текстовый датасет, распарсить фотографии этикеток, извлечь текст из скриншотов — задачи, где отдельная OCR-модель дешевле и точнее общего LLM.

Все цифры проверены 2 августа 2026 года на api-docs.deepseek.com и huggingface.co/deepseek-ai:

МодельTotal / ActiveКонтекстInput cache miss $/1MOutput $/1MСпециализацияДоступ
deepseek-v4-pro1.6T / 49B1M$0.435$0.87ФлагманAPI + open-weight
deepseek-v4-flash284B / 13B1M$0.14$0.28ДефолтAPI + open-weight
DeepSeek-V3.2685B / ~37B(см. HF card)— self-host —— self-host —Chat + toolsТолько веса (MIT)
DeepSeek-V3.2-Speciale685B / ~37B(см. HF card)— self-host —— self-host —Reasoning без toolsТолько веса (MIT)
DeepSeek-Math-V2685B / ~37B(см. HF card)— self-host —— self-host —Математика, доказательстваТолько веса (Apache 2.0)
DeepSeek-R1-0528-Qwen3-8B8B32K (Qwen3)— self-host —— self-host —Малый reasoningТолько веса (MIT)
DeepSeek-OCR / OCR-23B— self-host —— self-host —Распознавание документовТолько веса (MIT)

Cache hit input у V4 моделей стоит в 50–120 раз дешевле cache miss. Это самое агрессивное prompt-caching среди больших вендоров: если у вас RAG с одним и тем же system-промптом на 100k токенов — платите $0.28 за миллион cache-hit-токенов вместо $14. При 10 млн запросов в месяц экономия исчисляется тысячами долларов.

Планируемая peak/off-peak политика: DeepSeek объявила, что «API service will soon adopt a peak/off-peak pricing policy» — в пиковые часы (9:00–12:00 и 14:00–18:00 пекинского времени) цена удваивается. Дата ввода пока не объявлена, но следите за changelog.

Возьмите за нулевую точку deepseek-v4-flash через API. Это baseline по цене и качеству. Дальше три вопроса:

  1. Качество Flash недотягивает на вашей задаче? — попробуйте think max режим Flash (без смены модели). Если и это не помогает — переходите на V4-Pro.
  2. Данные не должны уходить в облако / нужна MIT-лицензия / есть инфраструктура? — берите DeepSeek-V3.2 open-weight через vLLM или ollama.
  3. Нужен reasoning на маленькой машине / edge-устройстве? — берите R1-0528-Qwen3-8B. 8B помещается на одну H100 в BF16 или на потребительский GPU в квантизации.

Практическая эвристика: V4-Flash для 90% задач, V4-Pro для остатка, open-weight для регуляторных ограничений.

Cross-ref с GPT-5.6 Sol/Terra/Luna и Claude Sonnet 5 для российского пользователя:

МодельInput $/1MOutput $/1MКонтекстOpen-weight
DeepSeek-V4-Pro$0.435$0.871MДа (MIT)
DeepSeek-V4-Flash$0.14$0.281MДа (MIT)
GPT-5.6 Sol$5.00$30.001.05MНет
GPT-5.6 Terra$2.00$12.001.05MНет
GPT-5.6 Luna$0.20$1.201.05MНет
Claude Sonnet 5по прайсу claude.com/pricingпо прайсузависит от версииНет

Разница в бизнес-модели: DeepSeek держит самые низкие цены среди крупных провайдеров плюс отдаёт веса. У OpenAI и Anthropic — облачный SaaS, качество premium, дороже. У Gemini — сильнее мультимодальность.

Практический совет: если ваш продукт делает миллионы дешёвых запросов и качество достаточно — DeepSeek выигрывает по стоимости с большим отрывом. Если качество важнее цены — прогоняйте свою реальную задачу на V4-Pro и на GPT-5.6 Sol и сравнивайте результат.

Ключевая проблема российского пользователя: прямая оплата DeepSeek с российской карты возможна не всегда. DeepSeek — китайский сервис, принимает Alipay, WeChat Pay, международные карты. Российские карты Visa/Mastercard/МИР работают нестабильно.

Что работает по состоянию на 2 августа 2026 года:

  1. Международный посредник для API. Российские SaaS-агрегаторы принимают рубли, отдают доступ к DeepSeek API через прокси. Ищите тех, кто прямо указывает deepseek-v4-flash и deepseek-v4-pro в списке моделей.
  2. Зарубежная карта. Работает, если есть карта иностранного банка. Технически всё легально.
  3. Оплата в криптовалюте. Часть агрегаторов принимает USDT/BTC и выдаёт баланс на DeepSeek.
  4. Self-hosting open-weight. Скачиваете V3.2 или R1-distill с HuggingFace, ставите на свои GPU или арендованные (Vast.ai, RunPod, Lambda Labs). Никакой платёжной системы не нужно.

Последний путь для российской команды с бюджетом на инфраструктуру часто оказывается самым устойчивым: платите один раз за GPU-часы у арендатора (USDT), веса скачиваете свободно, никаких санкционных рисков на уровне API-провайдера.

Сценарий 1. RAG-бот по документам компании. Задача: 100 000 запросов в месяц, средний вход 20K токенов (документы + вопрос), выход 500 токенов. System-промпт и общая база данных повторяются — попадают в кэш. Возьмите V4-Flash. Расчёт: 90% cache hit + 10% cache miss на входе = ~$3 + $28 = $31 + $14 на выходе = ~$45 в месяц. На V4-Pro это стоило бы ~$140. Разница 3×.

Сценарий 2. Юрист разбирает договор на 40 страниц. 40 страниц ≈ 30 000 токенов входа + 5 000 токенов ответа. Возьмите V4-Pro в режиме max. Стоимость: $0.013 (input miss) + $0.004 (output) = ~$0.02 за разбор. При 20 разборов в месяц — $0.40. На V4-Flash это же стоило бы $0.006, но качество на юридическом языке может отличаться — прогоните обе модели на своих примерах.

Сценарий 3. E-commerce сайт генерирует SEO-описания. 500 генераций в день, каждое описание 800 токенов на выход, входной промпт с примерами 3000 токенов. Возьмите V4-Flash с кэшированием примеров. День: 500 × ($0.003 input hit + $0.22 output) = ~$1.1. Месяц: ~$33. На GPT-5.6 Terra это стоило бы $180. Разница 5×.

Сценарий 4. Сложный агент на 50 инструментов для внутренней аналитики. Многошаговые рассуждения, сложный tool-calling, важна точность. Возьмите V4-Pro с reasoning=max. Отдельные шаги можете скидывать на Flash для дешевизны, но финальные решения оставьте на Pro. Cache hit critical — держите system-промпт и tool-схемы стабильными.

Сценарий 5. On-premise deployment для банка / медицины. Данные нельзя отправлять в облако. Возьмите DeepSeek-V3.2 open-weight и разверните на кластере 8×H100 через vLLM. Лицензия MIT — коммерция разрешена. Или ещё дешевле — R1-0528-Qwen3-8B для reasoning-задач на 1× GPU. Один раз настроили, платите только за GPU-часы, никаких API-платежей.

Куда пропал DeepSeek-R1 из API? Большая R1 (671B, январь 2025) была разовым релизом. Её reasoning-возможности вобрала в себя линия V3.2 и особенно V3.2-Speciale, а также V4. Через API теперь reasoning делается через think режимы в V4-Flash/V4-Pro. Веса оригинальной R1 остаются доступны на HuggingFace для скачивания.

Что такое DeepSeek Sparse Attention (DSA) и Hybrid Attention (CSA + HCA)? DSA — механизм внимания в V3.2, где модель «умно» пропускает большую часть матрицы внимания, экономя вычисления на длинных контекстах. Hybrid Attention в V4 — следующий шаг: сочетание Compressed Sparse Attention (агрессивное сжатие) и Heavily Compressed Attention (ещё агрессивнее). Практический эффект — V4-Flash тратит 27% FLOPs V3.2 на токен при таком же качестве.

Почему у V4 модели названы Flash и Pro, а не Sol/Terra/Luna как у GPT? Разный нейминг разных вендоров, семантики нет. Flash = «быстрая, дешёвая», Pro = «профессиональная, флагман». Аналогичное деление есть у Google (Gemini Flash / Pro), у Anthropic (Haiku / Sonnet / Opus).

Что такое peak/off-peak тарифы, о которых пишет DeepSeek? Планируемая политика: в пиковые часы Пекина (9:00–12:00 и 14:00–18:00 по CST) цена удваивается для всех моделей. Дата ввода пока не объявлена — следите за changelog. Практический совет: если у вас батчи — планируйте на off-peak, экономия удвоенная.

Почему Flash в 3 раза дешевле Pro, если разница в параметрах ~6×? Активные параметры — 13B у Flash и 49B у Pro (разница ~4×). Плюс архитектурные оптимизации Flash (гибридное внимание, FP4 для MoE). Плюс DeepSeek балансирует прайс так, чтобы Flash был очевидным дефолтом, а Pro — премиальным выбором для сложных задач. Классическая ценовая дискриминация.

Можно ли использовать DeepSeek для генерации изображений или голоса? Нет напрямую. V4-Flash/V4-Pro принимают только текст. Для OCR (распознавание изображений) есть DeepSeek-OCR и OCR-2, но это отдельные небольшие модели. Для генерации картинок и голоса берите другие вендоры (Yandex Cloud, GigaChat, Sber Kandinsky, HuggingFace для open-weight).

Насколько DeepSeek хорошо работает с русским языком? Работает достойно, но всегда прогоняйте на своих реальных задачах. Модели тренированы на большом мультиязычном корпусе, английский и китайский — сильнее всего, русский — на уровне «хороший, но не идеальный». Если у вас критично точное соблюдение TOV на русском — сравнивайте с YandexGPT-5 и GigaChat-3 Pro на своих примерах.

Что выгоднее для стартапа из РФ — DeepSeek через посредника или YandexGPT напрямую? Зависит от прайса посредника (обычно +15–30% к оригинальной цене DeepSeek) и объёма. При больших объёмах и агрессивном кэшировании DeepSeek часто выигрывает даже с наценкой. При маленьких объёмах и требовании к 152-ФЗ / резидентство данных — YandexGPT/GigaChat выигрывают за счёт RU-хостинга. Считайте на своих числах.

  • Артикул 035 — «DeepSeek API через российских посредников: сравнение по цене и SLA».
  • Артикул 036 — «Self-hosting DeepSeek-V3.2 на арендованных GPU: практика vLLM и ollama».
  • Артикул 011 — big-3 сравнение Claude / GPT / Gemini в единой таблице.
  • Артикул 020 / 022 — Claude Sonnet 5 и GPT-5.6 разборы для контекста.
  • Артикул 002 — базовое знакомство с LLM для тех, кто пришёл без бэкграунда.

Все ссылки проверены 2 августа 2026 года. Первоисточники — HuggingFace model cards и api-docs.deepseek.com.

  1. DeepSeek API Pricing — цены на deepseek-v4-flash и deepseek-v4-pro, cache hit / miss, context, max output. Проверено 02.08.2026.
  2. DeepSeek API Chat Completion — параметры API, reasoning effort levels. Проверено 02.08.2026.
  3. DeepSeek-V4-Flash model card — 284B/13B, Hybrid Attention, 1M контекст, бенчмарки. Проверено 02.08.2026.
  4. DeepSeek-V4-Pro model card — 1.6T/49B, LiveCodeBench 93,5%, Codeforces 3206. Проверено 02.08.2026.
  5. DeepSeek-V3.2 model card — 685B MoE, DSA architecture, MIT license. Проверено 02.08.2026.
  6. DeepSeek-V3.2-Speciale model card — reasoning-версия, GPQA 87,88%, без tool-calling. Проверено 02.08.2026.
  7. DeepSeek-Math-V2 model card — Apache 2.0, IMO 2025 Gold, Putnam 2024 118/120. Проверено 02.08.2026.
  8. DeepSeek-R1-0528-Qwen3-8B model card — AIME 2024 86%, 8B distill, MIT. Проверено 02.08.2026.
  9. DeepSeek AI organization on HuggingFace — сводный список опубликованных моделей. Проверено 02.08.2026.
  10. DeepSeek AI on GitHub — публичные репозитории (FlashMLA, DeepEP, DeepGEMM, 3FS). Проверено 02.08.2026.

Актуально на 02.08.2026. Модели, цены и условия доступа меняются часто. Перед бизнес-решением всегда сверяйся с первоисточником — все ссылки в разделе Sources выше. Peak/off-peak политика DeepSeek объявлена, но дата ввода пока не опубликована. RU-специфика (посредники, оплата) может измениться быстрее, чем прайс, — сверяйся отдельно перед оплатой.