DeepSeek V4, V3.2 и R1 в 2026: какую модель дипсик выбрать под задачу
Автор: Silvana · Дата: 02.08.2026 · Verified: 01.09.2026 · Reading time: 12 минут · Prerequisite: 002, 011
DeepSeek в 2026 — это две API-модели (deepseek-v4-flash и deepseek-v4-pro) плюс open-weight V3.2, R1-distill, Math-V2 и OCR под MIT-лицензией для self-hosting. Flash — рабочая лошадка за $0.14/$0.28 за миллион токенов, Pro — флагман за $0.435/$0.87. Контекст обоих — 1 миллион токенов, cache-hit практически бесплатен ($0.0028 у Flash). API совместим и с OpenAI, и с Anthropic SDK — миграция сводится к смене base_url. Оплата из РФ работает через посредников.
- DeepSeek к августу 2026 выпустила четыре крупных семейства: V3.1, V3.2, V4 и специализированные (Math, OCR, R1-distill). API-сервис отдаёт две модели:
deepseek-v4-flashиdeepseek-v4-pro. Остальные — open-weight на HuggingFace для self-hosting. - DeepSeek-V4-Pro — флагман. 1.6T параметров всего, 49B активных (MoE). Контекст 1M токенов. Цена: $0.435/MTok input non-cached, $0.87/MTok output.
- DeepSeek-V4-Flash — рабочая лошадка. 284B/13B (MoE). Контекст 1M. Цена: $0.14/MTok input non-cached, $0.28/MTok output. В 3× дешевле Pro.
- Cache hit input обоих моделей — практически бесплатно: $0.0028 для Flash и $0.003625 для Pro за миллион токенов. Это самое агрессивное prompt-caching среди больших провайдеров.
- DeepSeek-V3.2 и V3.2-Speciale — открытые веса на MIT-лицензии, 685B MoE. Speciale — reasoning-версия для сложной математики и научных задач, без tool-calling. Base V3.2 умеет tool-use.
- DeepSeek-R1-0528-Qwen3-8B — маленькая дистилляция R1 в Qwen3-8B, MIT. На AIME 2024 набирает 86%, сопоставимо с Qwen3-235B-thinking. Для self-hosted reasoning.
- DeepSeek-Math-V2 — специализированная математическая модель на базе V3.2-Exp-Base. Золото на IMO 2025, 118/120 на Putnam 2024. Apache 2.0.
- API DeepSeek поддерживает как OpenAI-совместимый формат (
https://api.deepseek.com), так и Anthropic-совместимый (https://api.deepseek.com/anthropic). Прямая оплата из РФ работает через посредников.
Что это и зачем
Заголовок раздела «Что это и зачем»DeepSeek — китайская лаборатория, которая с 2024 года двигает open-weight фронт. То, что западные лабы (OpenAI, Anthropic, Google) держат закрытым, DeepSeek выкладывает под MIT-лицензией: скачивай веса, ставь на свои GPU, крути без API-платежей.
Мысленный образ: если OpenAI и Anthropic — это премиум-облако с прайсом за секунду, то DeepSeek — это одновременно «дешёвый качественный API» и «весы под замок для тех, кто не хочет облако». Одна и та же модель работает и как SaaS, и как self-hosted.
К августу 2026 внутри DeepSeek живут параллельно три поколения — V3.1, V3.2 и V4. API-сервис давно съехал на V4, а V3.2 остаётся хитом в open-source комьюнити, потому что уже отработан под vLLM, llama.cpp, ollama и десятки продакшн-стеков. Для российского разработчика это значит одно: если облачный API не устраивает — можно поднять DeepSeek у себя без ограничений по лицензии.
Основной разбор
Заголовок раздела «Основной разбор»Обзор истории DeepSeek
Заголовок раздела «Обзор истории DeepSeek»Ключевые вехи по опубликованным моделям и датам:
| Поколение | Пример модели | Дата | Особенность |
|---|---|---|---|
| V2 | DeepSeek-V2 | Май 2024 | Первая MoE, привлекла внимание |
| V2.5 | DeepSeek-V2.5 | Сентябрь 2024 | Улучшенная V2 |
| V3 | DeepSeek-V3 | Декабрь 2024 | 671B MoE, 37B активных, первый прорыв в топ |
| R1 | DeepSeek-R1 | Январь 2025 | Chain-of-Thought, обучение через RL |
| R1-0528 | R1-0528-Qwen3-8B | Май 2025 | Distill в маленькую модель |
| V3.1 | DeepSeek-V3.1, V3.1-Terminus | 2025 | Уточнённая V3 |
| V3.2 | DeepSeek-V3.2, V3.2-Speciale, V3.2-Exp | Декабрь 2025 | DSA (Sparse Attention), крупные бенчмарки |
| Math-V2 | DeepSeek-Math-V2 | 2025 | Специализация на теоремах |
| OCR | DeepSeek-OCR, OCR-2 | 2025 | Визуальное сжатие для OCR |
| V4 | DeepSeek-V4-Flash, V4-Pro | 26 апреля 2026 | Hybrid Attention (CSA + HCA), 1M контекст |
Для российского разработчика в 2026 году главный практический выбор идёт между: API (V4-Flash/V4-Pro) для облака и open-weight (V3.2, R1-distill, Math-V2) для self-hosting.
DeepSeek-V4-Flash (API рабочая лошадка)
Заголовок раздела «DeepSeek-V4-Flash (API рабочая лошадка)»Verified specs из huggingface.co/deepseek-ai/DeepSeek-V4-Flash и api-docs.deepseek.com/quick_start/pricing:
| Параметр | Значение |
|---|---|
| Model ID (API) | deepseek-v4-flash |
| Total parameters | 284B |
| Active parameters (MoE) | 13B |
| Контекст | 1 000 000 токенов |
| Максимум выхода | 384 000 токенов |
| Архитектура | Hybrid Attention (CSA + HCA) |
| Точность весов | FP4 (MoE) + FP8 (base) |
| Reasoning | 3 уровня: non-think, think-high, think-max |
| Цена input (cache hit) | $0.0028 за 1M токенов |
| Цена input (cache miss) | $0.14 за 1M токенов |
| Цена output | $0.28 за 1M токенов |
| API endpoints | Chat Completions, Responses |
| Лицензия весов | MIT |
Ключевая фишка V4-Flash — гибридная архитектура внимания: Compressed Sparse Attention плюс Heavily Compressed Attention. По официальному техотчёту это даёт 27% от FLOPs V3.2 на один токен и 10% KV-кэша при контексте 1M. То есть та же длинная задача обходится в разы дешевле по инфраструктуре.
Три режима reasoning дают тонкий контроль:
- Non-Think — быстрые интуитивные ответы, для рутины.
- Think High — осознанный логический анализ, для стандартных сложных задач.
- Think Max — полное развёртывание reasoning, для граничных случаев (олимпиадная математика, длинные логические цепочки).
Когда брать V4-Flash: любой продакшн, где нужен большой контекст, честная цена и приличное качество на русском. Дефолт по классу.
DeepSeek-V4-Pro (API флагман)
Заголовок раздела «DeepSeek-V4-Pro (API флагман)»Verified specs из huggingface.co/deepseek-ai/DeepSeek-V4-Pro и api-docs.deepseek.com/quick_start/pricing:
| Параметр | Значение |
|---|---|
| Model ID (API) | deepseek-v4-pro |
| Total parameters | 1.6T |
| Active parameters (MoE) | 49B |
| Контекст | 1 000 000 токенов |
| Максимум выхода | 384 000 токенов |
| Точность весов | FP4 (MoE) + FP8 (base) |
| Reasoning | пока high и max (полная поддержка ожидается) |
| Цена input (cache hit) | $0.003625 за 1M токенов |
| Цена input (cache miss) | $0.435 за 1M токенов |
| Цена output | $0.87 за 1M токенов |
| API endpoints | Chat Completions (Responses — планируется) |
| Лицензия весов | MIT |
По бенчмаркам V4-Pro в режиме Max доходит до 93,5% на LiveCodeBench Pass@1, 3206 Codeforces rating и 89,8% на IMOAnswerBench — цифры одного уровня с закрытыми фронтир-моделями GPT-5.4 и Gemini-3.1-Pro.
Разница с Flash по цене: 3× дороже на входе, 3× дороже на выходе. Разница по качеству — заметна на сложных задачах: длинный код, глубокие математические выкладки, многошаговый reasoning на 20+ шагов. На повседневных задачах Flash часто «не отличишь на глаз».
Когда брать V4-Pro: сложная разработка, где ошибка стоит дорого; научный и математический разбор; сложные агенты на 50+ инструментов.
DeepSeek-V3.2 и V3.2-Speciale (open-weight)
Заголовок раздела «DeepSeek-V3.2 и V3.2-Speciale (open-weight)»Verified specs из huggingface.co/deepseek-ai/DeepSeek-V3.2 и huggingface.co/deepseek-ai/DeepSeek-V3.2-Speciale:
| Параметр | V3.2 (base) | V3.2-Speciale |
|---|---|---|
| Total parameters | 685B | 685B |
| Active parameters (MoE) | ~37B | ~37B |
| Архитектура | DeepSeek Sparse Attention (DSA) | То же + reasoning tuning |
| Tool calling | Да | Нет |
| GPQA Diamond | 82,4% | 87,88% |
| SWE-bench Verified | 70% | — |
| AIME 2026 | 94,17% | — |
| MMLU-Pro | 85% | — |
| Лицензия | MIT | MIT |
| Дата | Декабрь 2025 | Декабрь 2025 |
Что уникально: DSA (Deep Sparse Attention) — эффективный механизм внимания, оптимизированный под длинный контекст. По внутренним замерам DeepSeek — сопоставимо с GPT-5 общего назначения, а Speciale-версия обходит GPT-5 в reasoning на уровне Gemini-3.0-Pro.
Speciale — отдельная ветка. Она не поддерживает tool-calling, только reasoning. Если вам нужен агент с вызовом функций — используйте базовый V3.2. Если нужен разбор олимпиадной задачи или доказательство теоремы — Speciale.
Когда брать V3.2 open-weight: когда нужен self-hosting на своих GPU (типично H100/H200 или ниже с квантизацией), когда данные не должны уходить в облако, когда хочется MIT-лицензию для коммерческого продукта без API-платежей.
Практическое замечание: 685B требует минимум 8×H100 в BF16 или 4×H100 при FP8. Для команд с бюджетом на инфраструктуру — оправдано. Для одиночных разработчиков — дешевле идти через API V4-Flash.
DeepSeek-R1-0528-Qwen3-8B (маленькая reasoning-модель)
Заголовок раздела «DeepSeek-R1-0528-Qwen3-8B (маленькая reasoning-модель)»Verified specs из huggingface.co/deepseek-ai/DeepSeek-R1-0528-Qwen3-8B:
| Параметр | Значение |
|---|---|
| Параметры | 8B |
| Base | Qwen3-8B |
| Тип | Distill (R1-0528 → Qwen3-8B) |
| Лицензия | MIT (коммерция + дистилляция разрешены) |
| Дата релиза | 28 мая 2025 |
| AIME 2024 | 86,0% |
| AIME 2025 | 76,3% |
| GPQA Diamond | 61,1% |
| LiveCodeBench | 60,5% |
Что это: DeepSeek взяли большую R1-0528 (reasoning-модель на 671B), сгенерировали ей длинные цепочки рассуждений на математике/науке/коде, и на этих данных дообучили маленький Qwen3-8B. Получилась 8B-модель с reasoning-навыками, которые обычно требуют 200B+.
Ключевая цифра: 86% на AIME 2024 у модели в 8B. Это сопоставимо с Qwen3-235B-thinking, которая в 30 раз больше. Для локальной работы — прорыв.
Когда брать: локальный агент на одном GPU или даже CPU с квантизацией; edge-развёртывание; продукты, где нужен reasoning без облачных костов; исследование распределённых агентских систем без API-бюджета.
Ограничения: 8B — маленькая модель. Знаний она меньше знает, длинные документы держит слабее, генерализация ниже V4-Flash. Reasoning — да, эрудиция — нет.
Оригинальный R1 (671B) больше не имеет прямого API-endpoint у DeepSeek: обновлённая линия V3.2 и V4 вобрала его reasoning-возможности. Веса R1 остаются доступны для скачивания.
DeepSeek-Math-V2 (специализированная математическая)
Заголовок раздела «DeepSeek-Math-V2 (специализированная математическая)»Verified specs из huggingface.co/deepseek-ai/DeepSeek-Math-V2:
| Параметр | Значение |
|---|---|
| Параметры | 685B |
| Base | DeepSeek-V3.2-Exp-Base |
| Специализация | Теоремы, математический reasoning |
| Лицензия | Apache 2.0 |
| IMO 2025 | Gold |
| CMO 2024 | Gold |
| Putnam 2024 | 118 из 120 (при масштабировании test-time compute) |
Отличие от V3.2-Speciale: Math-V2 доводит reasoning до предела в математике, включая self-verifiable proofs — модель сама проверяет свои доказательства перед выдачей ответа. Это редкая архитектурная фича.
Когда брать: научные задачи, академические исследования, продукты для образования (олимпиадное решение, доказательства). Для типового бизнеса — избыточно.
DeepSeek-OCR и OCR-2 (визуальные)
Заголовок раздела «DeepSeek-OCR и OCR-2 (визуальные)»Небольшие 3B-модели, специализированные на OCR через новую технику Contexts Optical Compression. Не альтернатива основным LLM, а инструмент для распознавания документов и таблиц из изображений. Открытые веса, MIT.
Для маркетолога это полезно: превратить PDF-каталог WB в текстовый датасет, распарсить фотографии этикеток, извлечь текст из скриншотов — задачи, где отдельная OCR-модель дешевле и точнее общего LLM.
Сравнительная таблица моделей DeepSeek
Заголовок раздела «Сравнительная таблица моделей DeepSeek»Все цифры проверены 2 августа 2026 года на api-docs.deepseek.com и huggingface.co/deepseek-ai:
| Модель | Total / Active | Контекст | Input cache miss $/1M | Output $/1M | Специализация | Доступ |
|---|---|---|---|---|---|---|
| deepseek-v4-pro | 1.6T / 49B | 1M | $0.435 | $0.87 | Флагман | API + open-weight |
| deepseek-v4-flash | 284B / 13B | 1M | $0.14 | $0.28 | Дефолт | API + open-weight |
| DeepSeek-V3.2 | 685B / ~37B | (см. HF card) | — self-host — | — self-host — | Chat + tools | Только веса (MIT) |
| DeepSeek-V3.2-Speciale | 685B / ~37B | (см. HF card) | — self-host — | — self-host — | Reasoning без tools | Только веса (MIT) |
| DeepSeek-Math-V2 | 685B / ~37B | (см. HF card) | — self-host — | — self-host — | Математика, доказательства | Только веса (Apache 2.0) |
| DeepSeek-R1-0528-Qwen3-8B | 8B | 32K (Qwen3) | — self-host — | — self-host — | Малый reasoning | Только веса (MIT) |
| DeepSeek-OCR / OCR-2 | 3B | — | — self-host — | — self-host — | Распознавание документов | Только веса (MIT) |
Cache hit input у V4 моделей стоит в 50–120 раз дешевле cache miss. Это самое агрессивное prompt-caching среди больших вендоров: если у вас RAG с одним и тем же system-промптом на 100k токенов — платите $0.28 за миллион cache-hit-токенов вместо $14. При 10 млн запросов в месяц экономия исчисляется тысячами долларов.
Планируемая peak/off-peak политика: DeepSeek объявила, что «API service will soon adopt a peak/off-peak pricing policy» — в пиковые часы (9:00–12:00 и 14:00–18:00 пекинского времени) цена удваивается. Дата ввода пока не объявлена, но следите за changelog.
Как выбирать модель под задачу
Заголовок раздела «Как выбирать модель под задачу»Возьмите за нулевую точку deepseek-v4-flash через API. Это baseline по цене и качеству. Дальше три вопроса:
- Качество Flash недотягивает на вашей задаче? — попробуйте
think maxрежим Flash (без смены модели). Если и это не помогает — переходите на V4-Pro. - Данные не должны уходить в облако / нужна MIT-лицензия / есть инфраструктура? — берите DeepSeek-V3.2 open-weight через vLLM или ollama.
- Нужен reasoning на маленькой машине / edge-устройстве? — берите R1-0528-Qwen3-8B. 8B помещается на одну H100 в BF16 или на потребительский GPU в квантизации.
Практическая эвристика: V4-Flash для 90% задач, V4-Pro для остатка, open-weight для регуляторных ограничений.
DeepSeek vs GPT / Claude / Gemini
Заголовок раздела «DeepSeek vs GPT / Claude / Gemini»Cross-ref с GPT-5.6 Sol/Terra/Luna и Claude Sonnet 5 для российского пользователя:
| Модель | Input $/1M | Output $/1M | Контекст | Open-weight |
|---|---|---|---|---|
| DeepSeek-V4-Pro | $0.435 | $0.87 | 1M | Да (MIT) |
| DeepSeek-V4-Flash | $0.14 | $0.28 | 1M | Да (MIT) |
| GPT-5.6 Sol | $5.00 | $30.00 | 1.05M | Нет |
| GPT-5.6 Terra | $2.00 | $12.00 | 1.05M | Нет |
| GPT-5.6 Luna | $0.20 | $1.20 | 1.05M | Нет |
| Claude Sonnet 5 | по прайсу claude.com/pricing | по прайсу | зависит от версии | Нет |
Разница в бизнес-модели: DeepSeek держит самые низкие цены среди крупных провайдеров плюс отдаёт веса. У OpenAI и Anthropic — облачный SaaS, качество premium, дороже. У Gemini — сильнее мультимодальность.
Практический совет: если ваш продукт делает миллионы дешёвых запросов и качество достаточно — DeepSeek выигрывает по стоимости с большим отрывом. Если качество важнее цены — прогоняйте свою реальную задачу на V4-Pro и на GPT-5.6 Sol и сравнивайте результат.
RU-специфика доступа
Заголовок раздела «RU-специфика доступа»Ключевая проблема российского пользователя: прямая оплата DeepSeek с российской карты возможна не всегда. DeepSeek — китайский сервис, принимает Alipay, WeChat Pay, международные карты. Российские карты Visa/Mastercard/МИР работают нестабильно.
Что работает по состоянию на 2 августа 2026 года:
- Международный посредник для API. Российские SaaS-агрегаторы принимают рубли, отдают доступ к DeepSeek API через прокси. Ищите тех, кто прямо указывает
deepseek-v4-flashиdeepseek-v4-proв списке моделей. - Зарубежная карта. Работает, если есть карта иностранного банка. Технически всё легально.
- Оплата в криптовалюте. Часть агрегаторов принимает USDT/BTC и выдаёт баланс на DeepSeek.
- Self-hosting open-weight. Скачиваете V3.2 или R1-distill с HuggingFace, ставите на свои GPU или арендованные (Vast.ai, RunPod, Lambda Labs). Никакой платёжной системы не нужно.
Последний путь для российской команды с бюджетом на инфраструктуру часто оказывается самым устойчивым: платите один раз за GPU-часы у арендатора (USDT), веса скачиваете свободно, никаких санкционных рисков на уровне API-провайдера.
Практика (5 сценариев)
Заголовок раздела «Практика (5 сценариев)»Сценарий 1. RAG-бот по документам компании. Задача: 100 000 запросов в месяц, средний вход 20K токенов (документы + вопрос), выход 500 токенов. System-промпт и общая база данных повторяются — попадают в кэш. Возьмите V4-Flash. Расчёт: 90% cache hit + 10% cache miss на входе = ~$3 + $28 = $31 + $14 на выходе = ~$45 в месяц. На V4-Pro это стоило бы ~$140. Разница 3×.
Сценарий 2. Юрист разбирает договор на 40 страниц. 40 страниц ≈ 30 000 токенов входа + 5 000 токенов ответа. Возьмите V4-Pro в режиме max. Стоимость: $0.013 (input miss) + $0.004 (output) = ~$0.02 за разбор. При 20 разборов в месяц — $0.40. На V4-Flash это же стоило бы $0.006, но качество на юридическом языке может отличаться — прогоните обе модели на своих примерах.
Сценарий 3. E-commerce сайт генерирует SEO-описания. 500 генераций в день, каждое описание 800 токенов на выход, входной промпт с примерами 3000 токенов. Возьмите V4-Flash с кэшированием примеров. День: 500 × ($0.003 input hit + $0.22 output) = ~$1.1. Месяц: ~$33. На GPT-5.6 Terra это стоило бы $180. Разница 5×.
Сценарий 4. Сложный агент на 50 инструментов для внутренней аналитики.
Многошаговые рассуждения, сложный tool-calling, важна точность. Возьмите V4-Pro с reasoning=max. Отдельные шаги можете скидывать на Flash для дешевизны, но финальные решения оставьте на Pro. Cache hit critical — держите system-промпт и tool-схемы стабильными.
Сценарий 5. On-premise deployment для банка / медицины. Данные нельзя отправлять в облако. Возьмите DeepSeek-V3.2 open-weight и разверните на кластере 8×H100 через vLLM. Лицензия MIT — коммерция разрешена. Или ещё дешевле — R1-0528-Qwen3-8B для reasoning-задач на 1× GPU. Один раз настроили, платите только за GPU-часы, никаких API-платежей.
Куда пропал DeepSeek-R1 из API?
Большая R1 (671B, январь 2025) была разовым релизом. Её reasoning-возможности вобрала в себя линия V3.2 и особенно V3.2-Speciale, а также V4. Через API теперь reasoning делается через think режимы в V4-Flash/V4-Pro. Веса оригинальной R1 остаются доступны на HuggingFace для скачивания.
Что такое DeepSeek Sparse Attention (DSA) и Hybrid Attention (CSA + HCA)? DSA — механизм внимания в V3.2, где модель «умно» пропускает большую часть матрицы внимания, экономя вычисления на длинных контекстах. Hybrid Attention в V4 — следующий шаг: сочетание Compressed Sparse Attention (агрессивное сжатие) и Heavily Compressed Attention (ещё агрессивнее). Практический эффект — V4-Flash тратит 27% FLOPs V3.2 на токен при таком же качестве.
Почему у V4 модели названы Flash и Pro, а не Sol/Terra/Luna как у GPT? Разный нейминг разных вендоров, семантики нет. Flash = «быстрая, дешёвая», Pro = «профессиональная, флагман». Аналогичное деление есть у Google (Gemini Flash / Pro), у Anthropic (Haiku / Sonnet / Opus).
Что такое peak/off-peak тарифы, о которых пишет DeepSeek? Планируемая политика: в пиковые часы Пекина (9:00–12:00 и 14:00–18:00 по CST) цена удваивается для всех моделей. Дата ввода пока не объявлена — следите за changelog. Практический совет: если у вас батчи — планируйте на off-peak, экономия удвоенная.
Почему Flash в 3 раза дешевле Pro, если разница в параметрах ~6×? Активные параметры — 13B у Flash и 49B у Pro (разница ~4×). Плюс архитектурные оптимизации Flash (гибридное внимание, FP4 для MoE). Плюс DeepSeek балансирует прайс так, чтобы Flash был очевидным дефолтом, а Pro — премиальным выбором для сложных задач. Классическая ценовая дискриминация.
Можно ли использовать DeepSeek для генерации изображений или голоса? Нет напрямую. V4-Flash/V4-Pro принимают только текст. Для OCR (распознавание изображений) есть DeepSeek-OCR и OCR-2, но это отдельные небольшие модели. Для генерации картинок и голоса берите другие вендоры (Yandex Cloud, GigaChat, Sber Kandinsky, HuggingFace для open-weight).
Насколько DeepSeek хорошо работает с русским языком? Работает достойно, но всегда прогоняйте на своих реальных задачах. Модели тренированы на большом мультиязычном корпусе, английский и китайский — сильнее всего, русский — на уровне «хороший, но не идеальный». Если у вас критично точное соблюдение TOV на русском — сравнивайте с YandexGPT-5 и GigaChat-3 Pro на своих примерах.
Что выгоднее для стартапа из РФ — DeepSeek через посредника или YandexGPT напрямую? Зависит от прайса посредника (обычно +15–30% к оригинальной цене DeepSeek) и объёма. При больших объёмах и агрессивном кэшировании DeepSeek часто выигрывает даже с наценкой. При маленьких объёмах и требовании к 152-ФЗ / резидентство данных — YandexGPT/GigaChat выигрывают за счёт RU-хостинга. Считайте на своих числах.
Что дальше
Заголовок раздела «Что дальше»- Артикул 035 — «DeepSeek API через российских посредников: сравнение по цене и SLA».
- Артикул 036 — «Self-hosting DeepSeek-V3.2 на арендованных GPU: практика vLLM и ollama».
- Артикул 011 — big-3 сравнение Claude / GPT / Gemini в единой таблице.
- Артикул 020 / 022 — Claude Sonnet 5 и GPT-5.6 разборы для контекста.
- Артикул 002 — базовое знакомство с LLM для тех, кто пришёл без бэкграунда.
Sources
Заголовок раздела «Sources»Все ссылки проверены 2 августа 2026 года. Первоисточники — HuggingFace model cards и api-docs.deepseek.com.
- DeepSeek API Pricing — цены на deepseek-v4-flash и deepseek-v4-pro, cache hit / miss, context, max output. Проверено 02.08.2026.
- DeepSeek API Chat Completion — параметры API, reasoning effort levels. Проверено 02.08.2026.
- DeepSeek-V4-Flash model card — 284B/13B, Hybrid Attention, 1M контекст, бенчмарки. Проверено 02.08.2026.
- DeepSeek-V4-Pro model card — 1.6T/49B, LiveCodeBench 93,5%, Codeforces 3206. Проверено 02.08.2026.
- DeepSeek-V3.2 model card — 685B MoE, DSA architecture, MIT license. Проверено 02.08.2026.
- DeepSeek-V3.2-Speciale model card — reasoning-версия, GPQA 87,88%, без tool-calling. Проверено 02.08.2026.
- DeepSeek-Math-V2 model card — Apache 2.0, IMO 2025 Gold, Putnam 2024 118/120. Проверено 02.08.2026.
- DeepSeek-R1-0528-Qwen3-8B model card — AIME 2024 86%, 8B distill, MIT. Проверено 02.08.2026.
- DeepSeek AI organization on HuggingFace — сводный список опубликованных моделей. Проверено 02.08.2026.
- DeepSeek AI on GitHub — публичные репозитории (FlashMLA, DeepEP, DeepGEMM, 3FS). Проверено 02.08.2026.
Актуальность
Заголовок раздела «Актуальность»Актуально на 02.08.2026. Модели, цены и условия доступа меняются часто. Перед бизнес-решением всегда сверяйся с первоисточником — все ссылки в разделе Sources выше. Peak/off-peak политика DeepSeek объявлена, но дата ввода пока не опубликована. RU-специфика (посредники, оплата) может измениться быстрее, чем прайс, — сверяйся отдельно перед оплатой.