DeepSeek API и self-hosting в 2026: платформа, open-source деплой, distilled модели
Автор: Silvana · Дата: 02.08.2026 · Verified: 01.09.2026 · Reading time: 12 минут · Prerequisite: [017] Локальные LLM: Ollama, LM Studio, vLLM, [036] DeepSeek: китайская open-source лаборатория
DeepSeek API — это платная платформа api.deepseek.com с моделями deepseek-v4-flash и deepseek-v4-pro и параллельный путь через self-hosting open-weight DeepSeek-V3 и R1. Платформа совместима и с OpenAI SDK, и с Anthropic SDK — миграция сводится к смене base_url. Полные веса под MIT-лицензией лежат на HuggingFace, для запуска 671B MoE нужен кластер из нескольких H100. Distilled-версии (DeepSeek-R1-Distill 1.5B–70B) переносят reasoning-паттерны на маленькие модели и запускаются на consumer-железе через Ollama, vLLM или llama.cpp. Матрица выбора простая: до 100 миллионов токенов в месяц — API дешевле, свыше 1 миллиарда — окупается своя инфраструктура.
- DeepSeek предлагает два пути использования: платная платформа
api.deepseek.com(актуальные модели DeepSeek-V4-Flash и DeepSeek-V4-Pro) или self-hosting open-source моделей DeepSeek-V3 и DeepSeek-R1 через vLLM, SGLang, Ollama или llama.cpp. - API-формат совместим с OpenAI SDK: любой существующий код на
openaiбиблиотеке работает через сменуbase_url. Дополнительно поддерживается Anthropic-совместимый endpointapi.deepseek.com/anthropicдля миграции с Claude API. - Актуальные API-модели (август 2026):
deepseek-v4-flash(быстрая, дешёвая) иdeepseek-v4-pro(глубокая, дороже). Обе поддерживают 1M токенов контекста и thinking mode (reasoning_effort: low / high / max). - Open-source флагманы (MIT license, коммерческое использование разрешено): DeepSeek-V3 и DeepSeek-R1 — оба 671B параметров MoE с 37B активных на токен, 128K контекст. Требуют 8×H100 или эквивалент для полноценного inference.
- Distilled версии R1 (DeepSeek-R1-Distill-Qwen 1.5B/7B/14B/32B, DeepSeek-R1-Distill-Llama 8B/70B) переносят reasoning-паттерны на маленькие модели. 32B-версия обгоняет OpenAI-o1-mini на бенчмарках. Запускаются на consumer-железе.
- Ollama даёт самый быстрый путь для локального запуска distilled моделей:
ollama run deepseek-r1:7b— одна команда, работает на MacBook M1/M2/M3 и любом PC с 16GB+ RAM. - Rate limits платформы: 500 concurrent для v4-pro, 2500 concurrent для v4-flash. Одна учётная запись — единый пул. Enterprise-расширение — через форму, бесплатно.
- Матрица выбора: до 100M токенов/месяц API дешевле self-hosting; свыше 1B токенов/месяц окупается своя инфраструктура. При требованиях data residency (данные не покидают ЕС/РФ) — только self-hosting.
Что это и зачем
Заголовок раздела «Что это и зачем»DeepSeek выпустила две вещи одновременно: работающий API-сервис и полные веса моделей на HuggingFace под MIT-лицензией. Такая комбинация редкая. OpenAI и Anthropic весов не отдают. Meta отдаёт (Llama), но своего API-сервиса не держит. DeepSeek занимает нишу «попробуй через API, потом захотел — скачай веса и подними у себя». Подробнее про пейзаж open-weight LLM (Llama, Qwen, DeepSeek).
Для практики это значит два сценария развёртывания:
- Хочу быстро проверить идею — берёшь API-ключ на
platform.deepseek.com, за 5 минут получаешь первые ответы. Оплата по факту использования. - Хочу свою инфраструктуру — скачиваешь веса, поднимаешь на vLLM/SGLang/Ollama. Оплата — только за железо (свой сервер, аренду GPU в облаке).
Оба пути в этой статье. Начнём с API как самого простого.
Основной разбор
Заголовок раздела «Основной разбор»DeepSeek API (platform.deepseek.com)
Заголовок раздела «DeepSeek API (platform.deepseek.com)»Регистрация и API-ключ
Заголовок раздела «Регистрация и API-ключ»- Заходишь на
platform.deepseek.com, регистрируешься через email или Google. - Пополняешь баланс (принимаются международные карты; из РФ — через посредника, платёж от российской карты обычно не проходит).
- Создаёшь API-ключ в разделе
API keys. Ключ показывается один раз — сохрани сразу.
Дальше — работа через HTTP. Никаких SDK устанавливать не обязательно.
Базовый endpoint
Заголовок раздела «Базовый endpoint»POST https://api.deepseek.com/chat/completionsЕсть два варианта совместимости:
- OpenAI формат — базовый URL
https://api.deepseek.com. Работает как OpenAI API. - Anthropic формат — базовый URL
https://api.deepseek.com/anthropic. Работает как Claude Messages API.
Такое двойное покрытие удобно при миграции: если ваш код написан под OpenAI SDK — используете OpenAI-совместимый endpoint. Если под Anthropic SDK — Anthropic-совместимый. Ни строчки менять не нужно кроме base_url и api_key.
Аутентификация
Заголовок раздела «Аутентификация»Bearer token в заголовке:
Authorization: Bearer sk-your-key-hereContent-Type: application/jsonПервый API-call через curl
Заголовок раздела «Первый API-call через curl»curl https://api.deepseek.com/chat/completions \ -H "Content-Type: application/json" \ -H "Authorization: Bearer $DEEPSEEK_API_KEY" \ -d '{ "model": "deepseek-v4-flash", "messages": [ {"role": "system", "content": "Отвечай на русском, кратко."}, {"role": "user", "content": "Что такое MoE-архитектура?"} ], "temperature": 0.7 }'Ответ — стандартный JSON в OpenAI-формате:
{ "id": "chatcmpl-abc123", "object": "chat.completion", "created": 1754400000, "model": "deepseek-v4-flash", "choices": [ { "index": 0, "message": { "role": "assistant", "content": "MoE (Mixture of Experts) — архитектура, где ..." }, "finish_reason": "stop" } ], "usage": { "prompt_tokens": 25, "completion_tokens": 87, "total_tokens": 112 }}Python через openai SDK
Заголовок раздела «Python через openai SDK»Никаких специальных библиотек. Ставите обычный openai, меняете base_url:
from openai import OpenAI
client = OpenAI( api_key="sk-your-deepseek-key", base_url="https://api.deepseek.com")
response = client.chat.completions.create( model="deepseek-v4-flash", messages=[ {"role": "system", "content": "Ты редактор карточек WB."}, {"role": "user", "content": "Напиши описание для термокружки."} ], temperature=0.7, max_tokens=500)
print(response.choices[0].message.content)Тот же код с base_url="https://api.openai.com/v1" работал бы с OpenAI. Переключение — одна строка.
Актуальные модели (август 2026)
Заголовок раздела «Актуальные модели (август 2026)»Согласно api-docs.deepseek.com:
- deepseek-v4-flash — быстрая, дешёвая. Подходит для генерации контента, чат-ботов, коротких классификаций.
- deepseek-v4-pro — глубокая, дороже. Reasoning, длинный код, сложный анализ.
Обе модели поддерживают контекст 1 миллион токенов и thinking mode (reasoning_effort: low / high / max).
Streaming API
Заголовок раздела «Streaming API»Для потокового получения ответа (важно для UX чатов — пользователь видит текст сразу):
curl https://api.deepseek.com/chat/completions \ -H "Content-Type: application/json" \ -H "Authorization: Bearer $DEEPSEEK_API_KEY" \ -d '{ "model": "deepseek-v4-flash", "messages": [{"role": "user", "content": "Расскажи про Claude Code."}], "stream": true }'Ответ приходит как Server-Sent Events (SSE). Каждое событие — отдельный JSON-чанк:
data: {"id":"chatcmpl-x","object":"chat.completion.chunk","choices":[{"delta":{"content":"Claude"},"finish_reason":null}]}
data: {"id":"chatcmpl-x","object":"chat.completion.chunk","choices":[{"delta":{"content":" Code"},"finish_reason":null}]}
data: {"id":"chatcmpl-x","object":"chat.completion.chunk","choices":[{"delta":{"content":" — это"},"finish_reason":null}]}
data: [DONE]Парсинг на Python:
stream = client.chat.completions.create( model="deepseek-v4-flash", messages=[{"role": "user", "content": "Расскажи про Claude Code."}], stream=True)
for chunk in stream: if chunk.choices[0].delta.content: print(chunk.choices[0].delta.content, end="", flush=True)JSON mode
Заголовок раздела «JSON mode»Если нужен строго JSON-ответ (для парсинга в pipeline) — включаешь response_format:
response = client.chat.completions.create( model="deepseek-v4-flash", messages=[ {"role": "system", "content": "Отвечай только JSON."}, {"role": "user", "content": "Извлеки из текста имя, возраст, город: Мария, 38 лет, Москва."} ], response_format={"type": "json_object"})Ответ гарантированно валидный JSON. Модель сама подберёт структуру ключей — если хочешь фиксированную схему, опиши её в system prompt.
Function calling / tool use
Заголовок раздела «Function calling / tool use»DeepSeek API поддерживает вызов инструментов в OpenAI-формате:
tools = [ { "type": "function", "function": { "name": "get_wb_card_metrics", "description": "Получить метрики карточки WB по SKU", "parameters": { "type": "object", "properties": { "sku": {"type": "string", "description": "Артикул товара"} }, "required": ["sku"] } } }]
response = client.chat.completions.create( model="deepseek-v4-pro", messages=[{"role": "user", "content": "Покажи метрики карточки 12345678."}], tools=tools)Модель возвращает tool_calls в ответе — с именем функции и аргументами. Дальше твой код исполняет функцию и передаёт результат в следующий круг разговора.
Thinking mode (reasoning)
Заголовок раздела «Thinking mode (reasoning)»DeepSeek-V4 поддерживает контролируемый thinking mode:
response = client.chat.completions.create( model="deepseek-v4-pro", messages=[{"role": "user", "content": "Реши: (x²+5x+6)/(x²-9) при x=4"}], extra_body={ "thinking": { "type": "enabled", "reasoning_effort": "high" } })Параметр reasoning_effort принимает low / high / max. Чем выше — тем больше «внутренних размышлений» модели перед ответом, дольше время, точнее результат на сложных задачах.
Open-source модели: что и где скачать
Заголовок раздела «Open-source модели: что и где скачать»DeepSeek-V3
Заголовок раздела «DeepSeek-V3»Флагманская base-модель, не reasoning. Опубликована декабрь 2024, продолжает поддерживаться в 2026.
- Параметры: 671B total, 37B активных на токен (MoE-архитектура с Multi-head Latent Attention)
- Контекст: 128K токенов
- Обучение: 14.8 триллиона токенов
- Лицензия: MIT (код), Model Agreement (веса), коммерческое использование разрешено
- HuggingFace:
huggingface.co/deepseek-ai/DeepSeek-V3
DeepSeek-R1
Заголовок раздела «DeepSeek-R1»Reasoning-модель на основе V3, обученная через reinforcement learning. Достигает результатов сравнимых с OpenAI-o1 на математике, коде, reasoning.
- Параметры: 671B total, 37B активных
- Контекст: 128K (у полной версии в Ollama — 160K)
- AIME 2024: 79,8% pass@1
- MATH-500: 97,3% pass@1
- Лицензия: MIT
- HuggingFace:
huggingface.co/deepseek-ai/DeepSeek-R1
Distilled модели R1
Заголовок раздела «Distilled модели R1»Это уменьшенные модели (Qwen и Llama базы), которые обучены имитировать reasoning-паттерны большой R1. Фактически — «дистилляция мозгов R1 в маленькую модель».
| Модель | База | Параметры | HuggingFace slug |
|---|---|---|---|
| DeepSeek-R1-Distill-Qwen-1.5B | Qwen2.5-Math | 1.5B | deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B |
| DeepSeek-R1-Distill-Qwen-7B | Qwen2.5-Math | 7B | deepseek-ai/DeepSeek-R1-Distill-Qwen-7B |
| DeepSeek-R1-Distill-Llama-8B | Llama-3.1 | 8B | deepseek-ai/DeepSeek-R1-Distill-Llama-8B |
| DeepSeek-R1-Distill-Qwen-14B | Qwen2.5 | 14B | deepseek-ai/DeepSeek-R1-Distill-Qwen-14B |
| DeepSeek-R1-Distill-Qwen-32B | Qwen2.5 | 32B | deepseek-ai/DeepSeek-R1-Distill-Qwen-32B |
| DeepSeek-R1-Distill-Llama-70B | Llama-3.3 | 70B | deepseek-ai/DeepSeek-R1-Distill-Llama-70B |
Все шесть — под MIT. R1-Distill-Qwen-32B обгоняет OpenAI-o1-mini на нескольких бенчмарках при радикально меньших требованиях к железу.
Self-hosting варианты
Заголовок раздела «Self-hosting варианты»1. vLLM — production-grade serving
Заголовок раздела «1. vLLM — production-grade serving»Индустриальный стандарт для serving больших LLM. Поддерживает tensor и pipeline parallelism, PagedAttention для эффективного KV-cache, continuous batching, streaming.
Установка и запуск distill-модели:
pip install vllmvllm serve deepseek-ai/DeepSeek-R1-Distill-Qwen-7B \ --host 0.0.0.0 \ --port 8000После запуска — OpenAI-совместимый endpoint на http://localhost:8000/v1. Работает с любым OpenAI SDK.
Для полной DeepSeek-V3 или R1 нужен vLLM 0.6.6+ и multi-GPU кластер:
vllm serve deepseek-ai/DeepSeek-V3 \ --tensor-parallel-size 8 \ --pipeline-parallel-size 1Минимум — 8×H100 (80GB) или эквивалент. Аренда в AWS/CoreWeave/RunPod — примерно $20–40/час за такой кластер.
2. SGLang — рекомендуемый DeepSeek
Заголовок раздела «2. SGLang — рекомендуемый DeepSeek»DeepSeek-команда рекомендует SGLang как первичный inference framework. Поддерживает NVIDIA и AMD GPU, FP8 и BF16, structured generation.
python3 -m sglang.launch_server \ --model-path deepseek-ai/DeepSeek-R1-Distill-Qwen-7B \ --host 0.0.0.0 \ --port 30000Также OpenAI-совместимый API. Для полной V3/R1 — многосерверный setup с tensor parallelism.
3. Text Generation Inference (TGI) от HuggingFace
Заголовок раздела «3. Text Generation Inference (TGI) от HuggingFace»Официальный serving-framework от HuggingFace. Хорош если у вас уже HuggingFace ecosystem (Inference Endpoints, Datasets, Spaces).
docker run --gpus all -p 8080:80 \ -v $PWD/data:/data \ ghcr.io/huggingface/text-generation-inference:latest \ --model-id deepseek-ai/DeepSeek-R1-Distill-Qwen-7B4. Ollama — самый простой путь для локалки
Заголовок раздела «4. Ollama — самый простой путь для локалки»Ollama прячет всю сложность за одной командой. Идеально для локального запуска distill-моделей на MacBook M1/M2/M3 или PC с consumer GPU.
Установка (macOS/Linux):
curl -fsSL https://ollama.com/install.sh | shЗапуск distilled R1:
ollama run deepseek-r1:7bТочные размеры и команды из библиотеки ollama.com/library/deepseek-r1:
| Тег | Размер файла | Контекст | Команда |
|---|---|---|---|
| deepseek-r1:1.5b | 1.1 GB | 128K | ollama run deepseek-r1:1.5b |
| deepseek-r1:7b | 4.7 GB | 128K | ollama run deepseek-r1:7b |
| deepseek-r1:8b | 5.2 GB | 128K | ollama run deepseek-r1:8b |
| deepseek-r1:14b | 9.0 GB | 128K | ollama run deepseek-r1:14b |
| deepseek-r1:32b | 20 GB | 128K | ollama run deepseek-r1:32b |
| deepseek-r1:70b | 43 GB | 128K | ollama run deepseek-r1:70b |
| deepseek-r1:671b | 404 GB | 160K | ollama run deepseek-r1:671b |
Ollama модели уже квантизованы (обычно Q4_K_M) — размер файла на диске примерно равен требуемой RAM/VRAM при запуске.
Ollama даёт REST API на порту 11434 совместимый с OpenAI:
curl http://localhost:11434/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{ "model": "deepseek-r1:7b", "messages": [{"role": "user", "content": "Что такое MoE?"}] }'5. llama.cpp — CPU inference или mixed
Заголовок раздела «5. llama.cpp — CPU inference или mixed»Если GPU нет вообще, или он маленький — llama.cpp даёт CPU inference через квантизацию (GGUF). Медленнее чем vLLM/SGLang, но работает на любом железе.
git clone https://github.com/ggerganov/llama.cppcd llama.cpp && make./llama-cli -m ./models/deepseek-r1-distill-qwen-7b-q4_k_m.gguf \ -p "Explain MoE architecture briefly." \ -n 512GGUF-файлы для distill моделей DeepSeek качаются с HuggingFace от community (например, репозитории TheBloke, bartowski, unsloth).
Distilled модели: что и когда выбирать
Заголовок раздела «Distilled модели: что и когда выбирать»Практическая матрица под железо и задачи:
| Модель | Железо | Скорость | На что хватает |
|---|---|---|---|
| R1-Distill-Qwen-1.5B | mobile / Raspberry Pi 5 / edge | быстро | простой Q&A, классификация, тесты |
| R1-Distill-Qwen-7B | MacBook M1/M2/M3, PC 16GB RAM | 20–40 t/s | локальный ассистент, кодинг, reasoning |
| R1-Distill-Llama-8B | то же | 20–40 t/s | альтернатива 7B на базе Llama-архитектуры |
| R1-Distill-Qwen-14B | одна GPU 24GB (RTX 3090, 4090, A5000) | 30–60 t/s | серьёзная работа, длинный код |
| R1-Distill-Qwen-32B | одна GPU 40+GB (A100 40, L40S) | 40–80 t/s | обгоняет o1-mini, продакшн-качество |
| R1-Distill-Llama-70B | 2×A100 80GB или 4×A100 40GB | 20–40 t/s | максимум качества среди distill |
Общее правило: начинаешь с 7B на своём железе. Если качество устраивает — стоп. Если нет — идёшь к 32B (лучший ROI по качеству/железу). 70B имеет смысл когда 32B на конкретных задачах систематически недотягивает.
Важные особенности distill R1 (из model card DeepSeek-R1-Distill-Qwen-7B):
- Temperature 0.5–0.7 (рекомендуется 0.6). Ниже — повторы, выше — галлюцинации.
- Без system prompt. Инструкции — только в user message. Distilled R1 обучены игнорировать system role.
- Для математики добавь: «Please reason step by step, and put your final answer within \boxed{}.»
- Enforce thinking — префикс вывода
<think>\nчтобы модель развернула reasoning. - Множественные прогоны для оценки — усредняй результаты.
VRAM-требования — расчёт
Заголовок раздела «VRAM-требования — расчёт»Формула для FP16/BF16 inference: VRAM ≈ параметры × 2 байта × 1.2 (запас на KV-cache и активации).
- 1.5B → ~3.6 GB VRAM
- 7B → ~16 GB VRAM
- 8B → ~19 GB VRAM
- 14B → ~34 GB VRAM
- 32B → ~77 GB VRAM
- 70B → ~168 GB VRAM
- 671B → ~1.6 TB VRAM (только multi-node)
Квантизация Q4 (4 бита на параметр) снижает требования в ~4 раза:
- 7B Q4 → ~4 GB VRAM (запускается на GPU 8GB)
- 32B Q4 → ~20 GB (одна RTX 4090)
- 70B Q4 → ~40 GB (одна A100 40 или 2×RTX 4090)
- 671B Q4 → ~404 GB (см. Ollama-тег
deepseek-r1:671b)
Rate limits платформы
Заголовок раздела «Rate limits платформы»Из api-docs.deepseek.com/quick_start/rate_limit:
- deepseek-v4-pro: 500 concurrent requests на учётную запись
- deepseek-v4-flash: 2 500 concurrent requests на учётную запись
«Concurrent» здесь — количество одновременно открытых соединений от отправки до полного получения ответа модели. Превышение — HTTP 429.
Явных RPM/TPM (requests/tokens per minute) DeepSeek не публикует. Concurrency — основной механизм ограничения.
Enterprise-расширение: DeepSeek принимает запросы на увеличение лимитов через официальную форму. Согласно документации, расширение бесплатное — вы платите только за токены как обычно, а увеличенный concurrency получаете без дополнительной подписки.
Если вы хостите API от лица нескольких клиентов — используйте параметр user_id в запросах для изоляции rate limits, cache privacy и планирования между вашими пользователями.
Стратегия выбора: API vs Self-hosting
Заголовок раздела «Стратегия выбора: API vs Self-hosting»Простая матрица по объёму:
| Объём в месяц | Рекомендация |
|---|---|
| до 100M входных токенов | Только API. Self-hosting не окупится. |
| 100M — 1B | Гибрид. Prod через API, эксперименты локально. |
| 1B — 10B | Self-hosting distill 32B становится дешевле в TCO. |
| свыше 10B | Своя инфраструктура на V3/R1 (multi-H100). |
Compliance и data residency:
- Данные не должны покидать РФ / ЕС — только self-hosting. DeepSeek — китайская компания, серверы в Китае. Даже без формальных запретов, для персональных данных клиентов из ЕС (GDPR) и РФ (152-ФЗ) API-путь блокируется на compliance-review.
- Отраслевой compliance (HIPAA, PCI-DSS, банковский) — self-hosting в собственном контуре, обычно на VPC-инфраструктуре.
Скорость первого ответа (TTFB):
- API: 200–500 мс на первый токен (сеть + очередь).
- Self-hosting локальный (Ollama на MacBook): 100–300 мс.
- Self-hosting в дата-центре (vLLM на A100): 50–150 мс.
Локальный self-hosting выигрывает по latency, но проигрывает по throughput. Для интерактивных приложений (чат, ассистент) — self-hosting часто ощущается «отзывчивее», даже если абсолютная скорость генерации ниже.
Скрытые расходы self-hosting — не забывай про них:
- Аренда GPU (или капекс на своё железо)
- Электричество (полный H100 сервер — 6–8 кВт)
- Инженерное время на maintenance (обновления моделей, мониторинг, восстановление после сбоев)
- Резервирование (single GPU — single point of failure)
- Компетенция команды (нанять/удержать MLOps инженера)
Для команд без DevOps-экспертизы стартовать с API — правильно почти всегда. Self-hosting включается когда API-счёт превышает $2–3k/месяц и появляется прогноз стабильного роста.
Что запомнить
Заголовок раздела «Что запомнить»- API-endpoint DeepSeek:
https://api.deepseek.com/chat/completions. Bearer token, OpenAI-совместимый формат. - Актуальные модели платформы (август 2026):
deepseek-v4-flash(быстрая) иdeepseek-v4-pro(глубокая). Обе 1M context, обе поддерживают thinking mode. - OpenAI SDK работает: меняешь
base_url="https://api.deepseek.com"— весь остальной код прежний. Есть также Anthropic-совместимый endpoint для миграции с Claude API. - Streaming через
stream=true, JSON mode черезresponse_format, function calling — всё в OpenAI-формате. - Open-source флагманы под MIT: DeepSeek-V3 (base) и DeepSeek-R1 (reasoning). Оба 671B MoE, 128K контекст.
- Шесть distilled версий R1 (Qwen 1.5B/7B/14B/32B + Llama 8B/70B) под MIT. R1-Distill-Qwen-32B обгоняет OpenAI-o1-mini.
- Для локального запуска — Ollama: одна команда,
ollama run deepseek-r1:7b. Работает на MacBook и любом PC с 16 GB RAM. - Для production self-hosting — vLLM или SGLang (последний рекомендован DeepSeek). Оба OpenAI-совместимы.
- Rate limits: 500 concurrent для v4-pro, 2500 для v4-flash. Enterprise-расширение бесплатное — через форму.
- Развилка API vs self-hosting: до 100M токенов/мес — API, выше 1B — своя инфра. При требованиях data residency — только self-hosting.
В: Работает ли DeepSeek API из РФ?
Технически endpoint отвечает — блокировок по IP нет. Проблема с оплатой: российские карты BIN обычно отклоняются. Вариант — пополнение через посредника с зарубежной карты. Альтернатива — сразу идти в self-hosting distill-модели, которые вообще не требуют внешней оплаты.
В: Можно ли использовать веса DeepSeek для коммерческого продукта?
Да. Все модели (V3, R1, шесть distilled версий) под MIT License. Коммерческое использование разрешено, включая fine-tuning и derivative works. Единственное — уважать условия базовых моделей: distill-Qwen наследует Apache 2.0 от Qwen2.5, distill-Llama наследует лицензию Llama-3.
В: Какая модель лучше для написания кода — API или distill?
Полная API-модель deepseek-v4-pro обгоняет любую distill-версию. Но для локальной работы (privacy, offline) — R1-Distill-Qwen-32B даёт близкое к продакшн качество на кодинге. R1-Distill-Qwen-7B — минимально жизнеспособный, для простых задач.
В: Как соотносится DeepSeek-V4 (API) с DeepSeek-R1 (open-source)?
V4 — свежее поколение, октябрь 2025 — 2026, только через API. R1 — предыдущий флагман, полностью open-source. V4 внутренне включает большинство улучшений R1 плюс новую MoE-архитектуру и увеличенный контекст (1M токенов). Если хочется веса — берёшь R1. Если нужен максимум — идёшь через API на V4.
В: Можно ли fine-tuning DeepSeek моделей?
Open-source веса — да. Стандартные подходы: LoRA/QLoRA (компактно), full fine-tuning (для крупных изменений). Frameworks: HuggingFace Transformers + PEFT, Axolotl, Unsloth. Fine-tuning платформы (через API) — DeepSeek на момент написания не предлагает fine-tuning-as-a-service.
В: Как рассчитать бюджет на self-hosting distill 32B в облаке?
Аренда одной A100 40GB на месяц: примерно $1500–2500 (24/7). SGLang или vLLM держат ~40 t/s. Итого ~104 миллиона выходных токенов в месяц потолком, при 100% загрузке. Считай TCO против API-цены и сравнивай.
В: Что такое thinking mode и когда его включать?
Thinking mode заставляет модель провести внутреннее reasoning перед финальным ответом. Включай для: сложных reasoning-задач (математика, логика), длинного кода, планирования. Не включай для: простых Q&A, генерации контента, чат-бота с быстрыми ответами. reasoning_effort=high — компромисс. max — максимум качества, дольше время, больше токенов в биллинге.
В: Что делать, если получаю HTTP 429?
Значит превысил concurrency. Решения: (1) снизить количество одновременных запросов в клиенте, (2) добавить exponential backoff на retry, (3) распределить нагрузку между v4-flash (2500) и v4-pro (500), (4) подать заявку на capacity expansion через официальную форму DeepSeek.
В: Насколько R1-Distill-Qwen-7B хуже полной R1 671B?
По математике (AIME 2024): 55,5% pass@1 у 7B vs 79,8% у полной. По MATH-500: 92,8% у 7B vs 97,3% у полной. По кодированию (Codeforces rating): 1189 у 7B — уровень серьёзного любителя, но не топового. 7B выигрывает по TCO при доступной точности для большинства практических задач.
В: OpenAI SDK — это официальная поддержка или самопал?
Официальная. В документации DeepSeek прямо написано «The DeepSeek API uses an API format compatible with OpenAI/Anthropic», и есть примеры кода через openai SDK. Anthropic-совместимый endpoint api.deepseek.com/anthropic — тоже официальный.
В: Может ли DeepSeek выдать содержимое с явно ограниченными темами (например, критика Китая)?
Модели DeepSeek — что через API, что open-source — имеют встроенные фильтры на определённые политически чувствительные темы, отражающие китайское регулирование ИИ. Fine-tuning на своих данных или использование других базовых моделей (Llama-версии distill) может ослабить некоторые ограничения, но полностью не устраняет — веса содержат RLHF-подстройку. Для чувствительных бизнес-задач тестируй свой конкретный use-case.
В: Актуальны ли модели R1 и V3, если платформа уже на V4?
Да. R1 и V3 остаются полностью поддерживаемыми на HuggingFace для скачивания. Community активно fine-tune-ит их. Distilled версии R1 остаются лучшими open-source reasoning-моделями своего размера на момент август 2026. Смена платформенных моделей не отменяет open-source-релиз.
В: Есть ли DeepSeek-Coder как отдельная модель?
Была — deepseek-coder-33b-instruct доступна на HuggingFace. В 2026 команда сместила фокус на общие модели V3/V4 с сильными кодинг-возможностями, отдельная линейка Coder не обновляется. Для локального кодинга сейчас лучший baseline — R1-Distill-Qwen-32B или Qwen2.5-Coder (свежее и специализированное).
В: Как безопасно хранить API-ключ?
Никогда в коде, никогда в git-репе, никогда в логи. Переменные окружения (DEEPSEEK_API_KEY), secret manager (AWS Secrets Manager, HashiCorp Vault, 1Password CLI, Doppler), либо .env файл под .gitignore. Ротация — раз в 90 дней или сразу после подозрения на утечку.
В: Можно ли использовать DeepSeek в Claude Code или Cursor?
Да. Обе платформы поддерживают custom API endpoints с OpenAI-форматом. В Claude Code — через настройку provider URL. В Cursor — через Custom API Endpoint в настройках. Указываешь https://api.deepseek.com/v1 и свой API-ключ.
Actualnost
Заголовок раздела «Actualnost»Актуально на 02.08.2026. Модели, цены и условия доступа к DeepSeek меняются часто. Названия и версии API-моделей (V4-Flash, V4-Pro) актуальны на момент публикации — перед прод-интеграцией всегда сверяйся с api-docs.deepseek.com. Rate limits и enterprise-условия могут пересматриваться. Open-source веса на HuggingFace остаются доступными без изменения лицензий, но новые релизы могут появиться. Перед бизнес-решением сверяйся с первоисточником — все ссылки в разделе Sources ниже.
Sources
Заголовок раздела «Sources»- DeepSeek API Docs — основная:
https://api-docs.deepseek.com/(verified 02.08.2026) - DeepSeek API Docs — Rate Limits:
https://api-docs.deepseek.com/quick_start/rate_limit(verified 02.08.2026) - DeepSeek API Docs — Create Chat Completion:
https://api-docs.deepseek.com/api/create-chat-completion(verified 02.08.2026) - DeepSeek API Docs — Pricing:
https://api-docs.deepseek.com/quick_start/pricing(verified 02.08.2026) - DeepSeek-V3 GitHub Repository:
https://github.com/deepseek-ai/DeepSeek-V3(verified 02.08.2026) - DeepSeek-R1 GitHub Repository:
https://github.com/deepseek-ai/DeepSeek-R1(verified 02.08.2026) - DeepSeek-R1-Distill-Qwen-7B Model Card:
https://huggingface.co/deepseek-ai/DeepSeek-R1-Distill-Qwen-7B(verified 02.08.2026) - DeepSeek HuggingFace org:
https://huggingface.co/deepseek-ai(verified 02.08.2026) - Ollama DeepSeek-R1 library:
https://ollama.com/library/deepseek-r1(verified 02.08.2026) - DeepSeek Platform:
https://platform.deepseek.com/ - vLLM Documentation:
https://docs.vllm.ai/ - SGLang Documentation:
https://sgl-project.github.io/ - Ollama Documentation:
https://ollama.com/docs - llama.cpp Repository:
https://github.com/ggerganov/llama.cpp
Русские пересказы (vc.ru, habr, retail.ru) в этой статье не использовались согласно правилу primary sources only для library.