Перейти к содержимому

DeepSeek API и self-hosting в 2026: платформа, open-source деплой, distilled модели

Автор: Silvana · Дата: 02.08.2026 · Verified: 01.09.2026 · Reading time: 12 минут · Prerequisite: [017] Локальные LLM: Ollama, LM Studio, vLLM, [036] DeepSeek: китайская open-source лаборатория

DeepSeek API — это платная платформа api.deepseek.com с моделями deepseek-v4-flash и deepseek-v4-pro и параллельный путь через self-hosting open-weight DeepSeek-V3 и R1. Платформа совместима и с OpenAI SDK, и с Anthropic SDK — миграция сводится к смене base_url. Полные веса под MIT-лицензией лежат на HuggingFace, для запуска 671B MoE нужен кластер из нескольких H100. Distilled-версии (DeepSeek-R1-Distill 1.5B–70B) переносят reasoning-паттерны на маленькие модели и запускаются на consumer-железе через Ollama, vLLM или llama.cpp. Матрица выбора простая: до 100 миллионов токенов в месяц — API дешевле, свыше 1 миллиарда — окупается своя инфраструктура.

  • DeepSeek предлагает два пути использования: платная платформа api.deepseek.com (актуальные модели DeepSeek-V4-Flash и DeepSeek-V4-Pro) или self-hosting open-source моделей DeepSeek-V3 и DeepSeek-R1 через vLLM, SGLang, Ollama или llama.cpp.
  • API-формат совместим с OpenAI SDK: любой существующий код на openai библиотеке работает через смену base_url. Дополнительно поддерживается Anthropic-совместимый endpoint api.deepseek.com/anthropic для миграции с Claude API.
  • Актуальные API-модели (август 2026): deepseek-v4-flash (быстрая, дешёвая) и deepseek-v4-pro (глубокая, дороже). Обе поддерживают 1M токенов контекста и thinking mode (reasoning_effort: low / high / max).
  • Open-source флагманы (MIT license, коммерческое использование разрешено): DeepSeek-V3 и DeepSeek-R1 — оба 671B параметров MoE с 37B активных на токен, 128K контекст. Требуют 8×H100 или эквивалент для полноценного inference.
  • Distilled версии R1 (DeepSeek-R1-Distill-Qwen 1.5B/7B/14B/32B, DeepSeek-R1-Distill-Llama 8B/70B) переносят reasoning-паттерны на маленькие модели. 32B-версия обгоняет OpenAI-o1-mini на бенчмарках. Запускаются на consumer-железе.
  • Ollama даёт самый быстрый путь для локального запуска distilled моделей: ollama run deepseek-r1:7b — одна команда, работает на MacBook M1/M2/M3 и любом PC с 16GB+ RAM.
  • Rate limits платформы: 500 concurrent для v4-pro, 2500 concurrent для v4-flash. Одна учётная запись — единый пул. Enterprise-расширение — через форму, бесплатно.
  • Матрица выбора: до 100M токенов/месяц API дешевле self-hosting; свыше 1B токенов/месяц окупается своя инфраструктура. При требованиях data residency (данные не покидают ЕС/РФ) — только self-hosting.

DeepSeek выпустила две вещи одновременно: работающий API-сервис и полные веса моделей на HuggingFace под MIT-лицензией. Такая комбинация редкая. OpenAI и Anthropic весов не отдают. Meta отдаёт (Llama), но своего API-сервиса не держит. DeepSeek занимает нишу «попробуй через API, потом захотел — скачай веса и подними у себя». Подробнее про пейзаж open-weight LLM (Llama, Qwen, DeepSeek).

Для практики это значит два сценария развёртывания:

  • Хочу быстро проверить идею — берёшь API-ключ на platform.deepseek.com, за 5 минут получаешь первые ответы. Оплата по факту использования.
  • Хочу свою инфраструктуру — скачиваешь веса, поднимаешь на vLLM/SGLang/Ollama. Оплата — только за железо (свой сервер, аренду GPU в облаке).

Оба пути в этой статье. Начнём с API как самого простого.

  1. Заходишь на platform.deepseek.com, регистрируешься через email или Google.
  2. Пополняешь баланс (принимаются международные карты; из РФ — через посредника, платёж от российской карты обычно не проходит).
  3. Создаёшь API-ключ в разделе API keys. Ключ показывается один раз — сохрани сразу.

Дальше — работа через HTTP. Никаких SDK устанавливать не обязательно.

POST https://api.deepseek.com/chat/completions

Есть два варианта совместимости:

  • OpenAI формат — базовый URL https://api.deepseek.com. Работает как OpenAI API.
  • Anthropic формат — базовый URL https://api.deepseek.com/anthropic. Работает как Claude Messages API.

Такое двойное покрытие удобно при миграции: если ваш код написан под OpenAI SDK — используете OpenAI-совместимый endpoint. Если под Anthropic SDK — Anthropic-совместимый. Ни строчки менять не нужно кроме base_url и api_key.

Bearer token в заголовке:

Authorization: Bearer sk-your-key-here
Content-Type: application/json
Окно терминала
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{
"model": "deepseek-v4-flash",
"messages": [
{"role": "system", "content": "Отвечай на русском, кратко."},
{"role": "user", "content": "Что такое MoE-архитектура?"}
],
"temperature": 0.7
}'

Ответ — стандартный JSON в OpenAI-формате:

{
"id": "chatcmpl-abc123",
"object": "chat.completion",
"created": 1754400000,
"model": "deepseek-v4-flash",
"choices": [
{
"index": 0,
"message": {
"role": "assistant",
"content": "MoE (Mixture of Experts) — архитектура, где ..."
},
"finish_reason": "stop"
}
],
"usage": {
"prompt_tokens": 25,
"completion_tokens": 87,
"total_tokens": 112
}
}

Никаких специальных библиотек. Ставите обычный openai, меняете base_url:

from openai import OpenAI
client = OpenAI(
api_key="sk-your-deepseek-key",
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{"role": "system", "content": "Ты редактор карточек WB."},
{"role": "user", "content": "Напиши описание для термокружки."}
],
temperature=0.7,
max_tokens=500
)
print(response.choices[0].message.content)

Тот же код с base_url="https://api.openai.com/v1" работал бы с OpenAI. Переключение — одна строка.

Согласно api-docs.deepseek.com:

  • deepseek-v4-flash — быстрая, дешёвая. Подходит для генерации контента, чат-ботов, коротких классификаций.
  • deepseek-v4-pro — глубокая, дороже. Reasoning, длинный код, сложный анализ.

Обе модели поддерживают контекст 1 миллион токенов и thinking mode (reasoning_effort: low / high / max).

Для потокового получения ответа (важно для UX чатов — пользователь видит текст сразу):

Окно терминала
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{
"model": "deepseek-v4-flash",
"messages": [{"role": "user", "content": "Расскажи про Claude Code."}],
"stream": true
}'

Ответ приходит как Server-Sent Events (SSE). Каждое событие — отдельный JSON-чанк:

data: {"id":"chatcmpl-x","object":"chat.completion.chunk","choices":[{"delta":{"content":"Claude"},"finish_reason":null}]}
data: {"id":"chatcmpl-x","object":"chat.completion.chunk","choices":[{"delta":{"content":" Code"},"finish_reason":null}]}
data: {"id":"chatcmpl-x","object":"chat.completion.chunk","choices":[{"delta":{"content":" — это"},"finish_reason":null}]}
data: [DONE]

Парсинг на Python:

stream = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Расскажи про Claude Code."}],
stream=True
)
for chunk in stream:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)

Если нужен строго JSON-ответ (для парсинга в pipeline) — включаешь response_format:

response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{"role": "system", "content": "Отвечай только JSON."},
{"role": "user", "content": "Извлеки из текста имя, возраст, город: Мария, 38 лет, Москва."}
],
response_format={"type": "json_object"}
)

Ответ гарантированно валидный JSON. Модель сама подберёт структуру ключей — если хочешь фиксированную схему, опиши её в system prompt.

DeepSeek API поддерживает вызов инструментов в OpenAI-формате:

tools = [
{
"type": "function",
"function": {
"name": "get_wb_card_metrics",
"description": "Получить метрики карточки WB по SKU",
"parameters": {
"type": "object",
"properties": {
"sku": {"type": "string", "description": "Артикул товара"}
},
"required": ["sku"]
}
}
}
]
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "Покажи метрики карточки 12345678."}],
tools=tools
)

Модель возвращает tool_calls в ответе — с именем функции и аргументами. Дальше твой код исполняет функцию и передаёт результат в следующий круг разговора.

DeepSeek-V4 поддерживает контролируемый thinking mode:

response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "Реши: (x²+5x+6)/(x²-9) при x=4"}],
extra_body={
"thinking": {
"type": "enabled",
"reasoning_effort": "high"
}
}
)

Параметр reasoning_effort принимает low / high / max. Чем выше — тем больше «внутренних размышлений» модели перед ответом, дольше время, точнее результат на сложных задачах.

Флагманская base-модель, не reasoning. Опубликована декабрь 2024, продолжает поддерживаться в 2026.

  • Параметры: 671B total, 37B активных на токен (MoE-архитектура с Multi-head Latent Attention)
  • Контекст: 128K токенов
  • Обучение: 14.8 триллиона токенов
  • Лицензия: MIT (код), Model Agreement (веса), коммерческое использование разрешено
  • HuggingFace: huggingface.co/deepseek-ai/DeepSeek-V3

Reasoning-модель на основе V3, обученная через reinforcement learning. Достигает результатов сравнимых с OpenAI-o1 на математике, коде, reasoning.

  • Параметры: 671B total, 37B активных
  • Контекст: 128K (у полной версии в Ollama — 160K)
  • AIME 2024: 79,8% pass@1
  • MATH-500: 97,3% pass@1
  • Лицензия: MIT
  • HuggingFace: huggingface.co/deepseek-ai/DeepSeek-R1

Это уменьшенные модели (Qwen и Llama базы), которые обучены имитировать reasoning-паттерны большой R1. Фактически — «дистилляция мозгов R1 в маленькую модель».

МодельБазаПараметрыHuggingFace slug
DeepSeek-R1-Distill-Qwen-1.5BQwen2.5-Math1.5Bdeepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B
DeepSeek-R1-Distill-Qwen-7BQwen2.5-Math7Bdeepseek-ai/DeepSeek-R1-Distill-Qwen-7B
DeepSeek-R1-Distill-Llama-8BLlama-3.18Bdeepseek-ai/DeepSeek-R1-Distill-Llama-8B
DeepSeek-R1-Distill-Qwen-14BQwen2.514Bdeepseek-ai/DeepSeek-R1-Distill-Qwen-14B
DeepSeek-R1-Distill-Qwen-32BQwen2.532Bdeepseek-ai/DeepSeek-R1-Distill-Qwen-32B
DeepSeek-R1-Distill-Llama-70BLlama-3.370Bdeepseek-ai/DeepSeek-R1-Distill-Llama-70B

Все шесть — под MIT. R1-Distill-Qwen-32B обгоняет OpenAI-o1-mini на нескольких бенчмарках при радикально меньших требованиях к железу.

Индустриальный стандарт для serving больших LLM. Поддерживает tensor и pipeline parallelism, PagedAttention для эффективного KV-cache, continuous batching, streaming.

Установка и запуск distill-модели:

Окно терминала
pip install vllm
vllm serve deepseek-ai/DeepSeek-R1-Distill-Qwen-7B \
--host 0.0.0.0 \
--port 8000

После запуска — OpenAI-совместимый endpoint на http://localhost:8000/v1. Работает с любым OpenAI SDK.

Для полной DeepSeek-V3 или R1 нужен vLLM 0.6.6+ и multi-GPU кластер:

Окно терминала
vllm serve deepseek-ai/DeepSeek-V3 \
--tensor-parallel-size 8 \
--pipeline-parallel-size 1

Минимум — 8×H100 (80GB) или эквивалент. Аренда в AWS/CoreWeave/RunPod — примерно $20–40/час за такой кластер.

DeepSeek-команда рекомендует SGLang как первичный inference framework. Поддерживает NVIDIA и AMD GPU, FP8 и BF16, structured generation.

Окно терминала
python3 -m sglang.launch_server \
--model-path deepseek-ai/DeepSeek-R1-Distill-Qwen-7B \
--host 0.0.0.0 \
--port 30000

Также OpenAI-совместимый API. Для полной V3/R1 — многосерверный setup с tensor parallelism.

Официальный serving-framework от HuggingFace. Хорош если у вас уже HuggingFace ecosystem (Inference Endpoints, Datasets, Spaces).

Окно терминала
docker run --gpus all -p 8080:80 \
-v $PWD/data:/data \
ghcr.io/huggingface/text-generation-inference:latest \
--model-id deepseek-ai/DeepSeek-R1-Distill-Qwen-7B

Ollama прячет всю сложность за одной командой. Идеально для локального запуска distill-моделей на MacBook M1/M2/M3 или PC с consumer GPU.

Установка (macOS/Linux):

Окно терминала
curl -fsSL https://ollama.com/install.sh | sh

Запуск distilled R1:

Окно терминала
ollama run deepseek-r1:7b

Точные размеры и команды из библиотеки ollama.com/library/deepseek-r1:

ТегРазмер файлаКонтекстКоманда
deepseek-r1:1.5b1.1 GB128Kollama run deepseek-r1:1.5b
deepseek-r1:7b4.7 GB128Kollama run deepseek-r1:7b
deepseek-r1:8b5.2 GB128Kollama run deepseek-r1:8b
deepseek-r1:14b9.0 GB128Kollama run deepseek-r1:14b
deepseek-r1:32b20 GB128Kollama run deepseek-r1:32b
deepseek-r1:70b43 GB128Kollama run deepseek-r1:70b
deepseek-r1:671b404 GB160Kollama run deepseek-r1:671b

Ollama модели уже квантизованы (обычно Q4_K_M) — размер файла на диске примерно равен требуемой RAM/VRAM при запуске.

Ollama даёт REST API на порту 11434 совместимый с OpenAI:

Окно терминала
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-r1:7b",
"messages": [{"role": "user", "content": "Что такое MoE?"}]
}'

Если GPU нет вообще, или он маленький — llama.cpp даёт CPU inference через квантизацию (GGUF). Медленнее чем vLLM/SGLang, но работает на любом железе.

Окно терминала
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp && make
./llama-cli -m ./models/deepseek-r1-distill-qwen-7b-q4_k_m.gguf \
-p "Explain MoE architecture briefly." \
-n 512

GGUF-файлы для distill моделей DeepSeek качаются с HuggingFace от community (например, репозитории TheBloke, bartowski, unsloth).

Практическая матрица под железо и задачи:

МодельЖелезоСкоростьНа что хватает
R1-Distill-Qwen-1.5Bmobile / Raspberry Pi 5 / edgeбыстропростой Q&A, классификация, тесты
R1-Distill-Qwen-7BMacBook M1/M2/M3, PC 16GB RAM20–40 t/sлокальный ассистент, кодинг, reasoning
R1-Distill-Llama-8Bто же20–40 t/sальтернатива 7B на базе Llama-архитектуры
R1-Distill-Qwen-14Bодна GPU 24GB (RTX 3090, 4090, A5000)30–60 t/sсерьёзная работа, длинный код
R1-Distill-Qwen-32Bодна GPU 40+GB (A100 40, L40S)40–80 t/sобгоняет o1-mini, продакшн-качество
R1-Distill-Llama-70B2×A100 80GB или 4×A100 40GB20–40 t/sмаксимум качества среди distill

Общее правило: начинаешь с 7B на своём железе. Если качество устраивает — стоп. Если нет — идёшь к 32B (лучший ROI по качеству/железу). 70B имеет смысл когда 32B на конкретных задачах систематически недотягивает.

Важные особенности distill R1 (из model card DeepSeek-R1-Distill-Qwen-7B):

  • Temperature 0.5–0.7 (рекомендуется 0.6). Ниже — повторы, выше — галлюцинации.
  • Без system prompt. Инструкции — только в user message. Distilled R1 обучены игнорировать system role.
  • Для математики добавь: «Please reason step by step, and put your final answer within \boxed{}.»
  • Enforce thinking — префикс вывода <think>\n чтобы модель развернула reasoning.
  • Множественные прогоны для оценки — усредняй результаты.

Формула для FP16/BF16 inference: VRAM ≈ параметры × 2 байта × 1.2 (запас на KV-cache и активации).

  • 1.5B → ~3.6 GB VRAM
  • 7B → ~16 GB VRAM
  • 8B → ~19 GB VRAM
  • 14B → ~34 GB VRAM
  • 32B → ~77 GB VRAM
  • 70B → ~168 GB VRAM
  • 671B → ~1.6 TB VRAM (только multi-node)

Квантизация Q4 (4 бита на параметр) снижает требования в ~4 раза:

  • 7B Q4 → ~4 GB VRAM (запускается на GPU 8GB)
  • 32B Q4 → ~20 GB (одна RTX 4090)
  • 70B Q4 → ~40 GB (одна A100 40 или 2×RTX 4090)
  • 671B Q4 → ~404 GB (см. Ollama-тег deepseek-r1:671b)

Из api-docs.deepseek.com/quick_start/rate_limit:

  • deepseek-v4-pro: 500 concurrent requests на учётную запись
  • deepseek-v4-flash: 2 500 concurrent requests на учётную запись

«Concurrent» здесь — количество одновременно открытых соединений от отправки до полного получения ответа модели. Превышение — HTTP 429.

Явных RPM/TPM (requests/tokens per minute) DeepSeek не публикует. Concurrency — основной механизм ограничения.

Enterprise-расширение: DeepSeek принимает запросы на увеличение лимитов через официальную форму. Согласно документации, расширение бесплатное — вы платите только за токены как обычно, а увеличенный concurrency получаете без дополнительной подписки.

Если вы хостите API от лица нескольких клиентов — используйте параметр user_id в запросах для изоляции rate limits, cache privacy и планирования между вашими пользователями.

Простая матрица по объёму:

Объём в месяцРекомендация
до 100M входных токеновТолько API. Self-hosting не окупится.
100M — 1BГибрид. Prod через API, эксперименты локально.
1B — 10BSelf-hosting distill 32B становится дешевле в TCO.
свыше 10BСвоя инфраструктура на V3/R1 (multi-H100).

Compliance и data residency:

  • Данные не должны покидать РФ / ЕС — только self-hosting. DeepSeek — китайская компания, серверы в Китае. Даже без формальных запретов, для персональных данных клиентов из ЕС (GDPR) и РФ (152-ФЗ) API-путь блокируется на compliance-review.
  • Отраслевой compliance (HIPAA, PCI-DSS, банковский) — self-hosting в собственном контуре, обычно на VPC-инфраструктуре.

Скорость первого ответа (TTFB):

  • API: 200–500 мс на первый токен (сеть + очередь).
  • Self-hosting локальный (Ollama на MacBook): 100–300 мс.
  • Self-hosting в дата-центре (vLLM на A100): 50–150 мс.

Локальный self-hosting выигрывает по latency, но проигрывает по throughput. Для интерактивных приложений (чат, ассистент) — self-hosting часто ощущается «отзывчивее», даже если абсолютная скорость генерации ниже.

Скрытые расходы self-hosting — не забывай про них:

  • Аренда GPU (или капекс на своё железо)
  • Электричество (полный H100 сервер — 6–8 кВт)
  • Инженерное время на maintenance (обновления моделей, мониторинг, восстановление после сбоев)
  • Резервирование (single GPU — single point of failure)
  • Компетенция команды (нанять/удержать MLOps инженера)

Для команд без DevOps-экспертизы стартовать с API — правильно почти всегда. Self-hosting включается когда API-счёт превышает $2–3k/месяц и появляется прогноз стабильного роста.

  • API-endpoint DeepSeek: https://api.deepseek.com/chat/completions. Bearer token, OpenAI-совместимый формат.
  • Актуальные модели платформы (август 2026): deepseek-v4-flash (быстрая) и deepseek-v4-pro (глубокая). Обе 1M context, обе поддерживают thinking mode.
  • OpenAI SDK работает: меняешь base_url="https://api.deepseek.com" — весь остальной код прежний. Есть также Anthropic-совместимый endpoint для миграции с Claude API.
  • Streaming через stream=true, JSON mode через response_format, function calling — всё в OpenAI-формате.
  • Open-source флагманы под MIT: DeepSeek-V3 (base) и DeepSeek-R1 (reasoning). Оба 671B MoE, 128K контекст.
  • Шесть distilled версий R1 (Qwen 1.5B/7B/14B/32B + Llama 8B/70B) под MIT. R1-Distill-Qwen-32B обгоняет OpenAI-o1-mini.
  • Для локального запуска — Ollama: одна команда, ollama run deepseek-r1:7b. Работает на MacBook и любом PC с 16 GB RAM.
  • Для production self-hosting — vLLM или SGLang (последний рекомендован DeepSeek). Оба OpenAI-совместимы.
  • Rate limits: 500 concurrent для v4-pro, 2500 для v4-flash. Enterprise-расширение бесплатное — через форму.
  • Развилка API vs self-hosting: до 100M токенов/мес — API, выше 1B — своя инфра. При требованиях data residency — только self-hosting.

В: Работает ли DeepSeek API из РФ?

Технически endpoint отвечает — блокировок по IP нет. Проблема с оплатой: российские карты BIN обычно отклоняются. Вариант — пополнение через посредника с зарубежной карты. Альтернатива — сразу идти в self-hosting distill-модели, которые вообще не требуют внешней оплаты.

В: Можно ли использовать веса DeepSeek для коммерческого продукта?

Да. Все модели (V3, R1, шесть distilled версий) под MIT License. Коммерческое использование разрешено, включая fine-tuning и derivative works. Единственное — уважать условия базовых моделей: distill-Qwen наследует Apache 2.0 от Qwen2.5, distill-Llama наследует лицензию Llama-3.

В: Какая модель лучше для написания кода — API или distill?

Полная API-модель deepseek-v4-pro обгоняет любую distill-версию. Но для локальной работы (privacy, offline) — R1-Distill-Qwen-32B даёт близкое к продакшн качество на кодинге. R1-Distill-Qwen-7B — минимально жизнеспособный, для простых задач.

В: Как соотносится DeepSeek-V4 (API) с DeepSeek-R1 (open-source)?

V4 — свежее поколение, октябрь 2025 — 2026, только через API. R1 — предыдущий флагман, полностью open-source. V4 внутренне включает большинство улучшений R1 плюс новую MoE-архитектуру и увеличенный контекст (1M токенов). Если хочется веса — берёшь R1. Если нужен максимум — идёшь через API на V4.

В: Можно ли fine-tuning DeepSeek моделей?

Open-source веса — да. Стандартные подходы: LoRA/QLoRA (компактно), full fine-tuning (для крупных изменений). Frameworks: HuggingFace Transformers + PEFT, Axolotl, Unsloth. Fine-tuning платформы (через API) — DeepSeek на момент написания не предлагает fine-tuning-as-a-service.

В: Как рассчитать бюджет на self-hosting distill 32B в облаке?

Аренда одной A100 40GB на месяц: примерно $1500–2500 (24/7). SGLang или vLLM держат ~40 t/s. Итого ~104 миллиона выходных токенов в месяц потолком, при 100% загрузке. Считай TCO против API-цены и сравнивай.

В: Что такое thinking mode и когда его включать?

Thinking mode заставляет модель провести внутреннее reasoning перед финальным ответом. Включай для: сложных reasoning-задач (математика, логика), длинного кода, планирования. Не включай для: простых Q&A, генерации контента, чат-бота с быстрыми ответами. reasoning_effort=high — компромисс. max — максимум качества, дольше время, больше токенов в биллинге.

В: Что делать, если получаю HTTP 429?

Значит превысил concurrency. Решения: (1) снизить количество одновременных запросов в клиенте, (2) добавить exponential backoff на retry, (3) распределить нагрузку между v4-flash (2500) и v4-pro (500), (4) подать заявку на capacity expansion через официальную форму DeepSeek.

В: Насколько R1-Distill-Qwen-7B хуже полной R1 671B?

По математике (AIME 2024): 55,5% pass@1 у 7B vs 79,8% у полной. По MATH-500: 92,8% у 7B vs 97,3% у полной. По кодированию (Codeforces rating): 1189 у 7B — уровень серьёзного любителя, но не топового. 7B выигрывает по TCO при доступной точности для большинства практических задач.

В: OpenAI SDK — это официальная поддержка или самопал?

Официальная. В документации DeepSeek прямо написано «The DeepSeek API uses an API format compatible with OpenAI/Anthropic», и есть примеры кода через openai SDK. Anthropic-совместимый endpoint api.deepseek.com/anthropic — тоже официальный.

В: Может ли DeepSeek выдать содержимое с явно ограниченными темами (например, критика Китая)?

Модели DeepSeek — что через API, что open-source — имеют встроенные фильтры на определённые политически чувствительные темы, отражающие китайское регулирование ИИ. Fine-tuning на своих данных или использование других базовых моделей (Llama-версии distill) может ослабить некоторые ограничения, но полностью не устраняет — веса содержат RLHF-подстройку. Для чувствительных бизнес-задач тестируй свой конкретный use-case.

В: Актуальны ли модели R1 и V3, если платформа уже на V4?

Да. R1 и V3 остаются полностью поддерживаемыми на HuggingFace для скачивания. Community активно fine-tune-ит их. Distilled версии R1 остаются лучшими open-source reasoning-моделями своего размера на момент август 2026. Смена платформенных моделей не отменяет open-source-релиз.

В: Есть ли DeepSeek-Coder как отдельная модель?

Была — deepseek-coder-33b-instruct доступна на HuggingFace. В 2026 команда сместила фокус на общие модели V3/V4 с сильными кодинг-возможностями, отдельная линейка Coder не обновляется. Для локального кодинга сейчас лучший baseline — R1-Distill-Qwen-32B или Qwen2.5-Coder (свежее и специализированное).

В: Как безопасно хранить API-ключ?

Никогда в коде, никогда в git-репе, никогда в логи. Переменные окружения (DEEPSEEK_API_KEY), secret manager (AWS Secrets Manager, HashiCorp Vault, 1Password CLI, Doppler), либо .env файл под .gitignore. Ротация — раз в 90 дней или сразу после подозрения на утечку.

В: Можно ли использовать DeepSeek в Claude Code или Cursor?

Да. Обе платформы поддерживают custom API endpoints с OpenAI-форматом. В Claude Code — через настройку provider URL. В Cursor — через Custom API Endpoint в настройках. Указываешь https://api.deepseek.com/v1 и свой API-ключ.

Актуально на 02.08.2026. Модели, цены и условия доступа к DeepSeek меняются часто. Названия и версии API-моделей (V4-Flash, V4-Pro) актуальны на момент публикации — перед прод-интеграцией всегда сверяйся с api-docs.deepseek.com. Rate limits и enterprise-условия могут пересматриваться. Open-source веса на HuggingFace остаются доступными без изменения лицензий, но новые релизы могут появиться. Перед бизнес-решением сверяйся с первоисточником — все ссылки в разделе Sources ниже.

  • DeepSeek API Docs — основная: https://api-docs.deepseek.com/ (verified 02.08.2026)
  • DeepSeek API Docs — Rate Limits: https://api-docs.deepseek.com/quick_start/rate_limit (verified 02.08.2026)
  • DeepSeek API Docs — Create Chat Completion: https://api-docs.deepseek.com/api/create-chat-completion (verified 02.08.2026)
  • DeepSeek API Docs — Pricing: https://api-docs.deepseek.com/quick_start/pricing (verified 02.08.2026)
  • DeepSeek-V3 GitHub Repository: https://github.com/deepseek-ai/DeepSeek-V3 (verified 02.08.2026)
  • DeepSeek-R1 GitHub Repository: https://github.com/deepseek-ai/DeepSeek-R1 (verified 02.08.2026)
  • DeepSeek-R1-Distill-Qwen-7B Model Card: https://huggingface.co/deepseek-ai/DeepSeek-R1-Distill-Qwen-7B (verified 02.08.2026)
  • DeepSeek HuggingFace org: https://huggingface.co/deepseek-ai (verified 02.08.2026)
  • Ollama DeepSeek-R1 library: https://ollama.com/library/deepseek-r1 (verified 02.08.2026)
  • DeepSeek Platform: https://platform.deepseek.com/
  • vLLM Documentation: https://docs.vllm.ai/
  • SGLang Documentation: https://sgl-project.github.io/
  • Ollama Documentation: https://ollama.com/docs
  • llama.cpp Repository: https://github.com/ggerganov/llama.cpp

Русские пересказы (vc.ru, habr, retail.ru) в этой статье не использовались согласно правилу primary sources only для library.