Перейти к содержимому

Deep Think и Search в DeepSeek 2026: reasoning-режим и веб-поиск в чате

Автор: Silvana · Дата: 02.08.2026 · Verified: 01.09.2026 · Reading time: 12 минут · Prerequisite: —

Deep Think в DeepSeek — это reasoning-режим (chain-of-thought), в котором модель тратит внутренние thinking-токены на разбор задачи перед ответом. В веб-чате chat.deepseek.com включается кнопкой «DeepThink» под полем ввода; в API — параметром thinking: {"type": "enabled"} и reasoning_effort (low/high/max). Search mode — отдельная кнопка в веб-чате, добавляет live web-поиск с источниками. В публичном API отдельного built-in search-инструмента пока нет — веб-поиск собирается через function calling. Актуальные API-модели — deepseek-v4-flash и deepseek-v4-pro, из РФ работают напрямую, оплата — только зарубежной картой.

  • Deep Think — reasoning-режим в DeepSeek, где модель тратит внутренние thinking-токены на разбор задачи перед ответом. В веб-чате chat.deepseek.com включается кнопкой «DeepThink» под полем ввода. В API — параметром thinking: {"type": "enabled"} и/или reasoning_effort со значениями low / high / max.
  • Актуальные API-модели на 02.08.2026 — deepseek-v4-flash и deepseek-v4-pro. Обе — MoE-архитектура с контекстным окном 1M токенов и max output 384k. Reasoning-архитектура заложена в базу, отдельного deepseek-reasoner больше нет.
  • Ключевая механика — модель возвращает два поля: reasoning_content (chain-of-thought, для отладки и логирования) и content (финальный ответ пользователю). В веб-чате reasoning показывается в раскрывающемся спойлере «Thinking…».
  • Search mode — отдельная кнопка в веб-чате, включает live web search внутри диалога. Модель делает retrieval, вставляет источники в контекст и отвечает уже с их учётом. В публичном API отдельного built-in search-тула на 02.08.2026 нет — веб-поиск придётся собирать самим через function calling.
  • Цены: v4-flash — $0.14 input / $0.28 output за миллион токенов, v4-pro — $0.435 / $0.87. Reasoning-токены биллятся как output, планируйте бюджет с запасом.
  • Из РФ работает и веб-чат, и API напрямую по состоянию на 02.08.2026. Оплата — только зарубежной картой; российские карты DeepSeek не принимает.
  • Deep Think и Search комбинируются в UI одним включением обеих кнопок. Для длинного ресёрча — самый мощный режим DeepSeek.

Deep Think — маркетинговое название reasoning-режима DeepSeek. Технически это chain-of-thought (CoT) — модель генерирует внутреннюю цепочку рассуждений до того как выдать финальный ответ.

Работает так. Обычная LLM пишет ответ токен за токеном напрямую: получила запрос → сразу начала генерить. Reasoning-модель между запросом и ответом вставляет ещё одну фазу — свободные рассуждения в отдельном канале. Модель разбивает задачу на подзадачи, проверяет варианты, ловит противоречия. Только потом переходит к финальному ответу.

Первое поколение — DeepSeek-R1 — вышло в январе 2025 и стало первой open-моделью, догнавшей OpenAI-o1 по reasoning-бенчмаркам. По model card на HuggingFace, DeepSeek-R1 набирает 79,8% на AIME 2024 (против 79,2% у o1) и 97,3% на MATH-500 (против 96,4% у o1). На тот момент это был технологический прорыв — впервые доказали, что reasoning в LLM можно вырастить только через reinforcement learning, без размеченных цепочек рассуждений от людей.

Ключевая цитата из паперы DeepSeek-R1:

«It is the first open research to validate that reasoning capabilities of LLMs can be incentivized purely through RL, without the need for SFT».

В 2026 отдельного deepseek-reasoner API-эндпоинта больше нет — reasoning встроен прямо в базовые модели V4-Flash и V4-Pro. Кнопка «DeepThink» в интерфейсе и параметры thinking + reasoning_effort в API управляют одной и той же механикой: как глубоко модель думает перед ответом.

Что видит пользователь. В веб-чате reasoning-содержимое отображается в раскрывающемся блоке «Thinking…» над финальным ответом. Можно раскрыть и посмотреть, как модель размышляла — иногда там видно интересное. В API это возвращается в отдельном поле reasoning_content рядом с обычным content.

Три главных отличия — скорость, стоимость, точность.

Скорость. Обычный чат стримит ответ за 1–3 секунды. Deep Think может думать 10–60 секунд перед первым видимым токеном. На тяжёлых задачах (сложная математика, дебаг многослойного кода) — до нескольких минут. Для интерактивного UX нужно показывать состояние «модель обдумывает», а не крутящийся спиннер без объяснений.

Стоимость. По прайслисту api-docs.deepseek.com/quick_start/pricing (проверено 02.08.2026):

МодельInput MTokOutput MTokContextMax output
deepseek-v4-flash$0.14$0.281 000 000384 000
deepseek-v4-pro$0.435$0.871 000 000384 000

Важное уточнение: thinking-токены биллятся как output. Если пользователь просил 500 токенов ответа, а модель потратила ещё 3 000 на рассуждения — вы платите за 3 500 output-токенов. На тяжёлых задачах разница между «стоимость без reasoning» и «с reasoning» может быть в 5–10 раз. Мониторьте usage в ответе API.

Плюс — с 2026 года у DeepSeek заявлено peak/off-peak pricing: в интервал 09:00–12:00 и 14:00–18:00 по пекинскому времени рейт может умножаться на 2. Для российского бизнеса это дневные часы Москвы — планируйте пайплайны с оглядкой на график, если гоняете много токенов.

Точность. Deep Think стабильно сильнее на:

  • Математике — algebra, calculus, комбинаторика, оптимизация. Разница особенно заметна на многошаговых задачах.
  • Коде — сложная отладка, security review, рефакторинг архитектур. Модель проверяет граничные случаи, которые в non-thinking режиме проскакивают.
  • Логике — LSAT-стиль задачи, разбор длинных документов на противоречия.
  • Планировании — многошаговые стратегические решения, разбивка задачи на подзадачи.

На простом копирайте, коротких переводах, генерации описаний — разница минимальна или отсутствует. Тратить в 3–10 раз больше на «напиши приветствие клиенту» не нужно.

Search mode — отдельная функция в веб-чате chat.deepseek.com, включается кнопкой рядом с DeepThink. Активирует live web search внутри диалога.

Как работает. При включённом Search модель перед формированием ответа делает retrieval — уходит в интернет, забирает актуальную информацию по запросу, вставляет её в свой контекст. Ответ формируется уже с учётом свежих данных. Внизу ответа появляется список источников со ссылками — можно проверить, откуда модель взяла факты.

Что это решает. У любой LLM есть дата актуальности знаний (reliable knowledge cutoff) — граница, дальше которой модель не знает событий. У DeepSeek V4 актуальность фиксируется на момент обучения, для свежих новостей и вышедших вчера релизов — модель не в курсе. Search вытаскивает эту информацию из веба в моменте.

Важное ограничение. Search-функция официально есть только в веб-чате. В публичном API на 02.08.2026 отдельного built-in search-tool от DeepSeek нет — я проверила документацию по guides/tool_calls и guides/function_calling, там описано только классическое function calling с вашими собственными функциями. Если нужен веб-поиск в API-пайплайне, придётся собирать самим: подключать сторонний search-провайдер (Tavily, Serper, Exa) как function, отдавать модели результаты в tool response. Про это отдельный разбор в LLM из России напрямую.

Что видит пользователь. В веб-чате при включённом Search в шапке ответа появляется индикатор «Searching the web…», под финальным текстом — блок с 5–10 источниками. Каждый источник — кликабельная ссылка на первоисточник. Полезно для факт-чека: модель может ошибиться в интерпретации, но по ссылке можно верифицировать оригинал.

Обе кнопки в веб-чате включаются независимо — можно активировать обе одновременно. Это самый мощный режим DeepSeek на 02.08.2026.

Модель сначала делает web retrieval по запросу — вытаскивает свежие данные. Потом заходит в reasoning-фазу — но уже с учётом полученных источников. Разбирает противоречия между источниками, взвешивает надёжность, делает выводы. И только тогда пишет финальный ответ.

Кейс. Запрос: «Изучи, что писали про новую политику Wildberries по возвратам в июле 2026, и сделай выводы — что это значит для селлеров категории одежда». Обычная модель без Search про июль 2026 ничего не знает. С Search — вытащит 5–10 материалов, но без Deep Think может пересказать их поверхностно. С обоими режимами — сделает retrieval, потом в reasoning-фазе сопоставит источники, найдёт противоречия, выделит ключевые выводы.

Цена комбинации. По совокупным токенам получается дороже чистого Deep Think — контекст расширяется на retrieval-содержимое, reasoning работает по бóльшему объёму. Но для сложного ресёрча это оправдано.

1. Математика. Алгебра, calculus, комбинаторика, оптимизационные задачи. Пример из практики: пересчитать unit-экономику при изменении комиссии маркетплейса — модель разбивает на шаги, проверяет знаки, ловит округления. Без Deep Think часто вылезают арифметические ошибки в середине цепочки.

2. Логические задачки. LSAT / GRE-стиль, анализ противоречий в документах, вычисление зависимостей в сложных условиях. Классика — разобрать оферту маркетплейса и найти пункт, который противоречит другому пункту той же оферты.

3. Дебаг сложного кода. Многослойная логика, race conditions, поиск бага в стек-трейсе через 3–5 сервисов. Deep Think моделирует, как ошибка распространяется через систему, находит первопричину. На простом синтаксисе разница минимальна.

4. Стратегические решения. Multi-step reasoning — «если сделаем X, то будет Y, а если Y → потом Z, но при условии W». Планирование запуска продукта, разбор конкурентов, выбор архитектуры. Модель проверяет альтернативы, не залипая на первой идее.

5. Прогнозирование и оценка риска. Финансовые сценарии, анализ трендов, оценка «стоит ли брать это решение». Не для точных предсказаний (никакая LLM не знает будущего), а для взвешивания факторов и построения структурированной аргументации.

1. Простой копирайт. Пост в Telegram-канал, описание товара, заголовок статьи. Обычный чат справится за секунду и в 5 раз дешевле. Reasoning не улучшит текст, только увеличит счёт.

2. Перевод короткого текста. RU→EN или наоборот, несколько абзацев. Non-thinking режим даёт качество, сопоставимое с Deep Think, но быстрее и дешевле.

3. Резюме. Сжать статью до трёх абзацев, выделить главное из письма. Задача не требует многошагового рассуждения, модель просто извлекает.

4. Простой факт-запрос. «Какая столица Аргентины?», «В каком году основана компания X?». Тут даже non-thinking режим — оверкил. Если задача действительно на факты, а не на анализ.

5. Творческий brainstorm. Генерация идей, ассоциаций, черновиков. Reasoning делает ответы более выверенными — но иногда именно поэтому менее креативными. Для brainstorm часто лучше обычный чат с высокой температурой.

Практическое правило. Если задачу вы бы поручили младшему специалисту без углубления — берите обычный чат. Если бы позвали senior’а разобрать по деталям — включайте Deep Think.

По документации DeepSeek (api-docs.deepseek.com/guides/thinking_mode, проверено 02.08.2026), thinking mode активируется автоматически с high effort по умолчанию. Для явного управления есть два параметра.

OpenAI-совместимый интерфейс:

  • reasoning_effort — уровни low / high / max. Обратите внимание: medium не поддерживается, в отличие от OpenAI o-series.
  • thinking: {"type": "enabled"} или thinking: {"type": "disabled"} — включение / выключение полностью.

Anthropic-совместимый интерфейс (через api.deepseek.com/anthropic):

  • reasoning: {"effort": "none" | "low" | "high" | "max"}. Значение none полностью отключает thinking.

Как effort мапится на модели:

  • deepseek-v4-flash — поддерживает все три уровня low / high / max реально.
  • deepseek-v4-pro — на 02.08.2026 запросы low и high оба мапятся на actual effort high. То есть тонкой настройки для V4-Pro пока нет — либо думает глубоко, либо не думает вовсе.

Пример на Python (OpenAI SDK):

from openai import OpenAI
client = OpenAI(
api_key="sk-...", # ключ DeepSeek
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{"role": "user", "content": "Реши: 3x + 7 = 22, найди x"}
],
reasoning_effort="high",
extra_body={"thinking": {"type": "enabled"}}
)
# Финальный ответ пользователю
print(response.choices[0].message.content)
# Chain-of-thought для отладки / логов
print(response.choices[0].message.reasoning_content)

Пример curl:

Окно терминала
curl https://api.deepseek.com/chat/completions \
-H "Authorization: Bearer sk-..." \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash",
"messages": [{"role": "user", "content": "Реши: 3x + 7 = 22"}],
"reasoning_effort": "high",
"thinking": {"type": "enabled"}
}'

Важные ограничения (verbatim из docs):

«Thinking mode does not support the temperature, top_p, presence_penalty, or frequency_penalty parameters.»

Задавать их можно, но они игнорируются — ошибки не будет, но и эффекта тоже.

Multi-turn диалоги. По документации, если в диалоге нет tool calls, reasoning_content из предыдущих ходов не нужно передавать обратно — только content. Если есть tool calls — reasoning_content обязан участвовать в конкатенации контекста и передаваться в API во всех следующих запросах. Иначе модель теряет связность рассуждений.

Streaming. Reasoning-режим поддерживает streaming. В delta-чанках reasoning_content приходит отдельно от content — можно в реальном времени показывать пользователю блок «Thinking…» и заполнять его по мере поступления, потом переключаться на финальный ответ.

Короткий ответ — на 02.08.2026 отдельного built-in web search у DeepSeek API нет. Search — фича веб-интерфейса chat.deepseek.com, не публичного API.

Если нужен веб-поиск в API-пайплайне, есть два практических пути.

Путь 1. Function calling + сторонний search-провайдер.

Оборачиваете API стороннего поисковика (Tavily, Serper, Exa, Bing Search API) в function, отдаёте её DeepSeek как tool. Модель сама решает, нужно ли ей искать, вызывает функцию, получает результаты, продолжает рассуждение. Классический RAG-паттерн.

Схема function-описания в DeepSeek идентична OpenAI:

{
"type": "function",
"function": {
"name": "web_search",
"description": "Search the web for recent information",
"parameters": {
"type": "object",
"properties": {
"query": {
"type": "string",
"description": "The search query"
}
},
"required": ["query"]
}
}
}

Подробнее про function calling — в DeepSeek API старт.

Путь 2. RAG через свою базу.

Если веб-источники не критичны, а нужен свежий контекст из ваших данных — собираете свою retrieval-систему (embeddings + векторная БД), передаёте результаты в prompt как контекст. Про это в RAG в 2026.

Для веб-чата всё проще — просто нажимаете кнопку Search и обе кнопки одновременно можно включить.

Полная карта оплаты и доступа к AI-сервисам из РФ — в как оплачивать AI-подписки из РФ и LLM из России напрямую. Здесь короткая выжимка под DeepSeek.

  • Работает из РФ напрямую? И веб-чат chat.deepseek.com, и API api.deepseek.com открываются с российского IP по состоянию на 02.08.2026. DeepSeek — китайская компания, регуляторных ограничений на РФ нет. Веб-чат разлогинивается редко, API стабилен.
  • Оплата в РФ? Российские карты DeepSeek не принимает. Пути: иностранная карта (казахстанская, армянская, грузинская, узбекская, турецкая), виртуальные карты типа Pyypl / Wise (проверять актуальность приёма на стороне DeepSeek). Российских посредников для DeepSeek-баланса пока мало — рынок только формируется, наценки высокие.
  • Русский язык. DeepSeek держит русский на приличном уровне — лучше многих китайских моделей за счёт крупной русской доли в pretrain. На чистой математике и коде русский промпт работает не хуже английского. На тонком копирайте и специфических RU-темах (юридические разборы, локальные бренды) иногда лучше давать инструкции на английском, ответ просить на русском.
  • RU-альтернативы. По ценам DeepSeek конкурирует не с YandexGPT / GigaChat (те дороже за схожие модели), а с открытыми моделями через локальный inference. См. YandexGPT vs GigaChat для сравнения российских LLM между собой.
  • Данные и приватность. DeepSeek — китайский сервис, размещает данные на серверах в КНР. Для чувствительных данных (персональные данные клиентов по ФЗ-152, коммерческая тайна) выбирайте либо российские LLM с локальным размещением, либо self-hosted DeepSeek-R1 через open weights (модель лежит на HuggingFace под MIT-лицензией, разрешает commercial use).

Чем Deep Think отличается от обычного chain-of-thought промпта «think step by step»?

Разница фундаментальная. «Think step by step» в промпте заставляет обычную модель выписывать рассуждения в основном ответе — токены расходуются на видимую цепочку, качество растёт незначительно. Deep Think — это архитектурная фича: модель обучена reinforcement learning на длинных цепочках, thinking-токены идут в отдельном канале, финальный ответ остаётся чистым. Плюс на reasoning-моделях промпт «think step by step» контрпродуктивен — модель уже думает внутри, инструкция мешает.

Можно ли посмотреть, о чём думает модель, через API?

Да, поле reasoning_content возвращает полный chain-of-thought. В отличие от OpenAI o-series, где reasoning-токены скрыты, DeepSeek отдаёт их открыто. Удобно для отладки промптов и логирования.

Сколько reasoning-токенов реально тратит модель?

Зависит от задачи. Простой запрос с включённым Deep Think — 500–2 000 reasoning-токенов. Средняя задача (разбор кода на 100 строк) — 3 000–8 000. Тяжёлое многошаговое рассуждение — 15 000+ и больше. Мониторьте usage.completion_tokens — там суммарно и reasoning, и content.

Deep Think работает с tool calling?

Да. По документации, tool calls поддерживаются как в thinking, так и в non-thinking режиме DeepSeek V3.2+. В multi-turn диалогах с tool calls важное правило: reasoning_content из предыдущих ходов обязан передаваться обратно в API — иначе модель теряет контекст рассуждений между инструментами.

Что произойдёт, если задать temperature при включённом thinking?

Ничего — параметр просто игнорируется, ошибки не будет. То же с top_p, presence_penalty, frequency_penalty. Reasoning-режим использует внутренние настройки семплинга, оптимизированные под chain-of-thought.

Deep Think работает так же хорошо на русском, как на английском?

Практически да. DeepSeek-R1 в оригинальной паперы показывала небольшую деградацию на неанглийских языках, но V4 линейка это подтянула. Разница между русским и английским на математике и коде минимальна. На тонких лингвистических задачах (юридический разбор на русском) английский промпт по-прежнему может дать чуть лучше — но эффект в единицах процентов.

Search в веб-чате бесплатный?

Да, включение кнопки Search в chat.deepseek.com не добавляет платы для пользователя веб-интерфейса — DeepSeek предоставляет её как часть бесплатного веб-доступа. В API отдельно платить за Search нельзя, потому что его там нет — нужно собирать через сторонние API.

Можно ли отключить Deep Think когда он включён по умолчанию?

Да. Через OpenAI-интерфейс — параметр thinking: {"type": "disabled"}. Через Anthropic-интерфейс — reasoning: {"effort": "none"}. В веб-чате — просто не нажимать кнопку DeepThink, она toggle-переключатель.

Правда ли, что старый DeepSeek-R1 всё ещё лучше V4 на reasoning?

Нет — R1 официально устарел с точки зрения API. На чекпоинтах веса R1 остались на HuggingFace под MIT-лицензией — можно скачать и запустить локально. Но production-путь через API идёт через V4-Flash / V4-Pro, где reasoning встроен в архитектуру и метрики выше.

Есть ли rate limits на Deep Think через API?

DeepSeek не публикует чёткие RPM/TPM лимиты. Из практики: при активной работе через api.deepseek.com начинается throttling где-то на десятках параллельных запросов. Для production-нагрузок пишите в support или используйте очередь.

Deep Think сильнее OpenAI o3 или Claude Opus 5?

На разных бенчмарках побеждают попеременно. На чистой математике (AIME, MATH-500) DeepSeek держит уровень o3. На агентных задачах и коде OpenAI o3 и Claude Opus 5 часто впереди. Ключевое преимущество DeepSeek — цена: в 5–15 раз дешевле американских reasoning-моделей. Для массовых задач это часто перевешивает разницу в качестве.

Можно ли использовать веса DeepSeek-R1 в коммерческом продукте?

Да. R1 и все её distilled-варианты выпущены под MIT-лицензией, коммерческое использование разрешено. Verbatim из model card:

«DeepSeek-R1 series support commercial use, allow for any modifications and derivative works, including, but not limited to, distillation for training other LLMs.»

Модели, цены и условия доступа меняются часто. Перед бизнес-решением всегда сверяйся с первоисточником — все ссылки в разделе Sources ниже.