Перейти к содержимому

o-series OpenAI (o1, o3, o3-pro, o4-mini): reasoning-модели в 2026 — когда брать вместо GPT

Автор: Silvana · Дата: 31.07.2026 · Verified: 01.09.2026 · Reading time: 12 минут · Prerequisite: 022-openai-api-start-za-30-minut

o-series OpenAI — это семейство reasoning-моделей (o1, o3, o3-pro, o3-mini, o4-mini), которые тратят внутренние thinking-токены на планирование до ответа. Продовые в 2026 — o3 ($2/$8 за 1M), o3-pro ($20/$80), o4-mini ($1.1/$4.4). В GPT-5.6 OpenAI встроил reasoning прямо в базовую модель через параметр reasoning_effort, поэтому o-series больше не единственный вариант «думающей» модели, но остаётся сильным на коде, математике и агентных задачах. API проходит из РФ, оплата — только зарубежной картой.

  • o-series — семейство reasoning-моделей OpenAI (o1, o3, o3-pro, o3-mini, o4-mini), которые «думают» перед ответом за счёт внутренних reasoning-токенов. Это отдельная линейка, живущая параллельно с GPT-серией.
  • Актуальные production-модели на 31.07.2026 — o3, o3-pro, o3-mini, o4-mini. Старая o1 и её варианты (o1-mini, o1-pro) остались в API, но большинство новых проектов берут o3 / o4-mini.
  • В GPT-5.6 (Sol, Terra, Luna) OpenAI встроил reasoning прямо в базовую модель — параметр reasoning_effort теперь есть и там. Это меняет правило выбора: reasoning больше не эксклюзив o-series.
  • Цены очень разные: o4-mini — $1.1 / $4.4 за миллион input / output токенов, o3 — $2 / $8, o3-pro — $20 / $80, старая o1-pro — $150 / $600. За глубину reasoning платите линейно.
  • Из РФ доступ такой же, как для GPT: API работает с российского IP пока (политика может поменяться), веб-чат ChatGPT — блокирован, оплата — через иностранную карту или посредника.
  • Промпт для reasoning-модели пишется иначе: коротко, без «think step by step», без цепочек рассуждений — модель делает это сама внутри.

o-series — линейка reasoning-моделей OpenAI. Появилась в сентябре 2024 (o1-preview), развилась в o3 и o4-mini в апреле 2025, дальше расширилась o3-pro (июнь 2025). В отличие от обычных GPT-моделей, которые генерят ответ «в лоб» токен за токеном, reasoning-модели тратят внутренние reasoning-токены на планирование, проверку альтернатив и разбор задачи — до того как начнут писать видимый ответ.

По документации OpenAI, reasoning-модели «используют внутренние reasoning-токены перед генерацией ответа», что помогает им «планировать, эффективно использовать инструменты, проверять альтернативы, восстанавливаться из неопределённости и решать более сложные многошаговые задачи». Практический смысл — эта линейка сильнее на код, математику, науку и агентные задачи, но медленнее и дороже обычного GPT.

Важное уточнение сразу. В GPT-5.6, вышедшей весной 2026, OpenAI встроил reasoning прямо в базовую модель — у Sol / Terra / Luna есть параметр reasoning_effort со значениями от none до max. Формально это делает выбор между «взять GPT или o-series» не таким чёрно-белым, как год назад. Про то, где граница проходит сейчас — во второй половине статьи.

Для российского пользователя o-series важна по двум причинам: (1) на многих сложных задачах (агенты, тяжёлый код, юридический разбор) это до сих пор сильнейшие модели OpenAI по абсолютному качеству, (2) при правильном подборе reasoning_effort можно платить сильно меньше за счёт компактного o4-mini или o3-mini.

Данные с developers.openai.com/api/docs/models, проверено 31.07.2026.

МодельModel IDContextMax outputInput / output MTokKnowledge cutoffДата снапшота
o4-minio4-mini200 000100 000$1.1 / $4.4 (cached $0.275)01.06.20242025
o3o3200 000100 000$2 / $8 (cached $0.5)01.06.2024o3-2025-04-16
o3-minio3-mini200 000100 000$1.1 / $4.4 (cached $0.55)01.10.2023o3-mini-2025-01-31
o3-proo3-pro200 000100 000$20 / $8001.06.2024o3-pro-2025-06-10
o1o1200 000100 000$15 / $60 (cached $7.5)01.10.2023o1-2024-12-17
o1-minio1-mini128 00065 536$1.1 / $4.4 (cached $0.55)01.10.20232024
o1-proo1-pro200 000100 000$150 / $60001.10.20232025

Практическое чтение таблицы:

  • Дефолт для новых проектовo3 (баланс качество / цена / скорость) или o4-mini (когда важна экономия).
  • Максимальное качествоo3-pro, но платите в 10 раз больше o3. Ответы иногда занимают несколько минут.
  • Legacyo1, o1-mini, o1-pro. Не deprecated, но большинство новых пайплайнов уходят на o3 / o4-mini. o1-pro при цене $150 / $600 сегодня почти нигде не оправдан.
  • o3-mini vs o4-mini — цена одинаковая ($1.1 / $4.4), но у o4-mini свежее cutoff (июнь 2024 vs октябрь 2023), поддержка картинок на входе и Fine-tuning. Для новых проектов берите o4-mini.

Ключевое отличие от обычной GPT-модели — reasoning-токены. По документации OpenAI, reasoning-модели «вводят reasoning-токены в дополнение к input и output токенам» и используют их чтобы «думать, разбивая промпт и рассматривая несколько подходов».

Что это значит практически:

  1. Reasoning-токены скрыты в API-ответе. Вы видите только финальный output. OpenAI намеренно не отдаёт трейсы — защита методологии.
  2. Reasoning-токены занимают место в контекстном окне и биллятся как output. Если context 200 000, модель потратила 15 000 на reasoning — на финальный ответ остаётся 85 000.
  3. Первый токен идёт с задержкой. GPT-4o стримит за 1–3 секунды. o3 может «думать» 15–60 секунд, o3-pro — иногда несколько минут.
  4. Стоимость непредсказуема без учёта reasoning. Планировали 500 output — модель потратила ещё 3 000 reasoning — счёт вырос в 7 раз. Мониторьте output_tokens_details.reasoning_tokens.

OpenAI рекомендует «резервировать минимум 25 000 токенов для reasoning и output когда вы начинаете экспериментировать». Если получаете incomplete status с причиной max_output_tokens — reasoning съел лимит.

reasoning_effort — параметр, который управляет тем, насколько глубоко модель «думает» перед ответом. Значения (зависят от модели):

УровеньЧто делаетКогда брать
noneReasoning отключёнLatency-critical задачи, где reasoning не нужен
minimalМинимальный reasoningБыстрые ответы с минимальной проверкой
lowБыстрый reasoningНебольшая задержка, средние задачи
mediumДефолтБаланс качества и надёжности
highГлубокий reasoningСложная отладка, тяжёлое планирование
xhighМаксимальный reasoningDeep research, асинхронные workflow
maxМаксимум для моделиСамые сложные задачи

Не все уровни доступны для всех моделей. o3, o4-mini поддерживают low, medium, high. GPT-5.6 добавил none, minimal, xhigh, max. o3-pro работает на встроенном высоком уровне — параметр либо игнорируется, либо ограничен.

Правило простое: reasoning_effort — это тюнер, а не главный способ вытащить качество. Если задача действительно требует больше рассуждений — сначала попробуйте high, потом решайте, стоит ли переходить на o3-pro.

Главная ошибка новичка — писать reasoning-модели тот же промпт, что для GPT-4o. По документации OpenAI, reasoning-модели требуют «фундаментально иных подходов».

Что НЕ работает:

  • «Think step by step» — не пишите. Модель уже думает step by step внутри.
  • Chain-of-thought промпты («сначала объясни логику, потом дай ответ») — контрпродуктивны.
  • Много few-shot примеров — reasoning-модели чаще выигрывают на zero-shot.
  • Длинные инструкции на несколько страниц — многословие мешает, они «превосходят на кратких, чётких инструкциях».

Что работает:

  • Задача, ограничения, формат вывода. Не расписывайте промежуточные шаги.
  • Разделители — markdown, XML-теги, заголовки секций.
  • Явные критерии успеха. «Ответ правильный если: (1) все три пункта, (2) без внешних ссылок, (3) до 300 слов».
  • Developer messages вместо system. Начиная с o1-2024-12-17 reasoning-модели поддерживают developer role — заменяет system.
  • Для markdown в ответе — первой строкой developer message пишите Formatting re-enabled.

Пример плохого промпта для o3:

Ты — эксперт по WB-карточкам. Давай подумаем пошагово. Сначала проанализируй запрос, потом объясни логику, потом составь заголовок. Разбери внимательно. Формат: анализ (3 абзаца), потом заголовок. Пример: […]. Ещё: […]. Теперь: [товар]

Пример правильного для o3:

Задача: составь SEO-заголовок карточки WB для товара.

Ограничения: 50–70 символов, keyword «женский свитер» в первых 30, без «лучший» и «уникальный», без хайпа.

Формат: три варианта списком, без объяснений.

Товар: [описание]

Второй в 3 раза короче, работает лучше.

GPT-5.6 (Sol, Terra, Luna) — обычная chat-модель OpenAI на 31.07.2026, но со встроенным reasoning. У неё тоже есть reasoning_effort, и она умеет «думать» перед ответом. Логичный вопрос — зачем тогда o-series вообще?

Различия по данным developers.openai.com/api/docs/models (проверено 31.07.2026):

ПараметрGPT-5.6 Solo3o4-mini
Context1 050 000200 000200 000
Max output128 000100 000100 000
Input / output MTok$5 / $30$2 / $8$1.1 / $4.4
Cached input$0.5$0.5$0.275
Knowledge cutoff16.02.202601.06.202401.06.2024
Reasoning уровниnone / minimal / low / medium / high / xhigh / maxlow / medium / highlow / medium / high
Мультимодал входтекст + картинкитекст + картинкитекст + картинки
Голос nativeнетнетнет

Практический разбор:

  • Контекст. GPT-5.6 — 1M токенов, o3 / o4-mini — 200k. Для длинных документов и целых репозиториев GPT-5.6 выигрывает по объёму.
  • Свежесть знаний. GPT-5.6 знает мир до февраля 2026, o3 и o4-mini — до июня 2024. Полтора года разницы. Для актуальных новостей и свежих библиотек GPT-5.6 полезнее из коробки, без RAG (RAG).
  • Цена. o4-mini в 4,5 раза дешевле GPT-5.6 Sol на input, в 6,8 раз дешевле на output. Для массовых операций критично.
  • Потолок качества на многошаговых задачах. o3 / o3-pro всё ещё считаются самыми сильными на агентных, математических и security-задачах. GPT-5.6 близко, но не идентично.
  • reasoning_effort: none и minimal. GPT-5.6 умеет отключить reasoning полностью — превращается в быстрый chat. o-series всегда «думает», нижний уровень low.

По документации OpenAI, reasoning-модели показывают лучший результат на:

  • Многошаговые агентные задачи. Планирование, вызов инструментов, проверка результата, коррекция плана.
  • Code review и security-аудит. Разбор чужого кода на баги, безопасность, читаемость.
  • Сложная отладка. Многослойная логика, race conditions, stack trace через несколько сервисов.
  • Юридический и научный анализ. Извлечь связи в длинных документах, где важна точность.
  • Visual reasoning. Диаграммы, схемы, чертежи, скриншоты (у моделей с image input — o3, o4-mini, o1, o3-pro, o1-pro).
  • Оценка выходов других моделей. LLM-as-judge паттерн работает лучше на o3, чем на GPT-5.6.

Для этих задач o-series предпочтительнее несмотря на меньший контекст и старше cutoff.

GPT-5.6 лучше подходит для:

  • Быстрая генерация контента (посты, письма, описания).
  • Классификация, извлечение сущностей, простой парсинг.
  • Голосовые интерфейсы (o-series не для voice).
  • Очень длинный контекст (500k+ токенов).
  • Задачи, где важна актуальность знаний до февраля 2026.
  • Latency-critical UX (ответ за 1–2 секунды).

Для o3 и o4-mini через Responses API есть режим store: true — передаёте reasoning-items из предыдущего запроса в следующий, улучшая качество и снижая расход токенов. По документации, «Chat Completions API не включает reasoning-items в контекст, что приводит к слегка деградированной производительности на сложных multi-function calling workflow». Для агентных задач с несколькими tool-вызовами внутри сессии используйте Responses API.

Encrypted reasoning content. В stateless режиме (store: false) reasoning-items включают поле encrypted_content — зашифрованные данные, которые передают в будущие вызовы, чтобы модель «помнила» рассуждения без хранения ответов на серверах OpenAI. Нужно compliance-чувствительным проектам: медицина, финансы, госсектор.

Reasoning summaries. Некоторые o-модели поддерживают экспорт человеко-читаемого резюме reasoning через параметр summary: "auto" — «наиболее детальный доступный саммэрайзер для модели». Полный трейс всё равно скрыт, только резюме верхнего уровня.

Аналог reasoning-моделей у Anthropic — extended thinking / adaptive thinking у Claude. Подробно про Sonnet 5 разбирали в Claude Sonnet 5 для RU и Claude Opus 5. Короткое сравнение:

ПараметрClaude Sonnet 5OpenAI o3
Context1 000 000200 000
Max output128 000100 000
Input / output MTok$3 / $15 (intro $2 / $10 до 31.08.2026)$2 / $8
Reasoning-тюнингAdaptive thinking + effort (low / medium / high)reasoning_effort (low / medium / high)
Reasoning видно?Через extended_thinking блок при запросеНет, скрыт
Cutoff (reliable)01.202606.2024

Отличия:

  • Прозрачность. Claude может показать рассуждения в API-ответе (блок extended_thinking). o-series — всё скрыто.
  • Свежесть. Sonnet 5 знает мир до января 2026, o3 — до июня 2024.
  • Цена. o3 дешевле по input ($2 vs $3) и output ($8 vs $15). Но считать надо total cost per task с учётом объёма reasoning-токенов.
  • Экосистема. Claude Code — сильный агентный runtime у Anthropic. У OpenAI есть ChatGPT Agents и Responses API — тоже мощно, но иначе устроено.

Практическое правило: под массовые задачи с экономией — o4-mini. Под тяжёлое многошаговое рассуждение — сравнивайте o3 и Sonnet 5 на своих кейсах, побеждают попеременно. Под голос и абсолютно свежий cutoff — GPT-5.6.

o3-pro — $20 / $80 за миллион токенов. В 10 раз дороже o3. Работает только через Responses API, запросы могут занимать несколько минут, рекомендуется background mode.

Стоит брать когда:

  • Задача редкая и критичная. 10 запросов в неделю, но каждый — важное решение (юридический анализ, security audit, стратегия).
  • Ошибка дороже оплаты токенов. Разница между «примерно» и «точно» — миллионы рублей.
  • Задача плохо помещается в one-shot. o3 не справляется даже с high, разбивать некогда.
  • Deep research. Много подходов, проверка противоречий, финальный вердикт.

Для всего остального o3 с reasoning_effort: high даст 85–95% качества o3-pro за 10% цены. Начинайте с o3 — переходите на o3-pro только когда доказали, что o3 не хватает.

Полная карта оплаты — как оплачивать AI-подписки из РФ. Полная карта доступа из РФ — LLM из России напрямую. Здесь короткая выжимка под o-series.

  • Работает из РФ напрямую? Веб-чат ChatGPT (chatgpt.com) с российского IP не открывается. API-запросы к api.openai.com пока проходят с российского IP — по состоянию на 31.07.2026 OpenAI не блокирует запросы по гео. Политика может поменяться в любой момент, для production берите зарубежный сервер.
  • Оплата в РФ? Российские карты OpenAI не принимает. Три пути: иностранная карта (казахстанская, армянская, грузинская, узбекская, турецкая), виртуальная карта (Pyypl, Zen, Wise — проверять актуальность), российский посредник (наценка 40–70%, без возни с картами).
  • RU-локализация? Русский держит на уровне GPT-4o — хорошо, но не идеально. На сложных reasoning-задачах на русском (юридический разбор) чаще уступает английскому. Практика: developer message на английском, ответы — на русском.
  • RU-альтернативы? Прямого аналога уровня o3 в РФ-стеке нет. Ближайшее — DeepSeek R1 / V3 (открытые, дёшево, у R1 явно reasoning-архитектура) — иногда близко к o3, часто уступает. YandexGPT и GigaChat пока слабее (YandexGPT vs GigaChat).
  • API-биллинг. Предоплата через привязанную карту. Пополняете кредит, модели списываются по факту usage. Auto-recharge с российских карт не работает даже через посредника — раз в неделю проверяйте баланс вручную.

Правда ли, что o-series всегда лучше GPT-5.6 на сложных задачах?

Не всегда. По документации OpenAI, o-series лучше на многошаговом reasoning, code, math, science, агентных задачах. GPT-5.6 со встроенным reasoning + свежий cutoff и больший контекст часто выигрывает там, где важна актуальность или объём. Сравнивайте на своих кейсах.

Можно ли переключаться между o-series и GPT-5.6 в одной сессии?

В API — да, каждый запрос независим, меняете model параметр. В ChatGPT UI — переключением модели вручную. В production не редкость: часть запросов через gpt-5.6-sol (быстро, дёшево, свежий cutoff), часть через o3 (глубокий reasoning).

Зачем reasoning_effort: none в GPT-5.6, если можно просто взять GPT-4o?

GPT-4o живёт для legacy, но GPT-5.6 с reasoning_effort: none даёт свежий cutoff (февраль 2026 против 2023 у 4o) и больший контекст (1M vs 128k). Для новых проектов дефолт — GPT-5.6.

Сколько reasoning-токенов реально тратит модель?

От 500 до 15 000 на средний запрос. На тяжёлые задачи o3-pro может потратить 30 000+. Мониторьте output_tokens_details.reasoning_tokens в usage. Планируйте бюджет с запасом — reasoning биллится как output.

Правда ли, что o1 и o1-pro устарели?

Технически не deprecated — API отдаёт запросы. Практически большинство новых проектов уходит на o3 / o4-mini: те же 200k context, ниже цены, свежее cutoff. o1-pro при $150 / $600 в 2026 году почти нигде не оправдан — o3-pro за $20 / $80 даёт сопоставимое качество.

Почему нельзя увидеть reasoning-токены в API?

OpenAI защищает методологию — если конкуренты получат доступ к трейсам, они смогут тренировать модели имитировать процесс. Отдаётся только финальный ответ и опциональный summary — резюме верхнего уровня.

Можно ли комбинировать o3 со streaming?

o3 поддерживает streaming через Responses API. Но первые 10–60 секунд ничего не приходит — модель думает. В UX показывайте состояние «модель обдумывает», не «модель отвечает».

Насколько reasoning_effort: high замедляет ответ?

Разница в 3–10 раз против low. На low o3 отвечает за 5–15 секунд, на high — 30–120 секунд. Для batch-задач разница не важна. Для интерактивного UX начинайте с medium, поднимайте до high только если реально не хватает.

Существует ли полноразмерная o4?

На 31.07.2026 в API доступна только o4-mini. Полноразмерная o4 не выпущена. Не строим планы на неанонсированный продукт.

Модели, цены и условия доступа меняются часто. Перед бизнес-решением всегда сверяйся с первоисточником — все ссылки в разделе Sources ниже.