o-series OpenAI (o1, o3, o3-pro, o4-mini): reasoning-модели в 2026 — когда брать вместо GPT
Автор: Silvana · Дата: 31.07.2026 · Verified: 01.09.2026 · Reading time: 12 минут · Prerequisite: 022-openai-api-start-za-30-minut
o-series OpenAI — это семейство reasoning-моделей (o1, o3, o3-pro, o3-mini, o4-mini), которые тратят внутренние thinking-токены на планирование до ответа. Продовые в 2026 — o3 ($2/$8 за 1M), o3-pro ($20/$80), o4-mini ($1.1/$4.4). В GPT-5.6 OpenAI встроил reasoning прямо в базовую модель через параметр reasoning_effort, поэтому o-series больше не единственный вариант «думающей» модели, но остаётся сильным на коде, математике и агентных задачах. API проходит из РФ, оплата — только зарубежной картой.
- o-series — семейство reasoning-моделей OpenAI (o1, o3, o3-pro, o3-mini, o4-mini), которые «думают» перед ответом за счёт внутренних reasoning-токенов. Это отдельная линейка, живущая параллельно с GPT-серией.
- Актуальные production-модели на 31.07.2026 —
o3,o3-pro,o3-mini,o4-mini. Стараяo1и её варианты (o1-mini,o1-pro) остались в API, но большинство новых проектов берут o3 / o4-mini. - В GPT-5.6 (Sol, Terra, Luna) OpenAI встроил reasoning прямо в базовую модель — параметр
reasoning_effortтеперь есть и там. Это меняет правило выбора: reasoning больше не эксклюзив o-series. - Цены очень разные: o4-mini — $1.1 / $4.4 за миллион input / output токенов, o3 — $2 / $8, o3-pro — $20 / $80, старая o1-pro — $150 / $600. За глубину reasoning платите линейно.
- Из РФ доступ такой же, как для GPT: API работает с российского IP пока (политика может поменяться), веб-чат ChatGPT — блокирован, оплата — через иностранную карту или посредника.
- Промпт для reasoning-модели пишется иначе: коротко, без «think step by step», без цепочек рассуждений — модель делает это сама внутри.
Что это и зачем
Заголовок раздела «Что это и зачем»o-series — линейка reasoning-моделей OpenAI. Появилась в сентябре 2024 (o1-preview), развилась в o3 и o4-mini в апреле 2025, дальше расширилась o3-pro (июнь 2025). В отличие от обычных GPT-моделей, которые генерят ответ «в лоб» токен за токеном, reasoning-модели тратят внутренние reasoning-токены на планирование, проверку альтернатив и разбор задачи — до того как начнут писать видимый ответ.
По документации OpenAI, reasoning-модели «используют внутренние reasoning-токены перед генерацией ответа», что помогает им «планировать, эффективно использовать инструменты, проверять альтернативы, восстанавливаться из неопределённости и решать более сложные многошаговые задачи». Практический смысл — эта линейка сильнее на код, математику, науку и агентные задачи, но медленнее и дороже обычного GPT.
Важное уточнение сразу. В GPT-5.6, вышедшей весной 2026, OpenAI встроил reasoning прямо в базовую модель — у Sol / Terra / Luna есть параметр reasoning_effort со значениями от none до max. Формально это делает выбор между «взять GPT или o-series» не таким чёрно-белым, как год назад. Про то, где граница проходит сейчас — во второй половине статьи.
Для российского пользователя o-series важна по двум причинам: (1) на многих сложных задачах (агенты, тяжёлый код, юридический разбор) это до сих пор сильнейшие модели OpenAI по абсолютному качеству, (2) при правильном подборе reasoning_effort можно платить сильно меньше за счёт компактного o4-mini или o3-mini.
Основной разбор
Заголовок раздела «Основной разбор»Актуальная линейка o-series на 31.07.2026
Заголовок раздела «Актуальная линейка o-series на 31.07.2026»Данные с developers.openai.com/api/docs/models, проверено 31.07.2026.
| Модель | Model ID | Context | Max output | Input / output MTok | Knowledge cutoff | Дата снапшота |
|---|---|---|---|---|---|---|
| o4-mini | o4-mini | 200 000 | 100 000 | $1.1 / $4.4 (cached $0.275) | 01.06.2024 | 2025 |
| o3 | o3 | 200 000 | 100 000 | $2 / $8 (cached $0.5) | 01.06.2024 | o3-2025-04-16 |
| o3-mini | o3-mini | 200 000 | 100 000 | $1.1 / $4.4 (cached $0.55) | 01.10.2023 | o3-mini-2025-01-31 |
| o3-pro | o3-pro | 200 000 | 100 000 | $20 / $80 | 01.06.2024 | o3-pro-2025-06-10 |
| o1 | o1 | 200 000 | 100 000 | $15 / $60 (cached $7.5) | 01.10.2023 | o1-2024-12-17 |
| o1-mini | o1-mini | 128 000 | 65 536 | $1.1 / $4.4 (cached $0.55) | 01.10.2023 | 2024 |
| o1-pro | o1-pro | 200 000 | 100 000 | $150 / $600 | 01.10.2023 | 2025 |
Практическое чтение таблицы:
- Дефолт для новых проектов —
o3(баланс качество / цена / скорость) илиo4-mini(когда важна экономия). - Максимальное качество —
o3-pro, но платите в 10 раз большеo3. Ответы иногда занимают несколько минут. - Legacy —
o1,o1-mini,o1-pro. Не deprecated, но большинство новых пайплайнов уходят на o3 / o4-mini.o1-proпри цене $150 / $600 сегодня почти нигде не оправдан. o3-minivso4-mini— цена одинаковая ($1.1 / $4.4), но уo4-miniсвежее cutoff (июнь 2024 vs октябрь 2023), поддержка картинок на входе и Fine-tuning. Для новых проектов беритеo4-mini.
Как reasoning-модели устроены изнутри
Заголовок раздела «Как reasoning-модели устроены изнутри»Ключевое отличие от обычной GPT-модели — reasoning-токены. По документации OpenAI, reasoning-модели «вводят reasoning-токены в дополнение к input и output токенам» и используют их чтобы «думать, разбивая промпт и рассматривая несколько подходов».
Что это значит практически:
- Reasoning-токены скрыты в API-ответе. Вы видите только финальный
output. OpenAI намеренно не отдаёт трейсы — защита методологии. - Reasoning-токены занимают место в контекстном окне и биллятся как output. Если context 200 000, модель потратила 15 000 на reasoning — на финальный ответ остаётся 85 000.
- Первый токен идёт с задержкой. GPT-4o стримит за 1–3 секунды. o3 может «думать» 15–60 секунд, o3-pro — иногда несколько минут.
- Стоимость непредсказуема без учёта reasoning. Планировали 500 output — модель потратила ещё 3 000 reasoning — счёт вырос в 7 раз. Мониторьте
output_tokens_details.reasoning_tokens.
OpenAI рекомендует «резервировать минимум 25 000 токенов для reasoning и output когда вы начинаете экспериментировать». Если получаете incomplete status с причиной max_output_tokens — reasoning съел лимит.
Параметр reasoning_effort — главный тюнер
Заголовок раздела «Параметр reasoning_effort — главный тюнер»reasoning_effort — параметр, который управляет тем, насколько глубоко модель «думает» перед ответом. Значения (зависят от модели):
| Уровень | Что делает | Когда брать |
|---|---|---|
none | Reasoning отключён | Latency-critical задачи, где reasoning не нужен |
minimal | Минимальный reasoning | Быстрые ответы с минимальной проверкой |
low | Быстрый reasoning | Небольшая задержка, средние задачи |
medium | Дефолт | Баланс качества и надёжности |
high | Глубокий reasoning | Сложная отладка, тяжёлое планирование |
xhigh | Максимальный reasoning | Deep research, асинхронные workflow |
max | Максимум для модели | Самые сложные задачи |
Не все уровни доступны для всех моделей. o3, o4-mini поддерживают low, medium, high. GPT-5.6 добавил none, minimal, xhigh, max. o3-pro работает на встроенном высоком уровне — параметр либо игнорируется, либо ограничен.
Правило простое: reasoning_effort — это тюнер, а не главный способ вытащить качество. Если задача действительно требует больше рассуждений — сначала попробуйте high, потом решайте, стоит ли переходить на o3-pro.
Как писать промпт для reasoning-модели
Заголовок раздела «Как писать промпт для reasoning-модели»Главная ошибка новичка — писать reasoning-модели тот же промпт, что для GPT-4o. По документации OpenAI, reasoning-модели требуют «фундаментально иных подходов».
Что НЕ работает:
- «Think step by step» — не пишите. Модель уже думает step by step внутри.
- Chain-of-thought промпты («сначала объясни логику, потом дай ответ») — контрпродуктивны.
- Много few-shot примеров — reasoning-модели чаще выигрывают на zero-shot.
- Длинные инструкции на несколько страниц — многословие мешает, они «превосходят на кратких, чётких инструкциях».
Что работает:
- Задача, ограничения, формат вывода. Не расписывайте промежуточные шаги.
- Разделители — markdown, XML-теги, заголовки секций.
- Явные критерии успеха. «Ответ правильный если: (1) все три пункта, (2) без внешних ссылок, (3) до 300 слов».
- Developer messages вместо system. Начиная с
o1-2024-12-17reasoning-модели поддерживаютdeveloperrole — заменяетsystem. - Для markdown в ответе — первой строкой developer message пишите
Formatting re-enabled.
Пример плохого промпта для o3:
Ты — эксперт по WB-карточкам. Давай подумаем пошагово. Сначала проанализируй запрос, потом объясни логику, потом составь заголовок. Разбери внимательно. Формат: анализ (3 абзаца), потом заголовок. Пример: […]. Ещё: […]. Теперь: [товар]
Пример правильного для o3:
Задача: составь SEO-заголовок карточки WB для товара.
Ограничения: 50–70 символов, keyword «женский свитер» в первых 30, без «лучший» и «уникальный», без хайпа.
Формат: три варианта списком, без объяснений.
Товар: [описание]
Второй в 3 раза короче, работает лучше.
Отличия от GPT-5.6
Заголовок раздела «Отличия от GPT-5.6»GPT-5.6 (Sol, Terra, Luna) — обычная chat-модель OpenAI на 31.07.2026, но со встроенным reasoning. У неё тоже есть reasoning_effort, и она умеет «думать» перед ответом. Логичный вопрос — зачем тогда o-series вообще?
Различия по данным developers.openai.com/api/docs/models (проверено 31.07.2026):
| Параметр | GPT-5.6 Sol | o3 | o4-mini |
|---|---|---|---|
| Context | 1 050 000 | 200 000 | 200 000 |
| Max output | 128 000 | 100 000 | 100 000 |
| Input / output MTok | $5 / $30 | $2 / $8 | $1.1 / $4.4 |
| Cached input | $0.5 | $0.5 | $0.275 |
| Knowledge cutoff | 16.02.2026 | 01.06.2024 | 01.06.2024 |
| Reasoning уровни | none / minimal / low / medium / high / xhigh / max | low / medium / high | low / medium / high |
| Мультимодал вход | текст + картинки | текст + картинки | текст + картинки |
| Голос native | нет | нет | нет |
Практический разбор:
- Контекст. GPT-5.6 — 1M токенов, o3 / o4-mini — 200k. Для длинных документов и целых репозиториев GPT-5.6 выигрывает по объёму.
- Свежесть знаний. GPT-5.6 знает мир до февраля 2026, o3 и o4-mini — до июня 2024. Полтора года разницы. Для актуальных новостей и свежих библиотек GPT-5.6 полезнее из коробки, без RAG (RAG).
- Цена. o4-mini в 4,5 раза дешевле GPT-5.6 Sol на input, в 6,8 раз дешевле на output. Для массовых операций критично.
- Потолок качества на многошаговых задачах. o3 / o3-pro всё ещё считаются самыми сильными на агентных, математических и security-задачах. GPT-5.6 близко, но не идентично.
reasoning_effort: noneиminimal. GPT-5.6 умеет отключить reasoning полностью — превращается в быстрый chat. o-series всегда «думает», нижний уровеньlow.
Когда брать o-series вместо GPT-5.6
Заголовок раздела «Когда брать o-series вместо GPT-5.6»По документации OpenAI, reasoning-модели показывают лучший результат на:
- Многошаговые агентные задачи. Планирование, вызов инструментов, проверка результата, коррекция плана.
- Code review и security-аудит. Разбор чужого кода на баги, безопасность, читаемость.
- Сложная отладка. Многослойная логика, race conditions, stack trace через несколько сервисов.
- Юридический и научный анализ. Извлечь связи в длинных документах, где важна точность.
- Visual reasoning. Диаграммы, схемы, чертежи, скриншоты (у моделей с image input — o3, o4-mini, o1, o3-pro, o1-pro).
- Оценка выходов других моделей. LLM-as-judge паттерн работает лучше на o3, чем на GPT-5.6.
Для этих задач o-series предпочтительнее несмотря на меньший контекст и старше cutoff.
GPT-5.6 лучше подходит для:
- Быстрая генерация контента (посты, письма, описания).
- Классификация, извлечение сущностей, простой парсинг.
- Голосовые интерфейсы (o-series не для voice).
- Очень длинный контекст (500k+ токенов).
- Задачи, где важна актуальность знаний до февраля 2026.
- Latency-critical UX (ответ за 1–2 секунды).
Responses API, encrypted reasoning, summaries
Заголовок раздела «Responses API, encrypted reasoning, summaries»Для o3 и o4-mini через Responses API есть режим store: true — передаёте reasoning-items из предыдущего запроса в следующий, улучшая качество и снижая расход токенов. По документации, «Chat Completions API не включает reasoning-items в контекст, что приводит к слегка деградированной производительности на сложных multi-function calling workflow». Для агентных задач с несколькими tool-вызовами внутри сессии используйте Responses API.
Encrypted reasoning content. В stateless режиме (store: false) reasoning-items включают поле encrypted_content — зашифрованные данные, которые передают в будущие вызовы, чтобы модель «помнила» рассуждения без хранения ответов на серверах OpenAI. Нужно compliance-чувствительным проектам: медицина, финансы, госсектор.
Reasoning summaries. Некоторые o-модели поддерживают экспорт человеко-читаемого резюме reasoning через параметр summary: "auto" — «наиболее детальный доступный саммэрайзер для модели». Полный трейс всё равно скрыт, только резюме верхнего уровня.
Сравнение с Claude Sonnet 5 extended thinking
Заголовок раздела «Сравнение с Claude Sonnet 5 extended thinking»Аналог reasoning-моделей у Anthropic — extended thinking / adaptive thinking у Claude. Подробно про Sonnet 5 разбирали в Claude Sonnet 5 для RU и Claude Opus 5. Короткое сравнение:
| Параметр | Claude Sonnet 5 | OpenAI o3 |
|---|---|---|
| Context | 1 000 000 | 200 000 |
| Max output | 128 000 | 100 000 |
| Input / output MTok | $3 / $15 (intro $2 / $10 до 31.08.2026) | $2 / $8 |
| Reasoning-тюнинг | Adaptive thinking + effort (low / medium / high) | reasoning_effort (low / medium / high) |
| Reasoning видно? | Через extended_thinking блок при запросе | Нет, скрыт |
| Cutoff (reliable) | 01.2026 | 06.2024 |
Отличия:
- Прозрачность. Claude может показать рассуждения в API-ответе (блок
extended_thinking). o-series — всё скрыто. - Свежесть. Sonnet 5 знает мир до января 2026, o3 — до июня 2024.
- Цена. o3 дешевле по input ($2 vs $3) и output ($8 vs $15). Но считать надо total cost per task с учётом объёма reasoning-токенов.
- Экосистема. Claude Code — сильный агентный runtime у Anthropic. У OpenAI есть ChatGPT Agents и Responses API — тоже мощно, но иначе устроено.
Практическое правило: под массовые задачи с экономией — o4-mini. Под тяжёлое многошаговое рассуждение — сравнивайте o3 и Sonnet 5 на своих кейсах, побеждают попеременно. Под голос и абсолютно свежий cutoff — GPT-5.6.
Когда o3-pro стоит своих денег
Заголовок раздела «Когда o3-pro стоит своих денег»o3-pro — $20 / $80 за миллион токенов. В 10 раз дороже o3. Работает только через Responses API, запросы могут занимать несколько минут, рекомендуется background mode.
Стоит брать когда:
- Задача редкая и критичная. 10 запросов в неделю, но каждый — важное решение (юридический анализ, security audit, стратегия).
- Ошибка дороже оплаты токенов. Разница между «примерно» и «точно» — миллионы рублей.
- Задача плохо помещается в one-shot. o3 не справляется даже с
high, разбивать некогда. - Deep research. Много подходов, проверка противоречий, финальный вердикт.
Для всего остального o3 с reasoning_effort: high даст 85–95% качества o3-pro за 10% цены. Начинайте с o3 — переходите на o3-pro только когда доказали, что o3 не хватает.
RU-специфика
Заголовок раздела «RU-специфика»Полная карта оплаты — как оплачивать AI-подписки из РФ. Полная карта доступа из РФ — LLM из России напрямую. Здесь короткая выжимка под o-series.
- Работает из РФ напрямую? Веб-чат ChatGPT (
chatgpt.com) с российского IP не открывается. API-запросы кapi.openai.comпока проходят с российского IP — по состоянию на 31.07.2026 OpenAI не блокирует запросы по гео. Политика может поменяться в любой момент, для production берите зарубежный сервер. - Оплата в РФ? Российские карты OpenAI не принимает. Три пути: иностранная карта (казахстанская, армянская, грузинская, узбекская, турецкая), виртуальная карта (Pyypl, Zen, Wise — проверять актуальность), российский посредник (наценка 40–70%, без возни с картами).
- RU-локализация? Русский держит на уровне GPT-4o — хорошо, но не идеально. На сложных reasoning-задачах на русском (юридический разбор) чаще уступает английскому. Практика: developer message на английском, ответы — на русском.
- RU-альтернативы? Прямого аналога уровня o3 в РФ-стеке нет. Ближайшее — DeepSeek R1 / V3 (открытые, дёшево, у R1 явно reasoning-архитектура) — иногда близко к o3, часто уступает. YandexGPT и GigaChat пока слабее (YandexGPT vs GigaChat).
- API-биллинг. Предоплата через привязанную карту. Пополняете кредит, модели списываются по факту usage. Auto-recharge с российских карт не работает даже через посредника — раз в неделю проверяйте баланс вручную.
Что дальше
Заголовок раздела «Что дальше»- Claude Sonnet 5 для RU — базовая статья по Claude, референс для сравнений в разделе.
- Claude Opus 5 — новая Sonnet 5 с extended thinking, прямой аналог o3.
- GPT-5.6 линейка — hello-world по OpenAI API, включая o-series.
- тарифы ChatGPT — разбор актуальной GPT-линейки с встроенным reasoning.
- Advanced Voice — как o3 работает с инструментами через Responses API.
- LLM из России напрямую — карта того, что работает из РФ напрямую и какие альтернативы есть.
- как оплачивать AI-подписки из РФ — как оплатить OpenAI из России.
Правда ли, что o-series всегда лучше GPT-5.6 на сложных задачах?
Не всегда. По документации OpenAI, o-series лучше на многошаговом reasoning, code, math, science, агентных задачах. GPT-5.6 со встроенным reasoning + свежий cutoff и больший контекст часто выигрывает там, где важна актуальность или объём. Сравнивайте на своих кейсах.
Можно ли переключаться между o-series и GPT-5.6 в одной сессии?
В API — да, каждый запрос независим, меняете model параметр. В ChatGPT UI — переключением модели вручную. В production не редкость: часть запросов через gpt-5.6-sol (быстро, дёшево, свежий cutoff), часть через o3 (глубокий reasoning).
Зачем reasoning_effort: none в GPT-5.6, если можно просто взять GPT-4o?
GPT-4o живёт для legacy, но GPT-5.6 с reasoning_effort: none даёт свежий cutoff (февраль 2026 против 2023 у 4o) и больший контекст (1M vs 128k). Для новых проектов дефолт — GPT-5.6.
Сколько reasoning-токенов реально тратит модель?
От 500 до 15 000 на средний запрос. На тяжёлые задачи o3-pro может потратить 30 000+. Мониторьте output_tokens_details.reasoning_tokens в usage. Планируйте бюджет с запасом — reasoning биллится как output.
Правда ли, что o1 и o1-pro устарели?
Технически не deprecated — API отдаёт запросы. Практически большинство новых проектов уходит на o3 / o4-mini: те же 200k context, ниже цены, свежее cutoff. o1-pro при $150 / $600 в 2026 году почти нигде не оправдан — o3-pro за $20 / $80 даёт сопоставимое качество.
Почему нельзя увидеть reasoning-токены в API?
OpenAI защищает методологию — если конкуренты получат доступ к трейсам, они смогут тренировать модели имитировать процесс. Отдаётся только финальный ответ и опциональный summary — резюме верхнего уровня.
Можно ли комбинировать o3 со streaming?
o3 поддерживает streaming через Responses API. Но первые 10–60 секунд ничего не приходит — модель думает. В UX показывайте состояние «модель обдумывает», не «модель отвечает».
Насколько reasoning_effort: high замедляет ответ?
Разница в 3–10 раз против low. На low o3 отвечает за 5–15 секунд, на high — 30–120 секунд. Для batch-задач разница не важна. Для интерактивного UX начинайте с medium, поднимайте до high только если реально не хватает.
Существует ли полноразмерная o4?
На 31.07.2026 в API доступна только o4-mini. Полноразмерная o4 не выпущена. Не строим планы на неанонсированный продукт.
Актуально на 31.07.2026
Заголовок раздела «Актуально на 31.07.2026»Модели, цены и условия доступа меняются часто. Перед бизнес-решением всегда сверяйся с первоисточником — все ссылки в разделе Sources ниже.
Sources
Заголовок раздела «Sources»- https://developers.openai.com/api/docs/models/o3 · проверено 31.07.2026
- https://developers.openai.com/api/docs/models/o4-mini · проверено 31.07.2026
- https://developers.openai.com/api/docs/models/o3-pro · проверено 31.07.2026
- https://developers.openai.com/api/docs/models/o3-mini · проверено 31.07.2026
- https://developers.openai.com/api/docs/models/o1 · проверено 31.07.2026
- https://developers.openai.com/api/docs/models/o1-mini · проверено 31.07.2026
- https://developers.openai.com/api/docs/models/o1-pro · проверено 31.07.2026
- https://developers.openai.com/api/docs/models/gpt-5.6-sol · проверено 31.07.2026
- https://developers.openai.com/api/docs/guides/reasoning · проверено 31.07.2026
- https://developers.openai.com/api/docs/guides/reasoning-best-practices · проверено 31.07.2026