Advanced Voice и Realtime API OpenAI: голосовой чат ChatGPT в 2026
Автор: Silvana · Дата: 31.07.2026 · Verified: 01.09.2026 · Reading time: 15 минут · Prerequisite: базовое понимание что такое API и WebSocket
Голосовой чат ChatGPT в 2026 — это два продукта OpenAI: Advanced Voice в самом приложении и Realtime API для встраивания в свой сервис. Оба работают на прямом speech-to-speech (звук на вход, звук на выход, без промежуточного текста), поддерживают русский, дают 10 голосов и умеют прерывания. Advanced Voice — для подписчика ChatGPT. Realtime API — для разработчика: WebSocket, WebRTC или SIP, оплата поминутно. Ниже — какие модели в линейке, сколько стоит минута и когда выгоднее взять OpenAI, а когда Gemini Live от Google.
Голос перестал быть отдельным экраном в приложении. Ты говоришь — модель отвечает голосом, слышит как ты её перебиваешь, замолкает, продолжает с новой ветки. Без пауз «печатаю ответ», без промежуточного текста, без нажатия кнопки «отправить».
В 2026 у OpenAI два продукта про голос. Первый — Advanced Voice в ChatGPT: то что видит обычный подписчик, когда жмёт значок волны и разговаривает с ChatGPT как с человеком. Второй — Realtime API: то же самое, но собранное в собственный продукт, вставленное в свой сайт, свой звонок клиенту, свой обучающий тренажёр.
В этой статье — как оба устроены изнутри, какие голосовые модели сейчас в линейке, сколько стоит минута, поддерживается ли русский и когда стоит выбрать OpenAI, а когда — Gemini Live от Google.
Что такое Advanced Voice в ChatGPT
Заголовок раздела «Что такое Advanced Voice в ChatGPT»Advanced Voice — это режим внутри приложения ChatGPT (iOS, Android, десктоп), в котором ты нажимаешь на значок звуковой волны и переходишь в непрерывный голосовой диалог. Не диктофон, не «преобразуй голос в текст → отправь запрос → озвучь ответ». Модель принимает звук напрямую и отдаёт звук напрямую, без текстовой промежуточной остановки.
Что это меняет на практике:
Ты можешь перебивать. Модель говорит, ты произносишь «стоп, а по-другому объясни» — она замолкает и переходит к твоей реплике. Никакой очереди «дай договорить». Именно так работает разговор между людьми, и Advanced Voice это воспроизводит.
Модель слышит эмоции и интонацию. Если ты говоришь усталым голосом, она это учитывает в ответе. Если смеёшься — она подстраивает тон. Она понимает не только слова, но и как ты их произносишь: шёпот, крик, задыхание после пробежки.
Она умеет играть голосом. Медленнее, быстрее, шёпотом, с акцентом, с эмоцией. Ты просишь — она делает.
Задержка меньше секунды. Ответ начинается ощутимо быстрее, чем в текстовом чате. Разница между «печатает» и «мгновенно отвечает» — категорическая.
Advanced Voice доступен на всех платных тарифах ChatGPT — Plus, Pro, Team, Enterprise, Edu. Бесплатный тариф получает ограниченную ежедневную квоту. Функция работает в мобильных приложениях и в десктопе. Технически она построена на том же слое, что и Realtime API — модели gpt-realtime и её потомки, о которых ниже.
Что такое Realtime API
Заголовок раздела «Что такое Realtime API»Realtime API — способ подключить ту же голосовую модель к своему продукту. Не через ChatGPT, а напрямую: звонок на IVR идёт в свой backend, backend соединяется с моделью, модель отвечает клиенту голосом. Или на сайте кнопка «поговорить с ассистентом», клик — открывается голосовой чат, поверх твоего продукта.
Формально это отдельный endpoint OpenAI /v1/realtime, к которому подключаются через WebRTC, WebSocket или SIP (для телефонии). Сессия остаётся открытой всё время разговора, аудио идёт в обе стороны потоком.
Три способа подключения
Заголовок раздела «Три способа подключения»WebRTC — для браузеров и мобильных приложений, которые сами захватывают звук с микрофона и воспроизводят через динамик. Peer connection обрабатывает аудио сам, писать буферизацию не нужно. OpenAI сама рекомендует WebRTC для клиентских подключений — стабильнее задержки, меньше кода.
WebSocket — для сервера, который уже получает сырой звук из другого источника: колл-центра, медиа-конвейера, worker’а. Ты руками управляешь аудио-чанками в base64, лимит 15 МБ на чанк.
SIP — для интеграции с классической телефонией. Модель становится тем, кто отвечает на звонок клиента.
Три типа сессий
Заголовок раздела «Три типа сессий»На endpoint /v1/realtime открываются три разных типа сессий, каждый под свою задачу:
Voice-agent сессия — полноценный голосовой диалог с моделью. Она слушает, отвечает голосом, вызывает функции, обрабатывает перебивания.
Translation сессия (/v1/realtime/translations) — синхронный перевод речи. Модель принимает поток на одном языке и отдаёт поток на другом, плюс текстовую расшифровку по мере поступления.
Transcription сессия — только расшифровка. Модель слушает и отдаёт текстовые дельты в реальном времени, без ответа голосом.
Каждый тип завязан на свою модель: voice-agent сидит на gpt-realtime, перевод — на gpt-realtime-translate, транскрипция — на gpt-live-transcribe.
Линейка голосовых моделей
Заголовок раздела «Линейка голосовых моделей»В документации OpenAI на июль 2026 актуальны следующие модели.
gpt-realtime и gpt-realtime-2.1
Заголовок раздела «gpt-realtime и gpt-realtime-2.1»Основная модель для голосовых агентов. Принимает аудио, текст и изображения на вход, отдаёт аудио и текст на выход. Поддерживает вызов функций, кеширование промптов, три транспорта (WebRTC, WebSocket, SIP).
Контекстное окно — 32 000 токенов, максимум на выход — 4 096 токенов. Дефолтный снапшот gpt-realtime-2025-08-28. Знания модели по состоянию на 1 октября 2023.
Есть режим рассуждения (reasoning.effort), но OpenAI прямо в документации советует ставить его на low для большинства продакшн-агентов — иначе задержка растёт до неприемлемых для живого диалога.
Цена (на 31.07.2026):
- Аудио на вход: 32 USD за 1M токенов, кешированный — 0,40 USD.
- Аудио на выход: 64 USD за 1M токенов.
- Текст на вход: 4 USD за 1M токенов, на выход — 24 USD.
- Изображение на вход: 5 USD за 1M токенов.
gpt-realtime-mini и gpt-realtime-2.1-mini
Заголовок раздела «gpt-realtime-mini и gpt-realtime-2.1-mini»Уменьшенная и дешёвая версия. Те же возможности — WebRTC/WebSocket/SIP, function calling, prompt caching, 32 000 токенов контекста, — но качество ниже, зато цена меньше в три раза.
Цена:
- Аудио на вход: 10 USD за 1M токенов, кешированный — 0,30 USD.
- Аудио на выход: 20 USD за 1M токенов.
- Текст на вход: 0,60 USD, на выход: 2,40 USD.
Дефолтный снапшот gpt-realtime-mini-2025-12-15. Хорош, когда бюджет важнее качества модуляции — например, простые FAQ-боты в звонках или инфо-справка.
gpt-realtime-translate
Заголовок раздела «gpt-realtime-translate»Специализированная модель для синхронного перевода. Принимает речь на одном языке, отдаёт речь на другом плюс текстовую расшифровку. Аудио продолжает поступать — перевод продолжает выдаваться, без ожидания конца предложения.
Тарификация по времени, а не по токенам: 0,034 USD за минуту аудио. Контекстное окно — 16 000 токенов.
gpt-live-transcribe
Заголовок раздела «gpt-live-transcribe»Модель только для транскрипции — принимает аудио, отдаёт текст. С низкой задержкой, потоком, дельтами. Поддерживает keyword hints (сказать модели, что в разговоре точно встретится «WB» или «маркетплейс»), context hints, подсказки по языку.
Тарификация: 0,017 USD за минуту аудио. Работает только через realtime endpoint транскрипции (/v1/realtime/transcription_sessions).
GPT-Realtime-1.5, GPT-Realtime-Whisper и другие
Заголовок раздела «GPT-Realtime-1.5, GPT-Realtime-Whisper и другие»В каталоге есть ещё несколько моделей — gpt-realtime-1.5 (та же цена что у 2.1, но снапшот прошлого поколения), gpt-realtime-whisper для транскрипции на базе Whisper. Для большинства новых проектов актуальна 2.1 или 2.1-mini. Whisper остаётся вариантом, когда важнее точность на редких языках, чем задержка.
Realtime API поддерживает 10 встроенных голосов. Полный список из документации (по состоянию на 31.07.2026): alloy, ash, ballad, coral, echo, sage, shimmer, verse, marin, cedar.
OpenAI явно рекомендует marin и cedar как самые качественные из текущей линейки. Это самые новые голоса, с наиболее живой модуляцией и стабильными интонациями.
Ограничение: как только модель уже произнесла хоть один звук в сессии, голос менять нельзя. То есть выбор делается один раз при открытии сессии — не в середине.
Через промпт можно управлять акцентом, темпом, эмоцией, темой речи. Но полностью заменить дизайн голоса промптом нельзя — если бренду нужен уникальный, узнаваемый голос, OpenAI предлагает программу Custom Voices для одобренных клиентов.
Аудио-формат и параметры
Заголовок раздела «Аудио-формат и параметры»Realtime API работает с PCM-аудио 16-бит на частоте дискретизации 24 кГц. Аудио передаётся как base64-кодированные байты чанками не больше 15 МБ.
Для транспорта WebRTC весь этот низкий уровень скрыт — peer connection сам делает конвертацию и стриминг. Для WebSocket ты руками режешь звук на чанки, кодируешь в base64, отправляешь.
Для SIP-подключений (телефония) поддержка форматов иная — там классические G.711 µ-law и A-law, но детали настройки идут через отдельный SIP-guide.
Как модель понимает, что ты закончил говорить
Заголовок раздела «Как модель понимает, что ты закончил говорить»По умолчанию Realtime сессии работают в режиме server VAD (Voice Activity Detection на стороне сервера). Модель сама решает, когда ты начал говорить, когда остановился, — и после паузы автоматически начинает отвечать.
Если это не подходит — например, ты делаешь push-to-talk интерфейс, где юзер удерживает кнопку, — то turn_detection ставится в null, и ты руками управляешь: когда отправлять команду «отвечай».
Interruption handling — как модель обрабатывает перебивания
Заголовок раздела «Interruption handling — как модель обрабатывает перебивания»Ключевая механика живого диалога. Если пользователь начинает говорить в момент, когда модель ещё отвечает, — сервер сам отменяет её ответ.
Для WebRTC клиенту почти ничего делать не нужно, peer connection просто останавливает воспроизведение. Для WebSocket есть нюанс: клиент должен остановить проигрывание аудио и послать событие conversation.item.truncate, чтобы удалить непроигранный кусок из состояния разговора. Иначе модель будет думать, что вся её реплика была услышана.
Это то, что отличает Realtime API от связки Whisper → GPT-4 → TTS. В классической схеме модель не знает, что её перебили, и продолжает генерировать ответ, который никто не услышит.
Function calling во время голоса
Заголовок раздела «Function calling во время голоса»Realtime API умеет вызывать функции прямо посреди разговора, не разрывая его. Стандартный сценарий: клиент спрашивает голосом «сколько у меня на счету», модель вызывает функцию get_balance(), получает JSON-ответ от твоего сервера, продолжает говорить голосом уже с цифрой.
Function calling работает в voice-agent сессиях как в chat completions — те же схемы функций, те же аргументы. Отличие только в том, что запрос функции идёт как event в data-channel (для WebRTC) или в WebSocket-канал, а не в HTTP-ответе.
Это фундамент для голосовых ассистентов, которые реально что-то делают, а не просто болтают. Записать клиента на приём, посмотреть номер заказа на WB, отправить SMS с кодом, забронировать столик.
Русский язык
Заголовок раздела «Русский язык»В открытой документации OpenAI Realtime API на 31.07.2026 нет отдельного списка поддерживаемых языков. По практике gpt-realtime и gpt-realtime-mini понимают и говорят на русском — как и обычная GPT-4o в чат-режиме. Качество зависит от голоса: у marin и cedar русский звучит естественнее, у alloy и echo — с заметным иностранным акцентом.
gpt-realtime-translate принимает русский как источник или как цель перевода — но список поддерживаемых пар не задокументирован публично. Для продакшн-сценария с переводом на русский стоит прогнать тестовый диалог перед покупкой квоты.
gpt-live-transcribe расшифровывает русскую речь, но качество ниже, чем у отдельного Whisper large-v3 в offline-режиме. Для точных расшифровок длинных записей лучше использовать whisper-1 через обычный /v1/audio/transcriptions, а gpt-live-transcribe — только когда критична задержка (субтитры прямого эфира, saved caption во время разговора).
OpenAI не публикует SLA по качеству отдельных языков в Realtime API. Всё что известно про русский — это опыт разработчиков и первичное тестирование в consumer-продукте ChatGPT.
Сколько стоит минута разговора
Заголовок раздела «Сколько стоит минута разговора»Реалистичная оценка для одного разговора длительностью 10 минут через gpt-realtime (не mini):
Голосовое сообщение генерирует примерно 100-150 аудио-токенов в секунду. За 10 минут диалога, где половину времени говорит юзер и половину — модель:
- Аудио на вход: ~5 минут × 60 сек × 100 токенов = 30 000 токенов → 30 000 / 1M × 32 USD = 0,96 USD
- Аудио на выход: ~5 минут × 60 сек × 100 токенов = 30 000 токенов → 30 000 / 1M × 64 USD = 1,92 USD
Итого около 2,88 USD за десятиминутный разговор без учёта текстовой части системного промпта. На gpt-realtime-mini та же арифметика даст около 0,90 USD за 10 минут.
Для перевода и транскрипции всё проще, оплата по времени напрямую:
- 10 минут перевода: 0,34 USD.
- 10 минут расшифровки: 0,17 USD.
Это порядок расходов на MVP голосового ассистента. Для реального продакшна с тысячами минут в сутки — обязательно проектировать кеширование входа (cached input стоит в 80 раз дешевле обычного), обрезку истории, задержки на VAD.
Use cases — где реально применять
Заголовок раздела «Use cases — где реально применять»Голосовой ассистент на сайте. Кнопка «позвонить помощнику» открывает голосовой чат через WebRTC. Модель отвечает на вопросы про продукт, помогает выбрать тариф, оформляет заказ через function calling. Работает круглосуточно, не устаёт, стоит копейки против живого оператора.
Автоматизация колл-центра. SIP-интеграция с телефонной линией. Входящий звонок принимает gpt-realtime, задаёт квалификационные вопросы, переводит на человека только если нужно. Экономия на первой линии — многократная.
Обучение языкам. Живой собеседник, который слушает произношение, поправляет, объясняет, играет роль (официант в кафе, полицейский на границе, риэлтор). Advanced Voice в consumer-продукте это уже умеет.
Голосовые FAQ в приложении. Мобильное приложение с голосовой поддержкой: юзер спрашивает голосом «как оформить возврат», модель отвечает голосом плюс подсвечивает нужный экран через function call.
Разбор документов голосом. Юзер загружает PDF, начинает голосом обсуждать — «прочитай раздел про штрафы», «что тут неясного». Модель принимает документ как контекст, отвечает голосом. Полезно для юристов, страховых агентов, экспертов.
Синхронный перевод в звонках. gpt-realtime-translate встроить в междугородний звонок или чат — обе стороны говорят на своих языках, модель переводит в реальном времени.
Live-транскрипция мероприятий. gpt-live-transcribe подключён к микрофону спикера, текст выводится на экран или сохраняется как расшифровка встречи. Дёшево (0,017 USD в минуту), с задержкой в секунды.
Сравнение с Gemini Live API от Google
Заголовок раздела «Сравнение с Gemini Live API от Google»Gemini Live API — прямой аналог Realtime API от OpenAI, тоже с speech-to-speech, тоже с interruption, тоже с function calling. Ключевые отличия по состоянию на 31.07.2026:
Гибкость модели. Gemini Live построен на Gemini 2.5 Native Audio и Gemini 2.5 Flash — те же модели, что отвечают в текстовых запросах, только с native audio-модулем. У OpenAI — отдельная линейка gpt-realtime, не связанная с текстовыми gpt-5.
Цена. Gemini Live дешевле на входе, дороже на выходе, но в целом примерно на 25% ниже OpenAI. Точные цифры смотри на ai.google.dev/pricing.
Мультимодальность в кадре. Gemini Live принимает видео-поток параллельно с аудио — юзер показывает камерой на предмет, модель видит и отвечает голосом. У OpenAI Realtime API есть приём изображений на вход, но не непрерывного видео.
Голоса. У Google — 30+ голосов на разных языках. У OpenAI — 10 голосов, но 2 (marin, cedar) премиум-качества.
Русский язык. Оба поддерживают, оба с ограничениями. У Gemini на русском ощутимо больше вариаций голоса, у OpenAI — стабильнее интонация в marin.
Экосистема. OpenAI лидирует по объёму разработчиков и готовых интеграций (LangChain, LlamaIndex, Vercel AI SDK — везде первым появляется поддержка OpenAI). Google Cloud лидирует по интеграции с корпоративным стеком.
Для проекта в РФ, где важна прямая доступность из России, оба сервиса требуют зарубежной оплаты и зарубежной регистрации. Российские альтернативы для голоса — Yandex SpeechKit и SaluteSpeech от Сбера (только TTS и STT, не speech-to-speech). Полноценного speech-to-speech в реальном времени с interruption в РФ на 31.07.2026 нет.
С чего начинать интеграцию
Заголовок раздела «С чего начинать интеграцию»Порядок для команды из 1-2 разработчиков, никогда не работавших с Realtime API:
- Прочитать
developers.openai.com/api/docs/guides/realtimeполностью — не по диагонали. Модель ментально по трём транспортам, трём типам сессий, механике interruption. - Собрать минимальный прототип в браузере на WebRTC. Голос → модель → голос. Один голос, один сценарий, без function calling. Пару дней работы.
- Добавить function calling: 1-2 функции, которые реально нужны в продукте. Проверить, что модель их вызывает в живом разговоре.
- Прогнать на 20 живых пользователях — записать разговоры, послушать, где модель проваливается: не понимает вопрос, отвечает не то, слишком долго думает, не перебивается.
- Только после этого — оптимизация:
reasoning.effort=low, кеширование входа, обрезка контекста.
Стоимость на этапе прототипа — 20-50 USD за пару недель тестирования. Продакшн-стоимость считается по формуле выше.
В чём разница между Advanced Voice и Realtime API?
Advanced Voice — это функция внутри приложения ChatGPT для конечного пользователя (Plus/Pro/Team). Realtime API — это endpoint, к которому подключается разработчик, чтобы встроить ту же голосовую модель в свой продукт. Технически под ними одна модель — gpt-realtime.
Какой транспорт выбрать: WebRTC или WebSocket? Для браузеров и мобильных приложений — WebRTC, OpenAI сама так рекомендует. Меньше кода, стабильнее задержки. WebSocket — только когда звук уже идёт через свой сервер (например, из колл-центра или медиа-конвейера).
Работает ли Realtime API на русском?
Да, все voice-agent модели (gpt-realtime, gpt-realtime-mini) понимают и говорят на русском. Официального SLA на язык нет, но качество на уровне текстовой GPT-4o. Голоса marin и cedar звучат на русском наиболее естественно.
Сколько стоит минута разговора?
Ориентировочно 0,29 USD за минуту на gpt-realtime или 0,09 USD на gpt-realtime-mini при среднем распределении речи. Точная цифра зависит от системного промпта, кеширования и function calling.
Можно ли поменять голос в середине разговора? Нет. Как только модель произнесла хоть один звук в сессии, голос заблокирован до конца сессии. Выбор делается один раз при открытии.
Что происходит, когда пользователь перебивает?
Сервер автоматически отменяет ответ модели. Для WebRTC клиент почти ничего не делает — peer connection сам останавливает звук. Для WebSocket клиент должен остановить воспроизведение и послать conversation.item.truncate, чтобы модель поняла, что реплика не была услышана до конца.
Есть ли лимит на длину сессии?
Публичного лимита нет, но практически сессии дольше около 20 минут становятся дорогими из-за роста контекста. Для длинных разговоров надо руками обрезать историю через conversation.item.delete.
Что дешевле — Realtime API или связка Whisper + GPT + TTS? Realtime API дороже за минуту, но:
- дает задержку в 300-600 мс против 2-4 секунды у связки;
- обрабатывает interruption корректно (связка не умеет);
- слышит эмоции в голосе (связка теряет всю просодию при переводе в текст). Если задержка и живость критичны — Realtime. Если бюджет важнее — связка.
Как работает Custom Voice в OpenAI? Программа доступна только одобренным корпоративным клиентам. Публично зарегистрироваться нельзя — нужна заявка через sales OpenAI. Внутри — тренинг уникального голоса под бренд.
Realtime API работает из России напрямую? Нужен зарубежный аккаунт OpenAI, зарубежный способ оплаты. Прямой доступ из России ограничен, как и весь остальной OpenAI API. Полный разбор путей — регистрация ChatGPT и OpenAI из России 2026. Российские команды обычно оформляют юрлицо в третьей стране.
Когда выбирать Gemini Live вместо OpenAI Realtime? Когда нужно принимать видео-поток параллельно с аудио, когда критична цена (Gemini дешевле примерно на 25%), когда команда уже в стеке Google Cloud. Во всех остальных случаях OpenAI Realtime — более зрелая экосистема, больше библиотек, больше готовых интеграций.
Actualnost
Заголовок раздела «Actualnost»Актуально на 31.07.2026. Модели, цены и условия доступа меняются часто. Перед бизнес-решением всегда сверяйся с первоисточником — все ссылки в разделе Sources ниже.
Sources
Заголовок раздела «Sources»- OpenAI Realtime API guide — https://developers.openai.com/api/docs/guides/realtime (проверено 31.07.2026)
- OpenAI Realtime conversations guide — https://developers.openai.com/api/docs/guides/realtime-conversations (проверено 31.07.2026)
- OpenAI Realtime WebRTC guide — https://developers.openai.com/api/docs/guides/realtime-webrtc (проверено 31.07.2026)
- Model card gpt-realtime — https://developers.openai.com/api/docs/models/gpt-realtime (проверено 31.07.2026)
- Model card gpt-realtime-mini — https://developers.openai.com/api/docs/models/gpt-realtime-mini (проверено 31.07.2026)
- Model card gpt-realtime-translate — https://developers.openai.com/api/docs/models/gpt-realtime-translate (проверено 31.07.2026)
- Model card gpt-live-transcribe — https://developers.openai.com/api/docs/models/gpt-live-transcribe (проверено 31.07.2026)
- OpenAI API pricing — https://developers.openai.com/api/docs/pricing (проверено 31.07.2026)
- OpenAI models overview — https://developers.openai.com/api/docs/models (проверено 31.07.2026)