Whisper и OpenAI TTS 2026: распознавание и синтез речи — цены API, локальный запуск
Автор: Silvana · Дата: 09.08.2026 · Verified: 01.09.2026 · Reading time: 23 минут · Prerequisite: —
Whisper — open-source модель распознавания речи от OpenAI, а OpenAI TTS — линейка голосовых моделей от того же вендора, включая gpt-4o-mini-tts и голоса Realtime API. Whisper поддерживает 99 языков, запускается локально через whisper.cpp и faster-whisper либо через облачный API. TTS-модели закрывают синтез речи для контента и голосовых агентов с низкой задержкой. Ниже — актуальные цены API, качество русского языка, где локальный запуск выигрывает у облачного и как это стыкуется с ElevenLabs и Yandex SpeechKit.
- OpenAI Whisper — open-source модель распознавания речи (speech-to-text, STT), выпущенная в 2022. Актуальная версия — large-v3-turbo (2024), сохранившая качество large-v3 с 8× ускорением инференса.
- Whisper поддерживает 99 языков, включая русский, с высокой точностью. Работает на своём железе (whisper.cpp, faster-whisper) или через OpenAI API.
- OpenAI TTS — синтез речи через API. Три модели: tts-1 (быстрая), tts-1-hd (качественная), gpt-4o-mini-tts (2026, с контролем стиля через промпт).
- Голоса TTS 2026: базовые (alloy, echo, fable, onyx, nova, shimmer) и новые (ash, ballad, coral, sage, verse) в gpt-4o-mini-tts. Все — англоязычные по звучанию, но модель говорит на 100+ языках.
- Цены OpenAI TTS (проверено 10.08.2026 на developers.openai.com/api/docs/pricing): tts-1 — $15/1M символов, tts-1-hd — $30/1M символов, gpt-4o-mini-tts — $0.60/1M текстовых входных токенов + $12/1M аудио-выходных токенов.
- Whisper API (
whisper-1) — $0.006 за минуту аудио. Новые gpt-4o-transcribe — $0.006/мин, gpt-4o-mini-transcribe — $0.003/мин (проверено 10.08.2026). Локальный запуск бесплатен. - Real-time API (актуальная модель gpt-realtime-2.1 на 09.08.2026) — потоковый голосовой AI-агент с задержкой 300-500 мс: аудио вход + STT + LLM + TTS + аудио выход в одном сеансе.
- Whisper локально: whisper.cpp для CPU, faster-whisper для GPU (использует CTranslate2). На CPU M-series MacBook — real-time для large моделей. На GPU — до 20× быстрее реального времени.
- Русский язык: Whisper large-v3-turbo даёт WER (word error rate) 8-12% на чистой речи, конкурентно с Yandex SpeechKit. TTS от OpenAI на русском говорит с сильным акцентом — для качественной русской озвучки лучше ElevenLabs или Yandex.
- Использование из России: локальный Whisper работает без ограничений. OpenAI API требует ключ и оплату иностранной картой; официально Россия не в списке поддерживаемых стран, но технически API работает при использовании иностранного аккаунта.
Что это и зачем
Заголовок раздела «Что это и зачем»OpenAI закрывает две базовые задачи работы с речью: распознавание (speech-to-text) через Whisper и синтез (text-to-speech) через TTS-модели. Оба направления доступны и через API, и — для STT — через open-source код и веса.
Whisper — модель, обученная на 680 000 часов многоязычной речи. Выпущена как open-source в сентябре 2022, актуальная версия large-v3-turbo — октябрь 2024. Модель распознаёт речь на 99 языках, автоматически определяет язык, переводит на английский (translate mode), генерирует тайминги для субтитров.
OpenAI TTS — синтез речи с 2023 года. Три поколения моделей на 2026:
- tts-1 — быстрая, приемлемое качество, для real-time.
- tts-1-hd — качественная, для продакшена (аудиокниги, подкасты).
- gpt-4o-mini-tts (2026) — новое поколение с контролем стиля через текстовый промпт, лучшее качество, эмоциональная выразительность.
Real-time API — комбинированный voice-in-voice-out эндпоинт. Актуальная модель на 09.08.2026 — gpt-realtime-2.1 (проверено). Полный voice-agent stack в одном WebSocket-соединении с задержкой 300-500 мс.
Зачем это нужно:
- Транскрипция. Аудио-записи встреч, интервью, лекций → текст. Whisper покрывает большинство сценариев, включая русскоязычные.
- Субтитры. Whisper выдаёт тайминги — можно генерировать SRT/VTT для видео.
- Голосовые AI-агенты. Real-time API даёт готовый стек: пользователь говорит, агент понимает, отвечает голосом. Минимум кода, максимум фич.
- Озвучка контента. TTS API для аудиокниг, подкастов, обучающих курсов. Особенно gpt-4o-mini-tts с контролем стиля.
- Voice cloning альтернатива. OpenAI не даёт клонирования голоса как ElevenLabs, но качество базовых голосов — достаточное для многих задач.
Whisper: модели и версии
Заголовок раздела «Whisper: модели и версии»За четыре года Whisper прошёл пять итераций.
Whisper original (2022): пять размеров — tiny (39M параметров), base (74M), small (244M), medium (769M), large (1550M). Каждая модель есть в двух вариантах: multilingual и english-only. Английские версии чуть точнее на английском, но не поддерживают другие языки.
Whisper large-v2 (2022): тот же large, дообученный на дополнительных данных. Стал стандартом для многоязычной транскрипции 2023 года.
Whisper large-v3 (2023): улучшенная архитектура — 128 mel-каналов вместо 80. Заметное улучшение на не-английских языках, особенно на редких (кантонский, суахили, кечуа).
Whisper large-v3-turbo (октябрь 2024): финальная production-модель на 2026. Количество decoder-слоёв уменьшено с 32 до 4, что даёт 8× ускорение инференса при сохранении качества large-v3. Размер — 809M параметров.
Практический выбор:
- Для транскрипции с максимальной точностью → large-v3 или large-v3-turbo.
- Для баланса скорость/качество → large-v3-turbo (та же точность, 8× быстрее).
- Для CPU-инференса на слабом железе → medium или small.
- Для мобильных устройств → tiny или base, но с потерей качества.
Whisper: локальный запуск
Заголовок раздела «Whisper: локальный запуск»Whisper — open-source (MIT license), веса доступны на HuggingFace и GitHub. Есть несколько реализаций.
Reference implementation (Python + PyTorch): оригинальный код от OpenAI на github.com/openai/whisper. Простая установка pip install openai-whisper, но требует PyTorch и достаточно тяжёлый. Подходит для экспериментов, не для production.
import whisper
model = whisper.load_model("large-v3-turbo")result = model.transcribe("audio.mp3")print(result["text"])faster-whisper: реимплементация на CTranslate2 — 4× быстрее reference на CPU, до 20× на GPU. Поддерживает quantization (int8, fp16). Устанавливается pip install faster-whisper.
from faster_whisper import WhisperModel
model = WhisperModel("large-v3-turbo", device="cuda", compute_type="float16")segments, info = model.transcribe("audio.mp3", language="ru")
for segment in segments: print(f"[{segment.start:.2f}s -> {segment.end:.2f}s] {segment.text}")whisper.cpp: C/C++ реализация Georgy Gerganov, оптимизированная для CPU (SIMD, quantization). Работает на MacBook M-series (Metal), Windows, Linux, iOS, Android. На Apple Silicon large-v3-turbo — real-time на CPU. Устанавливается через brew install whisper-cpp или сборка из исходников на github.com/ggerganov/whisper.cpp.
Модели-производные:
- Distil-Whisper (Hugging Face): дистилляция large-v3, ещё быстрее с небольшой потерей качества. Ниже качество на не-английских языках.
- Whisper Diarization: форки с добавлением speaker diarization (различение говорящих).
Требования по железу (large-v3-turbo):
- CPU: 4+ ядра, 8 GB RAM — работает реалистично на 1× real-time.
- GPU: 4+ GB VRAM — 5-20× быстрее реального времени.
- Apple Silicon M1/M2/M3: real-time на CPU через whisper.cpp с Metal, 3-5× real-time на GPU.
Whisper API
Заголовок раздела «Whisper API»Whisper доступен через OpenAI API как endpoint POST /v1/audio/transcriptions.
Простой запрос (Python):
from openai import OpenAI
client = OpenAI(api_key="sk-...")
audio_file = open("audio.mp3", "rb")transcript = client.audio.transcriptions.create( model="whisper-1", file=audio_file, language="ru", # optional, автоопределение работает response_format="verbose_json", # даёт таймкоды timestamp_granularities=["segment", "word"])
print(transcript.text)Параметры:
model: толькоwhisper-1доступен через API (это large-v2 в API, не latest). Для last-model — локальный запуск.language: ISO-639-1 код (ru,en,es), опционален.response_format:json,text,srt,verbose_json,vtt.timestamp_granularities:segment(по фразам),word(пословно).prompt: до 224 токенов подсказки для контекста и специфических терминов.temperature: 0-1, шумозащита.
Translation: отдельный endpoint POST /v1/audio/translations — переводит любой язык на английский. Полезно, если нужен только английский результат из мультиязычного аудио.
Ограничения:
- Максимальный размер файла — 25 MB. Длинные записи нужно разбивать на чанки.
- Поддерживаемые форматы: mp3, mp4, mpeg, mpga, m4a, wav, webm.
- Rate limits: разные по тирам, но обычно достаточно для типичных задач.
OpenAI TTS: модели и голоса
Заголовок раздела «OpenAI TTS: модели и голоса»На 2026 год у OpenAI три поколения TTS-моделей.
tts-1 — первая production-модель (ноябрь 2023). Быстрая, low-latency, приемлемое качество. Основной сценарий: интерактивные приложения, где скорость важнее максимального качества. Формат вывода — mp3, opus, aac, flac, wav, pcm.
tts-1-hd — HD-версия, лучше качество, чуть медленнее. Основной сценарий: не-real-time продакшен (аудиокниги, подкасты). Заметно натуральнее tts-1 на длинных фразах.
gpt-4o-mini-tts (2026) — новое поколение на базе gpt-4o-mini. Ключевая фича — управление стилем через текстовый промпт: voice_settings.style можно передать инструкцию типа «speak calmly and slowly», «with a British accent», «excited and cheerful». Модель адаптирует голос под инструкцию.
Голоса — предустановленные, клонирование пользовательских голосов OpenAI не даёт.
Базовые голоса (все модели):
- alloy — нейтральный, средний тембр.
- echo — мужской, глубокий.
- fable — британский акцент, тёплый.
- onyx — мужской, авторитетный.
- nova — женский, дружелюбный.
- shimmer — женский, мягкий.
Новые голоса в gpt-4o-mini-tts (2026):
- ash — молодой мужской.
- ballad — эмоциональный, для нарратива.
- coral — женский, тёплый.
- sage — зрелый мужской.
- verse — молодой универсальный.
Все голоса — англоязычные по звучанию, но говорят на 100+ языках. На русском все голоса имеют заметный английский акцент.
OpenAI TTS: API
Заголовок раздела «OpenAI TTS: API»Простой запрос (Python):
from openai import OpenAI
client = OpenAI(api_key="sk-...")
response = client.audio.speech.create( model="gpt-4o-mini-tts", voice="nova", input="Hello, this is a test of OpenAI text-to-speech.", response_format="mp3")
response.stream_to_file("output.mp3")С instructions (gpt-4o-mini-tts):
response = client.audio.speech.create( model="gpt-4o-mini-tts", voice="ballad", input="Once upon a time, in a distant galaxy...", instructions="Speak in a slow, dramatic storytelling voice with occasional pauses.", response_format="mp3")Параметры:
model:tts-1,tts-1-hd,gpt-4o-mini-tts.voice: см. список выше.input: текст, до 4096 символов.instructions: только для gpt-4o-mini-tts, до 1000 символов.response_format:mp3,opus,aac,flac,wav,pcm.speed: 0.25-4.0, скорость произношения.
Streaming: через stream=True получаешь chunks аудио по мере генерации, полезно для минимальной latency.
Real-time API
Заголовок раздела «Real-time API»Realtime API — WebSocket-based API для голосовых агентов. Актуальная модель на 10.08.2026 — gpt-realtime-2.1 (проверено developers.openai.com/api/docs/pricing); также доступны gpt-realtime-2, gpt-realtime-1.5, gpt-realtime и mini-варианты (gpt-realtime-2.1-mini, gpt-realtime-mini). В одном соединении:
- Пользователь говорит — аудио стримится в модель.
- Модель понимает речь (встроенный STT).
- Модель формирует ответ (LLM-часть).
- Модель произносит ответ голосом (встроенный TTS).
- Ответ стримится обратно пользователю.
Latency end-to-end — 300-500 мс, конкурентно с ElevenLabs Agents.
Ключевые фичи:
- Turn-taking: встроенная детекция окончания реплики пользователя.
- Interruption handling: пользователь может перебить модель, она немедленно замолкает.
- Function calling: тот же tool use, что в основном ChatCompletion API — модель может вызывать твои функции во время разговора.
- Голоса: те же, что в TTS API.
- Транскрипт: параллельно выдаётся текстовый транскрипт разговора для логирования.
Использование:
import asynciofrom openai import AsyncOpenAI
async def voice_agent(): client = AsyncOpenAI(api_key="sk-...")
async with client.beta.realtime.connect( model="gpt-realtime-2.1" ) as connection: await connection.session.update(session={ "modalities": ["audio", "text"], "instructions": "You are a helpful voice assistant.", "voice": "alloy", "turn_detection": {"type": "server_vad"} })
# send audio, receive audio + text ...
asyncio.run(voice_agent())Тарификация: отдельная. Актуальная модель на 10.08.2026 (проверено developers.openai.com/api/docs/pricing) — gpt-realtime-2.1: audio input $32/1M токенов, audio output $64/1M токенов, text input $4/1M токенов, text output $24/1M токенов. Для сценариев с бюджетными ограничениями — mini-вариант gpt-realtime-2.1-mini: audio $10/$20 per 1M токенов. На практике — единицы центов за минуту разговора в зависимости от плотности речи.
Цены на 2026
Заголовок раздела «Цены на 2026»Все цены — с developers.openai.com/api/docs/pricing (проверено 10.08.2026).
Транскрипция (Whisper / gpt-4o-transcribe):
- Whisper API endpoint (
whisper-1) — $0.006 за минуту аудио. Один час — $0.36 (проверено 10.08.2026). - gpt-4o-transcribe — $0.006/минуту, с дополнительным биллингом по токенам ($2.50/1M input, $10.00/1M output) (проверено 10.08.2026).
- gpt-4o-mini-transcribe — $0.003/минуту ($1.25/1M input, $5.00/1M output) (проверено 10.08.2026).
OpenAI TTS:
- tts-1: $15/1M символов (проверено 10.08.2026).
- tts-1-hd: $30/1M символов (проверено 10.08.2026).
- gpt-4o-mini-tts: $0.60/1M текстовых входных токенов + $12/1M аудио-выходных токенов (проверено 10.08.2026).
Real-time API (gpt-realtime-2.1, актуальная модель на 10.08.2026, также доступны gpt-realtime-2, 1.5, mini-варианты):
- Text input: $4/1M токенов (проверено 10.08.2026).
- Text output: $24/1M токенов (проверено 10.08.2026).
- Audio input: $32/1M токенов (проверено 10.08.2026).
- Audio output: $64/1M токенов (проверено 10.08.2026).
- Mini-варианты (gpt-realtime-2.1-mini, gpt-realtime-mini): audio $10/$20 per 1M токенов input/output (проверено 10.08.2026).
Практическое правило: чем сложнее модель, тем дороже. Транскрипция — самая дешёвая, TTS — средний, Real-time — самый дорогой. Для больших объёмов транскрипции локальный Whisper всё равно дешевле API.
Русский язык: качество
Заголовок раздела «Русский язык: качество»Whisper на русском:
- large-v3-turbo: WER 8-12% на чистой речи (студия, диктовка, интервью). На шумном аудио (уличная запись, плохое качество микрофона) — 15-25%.
- medium: WER 15-20% на чистой речи.
- small: WER 25-35%, часто неприемлемо для профессиональной транскрипции.
Сравнение с российскими сервисами: Yandex SpeechKit v3 на чистой русской речи даёт WER 5-8%, чуть лучше Whisper. Но Whisper — бесплатный локально, что часто перевешивает. Для критической точности (медицинская транскрипция, юридические записи) — Yandex; для общих задач — Whisper.
Улучшения через prompting:
transcript = client.audio.transcriptions.create( model="whisper-1", file=audio_file, language="ru", prompt="Транскрипция интервью с программистом. Используются термины: Python, FastAPI, PostgreSQL, Docker.")Prompt даёт модели контекст — она лучше распознаёт специфические термины.
OpenAI TTS на русском:
- Все голоса имеют заметный английский акцент.
- Правильные ударения в 80-85% случаев (хуже, чем ElevenLabs).
- Приемлемо для базовых задач, где акцент не критичен (обучающие материалы, генерация напоминаний).
- Не подходит для профессиональной русскоязычной озвучки — там лучше ElevenLabs Multilingual v2 или Yandex SpeechKit v3.
Работа из России
Заголовок раздела «Работа из России»Whisper локально:
- Работает без ограничений. Модели скачиваются с HuggingFace — доступ прямой.
- Ни API-ключей, ни оплаты не требуется.
- Единственное требование — железо (см. раздел Локальный запуск).
OpenAI API (Whisper и TTS через API):
- Официально Россия не в списке поддерживаемых стран OpenAI.
- Технически API работает через прямой доступ с иностранным аккаунтом.
- Регистрация аккаунта требует иностранный номер телефона для верификации.
- Оплата — только зарубежной картой.
- OpenAI периодически блокирует аккаунты, регистрируемые с российских IP — рекомендуется чистая регистрация с иностранного соединения.
Практически многие российские команды используют локальный Whisper для транскрипции (нет ограничений, бесплатно) и российские альтернативы (Yandex SpeechKit, SaluteSpeech) для TTS, где качество русского критично.
Как начать: пошагово
Заголовок раздела «Как начать: пошагово»Локальный Whisper (для CPU через whisper.cpp):
brew install whisper-cpp# Скачать модельwget https://huggingface.co/ggerganov/whisper.cpp/resolve/main/ggml-large-v3-turbo.bin# Транскрибироватьwhisper-cli -m ggml-large-v3-turbo.bin -f audio.wav -l ru -otxtЛокальный Whisper (для GPU через faster-whisper):
pip install faster-whisperfrom faster_whisper import WhisperModel
model = WhisperModel("large-v3-turbo", device="cuda", compute_type="float16")segments, info = model.transcribe("audio.mp3", language="ru", word_timestamps=True)
for seg in segments: print(f"[{seg.start:.2f}] {seg.text}")OpenAI Whisper API:
from openai import OpenAIclient = OpenAI(api_key="sk-...")
with open("audio.mp3", "rb") as f: transcript = client.audio.transcriptions.create(model="whisper-1", file=f)print(transcript.text)OpenAI TTS API:
response = client.audio.speech.create( model="gpt-4o-mini-tts", voice="nova", input="Привет, это тест синтеза речи.", response_format="mp3")response.stream_to_file("output.mp3")Кому подходит и не подходит
Заголовок раздела «Кому подходит и не подходит»Whisper подходит:
- Разработчикам, которым нужна бесплатная локальная транскрипция.
- Проектам с приватным аудио (медицина, юр-документы), где нельзя отправлять в облако.
- Массовой транскрипции больших архивов — локальный запуск дешевле API на объёме.
- Мобильным приложениям через whisper.cpp iOS/Android.
Whisper не подходит:
- Критичной точности транскрипции на русском — Yandex SpeechKit чуть лучше.
- Real-time потоковой транскрипции без задержек — Whisper обрабатывает целые фрагменты, не потоково.
OpenAI TTS подходит:
- Быстрым прототипам голосовых интерфейсов на английском.
- Real-time приложениям с gpt-realtime-2.1.
- Разработчикам, уже использующим OpenAI API — единый биллинг и SDK.
OpenAI TTS не подходит:
- Русскоязычной озвучке высокого качества — акцент заметный, лучше ElevenLabs или Yandex.
- Клонированию голосов — OpenAI не даёт этой функции.
- Проектам с жёсткими требованиями по хранению данных в РФ — API-серверы в США.
В чём разница между Whisper open-source и Whisper API?
Заголовок раздела «В чём разница между Whisper open-source и Whisper API?»Whisper open-source — код и веса модели, ты запускаешь на своём железе. Актуальная версия — large-v3-turbo (октябрь 2024). Бесплатно, работает без интернета, требует железо. Whisper API — облачный endpoint OpenAI, использует модель whisper-1 (это large-v2 под капотом, не последняя). Стоит 0.006$/минуту, работает через интернет, не требует железа.
Какая версия Whisper лучше для русского языка?
Заголовок раздела «Какая версия Whisper лучше для русского языка?»large-v3 или large-v3-turbo. Обе дают близкое качество — WER 8-12% на чистой русской речи. large-v3-turbo в 8× быстрее, что делает его практически безальтернативным для production. medium даёт WER 15-20% — приемлемо для черновой транскрипции, но не для чистовой.
Можно ли запускать Whisper на CPU?
Заголовок раздела «Можно ли запускать Whisper на CPU?»Да. Через whisper.cpp large-v3-turbo работает на MacBook M-series real-time (1× скорость реального времени). На обычном x86 CPU large-v3-turbo — примерно 0.3-0.5× real-time (5 минут аудио обрабатывается около 12 минут). Для реального времени на слабом CPU используй medium или small.
Какой размер файла Whisper API принимает?
Заголовок раздела «Какой размер файла Whisper API принимает?»25 MB максимум за один запрос. Длинные записи нужно разбивать: mp3 128 kbps — примерно 25 минут; wav 44.1 кГц — 3 минуты. Для длинных аудио: разбивай на чанки по около 15 минут через ffmpeg, транскрибируй по отдельности, склеивай результаты.
Есть ли у Whisper API real-time / streaming режим?
Заголовок раздела «Есть ли у Whisper API real-time / streaming режим?»Нет. Whisper API работает по batch-модели: загружаешь целый файл, ждёшь результат. Для потоковой транскрипции используй Real-time API (gpt-realtime-2.1) — там встроенный STT для голосового агента.
Могу ли я клонировать голос через OpenAI TTS?
Заголовок раздела «Могу ли я клонировать голос через OpenAI TTS?»Нет. OpenAI не даёт клонирования голосов. Доступны только предустановленные (alloy, echo, fable, onyx, nova, shimmer + новые в gpt-4o-mini-tts). Для клонирования — ElevenLabs (Instant/Professional Voice Clone).
В чём разница между tts-1, tts-1-hd и gpt-4o-mini-tts?
Заголовок раздела «В чём разница между tts-1, tts-1-hd и gpt-4o-mini-tts?»tts-1 — быстрая, low-latency, приемлемое качество. Для real-time. tts-1-hd — качественная, чуть медленнее, лучше на длинных фразах. Для продакшена аудиокниг. gpt-4o-mini-tts (2026) — новое поколение с контролем стиля через инструкции, лучшее качество, эмоциональная выразительность. Рекомендуется для новых проектов.
Работает ли OpenAI TTS на русском?
Заголовок раздела «Работает ли OpenAI TTS на русском?»Да, все голоса говорят на русском (и 100+ других языков). Но с заметным английским акцентом. Правильные ударения в 80-85% случаев. Для профессиональной русскоязычной озвучки лучше ElevenLabs Multilingual v2 или Yandex SpeechKit v3.
Сколько стоит транскрибировать час аудио через Whisper API?
Заголовок раздела «Сколько стоит транскрибировать час аудио через Whisper API?»0.36$ за час. 10 часов — 3.60$. 100 часов — 36$. Не зависит от языка и качества модели (API использует единую модель whisper-1). Для сравнения: Yandex SpeechKit — примерно 90 руб/час, Sber SaluteSpeech — 40-60 руб/час.
Что такое Real-time API и когда его использовать?
Заголовок раздела «Что такое Real-time API и когда его использовать?»Real-time API (актуальная модель gpt-realtime-2.1 на 10.08.2026) — WebSocket-based endpoint для голосовых агентов. В одном сеансе: аудио вход + STT + LLM + TTS + аудио выход с latency 300-500 мс. Используй для голосовых ассистентов, IVR-систем, интерактивных обучающих приложений. Тарификация: audio input $32/1M токенов, audio output $64/1M токенов — на практике единицы центов за минуту разговора. Для экономных сценариев — mini-вариант ($10/$20 per 1M токенов input/output).
Как получить тайминги слов в транскрипции?
Заголовок раздела «Как получить тайминги слов в транскрипции?»Через параметр response_format="verbose_json" + timestamp_granularities=["word"]. Whisper API вернёт список слов с start/end таймингами в секундах. Локальный faster-whisper — через word_timestamps=True в transcribe (). Whisper.cpp — через флаг --output-json или -oj.
Работает ли Whisper с диалектами русского?
Заголовок раздела «Работает ли Whisper с диалектами русского?»Общерусский — хорошо. Региональные диалекты (например, сильный южный или уральский акцент) распознаются приемлемо, но с более высоким WER. Специфические ситуации типа мешанины русско-английского («пришли мне meeting invite») — тоже работает, но с ошибками на переходах между языками.
Может ли Whisper различать говорящих (speaker diarization)?
Заголовок раздела «Может ли Whisper различать говорящих (speaker diarization)?»Нативно — нет. Whisper выдаёт единый текст без пометок кто что сказал. Для diarization — комбинируй Whisper с pyannote.audio (open-source diarization). Есть готовые пайплайны whisper-diarization на GitHub, которые делают это в один pipeline.
Что делать, если Whisper пропускает слова или части фраз?
Заголовок раздела «Что делать, если Whisper пропускает слова или части фраз?»- Увеличить модель — с medium на large-v3-turbo.
- Добавить
promptс контекстом задачи и специфическими терминами. - Проверить качество аудио — фоновый шум, слишком низкая громкость, реверберация ухудшают распознавание.
- Использовать
condition_on_previous_text=Falseв faster-whisper — иногда предыдущий контекст «сбивает» модель. - Для критичных участков — прогнать через две модели независимо и сравнить.
Есть ли ограничения на коммерческое использование Whisper?
Заголовок раздела «Есть ли ограничения на коммерческое использование Whisper?»Нет. Whisper выпущен под MIT license — можно использовать в коммерческих продуктах бесплатно, включая интеграцию в SaaS-сервисы. Единственное требование — сохранить копирайт-нотис MIT в исходниках, если распространяешь код. Использование через OpenAI API — по условиям API terms of service (стандартно для коммерческого использования).
Какие альтернативы Whisper от других вендоров?
Заголовок раздела «Какие альтернативы Whisper от других вендоров?»Yandex SpeechKit v3 (лучше на русском, платный), Google Cloud Speech-to-Text (сравнимое качество, дороже), AWS Transcribe (сравнимо), Deepgram (специализируется на скорости и real-time), AssemblyAI (много дополнительных фич). Для 90% задач Whisper — оптимальный выбор по соотношению качество/цена/приватность.
Актуальность
Заголовок раздела «Актуальность»Актуально на 09.08.2026. Модели, цены и условия доступа меняются часто. Перед бизнес-решением всегда сверяйся с первоисточником — все ссылки в разделе Sources ниже.
Sources
Заголовок раздела «Sources»- https://github.com/openai/whisper — исходный код и веса Whisper, MIT license (проверено 09.08.2026)
- https://platform.openai.com/docs/guides/speech-to-text — документация Whisper API (проверено 09.08.2026)
- https://platform.openai.com/docs/guides/text-to-speech — документация OpenAI TTS API (проверено 09.08.2026)
- https://platform.openai.com/docs/models/tts-1 — карточка модели tts-1 (проверено 09.08.2026)
- https://platform.openai.com/docs/models/gpt-4o-mini-tts — карточка модели gpt-4o-mini-tts (проверено 09.08.2026)
- https://platform.openai.com/docs/guides/realtime — документация Real-time API (проверено 09.08.2026)
- https://platform.openai.com/docs/models/whisper-1 — карточка модели whisper-1 (проверено 09.08.2026)
- https://developers.openai.com/api/docs/pricing — актуальные цены на API (проверено 09.08.2026, redirect с platform.openai.com/docs/pricing)
- https://huggingface.co/openai/whisper-large-v3-turbo — карточка модели large-v3-turbo на Hugging Face (проверено 09.08.2026)
- https://github.com/ggerganov/whisper.cpp — whisper.cpp реализация для CPU (проверено 09.08.2026)
- https://github.com/SYSTRAN/faster-whisper — faster-whisper на CTranslate2 (проверено 09.08.2026)