Yandex SpeechKit и Sber SaluteSpeech 2026: синтез речи нейросетью и распознавание на русском
Автор: Silvana · Дата: 09.08.2026 · Verified: 01.09.2026 · Reading time: 22 минут · Prerequisite: —
Yandex SpeechKit и Sber SaluteSpeech — две основные российские речевые платформы, которые закрывают распознавание речи (STT), синтез (TTS), голосовое клонирование, потоковую обработку и речевую аналитику. Обе доступны из РФ напрямую, оплачиваются рублями и часто дают более уместный результат на русском, чем западные ElevenLabs и OpenAI. Ниже — актуальные модели, тарифы, API, ограничения по клонированию голоса и когда российский стек выигрывает у зарубежного.
- Yandex SpeechKit и Sber SaluteSpeech — две основные российские речевые платформы: распознавание речи (STT), синтез (TTS), голосовое клонирование, потоковая обработка, речевая аналитика.
- Yandex SpeechKit v3 (актуальная версия) — часть Yandex Cloud, доступна через API и SDK. Поддерживает синхронное и потоковое распознавание, длинные аудио, синтез речи, клонирование голоса.
- Sber SaluteSpeech — речевые технологии от SberDevices, часть экосистемы GigaChat / SberDevices. STT + TTS + voice cloning + speaker recognition. Голоса синтеза интегрированы с ассистентом Салют.
- Русский язык — сильная сторона обоих. Точность распознавания на чистой речи: 5-8% WER у Yandex v3 и SaluteSpeech, что превосходит Whisper large-v3-turbo (8-12% на русском).
- Синтез речи: Yandex — голоса jane, alena, filipp, ermil, oksana, madirus, omazh, zahar плюс премиум-голоса neuro. Sber — голоса Nec (мужской), Bys (женский), May (женский нейтральный) и другие через SaluteSpeech.
- Цены Yandex (август 2026, тарифы могут меняться): распознавание — от 0.16 руб/15 сек синхронно, синтез — от 400 руб/1M символов, потоковое — примерно 12 руб/минута. Sber — сопоставимо, точные тарифы на developers.sber.ru.
- API: gRPC и REST у обоих, SDK для Python/Node.js/Java/C#. Yandex — Cloud SDK, доступ через API-ключ или IAM-токен. Sber — OAuth2, токены с ротацией.
- Юридический аспект: серверы на территории РФ, соответствие ФЗ-152 «О персональных данных» для обработки данных российских граждан. Критично для B2C-продуктов с ПДн (медицина, финансы, госсектор).
- Локальное развёртывание (on-premise): не для базовых тарифов. Yandex и Sber предлагают Enterprise-варианты с деплоем в контуре клиента через отдельные договоры.
- Оба сервиса — лидеры русскоязычного рынка. ElevenLabs и OpenAI дают более эмоциональные и разнообразные голоса, но уступают по правильности произношения на русском и по соответствию ФЗ-152.
Что это и зачем
Заголовок раздела «Что это и зачем»Российский рынок речевых технологий уверенно занят двумя платформами. Обе — часть больших облачных экосистем крупных технологических компаний.
Yandex SpeechKit — часть Yandex Cloud, речевая часть платформы. Первая публичная версия — 2016 год. Актуальная — v3 (обновлена 2024-2025). Ключевые продукты: SpeechKit STT (распознавание), SpeechKit TTS (синтез), SpeechKit Voice Cloning (клонирование), SpeechKit Real-Time (потоковое распознавание с низкой latency).
Sber SaluteSpeech — речевые технологии от SberDevices, часть экосистемы Sber (GigaChat, ассистент Салют, устройства SberBox/SberPortal). Разработан для собственных продуктов Sber, с 2020 года открыт как коммерческий API.
Оба сервиса покрывают одни и те же задачи:
- Распознавание речи (STT). Транскрипция звонков в колл-центрах, голосовых сообщений, интервью, медицинских записей, судебных заседаний. Русскоязычный — приоритет № 1.
- Синтез речи (TTS). IVR-системы, голосовые ассистенты, аудиокниги, обучающие материалы, персонализированные уведомления.
- Клонирование голоса. Персонализированные голосовые сообщения, брендовые голоса, замещение вокала актёров в дубляже.
- Речевая аналитика. Анализ разговоров в колл-центрах — определение эмоций, ключевых слов, скриптовых нарушений, конверсионных сигналов.
- Голосовые AI-агенты. Полноценные диалоговые системы с STT + LLM + TTS (Sber — через GigaChat, Yandex — через YandexGPT — см. YandexGPT vs GigaChat).
Зачем выбирать российские сервисы (когда есть ElevenLabs, OpenAI):
- Соответствие ФЗ-152. Обязательное требование для B2C-продуктов, обрабатывающих ПДн российских граждан (медицина, финансы, госсектор, HR). Серверы Yandex и Sber — на территории РФ.
- Оплата в рублях. Не требуется зарубежная карта. Оплата через российское юрлицо, интеграция с бухгалтерией.
- Официальная поддержка юрлиц. Договор оферты по российскому праву, техподдержка на русском, SLA в рамках российского регулирования.
- Качество русского языка. Модели обучены преимущественно на русскоязычных данных — стабильно правильное произношение сложных слов, правильная расстановка ударений, естественные интонации.
- Интеграция с российскими облаками. Yandex Cloud и SberCloud покрывают полный стек: серверы, БД, ML-платформы, речь.
Yandex SpeechKit: продукты и модели
Заголовок раздела «Yandex SpeechKit: продукты и модели»Yandex Cloud выделяет SpeechKit в отдельный продукт с несколькими режимами.
SpeechKit STT. Распознавание речи. Три режима:
- Синхронное распознавание. Отправляешь короткое аудио (до 1 минуты, до 1 MB), получаешь текстовый результат за секунды. Простой REST-запрос.
- Потоковое распознавание (streaming). gRPC-соединение, отправляешь аудио чанками, получаешь результаты по мере обработки. Latency 300-800 мс на первый результат. Для интерактивных приложений и IVR.
- Асинхронное (long-form) распознавание. Для длинных аудио (до нескольких часов). Ты загружаешь файл, получаешь operation ID, потом забираешь результат когда готово. Полезно для транскрипции подкастов, интервью, лекций.
Модели STT:
- general (v3) — универсальная модель для разговорной речи. Русский — flagship, точность WER 5-8% на чистой речи.
- general:rc — release candidate, самая свежая версия перед промо в general.
- deferred-general — модель для асинхронного распознавания с более высокой точностью.
SpeechKit TTS. Синтез речи. Голоса делятся на:
- Стандартные голоса: jane, alena, filipp, ermil, oksana, madirus, omazh, zahar. Классический TTS.
- Neuro-голоса: neuroaslan, neurodmitry и др. — нейросетевые голоса, более естественные интонации, эмоции.
Голоса выбираются через параметр voice в API. Каждый голос имеет несколько эмоций: good (радость), evil (гнев), neutral (нейтрально) — эмоции работают не для всех голосов.
SSML поддерживается — управление ударениями через <phoneme>, паузами через <break>, стилем через <voice>.
SpeechKit Voice Cloning. Персональный голос: ты загружаешь 30+ минут высококачественной речи, Yandex обучает индивидуальную модель. Обучение занимает несколько дней, доступно только на Enterprise-тарифе.
Sber SaluteSpeech: продукты и модели
Заголовок раздела «Sber SaluteSpeech: продукты и модели»SaluteSpeech покрывает те же основные задачи, что Yandex SpeechKit, с фокусом на интеграции с экосистемой Sber.
SaluteSpeech STT. Распознавание речи:
- Синхронный режим — короткое аудио через REST.
- Streaming режим — потоковое распознавание через WebSocket или gRPC.
- Асинхронный режим — длинные аудио, batch-обработка.
Модели STT:
- general — универсальная разговорная модель.
- callcenter — оптимизирована под записи звонков колл-центров (сжатое аудио, помехи, перекрывающиеся голоса).
- ivr — для IVR-сценариев с короткими репликами.
Точность на чистой речи — сопоставима с Yandex SpeechKit v3, WER 5-8%.
SaluteSpeech TTS. Голоса синтеза:
- Nec — стандартный мужской голос.
- Bys — стандартный женский голос.
- May — женский нейтральный.
- Marfa — женский с более эмоциональной окраской.
- Другие голоса через SBER Voice API.
Все голоса поддерживают SSML для управления просодией и стилем.
Voice Cloning. Персональные голоса — доступны через отдельный договор с SberDevices. Обучение на 30+ минутах референс-аудио.
Speaker Recognition. Идентификация говорящего по образцу голоса — отдельный продукт для сценариев голосовой биометрии.
Интеграция с GigaChat. SaluteSpeech работает как речевой слой для голосовых интерфейсов GigaChat. Полный voice-агент через комбинацию SaluteSpeech STT + GigaChat + SaluteSpeech TTS.
Сравнение Yandex SpeechKit и Sber SaluteSpeech
Заголовок раздела «Сравнение Yandex SpeechKit и Sber SaluteSpeech»| Критерий | Yandex SpeechKit v3 | Sber SaluteSpeech |
|---|---|---|
| STT точность (WER, чистая речь) | 5-8% | 5-8% |
| STT: специальные модели | general | general, callcenter, ivr |
| TTS: стандартные голоса | 8 голосов + neuro | Nec, Bys, May, Marfa и др. |
| TTS: эмоции | good/evil/neutral | SSML-based |
| Streaming latency | 300-800 мс | 300-800 мс |
| Long-form audio | Да, до нескольких часов | Да |
| Voice cloning | Enterprise | Enterprise |
| SDK | Python, Java, Node.js, C#, Go | Python, Java, JS, C# |
| Auth | IAM token, API key | OAuth2 |
| Интеграция с LLM | YandexGPT | GigaChat |
| Speaker recognition | Отдельный продукт | Да, в составе |
| Соответствие ФЗ-152 | Да | Да |
| Локация серверов | РФ | РФ |
| Оплата | Рубли, юр.лицо | Рубли, юр.лицо |
Когда выбрать Yandex:
- Уже используешь Yandex Cloud (компьютьютинг, БД, ML) — единый биллинг и интеграция.
- Нужны neuro-голоса (более эмоциональные) для маркетинга и подкастов.
- Долгая история продукта, стабильная документация, широкая экосистема.
Когда выбрать Sber:
- Строишь голосового агента и хочешь единый стек с GigaChat.
- Нужна модель, специализированная под колл-центры (callcenter модель STT).
- Уже клиент Sber или SberCloud, единый договор и биллинг.
- Нужен speaker recognition как встроенная функция.
Часто крупные компании используют оба сервиса — Yandex для одних задач (например, TTS для приложения), Sber для других (например, голосовая биометрия в приложении банка).
Все цены — примерные, актуальные на август 2026. Точные тарифы могут меняться, всегда сверяйся с сайтом провайдера.
Yandex SpeechKit (yandex.cloud/prices):
- Синхронное распознавание: от 0.16 руб за 15 секунд аудио.
- Потоковое распознавание: примерно 12 руб/минута (модель general).
- Асинхронное распознавание: примерно 0.08 руб за 15 секунд.
- Синтез (стандартные голоса): 400 руб за 1 млн символов.
- Синтез (neuro-голоса): 800-1600 руб за 1 млн символов.
При высоких объёмах — скидки по договору. Free tier: небольшой объём бесплатно для тестирования.
Sber SaluteSpeech (developers.sber.ru/docs/ru/salutespeech):
- Тарифы публикуются на developers.sber.ru. Обычная модель — оплата за минуту распознавания и за 1 000 символов синтеза.
- Free tier есть для разработчиков — небольшие лимиты для тестирования.
- Для юрлиц — договор с индивидуальными тарифами.
Общее правило: при объёме 100+ часов аудио в месяц у обоих провайдеров цены становятся сопоставимыми и заметно дешевле per-hour розничных тарифов. Для маленьких проектов удобнее оплачивать через личный кабинет, для больших — через договор.
API и SDK
Заголовок раздела «API и SDK»Yandex SpeechKit API:
REST и gRPC. Аутентификация через IAM-токен (для сервисных аккаунтов) или API-ключ.
STT синхронный (Python, REST):
import requests
with open("audio.ogg", "rb") as f: audio_data = f.read()
response = requests.post( "https://stt.api.cloud.yandex.net/speech/v1/stt:recognize", headers={"Authorization": f"Bearer {iam_token}"}, params={"lang": "ru-RU", "topic": "general", "folderId": folder_id}, data=audio_data)
print(response.json()["result"])TTS синтез (Python, REST):
import requests
response = requests.post( "https://tts.api.cloud.yandex.net/speech/v1/tts:synthesize", headers={"Authorization": f"Bearer {iam_token}"}, data={ "text": "Привет, это тестовый синтез речи.", "voice": "alena", "emotion": "neutral", "format": "mp3", "sampleRateHertz": 48000, "folderId": folder_id })
with open("output.mp3", "wb") as f: f.write(response.content)Streaming STT (Python, gRPC):
import grpcfrom yandex.cloud.ai.stt.v3 import stt_pb2, stt_service_pb2_grpc
channel = grpc.secure_channel("stt.api.cloud.yandex.net:443", grpc.ssl_channel_credentials())stub = stt_service_pb2_grpc.RecognizerStub(channel)
def generate_requests(audio_stream): yield stt_pb2.StreamingRequest( session_options=stt_pb2.StreamingOptions( recognition_model=stt_pb2.RecognitionModelOptions( audio_format=stt_pb2.AudioFormatOptions( raw_audio=stt_pb2.RawAudio( audio_encoding=stt_pb2.RawAudio.LINEAR16_PCM, sample_rate_hertz=16000, audio_channel_count=1 ) ), text_normalization=stt_pb2.TextNormalizationOptions( text_normalization=stt_pb2.TextNormalizationOptions.TEXT_NORMALIZATION_ENABLED ) ) ) ) for chunk in audio_stream: yield stt_pb2.StreamingRequest(chunk=stt_pb2.AudioChunk(data=chunk))
for response in stub.RecognizeStreaming( generate_requests(audio_stream), metadata=[("authorization", f"Bearer {iam_token}")]): for alt in response.partial.alternatives: print(alt.text)Sber SaluteSpeech API:
REST и gRPC. Аутентификация через OAuth2 — получаешь access_token из client_id + client_secret, токен действителен 30 минут, обновляешь по необходимости.
Синхронный STT (Python):
import requests
# Получение токенаtoken_response = requests.post( "https://ngw.devices.sberbank.ru:9443/api/v2/oauth", headers={ "Authorization": f"Basic {base64_credentials}", "RqUID": rquid, "Content-Type": "application/x-www-form-urlencoded" }, data={"scope": "SALUTE_SPEECH_PERS"}, verify="russiantrustedca.pem" # Russian trusted CA cert)access_token = token_response.json()["access_token"]
# Распознаваниеwith open("audio.opus", "rb") as f: audio_data = f.read()
response = requests.post( "https://smartspeech.sber.ru/rest/v1/speech:recognize", headers={ "Authorization": f"Bearer {access_token}", "Content-Type": "audio/ogg;codecs=opus" }, data=audio_data)
print(response.json()["result"])Синтез Sber (Python):
response = requests.post( "https://smartspeech.sber.ru/rest/v1/text:synthesize", headers={ "Authorization": f"Bearer {access_token}", "Content-Type": "application/text" }, params={"format": "wav16", "voice": "Nec_24000"}, data="Тестовый синтез через SaluteSpeech".encode("utf-8"))
with open("output.wav", "wb") as f: f.write(response.content)Оба провайдера дают детальные примеры на своих doc-сайтах для всех основных языков программирования.
Русский язык: качество
Заголовок раздела «Русский язык: качество»STT на чистой речи (студия, диктовка, интервью с хорошим микрофоном):
- Yandex SpeechKit v3 — WER 5-8%.
- Sber SaluteSpeech — WER 5-8%.
- Whisper large-v3-turbo — WER 8-12%.
Оба российских сервиса стабильно точнее Whisper на русском благодаря тренировке на большем объёме русскоязычных данных.
STT на шумной речи (уличная запись, плохой микрофон, помехи):
- Yandex — WER 15-20%.
- Sber (callcenter модель) — WER 12-18%, лучше на записях звонков.
- Whisper — WER около 25%.
TTS натуральность:
- ElevenLabs Multilingual v2 — самое эмоционально выразительное звучание, но с лёгким акцентом.
- Yandex neuro-голоса — очень натуральное произношение, правильные ударения, эмоции работают.
- Sber голоса — сопоставимо с Yandex, чуть меньше выбор эмоций.
- Yandex стандартные голоса — приемлемо, но заметно менее эмоциональны, чем neuro.
- OpenAI gpt-4o-mini-tts — заметный английский акцент, ниже качество на русском.
Специфические сложности русского:
- Ударения — обе российские платформы обрабатывают правильно в 95%+ случаев благодаря словарям.
- Числительные — автоматически озвучиваются словами («один», «десять миллионов»).
- Иностранные слова, аббревиатуры — работает через SSML
<phoneme>для сложных случаев. - Имена собственные — иногда требуется указывать ударения через SSML.
Соответствие ФЗ-152 и юридические аспекты
Заголовок раздела «Соответствие ФЗ-152 и юридические аспекты»Федеральный закон № 152-ФЗ «О персональных данных» требует, чтобы первичная обработка ПДн российских граждан происходила на территории РФ. Это критично для многих B2C-сценариев:
- Медицина. Голосовые записи консультаций врач-пациент содержат медицинские ПДн.
- Финансы. Записи звонков в банк, голосовая биометрия, распознавание речи для документов.
- Государственные сервисы. Голосовые IVR, автоматизированная обработка обращений.
- HR и рекрутинг. Записи интервью, оценки кандидатов.
- Юр.услуги. Записи консультаций, судебных заседаний, показаний.
Yandex SpeechKit и Sber SaluteSpeech:
- Серверы физически расположены на территории РФ.
- Провайдеры подписывают договор оператора ПДн.
- Данные обрабатываются в контуре РФ, не пересылаются за границу.
- Возможен деплой на инфраструктуре клиента (on-premise) через Enterprise-контракты.
ElevenLabs, OpenAI, Anthropic — серверы в США и ЕС, что не соответствует требованиям ФЗ-152 для обработки ПДн российских граждан.
Практическое правило: если проект обрабатывает ПДн российских граждан — используй Yandex SpeechKit или Sber SaluteSpeech. Если данные обезличены или ПДн не задействованы (например, генерация озвучки маркетингового ролика без ПДн) — можно использовать зарубежные сервисы.
Работа с колл-центрами
Заголовок раздела «Работа с колл-центрами»Один из ключевых сценариев обоих сервисов — обработка звонков в колл-центрах.
Задачи:
- Транскрипция всех звонков для аудита качества.
- Анализ эмоций клиентов (недовольство, удовлетворённость).
- Определение соблюдения скриптов операторами.
- Выделение ключевых слов (жалобы, запросы, конверсионные сигналы).
- Тегирование звонков по темам для аналитики.
Yandex SpeechKit для колл-центров:
- Асинхронное распознавание длинных записей.
- Возможность разделения говорящих (speaker diarization).
- Text normalization для дальнейшей аналитики.
- Интеграция с Yandex DataLens для визуализации метрик.
Sber SaluteSpeech callcenter model:
- Специализированная модель для сжатого аудио (μ-law, opus, low bitrate).
- Устойчивость к шумам колл-центра.
- Диаризация «оператор vs клиент».
- Интеграция с речевой аналитикой Sber.
Практически большинство крупных российских колл-центров используют один из двух сервисов. Обработка миллионов минут в месяц — обычная нагрузка.
On-premise развёртывание
Заголовок раздела «On-premise развёртывание»Локальный деплой (внутри контура клиента, без выхода в облако провайдера) доступен у обоих, но только через Enterprise-контракты, а не по обычному тарифу.
Yandex SpeechKit on-premise:
- Доступен через отдельный договор с Yandex Cloud.
- Модели поставляются как Docker-образы или готовые VM.
- Требуется собственная инфраструктура GPU/CPU.
- Ключевые сценарии: банки с строгими требованиями безопасности, госсектор, компании со внутренним ЦОД.
Sber SaluteSpeech on-premise:
- Доступен через договор с SberCloud/SberDevices.
- Аналогичная модель поставки — Docker или VM.
- Часто в связке с on-premise GigaChat.
Ценообразование on-premise — по договору, обычно значительно дороже облачного и подходит только для крупных клиентов с миллионами часов обработки в год.
Как начать: пошагово
Заголовок раздела «Как начать: пошагово»Yandex SpeechKit:
- Регистрируйся на cloud.yandex.ru, создай платёжный аккаунт.
- Создай каталог (folder) и сервисный аккаунт с ролью
ai.speechkit-tts.user(для синтеза) илиai.speechkit-stt.user(для распознавания). - Получи IAM-токен:
yc iam create-tokenв Yandex CLI. - Установи SDK:
pip install yandex-cloud-ml-sdkили используй прямые REST/gRPC запросы. - Проведи первый тест — синтез короткой фразы или распознавание тестового аудио.
- Настрой автоматическое обновление IAM-токена (действителен 12 часов).
Sber SaluteSpeech:
- Регистрируйся на developers.sber.ru как разработчик.
- Создай проект в SaluteSpeech, получи client_id и client_secret.
- Скачай Russian Trusted CA сертификат для HTTPS-запросов.
- Получи access_token через OAuth2 endpoint.
- Установи SDK:
pip install salute-speechили используй REST/gRPC. - Проведи первый тест синтеза/распознавания.
- Настрой автоматическую ротацию access_token (действителен 30 минут).
Кому подходит и не подходит
Заголовок раздела «Кому подходит и не подходит»Подходит:
- Российским B2C-продуктам, обрабатывающим ПДн (медицина, финансы, HR) — обязательное соответствие ФЗ-152.
- Колл-центрам и enterprise-приложениям — специализированные модели, on-premise возможен.
- Разработчикам, уже использующим Yandex Cloud или SberCloud — единая экосистема и биллинг.
- Русскоязычным задачам с высокими требованиями к качеству распознавания и синтеза.
- Проектам с оплатой в рублях через российское юрлицо.
Не подходит:
- Стартапам с иностранным юрлицом и глобальной аудиторией — зарубежные сервисы проще.
- Проектам, где важна максимальная эмоциональная выразительность голоса — ElevenLabs Multilingual v2 всё же выигрывает по этому параметру.
- Multi-language проектам (10+ языков) — российские сервисы фокусируются на русском, английский и несколько СНГ-языков, но не на глобальном покрытии.
- Локальному оффлайн-деплою без Enterprise-договора — только облако или дорогие Enterprise-контракты.
Какое качество русского языка у Yandex SpeechKit vs Whisper?
Заголовок раздела «Какое качество русского языка у Yandex SpeechKit vs Whisper?»Yandex SpeechKit v3 стабильно точнее Whisper large-v3-turbo на русском. WER 5-8% у Yandex против 8-12% у Whisper на чистой речи. На шумных записях разрыв ещё больше. Причина: Yandex обучен на большем объёме русскоязычных данных, включая специфические сценарии (звонки, диктовки, разговорную речь).
Насколько цены Yandex и Sber отличаются от ElevenLabs и OpenAI?
Заголовок раздела «Насколько цены Yandex и Sber отличаются от ElevenLabs и OpenAI?»Цены Yandex/Sber в рублях сопоставимы с международными сервисами при пересчёте. Yandex STT — примерно 12 руб/мин ≈ 0.13$/мин, OpenAI Whisper API — 0.006$/мин (в 20× дешевле). Yandex TTS neuro — примерно 800-1600 руб/1M символов ≈ 8-16$, ElevenLabs — 30-50$ за 1M символов. По TTS Yandex/Sber конкурентно, по STT OpenAI Whisper радикально дешевле — но у Whisper API нет соответствия ФЗ-152.
Соответствуют ли Yandex SpeechKit и SaluteSpeech ФЗ-152?
Заголовок раздела «Соответствуют ли Yandex SpeechKit и SaluteSpeech ФЗ-152?»Да. Оба сервиса размещают серверы на территории РФ, подписывают договор оператора ПДн, обрабатывают данные в контуре РФ. Это критично для B2C-продуктов с ПДн российских граждан (медицина, финансы, HR, госсектор). ElevenLabs, OpenAI и другие зарубежные сервисы не соответствуют ФЗ-152.
Можно ли использовать Yandex SpeechKit локально (on-premise)?
Заголовок раздела «Можно ли использовать Yandex SpeechKit локально (on-premise)?»Только через Enterprise-контракт с Yandex Cloud. Стандартные тарифы — только облачное использование. On-premise доступен как отдельная поставка Docker-образов, требует собственной инфраструктуры GPU/CPU. Стоимость — по индивидуальному договору, значительно дороже облачного.
Что такое neuro-голоса у Yandex?
Заголовок раздела «Что такое neuro-голоса у Yandex?»Neuro-голоса — нейросетевые голоса синтеза, натуральнее стандартных (jane, alena, filipp). Примеры: neuroaslan, neurodmitry. Более естественные интонации, эмоции работают качественнее, длинные фразы звучат живее. Стоят дороже стандартных (800-1600 руб/1M символов vs 400 руб). Рекомендуются для профессиональной озвучки — аудиокниги, подкасты, реклама.
Есть ли у SaluteSpeech специальная модель для колл-центров?
Заголовок раздела «Есть ли у SaluteSpeech специальная модель для колл-центров?»Да. Модель callcenter оптимизирована для записей звонков: сжатое аудио (μ-law, opus, low bitrate), фоновые шумы, перекрывающиеся голоса, эмоции. WER на записях колл-центров — 12-18%, лучше чем general-модель на том же аудио. Yandex тоже эффективен на колл-центрах через асинхронное распознавание, но без выделенной модели.
Можно ли клонировать голос через Yandex или Sber?
Заголовок раздела «Можно ли клонировать голос через Yandex или Sber?»Да, но только через Enterprise-контракт. Обычные тарифы клонирование не включают. Провайдеры требуют 30+ минут высококачественной речи, обучают индивидуальную модель за несколько дней. Стоимость — по договору. Для быстрого клонирования и Instant Voice Clone используй ElevenLabs (юридически подходит только для обезличенных задач, не для ПДн).
Работают ли эти сервисы из-за границы?
Заголовок раздела «Работают ли эти сервисы из-за границы?»Yandex Cloud API технически доступен из любой страны, включая ЕС и США. Sber SaluteSpeech тоже работает через глобальные CDN. Но регистрация аккаунтов и оплата обычно требуют российского юрлица или физлица с российскими документами. Для использования с зарубежным юрлицом — договор через Yandex Cloud Global (если доступен) или другие бизнес-каналы.
Какой SDK лучше выбрать для Python?
Заголовок раздела «Какой SDK лучше выбрать для Python?»Yandex: pip install yandex-cloud-ml-sdk (официальный) или pip install grpcio grpcio-tools для собственных gRPC-клиентов. Официальный SDK покрывает основные сценарии, для кастомных — прямые gRPC.
Sber: pip install salute-speech (несколько неофициальных SDK) или официальные примеры на GitHub. Для production многие пишут свои клиенты поверх requests/grpc.
Для обоих — можно использовать чистые REST-запросы через requests, если не нужна потоковая обработка. Для streaming — gRPC обязателен.
Что делать, если Yandex/Sber даёт ошибку авторизации?
Заголовок раздела «Что делать, если Yandex/Sber даёт ошибку авторизации?»Yandex: проверь, что IAM-токен свежий (действителен 12 часов), сервисный аккаунт имеет нужную роль (ai.speechkit-*.user), folderId в запросе правильный. Пересоздай токен через yc iam create-token.
Sber: проверь, что access_token свежий (действителен 30 минут), Russian Trusted CA сертификат подложен в trusted store или указан в verify параметре, RqUID уникален для каждого запроса на получение токена.
Поддерживается ли SSML полностью?
Заголовок раздела «Поддерживается ли SSML полностью?»Yandex: поддерживает основные теги SSML — <speak>, <voice>, <prosody>, <break>, <phoneme>, <say-as>, <sub>. Не поддерживает <audio> (вставка внешнего аудио). Полный список — в документации.
Sber: поддерживает похожий набор SSML-тегов. <speak>, <voice>, <prosody>, <break>, <phoneme>. Отличаются от Yandex в некоторых деталях.
Всегда сверяйся с актуальной документацией конкретного провайдера — поддержка SSML периодически расширяется.
Можно ли получить таймкоды распознанной речи?
Заголовок раздела «Можно ли получить таймкоды распознанной речи?»Yandex — да, через параметр raw_results=True в асинхронном режиме или через опции gRPC-стриминга. Возвращаются start/end таймкоды для каждого слова.
Sber — да, аналогично через параметры конфигурации распознавания. Пословные таймкоды возвращаются в структурированном ответе.
Полезно для генерации субтитров, аудитирования звонков, автоматических транскрипций с ссылками на моменты в записи.
Что происходит с записями аудио на серверах провайдера?
Заголовок раздела «Что происходит с записями аудио на серверах провайдера?»Yandex: по умолчанию аудио обрабатывается транзиентно, не сохраняется. Для отладки можно включить сохранение (persist=True) — тогда данные хранятся определённое время (см. Terms). Для сценариев с ПДн настройки хранения регулируются договором с оператором.
Sber: аналогично — по умолчанию транзиентная обработка, для отладки/анализа можно включить хранение. Персонализация под требования конкретного контракта.
Всегда проверяй Terms и SLA конкретного тарифа при работе с чувствительными данными.
Какие лимиты по нагрузке?
Заголовок раздела «Какие лимиты по нагрузке?»Yandex: rate limits зависят от тарифа. Базовый — 10-100 параллельных потоков, для Enterprise — тысячи. Точные цифры в документации yandex.cloud.
Sber: аналогично зависит от тарифа. Базовый — 10-50 параллельных сессий, для Enterprise — по договору.
Для проектов с высокой нагрузкой (сотни тысяч запросов/день) — обязательно обсуждать rate limits с провайдером на этапе внедрения.
В чём преимущество Yandex/Sber vs open-source Whisper + XTTS локально?
Заголовок раздела «В чём преимущество Yandex/Sber vs open-source Whisper + XTTS локально?»Плюсы Yandex/Sber:
- Не нужно железо и DevOps — сервис в облаке.
- Соответствие ФЗ-152 из коробки.
- Официальная поддержка русского юрлица.
- SLA и техподдержка на русском.
Плюсы open-source (Whisper + XTTS локально):
- Бесплатно (кроме железа).
- Полный контроль над данными — они не покидают инфраструктуру.
- Возможность fine-tuning на своих данных.
- Нет rate limits.
Выбор — по приоритетам. Для B2C с ПДн — почти всегда Yandex/Sber. Для внутренних задач без ПДн, где важен низкий cost на масштабе — open-source.
Какие типы аудиоформатов поддерживают эти сервисы?
Заголовок раздела «Какие типы аудиоформатов поддерживают эти сервисы?»Yandex SpeechKit STT: LPCM (16-bit signed), OggOpus, MP3. Частота дискретизации 8/16/48 кГц. Максимальный размер файла для синхронного распознавания — 1 MB, для асинхронного — до 1 GB. Моно и стерео каналы поддерживаются.
Yandex SpeechKit TTS: возвращает mp3, oggopus, lpcm с настраиваемой частотой (8/16/48 кГц).
Sber SaluteSpeech STT: PCM_S16LE (WAV), OggOpus, MP3, ALAW, MULAW, FLAC. Частота 8/16/24/48 кГц. Ограничения по размеру зависят от режима (синхронный/асинхронный/streaming).
Sber SaluteSpeech TTS: wav16, opus, pcm16 с частотой 8/16/24 кГц.
Оба сервиса рекомендуют для лучшего качества STT — LPCM 16-bit 16 кГц моно (это стандартный формат для распознавания речи).
Актуальность
Заголовок раздела «Актуальность»Актуально на 09.08.2026. Модели, цены и условия доступа меняются часто. Перед бизнес-решением всегда сверяйся с первоисточником — все ссылки в разделе Sources ниже.
Sources
Заголовок раздела «Sources»- https://yandex.cloud/ru/services/speechkit — обзорная страница Yandex SpeechKit
- https://aistudio.yandex.ru/docs/ru/speechkit — официальная документация Yandex SpeechKit (проверено 09.08.2026, redirect с yandex.cloud/ru/docs/speechkit)
- https://aistudio.yandex.ru/docs/ru/speechkit/stt — документация STT: синхронный, потоковый, асинхронный режимы
- https://aistudio.yandex.ru/docs/ru/speechkit/tts — документация TTS: голоса, эмоции, SSML
- https://aistudio.yandex.ru/docs/ru/speechkit/concepts/voice-cloning — документация Voice Cloning
- https://aistudio.yandex.ru/docs/ru/speechkit/pricing — прайс-лист SpeechKit (проверено 09.08.2026, сверять вручную; страница защищена CAPTCHA-верификацией)
- https://developers.sber.ru/docs/ru/salutespeech/overview — обзорная страница SaluteSpeech (проверено 09.08.2026)
- https://developers.sber.ru/docs/ru/salutespeech/guides/synthesis/overview — синтез речи SaluteSpeech, гайд (проверено 13.09.2026)
- https://developers.sber.ru/docs/ru/salutespeech/guides/recognition/overview — распознавание речи SaluteSpeech, гайд (проверено 13.09.2026)
- https://developers.sber.ru/docs/ru/salutespeech/api/grpc/reference-grpc — gRPC API SaluteSpeech (проверено 13.09.2026)
- https://developers.sber.ru/docs/ru/salutespeech/overview — SaluteSpeech, обзор и доступ (проверено 13.09.2026)