Перейти к содержимому

Yandex SpeechKit и Sber SaluteSpeech 2026: синтез речи нейросетью и распознавание на русском

Автор: Silvana · Дата: 09.08.2026 · Verified: 01.09.2026 · Reading time: 22 минут · Prerequisite: —

Yandex SpeechKit и Sber SaluteSpeech — две основные российские речевые платформы, которые закрывают распознавание речи (STT), синтез (TTS), голосовое клонирование, потоковую обработку и речевую аналитику. Обе доступны из РФ напрямую, оплачиваются рублями и часто дают более уместный результат на русском, чем западные ElevenLabs и OpenAI. Ниже — актуальные модели, тарифы, API, ограничения по клонированию голоса и когда российский стек выигрывает у зарубежного.

  • Yandex SpeechKit и Sber SaluteSpeech — две основные российские речевые платформы: распознавание речи (STT), синтез (TTS), голосовое клонирование, потоковая обработка, речевая аналитика.
  • Yandex SpeechKit v3 (актуальная версия) — часть Yandex Cloud, доступна через API и SDK. Поддерживает синхронное и потоковое распознавание, длинные аудио, синтез речи, клонирование голоса.
  • Sber SaluteSpeech — речевые технологии от SberDevices, часть экосистемы GigaChat / SberDevices. STT + TTS + voice cloning + speaker recognition. Голоса синтеза интегрированы с ассистентом Салют.
  • Русский язык — сильная сторона обоих. Точность распознавания на чистой речи: 5-8% WER у Yandex v3 и SaluteSpeech, что превосходит Whisper large-v3-turbo (8-12% на русском).
  • Синтез речи: Yandex — голоса jane, alena, filipp, ermil, oksana, madirus, omazh, zahar плюс премиум-голоса neuro. Sber — голоса Nec (мужской), Bys (женский), May (женский нейтральный) и другие через SaluteSpeech.
  • Цены Yandex (август 2026, тарифы могут меняться): распознавание — от 0.16 руб/15 сек синхронно, синтез — от 400 руб/1M символов, потоковое — примерно 12 руб/минута. Sber — сопоставимо, точные тарифы на developers.sber.ru.
  • API: gRPC и REST у обоих, SDK для Python/Node.js/Java/C#. Yandex — Cloud SDK, доступ через API-ключ или IAM-токен. Sber — OAuth2, токены с ротацией.
  • Юридический аспект: серверы на территории РФ, соответствие ФЗ-152 «О персональных данных» для обработки данных российских граждан. Критично для B2C-продуктов с ПДн (медицина, финансы, госсектор).
  • Локальное развёртывание (on-premise): не для базовых тарифов. Yandex и Sber предлагают Enterprise-варианты с деплоем в контуре клиента через отдельные договоры.
  • Оба сервиса — лидеры русскоязычного рынка. ElevenLabs и OpenAI дают более эмоциональные и разнообразные голоса, но уступают по правильности произношения на русском и по соответствию ФЗ-152.

Российский рынок речевых технологий уверенно занят двумя платформами. Обе — часть больших облачных экосистем крупных технологических компаний.

Yandex SpeechKit — часть Yandex Cloud, речевая часть платформы. Первая публичная версия — 2016 год. Актуальная — v3 (обновлена 2024-2025). Ключевые продукты: SpeechKit STT (распознавание), SpeechKit TTS (синтез), SpeechKit Voice Cloning (клонирование), SpeechKit Real-Time (потоковое распознавание с низкой latency).

Sber SaluteSpeech — речевые технологии от SberDevices, часть экосистемы Sber (GigaChat, ассистент Салют, устройства SberBox/SberPortal). Разработан для собственных продуктов Sber, с 2020 года открыт как коммерческий API.

Оба сервиса покрывают одни и те же задачи:

  1. Распознавание речи (STT). Транскрипция звонков в колл-центрах, голосовых сообщений, интервью, медицинских записей, судебных заседаний. Русскоязычный — приоритет № 1.
  2. Синтез речи (TTS). IVR-системы, голосовые ассистенты, аудиокниги, обучающие материалы, персонализированные уведомления.
  3. Клонирование голоса. Персонализированные голосовые сообщения, брендовые голоса, замещение вокала актёров в дубляже.
  4. Речевая аналитика. Анализ разговоров в колл-центрах — определение эмоций, ключевых слов, скриптовых нарушений, конверсионных сигналов.
  5. Голосовые AI-агенты. Полноценные диалоговые системы с STT + LLM + TTS (Sber — через GigaChat, Yandex — через YandexGPT — см. YandexGPT vs GigaChat).

Зачем выбирать российские сервисы (когда есть ElevenLabs, OpenAI):

  • Соответствие ФЗ-152. Обязательное требование для B2C-продуктов, обрабатывающих ПДн российских граждан (медицина, финансы, госсектор, HR). Серверы Yandex и Sber — на территории РФ.
  • Оплата в рублях. Не требуется зарубежная карта. Оплата через российское юрлицо, интеграция с бухгалтерией.
  • Официальная поддержка юрлиц. Договор оферты по российскому праву, техподдержка на русском, SLA в рамках российского регулирования.
  • Качество русского языка. Модели обучены преимущественно на русскоязычных данных — стабильно правильное произношение сложных слов, правильная расстановка ударений, естественные интонации.
  • Интеграция с российскими облаками. Yandex Cloud и SberCloud покрывают полный стек: серверы, БД, ML-платформы, речь.

Yandex Cloud выделяет SpeechKit в отдельный продукт с несколькими режимами.

SpeechKit STT. Распознавание речи. Три режима:

  • Синхронное распознавание. Отправляешь короткое аудио (до 1 минуты, до 1 MB), получаешь текстовый результат за секунды. Простой REST-запрос.
  • Потоковое распознавание (streaming). gRPC-соединение, отправляешь аудио чанками, получаешь результаты по мере обработки. Latency 300-800 мс на первый результат. Для интерактивных приложений и IVR.
  • Асинхронное (long-form) распознавание. Для длинных аудио (до нескольких часов). Ты загружаешь файл, получаешь operation ID, потом забираешь результат когда готово. Полезно для транскрипции подкастов, интервью, лекций.

Модели STT:

  • general (v3) — универсальная модель для разговорной речи. Русский — flagship, точность WER 5-8% на чистой речи.
  • general:rc — release candidate, самая свежая версия перед промо в general.
  • deferred-general — модель для асинхронного распознавания с более высокой точностью.

SpeechKit TTS. Синтез речи. Голоса делятся на:

  • Стандартные голоса: jane, alena, filipp, ermil, oksana, madirus, omazh, zahar. Классический TTS.
  • Neuro-голоса: neuroaslan, neurodmitry и др. — нейросетевые голоса, более естественные интонации, эмоции.

Голоса выбираются через параметр voice в API. Каждый голос имеет несколько эмоций: good (радость), evil (гнев), neutral (нейтрально) — эмоции работают не для всех голосов.

SSML поддерживается — управление ударениями через <phoneme>, паузами через <break>, стилем через <voice>.

SpeechKit Voice Cloning. Персональный голос: ты загружаешь 30+ минут высококачественной речи, Yandex обучает индивидуальную модель. Обучение занимает несколько дней, доступно только на Enterprise-тарифе.

SaluteSpeech покрывает те же основные задачи, что Yandex SpeechKit, с фокусом на интеграции с экосистемой Sber.

SaluteSpeech STT. Распознавание речи:

  • Синхронный режим — короткое аудио через REST.
  • Streaming режим — потоковое распознавание через WebSocket или gRPC.
  • Асинхронный режим — длинные аудио, batch-обработка.

Модели STT:

  • general — универсальная разговорная модель.
  • callcenter — оптимизирована под записи звонков колл-центров (сжатое аудио, помехи, перекрывающиеся голоса).
  • ivr — для IVR-сценариев с короткими репликами.

Точность на чистой речи — сопоставима с Yandex SpeechKit v3, WER 5-8%.

SaluteSpeech TTS. Голоса синтеза:

  • Nec — стандартный мужской голос.
  • Bys — стандартный женский голос.
  • May — женский нейтральный.
  • Marfa — женский с более эмоциональной окраской.
  • Другие голоса через SBER Voice API.

Все голоса поддерживают SSML для управления просодией и стилем.

Voice Cloning. Персональные голоса — доступны через отдельный договор с SberDevices. Обучение на 30+ минутах референс-аудио.

Speaker Recognition. Идентификация говорящего по образцу голоса — отдельный продукт для сценариев голосовой биометрии.

Интеграция с GigaChat. SaluteSpeech работает как речевой слой для голосовых интерфейсов GigaChat. Полный voice-агент через комбинацию SaluteSpeech STT + GigaChat + SaluteSpeech TTS.

КритерийYandex SpeechKit v3Sber SaluteSpeech
STT точность (WER, чистая речь)5-8%5-8%
STT: специальные моделиgeneralgeneral, callcenter, ivr
TTS: стандартные голоса8 голосов + neuroNec, Bys, May, Marfa и др.
TTS: эмоцииgood/evil/neutralSSML-based
Streaming latency300-800 мс300-800 мс
Long-form audioДа, до нескольких часовДа
Voice cloningEnterpriseEnterprise
SDKPython, Java, Node.js, C#, GoPython, Java, JS, C#
AuthIAM token, API keyOAuth2
Интеграция с LLMYandexGPTGigaChat
Speaker recognitionОтдельный продуктДа, в составе
Соответствие ФЗ-152ДаДа
Локация серверовРФРФ
ОплатаРубли, юр.лицоРубли, юр.лицо

Когда выбрать Yandex:

  • Уже используешь Yandex Cloud (компьютьютинг, БД, ML) — единый биллинг и интеграция.
  • Нужны neuro-голоса (более эмоциональные) для маркетинга и подкастов.
  • Долгая история продукта, стабильная документация, широкая экосистема.

Когда выбрать Sber:

  • Строишь голосового агента и хочешь единый стек с GigaChat.
  • Нужна модель, специализированная под колл-центры (callcenter модель STT).
  • Уже клиент Sber или SberCloud, единый договор и биллинг.
  • Нужен speaker recognition как встроенная функция.

Часто крупные компании используют оба сервиса — Yandex для одних задач (например, TTS для приложения), Sber для других (например, голосовая биометрия в приложении банка).

Все цены — примерные, актуальные на август 2026. Точные тарифы могут меняться, всегда сверяйся с сайтом провайдера.

Yandex SpeechKit (yandex.cloud/prices):

  • Синхронное распознавание: от 0.16 руб за 15 секунд аудио.
  • Потоковое распознавание: примерно 12 руб/минута (модель general).
  • Асинхронное распознавание: примерно 0.08 руб за 15 секунд.
  • Синтез (стандартные голоса): 400 руб за 1 млн символов.
  • Синтез (neuro-голоса): 800-1600 руб за 1 млн символов.

При высоких объёмах — скидки по договору. Free tier: небольшой объём бесплатно для тестирования.

Sber SaluteSpeech (developers.sber.ru/docs/ru/salutespeech):

  • Тарифы публикуются на developers.sber.ru. Обычная модель — оплата за минуту распознавания и за 1 000 символов синтеза.
  • Free tier есть для разработчиков — небольшие лимиты для тестирования.
  • Для юрлиц — договор с индивидуальными тарифами.

Общее правило: при объёме 100+ часов аудио в месяц у обоих провайдеров цены становятся сопоставимыми и заметно дешевле per-hour розничных тарифов. Для маленьких проектов удобнее оплачивать через личный кабинет, для больших — через договор.

Yandex SpeechKit API:

REST и gRPC. Аутентификация через IAM-токен (для сервисных аккаунтов) или API-ключ.

STT синхронный (Python, REST):

import requests
with open("audio.ogg", "rb") as f:
audio_data = f.read()
response = requests.post(
"https://stt.api.cloud.yandex.net/speech/v1/stt:recognize",
headers={"Authorization": f"Bearer {iam_token}"},
params={"lang": "ru-RU", "topic": "general", "folderId": folder_id},
data=audio_data
)
print(response.json()["result"])

TTS синтез (Python, REST):

import requests
response = requests.post(
"https://tts.api.cloud.yandex.net/speech/v1/tts:synthesize",
headers={"Authorization": f"Bearer {iam_token}"},
data={
"text": "Привет, это тестовый синтез речи.",
"voice": "alena",
"emotion": "neutral",
"format": "mp3",
"sampleRateHertz": 48000,
"folderId": folder_id
}
)
with open("output.mp3", "wb") as f:
f.write(response.content)

Streaming STT (Python, gRPC):

import grpc
from yandex.cloud.ai.stt.v3 import stt_pb2, stt_service_pb2_grpc
channel = grpc.secure_channel("stt.api.cloud.yandex.net:443", grpc.ssl_channel_credentials())
stub = stt_service_pb2_grpc.RecognizerStub(channel)
def generate_requests(audio_stream):
yield stt_pb2.StreamingRequest(
session_options=stt_pb2.StreamingOptions(
recognition_model=stt_pb2.RecognitionModelOptions(
audio_format=stt_pb2.AudioFormatOptions(
raw_audio=stt_pb2.RawAudio(
audio_encoding=stt_pb2.RawAudio.LINEAR16_PCM,
sample_rate_hertz=16000,
audio_channel_count=1
)
),
text_normalization=stt_pb2.TextNormalizationOptions(
text_normalization=stt_pb2.TextNormalizationOptions.TEXT_NORMALIZATION_ENABLED
)
)
)
)
for chunk in audio_stream:
yield stt_pb2.StreamingRequest(chunk=stt_pb2.AudioChunk(data=chunk))
for response in stub.RecognizeStreaming(
generate_requests(audio_stream),
metadata=[("authorization", f"Bearer {iam_token}")]
):
for alt in response.partial.alternatives:
print(alt.text)

Sber SaluteSpeech API:

REST и gRPC. Аутентификация через OAuth2 — получаешь access_token из client_id + client_secret, токен действителен 30 минут, обновляешь по необходимости.

Синхронный STT (Python):

import requests
# Получение токена
token_response = requests.post(
"https://ngw.devices.sberbank.ru:9443/api/v2/oauth",
headers={
"Authorization": f"Basic {base64_credentials}",
"RqUID": rquid,
"Content-Type": "application/x-www-form-urlencoded"
},
data={"scope": "SALUTE_SPEECH_PERS"},
verify="russiantrustedca.pem" # Russian trusted CA cert
)
access_token = token_response.json()["access_token"]
# Распознавание
with open("audio.opus", "rb") as f:
audio_data = f.read()
response = requests.post(
"https://smartspeech.sber.ru/rest/v1/speech:recognize",
headers={
"Authorization": f"Bearer {access_token}",
"Content-Type": "audio/ogg;codecs=opus"
},
data=audio_data
)
print(response.json()["result"])

Синтез Sber (Python):

response = requests.post(
"https://smartspeech.sber.ru/rest/v1/text:synthesize",
headers={
"Authorization": f"Bearer {access_token}",
"Content-Type": "application/text"
},
params={"format": "wav16", "voice": "Nec_24000"},
data="Тестовый синтез через SaluteSpeech".encode("utf-8")
)
with open("output.wav", "wb") as f:
f.write(response.content)

Оба провайдера дают детальные примеры на своих doc-сайтах для всех основных языков программирования.

STT на чистой речи (студия, диктовка, интервью с хорошим микрофоном):

  • Yandex SpeechKit v3 — WER 5-8%.
  • Sber SaluteSpeech — WER 5-8%.
  • Whisper large-v3-turbo — WER 8-12%.

Оба российских сервиса стабильно точнее Whisper на русском благодаря тренировке на большем объёме русскоязычных данных.

STT на шумной речи (уличная запись, плохой микрофон, помехи):

  • Yandex — WER 15-20%.
  • Sber (callcenter модель) — WER 12-18%, лучше на записях звонков.
  • Whisper — WER около 25%.

TTS натуральность:

  • ElevenLabs Multilingual v2 — самое эмоционально выразительное звучание, но с лёгким акцентом.
  • Yandex neuro-голоса — очень натуральное произношение, правильные ударения, эмоции работают.
  • Sber голоса — сопоставимо с Yandex, чуть меньше выбор эмоций.
  • Yandex стандартные голоса — приемлемо, но заметно менее эмоциональны, чем neuro.
  • OpenAI gpt-4o-mini-tts — заметный английский акцент, ниже качество на русском.

Специфические сложности русского:

  • Ударения — обе российские платформы обрабатывают правильно в 95%+ случаев благодаря словарям.
  • Числительные — автоматически озвучиваются словами («один», «десять миллионов»).
  • Иностранные слова, аббревиатуры — работает через SSML <phoneme> для сложных случаев.
  • Имена собственные — иногда требуется указывать ударения через SSML.

Федеральный закон № 152-ФЗ «О персональных данных» требует, чтобы первичная обработка ПДн российских граждан происходила на территории РФ. Это критично для многих B2C-сценариев:

  • Медицина. Голосовые записи консультаций врач-пациент содержат медицинские ПДн.
  • Финансы. Записи звонков в банк, голосовая биометрия, распознавание речи для документов.
  • Государственные сервисы. Голосовые IVR, автоматизированная обработка обращений.
  • HR и рекрутинг. Записи интервью, оценки кандидатов.
  • Юр.услуги. Записи консультаций, судебных заседаний, показаний.

Yandex SpeechKit и Sber SaluteSpeech:

  • Серверы физически расположены на территории РФ.
  • Провайдеры подписывают договор оператора ПДн.
  • Данные обрабатываются в контуре РФ, не пересылаются за границу.
  • Возможен деплой на инфраструктуре клиента (on-premise) через Enterprise-контракты.

ElevenLabs, OpenAI, Anthropic — серверы в США и ЕС, что не соответствует требованиям ФЗ-152 для обработки ПДн российских граждан.

Практическое правило: если проект обрабатывает ПДн российских граждан — используй Yandex SpeechKit или Sber SaluteSpeech. Если данные обезличены или ПДн не задействованы (например, генерация озвучки маркетингового ролика без ПДн) — можно использовать зарубежные сервисы.

Один из ключевых сценариев обоих сервисов — обработка звонков в колл-центрах.

Задачи:

  • Транскрипция всех звонков для аудита качества.
  • Анализ эмоций клиентов (недовольство, удовлетворённость).
  • Определение соблюдения скриптов операторами.
  • Выделение ключевых слов (жалобы, запросы, конверсионные сигналы).
  • Тегирование звонков по темам для аналитики.

Yandex SpeechKit для колл-центров:

  • Асинхронное распознавание длинных записей.
  • Возможность разделения говорящих (speaker diarization).
  • Text normalization для дальнейшей аналитики.
  • Интеграция с Yandex DataLens для визуализации метрик.

Sber SaluteSpeech callcenter model:

  • Специализированная модель для сжатого аудио (μ-law, opus, low bitrate).
  • Устойчивость к шумам колл-центра.
  • Диаризация «оператор vs клиент».
  • Интеграция с речевой аналитикой Sber.

Практически большинство крупных российских колл-центров используют один из двух сервисов. Обработка миллионов минут в месяц — обычная нагрузка.

Локальный деплой (внутри контура клиента, без выхода в облако провайдера) доступен у обоих, но только через Enterprise-контракты, а не по обычному тарифу.

Yandex SpeechKit on-premise:

  • Доступен через отдельный договор с Yandex Cloud.
  • Модели поставляются как Docker-образы или готовые VM.
  • Требуется собственная инфраструктура GPU/CPU.
  • Ключевые сценарии: банки с строгими требованиями безопасности, госсектор, компании со внутренним ЦОД.

Sber SaluteSpeech on-premise:

  • Доступен через договор с SberCloud/SberDevices.
  • Аналогичная модель поставки — Docker или VM.
  • Часто в связке с on-premise GigaChat.

Ценообразование on-premise — по договору, обычно значительно дороже облачного и подходит только для крупных клиентов с миллионами часов обработки в год.

Yandex SpeechKit:

  1. Регистрируйся на cloud.yandex.ru, создай платёжный аккаунт.
  2. Создай каталог (folder) и сервисный аккаунт с ролью ai.speechkit-tts.user (для синтеза) или ai.speechkit-stt.user (для распознавания).
  3. Получи IAM-токен: yc iam create-token в Yandex CLI.
  4. Установи SDK: pip install yandex-cloud-ml-sdk или используй прямые REST/gRPC запросы.
  5. Проведи первый тест — синтез короткой фразы или распознавание тестового аудио.
  6. Настрой автоматическое обновление IAM-токена (действителен 12 часов).

Sber SaluteSpeech:

  1. Регистрируйся на developers.sber.ru как разработчик.
  2. Создай проект в SaluteSpeech, получи client_id и client_secret.
  3. Скачай Russian Trusted CA сертификат для HTTPS-запросов.
  4. Получи access_token через OAuth2 endpoint.
  5. Установи SDK: pip install salute-speech или используй REST/gRPC.
  6. Проведи первый тест синтеза/распознавания.
  7. Настрой автоматическую ротацию access_token (действителен 30 минут).

Подходит:

  • Российским B2C-продуктам, обрабатывающим ПДн (медицина, финансы, HR) — обязательное соответствие ФЗ-152.
  • Колл-центрам и enterprise-приложениям — специализированные модели, on-premise возможен.
  • Разработчикам, уже использующим Yandex Cloud или SberCloud — единая экосистема и биллинг.
  • Русскоязычным задачам с высокими требованиями к качеству распознавания и синтеза.
  • Проектам с оплатой в рублях через российское юрлицо.

Не подходит:

  • Стартапам с иностранным юрлицом и глобальной аудиторией — зарубежные сервисы проще.
  • Проектам, где важна максимальная эмоциональная выразительность голоса — ElevenLabs Multilingual v2 всё же выигрывает по этому параметру.
  • Multi-language проектам (10+ языков) — российские сервисы фокусируются на русском, английский и несколько СНГ-языков, но не на глобальном покрытии.
  • Локальному оффлайн-деплою без Enterprise-договора — только облако или дорогие Enterprise-контракты.

Какое качество русского языка у Yandex SpeechKit vs Whisper?

Заголовок раздела «Какое качество русского языка у Yandex SpeechKit vs Whisper?»

Yandex SpeechKit v3 стабильно точнее Whisper large-v3-turbo на русском. WER 5-8% у Yandex против 8-12% у Whisper на чистой речи. На шумных записях разрыв ещё больше. Причина: Yandex обучен на большем объёме русскоязычных данных, включая специфические сценарии (звонки, диктовки, разговорную речь).

Насколько цены Yandex и Sber отличаются от ElevenLabs и OpenAI?

Заголовок раздела «Насколько цены Yandex и Sber отличаются от ElevenLabs и OpenAI?»

Цены Yandex/Sber в рублях сопоставимы с международными сервисами при пересчёте. Yandex STT — примерно 12 руб/мин ≈ 0.13$/мин, OpenAI Whisper API — 0.006$/мин (в 20× дешевле). Yandex TTS neuro — примерно 800-1600 руб/1M символов ≈ 8-16$, ElevenLabs — 30-50$ за 1M символов. По TTS Yandex/Sber конкурентно, по STT OpenAI Whisper радикально дешевле — но у Whisper API нет соответствия ФЗ-152.

Соответствуют ли Yandex SpeechKit и SaluteSpeech ФЗ-152?

Заголовок раздела «Соответствуют ли Yandex SpeechKit и SaluteSpeech ФЗ-152?»

Да. Оба сервиса размещают серверы на территории РФ, подписывают договор оператора ПДн, обрабатывают данные в контуре РФ. Это критично для B2C-продуктов с ПДн российских граждан (медицина, финансы, HR, госсектор). ElevenLabs, OpenAI и другие зарубежные сервисы не соответствуют ФЗ-152.

Можно ли использовать Yandex SpeechKit локально (on-premise)?

Заголовок раздела «Можно ли использовать Yandex SpeechKit локально (on-premise)?»

Только через Enterprise-контракт с Yandex Cloud. Стандартные тарифы — только облачное использование. On-premise доступен как отдельная поставка Docker-образов, требует собственной инфраструктуры GPU/CPU. Стоимость — по индивидуальному договору, значительно дороже облачного.

Neuro-голоса — нейросетевые голоса синтеза, натуральнее стандартных (jane, alena, filipp). Примеры: neuroaslan, neurodmitry. Более естественные интонации, эмоции работают качественнее, длинные фразы звучат живее. Стоят дороже стандартных (800-1600 руб/1M символов vs 400 руб). Рекомендуются для профессиональной озвучки — аудиокниги, подкасты, реклама.

Есть ли у SaluteSpeech специальная модель для колл-центров?

Заголовок раздела «Есть ли у SaluteSpeech специальная модель для колл-центров?»

Да. Модель callcenter оптимизирована для записей звонков: сжатое аудио (μ-law, opus, low bitrate), фоновые шумы, перекрывающиеся голоса, эмоции. WER на записях колл-центров — 12-18%, лучше чем general-модель на том же аудио. Yandex тоже эффективен на колл-центрах через асинхронное распознавание, но без выделенной модели.

Можно ли клонировать голос через Yandex или Sber?

Заголовок раздела «Можно ли клонировать голос через Yandex или Sber?»

Да, но только через Enterprise-контракт. Обычные тарифы клонирование не включают. Провайдеры требуют 30+ минут высококачественной речи, обучают индивидуальную модель за несколько дней. Стоимость — по договору. Для быстрого клонирования и Instant Voice Clone используй ElevenLabs (юридически подходит только для обезличенных задач, не для ПДн).

Yandex Cloud API технически доступен из любой страны, включая ЕС и США. Sber SaluteSpeech тоже работает через глобальные CDN. Но регистрация аккаунтов и оплата обычно требуют российского юрлица или физлица с российскими документами. Для использования с зарубежным юрлицом — договор через Yandex Cloud Global (если доступен) или другие бизнес-каналы.

Yandex: pip install yandex-cloud-ml-sdk (официальный) или pip install grpcio grpcio-tools для собственных gRPC-клиентов. Официальный SDK покрывает основные сценарии, для кастомных — прямые gRPC.

Sber: pip install salute-speech (несколько неофициальных SDK) или официальные примеры на GitHub. Для production многие пишут свои клиенты поверх requests/grpc.

Для обоих — можно использовать чистые REST-запросы через requests, если не нужна потоковая обработка. Для streaming — gRPC обязателен.

Что делать, если Yandex/Sber даёт ошибку авторизации?

Заголовок раздела «Что делать, если Yandex/Sber даёт ошибку авторизации?»

Yandex: проверь, что IAM-токен свежий (действителен 12 часов), сервисный аккаунт имеет нужную роль (ai.speechkit-*.user), folderId в запросе правильный. Пересоздай токен через yc iam create-token.

Sber: проверь, что access_token свежий (действителен 30 минут), Russian Trusted CA сертификат подложен в trusted store или указан в verify параметре, RqUID уникален для каждого запроса на получение токена.

Yandex: поддерживает основные теги SSML — <speak>, <voice>, <prosody>, <break>, <phoneme>, <say-as>, <sub>. Не поддерживает <audio> (вставка внешнего аудио). Полный список — в документации.

Sber: поддерживает похожий набор SSML-тегов. <speak>, <voice>, <prosody>, <break>, <phoneme>. Отличаются от Yandex в некоторых деталях.

Всегда сверяйся с актуальной документацией конкретного провайдера — поддержка SSML периодически расширяется.

Можно ли получить таймкоды распознанной речи?

Заголовок раздела «Можно ли получить таймкоды распознанной речи?»

Yandex — да, через параметр raw_results=True в асинхронном режиме или через опции gRPC-стриминга. Возвращаются start/end таймкоды для каждого слова.

Sber — да, аналогично через параметры конфигурации распознавания. Пословные таймкоды возвращаются в структурированном ответе.

Полезно для генерации субтитров, аудитирования звонков, автоматических транскрипций с ссылками на моменты в записи.

Что происходит с записями аудио на серверах провайдера?

Заголовок раздела «Что происходит с записями аудио на серверах провайдера?»

Yandex: по умолчанию аудио обрабатывается транзиентно, не сохраняется. Для отладки можно включить сохранение (persist=True) — тогда данные хранятся определённое время (см. Terms). Для сценариев с ПДн настройки хранения регулируются договором с оператором.

Sber: аналогично — по умолчанию транзиентная обработка, для отладки/анализа можно включить хранение. Персонализация под требования конкретного контракта.

Всегда проверяй Terms и SLA конкретного тарифа при работе с чувствительными данными.

Yandex: rate limits зависят от тарифа. Базовый — 10-100 параллельных потоков, для Enterprise — тысячи. Точные цифры в документации yandex.cloud.

Sber: аналогично зависит от тарифа. Базовый — 10-50 параллельных сессий, для Enterprise — по договору.

Для проектов с высокой нагрузкой (сотни тысяч запросов/день) — обязательно обсуждать rate limits с провайдером на этапе внедрения.

В чём преимущество Yandex/Sber vs open-source Whisper + XTTS локально?

Заголовок раздела «В чём преимущество Yandex/Sber vs open-source Whisper + XTTS локально?»

Плюсы Yandex/Sber:

  • Не нужно железо и DevOps — сервис в облаке.
  • Соответствие ФЗ-152 из коробки.
  • Официальная поддержка русского юрлица.
  • SLA и техподдержка на русском.

Плюсы open-source (Whisper + XTTS локально):

  • Бесплатно (кроме железа).
  • Полный контроль над данными — они не покидают инфраструктуру.
  • Возможность fine-tuning на своих данных.
  • Нет rate limits.

Выбор — по приоритетам. Для B2C с ПДн — почти всегда Yandex/Sber. Для внутренних задач без ПДн, где важен низкий cost на масштабе — open-source.

Какие типы аудиоформатов поддерживают эти сервисы?

Заголовок раздела «Какие типы аудиоформатов поддерживают эти сервисы?»

Yandex SpeechKit STT: LPCM (16-bit signed), OggOpus, MP3. Частота дискретизации 8/16/48 кГц. Максимальный размер файла для синхронного распознавания — 1 MB, для асинхронного — до 1 GB. Моно и стерео каналы поддерживаются.

Yandex SpeechKit TTS: возвращает mp3, oggopus, lpcm с настраиваемой частотой (8/16/48 кГц).

Sber SaluteSpeech STT: PCM_S16LE (WAV), OggOpus, MP3, ALAW, MULAW, FLAC. Частота 8/16/24/48 кГц. Ограничения по размеру зависят от режима (синхронный/асинхронный/streaming).

Sber SaluteSpeech TTS: wav16, opus, pcm16 с частотой 8/16/24 кГц.

Оба сервиса рекомендуют для лучшего качества STT — LPCM 16-bit 16 кГц моно (это стандартный формат для распознавания речи).

Актуально на 09.08.2026. Модели, цены и условия доступа меняются часто. Перед бизнес-решением всегда сверяйся с первоисточником — все ссылки в разделе Sources ниже.