- синтез речи
- text-to-speech
- TTS API
- озвучка текста
- Tavio
Синтез речи через API: как озвучить текст естественным голосом
Синтез речи (text-to-speech, TTS) превращает обычный текст в аудио с естественным человеческим голосом. Раньше это требовало студии и диктора, сегодня достаточно одного HTTP-запроса. В этом гайде разберём, как озвучить текст через API Tavio: от первого curl-запроса до сохранения готового mp3 и понимания того, за что вы платите.
Что такое синтез речи через API
Синтез речи через API — это программный способ получить аудиофайл из текстовой строки: вы отправляете текст и название голоса, а сервис возвращает готовую озвучку. Tavio — это единый API и веб-панель для генерации изображений, видео, речи (TTS) и текста (chat/LLM) с одним ключом на все модальности.
Ключевая особенность: API Tavio совместим с OpenAI. Это значит, что путь /audio/speech, формат запроса и существующие SDK OpenAI работают без изменений — достаточно подменить базовый URL на https://api.tavio.tech/v1 и подставить свой ключ Tavio.
С Tavio вы можете озвучивать текст, генерировать изображения, видео и работать с LLM через один и тот же ключ, а запросы обрабатываются на edge-инфраструктуре с низкой задержкой по всему миру.
Где применяют озвучку текста
TTS давно вышел за рамки «читалок». Вот основные сценарии, где синтез речи через API экономит время и деньги:
- Озвучка видео и роликов. Закадровый голос для YouTube, обучающих курсов, рекламных вставок без записи в студии. Можно за минуты переозвучить ролик, если поменялся сценарий, — не нужно снова собирать диктора.
- IVR и голосовые меню. Автоответчики и телефонные боты, где реплики генерируются на лету под конкретного клиента: имя, номер заказа, статус доставки.
- Доступность (accessibility). Озвучивание статей, интерфейсов и документов для людей с нарушениями зрения — озвучка добавляется программно ко всему контенту сайта.
- Аудиокниги и подкасты. Быстрое превращение сценария в аудиодорожку с ровным темпом и интонацией, включая длинные тексты, которые дорого записывать вручную.
- Уведомления и ассистенты. Голосовые сообщения в приложениях, умных устройствах и чат-ботах, где ответ формируется динамически.
Главный практический выигрыш в том, что озвучка становится частью кода, а не отдельным ручным этапом. Текст меняется — новое аудио генерируется автоматически, без правок в студии.
Как вызвать endpoint синтеза речи
Endpoint синтеза речи в Tavio — это POST https://api.tavio.tech/v1/audio/speech. В теле запроса вы указываете три главных поля: model (какая модель озвучивает), input (текст для озвучки) и voice (какой голос использовать). Ответ — бинарный аудиопоток, который сразу можно записать в файл.
Вот минимальный copy-paste пример на curl, который сохраняет результат в speech.mp3:
curl https://api.tavio.tech/v1/audio/speech \
-H "Authorization: Bearer $TAVIO_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "elevenlabs-tts",
"input": "Привет! Это синтез речи через API Tavio.",
"voice": "alloy"
}' \
--output speech.mp3
После выполнения в текущей папке появится файл speech.mp3, готовый к прослушиванию. Переменную TAVIO_API_KEY удобно один раз экспортировать в окружение, чтобы не хранить ключ в коде.
Пример на Python через OpenAI SDK
Поскольку API совместим с OpenAI, вам не нужен отдельный клиент — подойдёт официальный пакет openai. Достаточно указать base_url, ведущий на Tavio, и свой ключ. Пример ниже генерирует речь и сохраняет её на диск:
from openai import OpenAI
client = OpenAI(
base_url="https://api.tavio.tech/v1",
api_key="TAVIO_API_KEY",
)
response = client.audio.speech.create(
model="openai-tts",
voice="nova",
input="Tavio превращает текст в естественную речь одним запросом.",
)
response.stream_to_file("output.mp3")
print("Готово: output.mp3")
Этот же паттерн работает в связке с любыми инструментами, которые уже используют OpenAI SDK — от скриптов автоматизации до бэкенда продакшена. Меняется только base_url и ключ.
Как выбрать голос и модель: elevenlabs-tts или openai-tts
В Tavio для синтеза речи доступны две модели, и выбор зависит от задачи:
elevenlabs-tts— упор на максимально естественное, эмоциональное звучание. Хороший выбор для аудиокниг, подкастов и рекламных роликов, где важна «живость» голоса.openai-tts— сбалансированное, чистое звучание, отлично подходит для интерфейсных уведомлений, IVR и служебных подсказок, где нужна предсказуемость и скорость.
Голос задаётся полем voice (например, alloy или nova). Практический совет: озвучьте один и тот же короткий фрагмент обеими моделями и несколькими голосами — так вы за пару минут подберёте тембр под свой проект, не гадая по описанию.
Дополнительный плюс платформы — автоматический failover между провайдерами: если одна модель или провайдер временно недоступны, запрос автоматически уходит на резервный, и ваша генерация не падает.
Сколько стоит озвучка: расход кредитов по секундам
Tavio работает по подписке: тариф даёт дневную квоту кредитов, которая обновляется каждый день, а неизрасходованный остаток сгорает в полночь UTC. Платные тарифы начинаются от $10/мес, есть Enterprise по запросу. Синтез речи списывает кредиты по секундам сгенерированного аудио — из вашей дневной квоты, ровно за длительность полученной озвучки, а не за количество символов или запросов.
Точные цены по каждой модели в кредитах (включая стоимость секунды для elevenlabs-tts и openai-tts) указаны на странице тарифов: tavio.tech/pricing. Тестовые кредиты на старте удобны для проверки: можно озвучить пару фраз и оценить качество, не оформляя платный тариф заранее.
Частые вопросы
Нужен ли отдельный SDK для синтеза речи в Tavio?
Нет. API Tavio совместим с OpenAI, поэтому подходят официальные SDK OpenAI и любые инструменты, которые их используют. Достаточно указать базовый URL https://api.tavio.tech/v1 и ваш ключ Tavio — существующий код работает без переписывания.
Какой формат аудио возвращает endpoint?
Endpoint /audio/speech возвращает бинарный аудиопоток, который вы записываете в файл (в примерах выше — mp3). В curl это делается флагом --output, а в Python SDK — методом stream_to_file.
elevenlabs-tts или openai-tts — что выбрать?
Для максимально живого и эмоционального звучания (аудиокниги, реклама) берите elevenlabs-tts. Для чистых, предсказуемых служебных реплик (IVR, уведомления) — openai-tts. Лучший способ — протестировать оба на одном фрагменте текста.
Как списываются кредиты за синтез речи?
По секундам сгенерированного аудио — кредиты списываются из дневной квоты вашего тарифа. Актуальную стоимость секунды для каждой модели в кредитах смотрите на tavio.tech/pricing.
Попробуйте прямо сейчас
Чтобы начать озвучивать текст, зарегистрируйтесь через Telegram-бота https://t.me/taviotech_bot — он создаст аккаунт и выдаст API-ключ за несколько секунд. Полное описание endpoint синтеза речи и остальных модальностей — в документации https://api.tavio.tech/docs. Один ключ, подписка с дневной квотой, естественный голос из текста одним запросом.