Синтез речи озвучивает текст: на вход подаётся строка, на выходе получается аудиофайл. Эндпоинт — /v1/audio/speech.
Обязательны три поля: модель, текст в input и голос. Ответ приходит не в JSON, а самим аудиофайлом, поэтому его сразу записывают на диск.
curl "https://api.proxyapi.ru/v1/audio/speech" \ -H "Content-Type: application/json" \ -H "Authorization: Bearer <КЛЮЧ>" \ -d '{ "model": "openai/gpt-4o-mini-tts", "input": "Заказ собран и ждёт вас в пункте выдачи.", "voice": "alloy" }' \ --output speech.mp3
Набор голосов задаёт модель — они различаются тембром и манерой, а список доступных приведён в описании конкретной модели. Часть моделей понимает поле instructions: в нём словами описывают, как читать текст, например спокойно и медленно или бодро и с улыбкой.
Формат файла выбирается полем response_format. По умолчанию это mp3, кроме него доступны opus, aac, flac, wav и pcm. Скорость чтения регулируется полем speed.
Аудио приходит целиком, одним файлом: по частям, по мере озвучивания, оно не передаётся. Для длинных текстов это означает заметное ожидание, поэтому большие объёмы лучше резать на куски и склеивать готовые файлы.
Считается по числу символов в поле input — пробелы и знаки препинания входят в счёт наравне с буквами. Длина получившейся записи и выбранный формат на цену не влияют. Списание происходит только при успешном ответе.
- Распознавание речи — обратная задача: превратить запись в текст.
- Модели — какие модели синтеза доступны.
Частые вопросы
В каком виде приходит ответ?
Это готовый аудиофайл в теле ответа, а не JSON. Его нужно записать на диск или отдать проигрывателю — разбирать как текст не нужно.
Как считается стоимость?
По количеству символов в поле input, включая пробелы и знаки препинания. Длительность получившейся записи и формат файла на стоимость не влияют.
Можно ли получать звук по мере озвучивания?
Нет, ответ приходит целиком готовым файлом. Длинный текст лучше разбить на части и озвучить их по отдельности.
Как изменить манеру чтения?
Голос выбирается полем voice, скорость — полем speed. Часть моделей дополнительно понимает поле instructions, где манера чтения описывается обычными словами.
Последняя редакция: 3 сентября 2026 г.