Alibaba представила линейку моделей Qwen-Audio-3.0-TTS для синтеза речи. В неё вошли Flash — для озвучки с минимальной задержкой и Plus — с упором на качество генерации.
Модели доступны через API Alibaba Cloud Model Studio в регионах Сингапур и Китай (Пекин). Flash стоит $0,15, а Plus — $0,20 за 10 тысяч входных символов. Подробности в материале Postium.
Что умеет нейросеть Qwen-Audio-3.0-TTS
Модели поддерживают 16 языков, включая русский, английский, китайский, японский, корейский, немецкий, французский, итальянский, португальский, тайский, индонезийский, малайский и вьетнамский.
Стиль речи можно задать обычным текстом: например, попросить модель говорить медленнее, эмоциональнее, шёпотом или в манере диктора. В текст также можно добавлять теги для эмоций и звуковых действий: смеха, вздоха, кашля, шёпота или пения.
Клонирование голоса доступно в версии Flash. Для этого нужно загрузить аудиозапись, создать голос через API, а затем указать его идентификатор при генерации. По данным Qwen, новая версия лучше работает с неидеальными записями.
Как подключить Qwen-Audio-3.0-TTS
Для работы потребуется API-ключ Alibaba Cloud Model Studio. В запросе нужно указать модель qwen-audio-3.0-tts-flash или qwen-audio-3.0-tts-plus, а также выбрать голос и передать текст для озвучки.
Модели поддерживают потоковую генерацию аудио через WebSocket. Сейчас API работает только в однонаправленном потоковом режиме.
Почему это важно? Днём ранее Qwen представила Qwen 3.8 Max Preview — новую языковую модель. Теперь компания выпустила отдельные модели для синтеза речи. Это позволит использовать Qwen в голосовых ассистентах, сервисах озвучки контента и приложениях с клонированием голоса без подключения отдельного TTS-сервиса.
Итог: В Alibaba Cloud Model Studio появились две ИИ-модели для многоязычной озвучки — Qwen-Audio-3.0-TTS.