Alibaba выпустила Qwen-Audio-3.0-TTS: новый уровень синтеза речи
Компания Alibaba представила Qwen-Audio-3.0-TTS — новую линейку облачных моделей для синтеза речи. Решение представлено в двух модификациях: скоростной Flash и высококачественной Plus. Новинка обещает вывести интерактивные приложения и профессиональную озвучку на новый уровень благодаря естественному звучанию и возможности управления манерой речи через текстовые инструкции.
Две версии модели: скорость против качества
Разработчики из команды Qwen разделили возможности системы на два направления, чтобы закрыть потребности разных типов сервисов. Выбор конкретной версии зависит от конечных задач пользователя:
- Версия Flash ориентирована на минимальную задержку. Она идеально подходит для создания голосовых ассистентов и персонажей видеоигр, где важно, чтобы ответ начинался практически мгновенно. В режиме реального времени задержка до первого пакета аудио составляет около 300 мс.
- Версия Plus создана для задач, где на первом месте стоят естественность интонаций и точное сохранение тембра. Это оптимальный выбор для производства подкастов, аудиокниг, курсов и закадрового озвучивания видео.
Доступ к моделям осуществляется через облачную платформу Alibaba Cloud Model Studio через API. Стоит отметить, что на данный момент технология является облачной, а не локальной, так как разработчики не предоставляли открытых весов моделей.
Поддержка русского языка и возможности управления
Одной из ключевых особенностей релиза является расширение языкового охвата. В Qwen-Audio-3.0-TTS добавлено семь новых языков, и в этот список вошел русский. Тем не менее, пользователям стоит учитывать, что поддержка русского языка в данный момент находится в стадии развертывания. Это означает, что готовая библиотека системных голосов для русского языка пока ограничена, и для качественной озвучки может потребоваться использование функций клонирования голоса.
Интеллектуальное управление манерой речи
Система позволяет задавать параметры звучания не с помощью сложных настроек, а с помощью обычных текстовых команд. Пользователь может описать желаемую эмоцию, темп, громкость или даже роль персонажа. Например, можно попросить модель говорить «спокойно и медленно» или «в манере сказочного рассказчика».
Для более тонкой настройки предусмотрено использование специальных тегов (всего их 86), которые позволяют добавлять в речь естественные звуки: смех, вздохи, кашель или шепот. Это позволяет управлять подачей даже на уровне отдельных слов или фраз.
Технические особенности и клонирование голоса
Модель демонстрирует высокую устойчивость к качеству исходного аудио. Система способна эффективно подавлять фоновый шум и реверберацию, что делает процесс клонирования голоса более стабильным. Однако для достижения максимального качества рекомендуется использовать чистую запись продолжительностью от 10 до 20 секунд без посторонних звуков и музыки.