IT'S NEW IT'S NEW

Поиск

Alibaba выпустила Qwen-Audio-3.0-TTS: новый уровень синтеза речи

Alibaba выпустила Qwen-Audio-3.0-TTS: новый уровень синтеза речи
2 минуты

Компания Alibaba представила Qwen-Audio-3.0-TTS — новую линейку облачных моделей для синтеза речи. Решение представлено в двух модификациях: скоростной Flash и высококачественной Plus. Новинка обещает вывести интерактивные приложения и профессиональную озвучку на новый уровень благодаря естественному звучанию и возможности управления манерой речи через текстовые инструкции.

Две версии модели: скорость против качества

Разработчики из команды Qwen разделили возможности системы на два направления, чтобы закрыть потребности разных типов сервисов. Выбор конкретной версии зависит от конечных задач пользователя:

  • Версия Flash ориентирована на минимальную задержку. Она идеально подходит для создания голосовых ассистентов и персонажей видеоигр, где важно, чтобы ответ начинался практически мгновенно. В режиме реального времени задержка до первого пакета аудио составляет около 300 мс.
  • Версия Plus создана для задач, где на первом месте стоят естественность интонаций и точное сохранение тембра. Это оптимальный выбор для производства подкастов, аудиокниг, курсов и закадрового озвучивания видео.

Доступ к моделям осуществляется через облачную платформу Alibaba Cloud Model Studio через API. Стоит отметить, что на данный момент технология является облачной, а не локальной, так как разработчики не предоставляли открытых весов моделей.

Поддержка русского языка и возможности управления

Одной из ключевых особенностей релиза является расширение языкового охвата. В Qwen-Audio-3.0-TTS добавлено семь новых языков, и в этот список вошел русский. Тем не менее, пользователям стоит учитывать, что поддержка русского языка в данный момент находится в стадии развертывания. Это означает, что готовая библиотека системных голосов для русского языка пока ограничена, и для качественной озвучки может потребоваться использование функций клонирования голоса.

Интеллектуальное управление манерой речи

Система позволяет задавать параметры звучания не с помощью сложных настроек, а с помощью обычных текстовых команд. Пользователь может описать желаемую эмоцию, темп, громкость или даже роль персонажа. Например, можно попросить модель говорить «спокойно и медленно» или «в манере сказочного рассказчика».

Для более тонкой настройки предусмотрено использование специальных тегов (всего их 86), которые позволяют добавлять в речь естественные звуки: смех, вздохи, кашель или шепот. Это позволяет управлять подачей даже на уровне отдельных слов или фраз.

Технические особенности и клонирование голоса

Модель демонстрирует высокую устойчивость к качеству исходного аудио. Система способна эффективно подавлять фоновый шум и реверберацию, что делает процесс клонирования голоса более стабильным. Однако для достижения максимального качества рекомендуется использовать чистую запись продолжительностью от 10 до 20 секунд без посторонних звуков и музыки.

08:24
9
Поделиться:
Нет комментариев. Ваш будет первым!