IT'S NEW IT'S NEW

Поиск

OpenAI запустила GPT-Live: голосовой ChatGPT учится слушать и говорить одновременно

OpenAI запустила GPT-Live: голосовой ChatGPT учится слушать и говорить одновременно
4 минуты

8 июля OpenAI представила GPT-Live — новое поколение голосовых моделей для ChatGPT, которое кардинально меняет принцип общения с чат-ботом. Главная особенность: система умеет слушать и говорить одновременно, не дожидаясь, пока собеседник замолчит. Обновление уже развернуто для всех пользователей по всему миру на платформах iOS, Android и в веб-версии, заменив старый голосовой режим. По данным компании, еженедельно голосом ChatGPT пользуются более 150 миллионов человек — для бытовых вопросов, изучения языков, чтения сказок или просто для разговора по дороге на работу. Именно этот массовый сценарий получил новую архитектуру.

Как работало голосовое общение раньше

Первая версия голосового ChatGPT строилась на каскадной схеме: отдельная модель переводила речь в текст, вторая генерировала ответ, третья озвучивала его. Подход рабочий, но задерживающийся — на стыках терялась информация, а речь звучала механически. Позже появился Advanced Voice Mode на базе GPT-4o: распознавание и синтез объединили в одной модели, что снизило задержку. Однако диалог всё равно шёл по очереди — система ждала тишины, чтобы понять конец фразы. Случайная пауза или фоновый шум могли быть приняты за завершение реплики, и модель перебивала пользователя.

Full-duplex: настоящий диалог без пауз

GPT-Live основана на архитектуре full-duplex: входящий звук обрабатывается и ответ формируется параллельно, а не последовательно. Несколько раз в секунду модель решает — говорить, слушать дальше, сделать паузу, перебить или обратиться к инструменту. В разговор она вставляет короткие реакции вроде «угу» или «понятно», показывая, что следит за мыслью собеседника. Если пользователь перебил её на полуслове, GPT-Live мгновенно перестраивает ответ. OpenAI заявляет, что система точнее отличает раздумье от законченной фразы и лучше выделяет голос на фоне посторонних звуков. Для запуска были переозвучены все девять голосов ChatGPT.

Сложные задачи — на фоне, разговор — без прерывания

Для ресурсоёмких операций — поиска в интернете, многошагового рассуждения, работы с инструментами — GPT-Live передаёт запрос фронтир-модели (на старте это GPT-5.5) и продолжает беседу, пока та считает в фоне. Когда результат готов, он возвращается в диалог без неловкой паузы на обработку. Разговорная часть и «тяжёлое мышление» разделены, что позволяет обновлять модель для сложных задач независимо от голосового слоя.

Дополнительные возможности

  • Синхронный перевод: собеседники говорят каждый на своём языке, GPT-Live переводит с минимальной задержкой.
  • Визуальные карточки: во время разговора ChatGPT может показывать прогноз погоды, курсы акций, спортивные результаты, карты — прямо поверх голосового интерфейса.

Кто получает доступ и какие есть ограничения

GPT-Live выходит в двух версиях: GPT-Live-1 становится голосом по умолчанию для тарифов Go, Plus и Pro; GPT-Live-1 mini — для бесплатного плана. Разработчикам и корпоративным клиентам доступ к API обещают «скоро», пока открыт только список ожидания.

На старте есть заметные ограничения:

  • Нет работы с видео и демонстрацией экрана — для этих сценариев остаются старые Standard и Advanced Voice Mode.
  • Часть языков модель говорит с акцентом или спотыкается на беглости; OpenAI признаёт это и обещает донастройку.

Результаты внутренних тестов

По данным OpenAI, в парных сравнениях длинных разговоров (5–10 минут) пользователи чаще предпочитали GPT-Live старому Advanced Voice Mode — за естественность, умение держать очередь реплик и реакцию на перебивания. На тесте экспертных научных рассуждений GPQA новая модель обошла предшественника с большим отрывом. На BrowseComp (проверка агентного поиска сложно находимой информации) также зафиксирован рост. На внутреннем тесте телеком-поддержки τ³-Voice Telecom GPT-Live опередила предыдущую версию. Все цифры — из тестов самой OpenAI, независимого аудита пока не было.

Безопасность живого голоса

Голосовой формат создаёт риски, других чем текстовый чат: реакция должна быть безопасной здесь и сейчас. OpenAI расширила тесты под аудио — с фокусом на самоповреждение, психоз и манию, эмоциональную привязанность к ИИ, насилие и сексуальный контент. Если система фиксирует потенциально небезопасный ответ во время разговора, она может мягко перенаправить беседу, предложить ресурсы поддержки или в критических случаях завершить диалог. Для тем, связанных с самоповреждением, голосовой режим адаптировали под линии психологической помощи.

Отдельно прописаны ограничения для подростков через родительский контроль; родители могут получать уведомления при признаках высокого риска. Голоса в GPT-Live — фиксированный набор, модель специально не умеет имитировать голос конкретного человека.

Конкуренты не ждут

Живой голосовой ИИ — не монополия OpenAI. Gemini Live у Google построен на похожем принципе нативной обработки звука с низкой задержкой и глубоко интегрирован в Workspace и Android. Стартап Sesame до недавнего времени многие называли самым «живым» голосовым ассистентом на рынке — компания сделала ставку именно на естественность речи. Hume AI пошла иным путём: её Empathic Voice Interface распознаёт более 48 оттенков эмоций по интонации и дыханию, а не просто стремится звучать по-человечески.

GPT-Live выходит на поле, где естественность голоса уже не редкость. Редкость — связка живого разговора с полноценным фронтир-интеллектом на фоне. Насколько разница ощущается в реальном использовании, а не в демо на 5–10 минут, покажут ближайшие недели: сама OpenAI признаёт, что часть языков и сценариев ещё не дотянута.

Краткий итог

OpenAI запустила GPT-Live — первый массовый голосовой ассистент с настоящей full-duplex архитектурой. Он слушает и говорит одновременно, умеет перебивать и реагировать на перебивания, делегирует сложные задачи более мощной модели без прерывания диалога и добавляет перевод и визуальные карточки. Доступно всем пользователям, но без видео, с проблемами на некоторых языках и пока без API для разработчиков. Безопасность усилена под реальное время. Главный тест — повседневная эксплуатация миллионами людей в ближайшие недели.

11:46
45
Поделиться:
Нет комментариев. Ваш будет первым!