OpenAI представила более естественный голосовой режим для ChatGPT
ChatGPT перешёл на новую модель GPT-Live для голосового общения, которая позволяет одновременно слушать и говорить, делая диалог более естественным. Обновление заменяет прежнюю модель Advanced Voice в качестве стандартного режима.

OpenAI обновила голосовую функцию ChatGPT, внедрив новую модель под названием GPT-Live, которая заметно улучшает естественность звучания разговоров с ассистентом.
От трёх систем к одной модели
Первоначальный голосовой режим ChatGPT, появившийся в 2023 году, опирался на три отдельные системы: преобразование речи в текст, генерацию ответа и последующее озвучивание текста. Более поздний Advanced Voice Mode объединил эти функции в единую мультимодальную модель. GPT-Live идёт дальше, используя так называемую архитектуру "полного дуплекса", которая позволяет модели одновременно слушать и говорить.
Это решает распространённую проблему прежних версий, которые иногда принимали короткую паузу за конец фразы и начинали отвечать раньше, чем пользователь заканчивал говорить. Теперь во время разговора ChatGPT может издавать короткие звуки вроде "угу" или "да", подобно тому, как это делает человек, слушая собеседника. Более сложные задачи, требующие рассуждений или поиска информации, GPT-Live может передавать другим, более мощным моделям в фоновом режиме.
Доступ и настройка
Модель GPT-Live доступна в приложении ChatGPT на Android и iOS, а также в любом веб-браузере. Платные подписчики тарифов Pro, Plus и Go получают доступ к полной версии GPT-Live-1, а пользователи бесплатного тарифа — к облегчённой версии GPT-Live-1 mini. Чтобы начать разговор, нужно нажать на значок в виде волны в текстовом поле и разрешить доступ к микрофону при первом использовании.
В настройках можно выбрать один из трёх уровней "интеллекта" — Instant, Medium и High, однако эта возможность доступна только на платных тарифах. Голосовой разговор продолжается, даже если приложение свёрнуто или устройство заблокировано. Пока ограничением остаётся отсутствие поддержки демонстрации экрана или видео, но при необходимости пользователи могут вернуться к прежней голосовой модели через настройки.


