ChatGPT научился одновременно говорить и слушать: OpenAI представила голосовые модели GPT-Live
OpenAI представила новое семейство голосовых моделей GPT-Live, которое позволяет ChatGPT одновременно слушать и говорить, делая общение более естественным. Теперь искусственный интеллект может вставлять короткие реплики, перебивать собеседника и ждать, если пользователь задумался. Полная версия GPT-Live-1 доступна подписчикам платных тарифов, а бесплатным пользователям — облегченная GPT-Live-1 mini.
Главная особенность GPT-Live — полнодуплексная архитектура, благодаря которой ИИ способен одновременно анализировать входящий аудиопоток и формировать ответ, не дожидаясь окончания реплики. В отличие от предыдущих версий, где диалог строился по очереди, новая модель может использовать междометия вроде «угу» или «понял», быстро обмениваться короткими фразами или выдерживать паузы. Система также стала лучше распознавать голос пользователя на фоне шума.
Если вопрос требует сложных вычислений или поиска в интернете, GPT-Live передает задачу более мощной модели (например, GPT-5.5), которая выполняет ее в фоновом режиме, не прерывая основной разговор. Кроме того, модель поддерживает синхронный перевод в реальном времени и может отображать информационные карточки с погодой, биржевыми данными или спортивными результатами.
OpenAI уже начала внедрять GPT-Live в ChatGPT. Полная версия GPT-Live-1 доступна подписчикам тарифов Go, Plus и Pro в веб-версии и приложениях для iOS и Android. Пользователям без подписки предлагается облегченная версия GPT-Live-1 mini. В будущем компания планирует предоставить доступ к GPT-Live через API для разработчиков. Модель оптимизирована для ряда популярных языков, но на некоторых языках пока может говорить менее бегло или с акцентом.