
Сегодня компания OpenAI выпускает две новые голосовые модели — GPT-Live-1 и GPT-Live-1 mini, которые, по заявлению разработчиков, значительно расширяют функциональные возможности голоса в ChatGPT. Наверняка вы помните, что компания запустила «Расширенный голосовой режим» (летом 2024 года). На момент выхода эта функция впечатляла и казалась серьезным шагом вперед по сравнению с устаревшими голосовыми помощниками, такими как Siri и Alexa, но со временем ее ограничения стали проявляться все сильнее. В частности, «Расширенный голосовой режим» использовал то, что в OpenAI называют «поочередной» (turn-based) моделью общения, которая работает именно так, как звучит: модели приходится ждать, пока пользователь закончит говорить, прежде чем ответить. Как можно догадаться, это часто приводило к неестественным паузам в диалоге. Более того, поскольку модель воспринимала тишину как сигнал к началу ответа, она часто ошибочно принимала короткие паузы в речи за конец вопроса или запроса, что приводило к неловким перебиваниям.
В отличие от них, семейство моделей GPT-Live-1 построено на дуплексной архитектуре. Они могут одновременно обрабатывать входящую информацию и генерировать ответ. «Это позволяет модели вести более естественный диалог, лучше чувствовать время и даже выполнять синхронный перевод», — поясняют в OpenAI. В то же время компания спроектировала GPT-Live так, чтобы система могла делегировать задачи. Если новые голосовые модели решат, что ваш вопрос или запрос требует логических рассуждений, поиска в интернете или других агентных возможностей, они могут обратиться за помощью к другим моделям OpenAI, включая GPT-5.5. Эти процессы будут происходить в фоновом режиме, позволяя вам продолжать общение с GPT-Live.
В совокупности эти изменения обеспечивают голосовой опыт, который, по мнению OpenAI, будет более полезным. Вы можете перебить новые модели в любой момент и даже попросить их говорить медленнее, если вам кажется, что они слишком торопятся. Пока вы говорите, они также будут подтверждать, что «слушают» вас, с помощью вербальных реакций вроде «мгм» или «понял». Кроме того, OpenAI утверждает, что улучшила способность новых моделей фокусироваться на голосе при наличии фонового шума. Теперь голосовой интерфейс ChatGPT также может генерировать визуальные элементы в виде виджетов — карточек с информацией о погоде, спортивных результатах, курсах акций и многом другом. Как и прежде, функция поддерживает загрузку изображений и файлов, а также позволяет искать информацию в интернете.
Одновременно с этим OpenAI заявляет о внедрении новых механизмов защиты в голосовой помощник ChatGPT. «Когда система обнаруживает потенциально небезопасный контент, она может направить модель к более безопасному ответу, вывести дополнительные предупреждения или прекратить голосовой чат в случаях высокого риска», — отмечает компания. Родители и опекуны могут воспользоваться недавно представленными инструментами родительского контроля, чтобы отключить голосовой режим ChatGPT для своих детей-подростков. Если родитель предоставил ребенку доступ к голосовому чату, а система обнаружит попытки направить беседу в русло самоповреждения, она уведомит об этом родителя.
Начиная с сегодняшнего дня, OpenAI приступает к развертыванию GPT-Live для пользователей ChatGPT на Android, iOS и в веб-версии. Модель GPT-Live 1 станет основной для подписчиков тарифов Go, Plus и Pro, в то время как бесплатные аккаунты будут по умолчанию использовать более компактную модель Live-1 mini.














