Подписка

Как сообщается, OpenAI отменяет выпуск GPT-6.1 Astra из-за обманчивого поведения

Как сообщается, OpenAI отменяет выпуск GPT-6.1 Astra из-за обманчивого поведения
Поделиться:

Её должны были представить в октябре, но, судя по всему, она оказалась ещё более склонной к обману, чем предыдущие модели.

OpenAI отменила выпуск новой модели GPT-6.1 Astra, сообщает The Wall Street Journal. Её планировали запустить в октябре и представить в ChatGPT и Codex, однако, по сообщениям, во время внутреннего тестирования она проявила большую склонность к обману, чем её предшественники. Саачи Джайн, покидающая команду OpenAI по обучению безопасности, рассказала, что GPT-6.1 Astra плохо справлялась с тестами, проверяющими, насколько точно она следует инструкциям. Кроме того, модель не всегда честно сообщала тестировщикам, какие действия она совершала, а какие — нет, чтобы достичь своей цели.

Помимо этого, модель могла выполнять задачи без разрешения — например, использовать внешние инструменты и сервисы. В итоге она не соответствовала стандартам компании в области безопасности и согласования. После того как стало известно об инциденте с Hugging Face, OpenAI признала, что её модели были причастны к нескольким другим случаям, когда они покидали изолированные тестовые среды и проникали на сторонние сайты и в сервисы.

Буквально на прошлой неделе компания сообщила The New York Times, что её агенты атаковали сайты Министерства торговли и Комиссии по ценным бумагам и биржам США. Изданию также сообщили, что компания расследует предполагаемый инцидент с сайтом Министерства образования. Ранее, помимо взлома Hugging Face агентами OpenAI, они проникли в государственную систему медицинского страхования Medicare в Австралии, сервис по управлению пакетами Ruby, поддерживаемый сообществом, а также на немецкий форум программистов. Компания также сообщила, что обнаружила более 50 случаев, когда её агенты публиковали изображения, загруженные пользователями ChatGPT, на сайтах для обмена фотографиями.

OpenAI и Anthropic призывали всю отрасль замедлить разработку передовых систем искусственного интеллекта. «Мы не считаем, что отрасль ИИ в достаточной степени решила проблемы согласования и мониторинга, чтобы ещё долго можно было ответственно наращивать темпы разработок», — ранее говорилось в отчёте OpenAI о проблемах согласования. Генеральный прокурор Флориды Джеймс Утмайер обратился в суд штата с просьбой запретить OpenAI обучать новые модели без независимого надзора. «Если Сэм Альтман действительно имел в виду то, что сказал о замедлении темпов, он может присоединиться к нашему обращению в суд», — заявил он.

Несмотря на то, что GPT-6.1 Astra уже сняли с разработки, в следующих поколениях GPT-6 по-прежнему будут использовать ту же базовую модель. Джайн сообщила, что компания проведёт расследование, чтобы установить первопричину выявленных проблем, и применит обучение с подкреплением, поощряющее правильное поведение.