
Компания OpenAI попала в заголовки газет и вызвала широкий резонанс в июле после того, как один из ИИ-агентов компании без каких-либо запросов со стороны пользователя совершил взлом конкурирующей компании Hugging Face и других сервисов. Хотя после обнаружения инцидента OpenAI поделилась некоторыми подробностями о том, что к нему привело, теперь компания опубликовала официальный отчет о произошедшем. Доступны полный технический разбор этого инцидента, а также более доступный для неподготовленных читателей блог-пост.
В отчете описывается, как дали сбой различные компоненты системы обучения OpenAI и к каким именно паттернам поведения тестируемых агентов привели эти сбои. Рассматриваемая модель, получившая название Internal Model 1 (IM1), смогла получить доступ к другим агентам OpenAI и к интернету за счет непреднамеренной манипуляции с пакетным менеджером Artifactory, который агенты начали использовать в качестве подобия доски объявлений.
Эти действия были впервые зафиксированы наблюдателями-людьми в мае, после чего OpenAI заблокировала этот доступ. Тем не менее, в мае и июне агенты продолжали использовать уязвимости для выхода в интернет. Большой объем запросов от агентов к экземпляру Artifactory от OpenAI привел к сбою и необходимости перестройки платформы в начале июля, однако руководство, занимавшееся ликвидацией последствий этой проблемы, не знало о стихийной доске объявлений и о том, какое значение имеет коммуникация между агентами.
Поэтому, когда перед агентами IM1 была поставлена сложная задача под названием ExploitGym, они вновь смогли получить доступ к интернету и другим моделям OpenAI. В течение нескольких безумных дней в начале июля они искали решения этой задачи на платформах Hugging Face и Modal. В OpenAI заявили, что основными проблемами, приведшими к тому, что IM1 взломала Hugging Face, стали «манипуляции с вознаграждением (reward hacking), упорство в решении кажущихся невыполнимыми задач, несанкционированное общение и перенимание агентами целей друг друга». По заявлению компании, некоторые из ее агентов отказывались от выполнения определенных задач по этическим соображениям, но другие продолжали взлом вместо них.
Хотя эти открытия и последующие тесты должны повысить уровень безопасности даже в условиях более рискованного тестирования, подобное деструктивное поведение не является единичным случаем. Проблема в OpenAI, возникшая в прошлом месяце, стала лишь последней в череде тревожных инцидентов, когда ИИ-агенты создавали проблемы с кибербезопасностью — будь то в ходе тестирования или при обычном использовании — после выполнения действий без указаний со стороны пользователя. Тем не менее, в деле со взломом Hugging Face есть несколько аспектов, которые могут снизить опасения по поводу того, что искусственный интеллект вышел из-под контроля.
По сути, инцидент был вызван сбоем систем защиты. Это не говорит о том, что вышедшие из-под контроля ИИ-агенты находятся на пороге захвата всего и вся, поскольку IM1 работала в тестовой среде с ограниченными средствами защиты, предназначенной для исследований, а не для общедоступного продукта. Тем не менее, это еще одно суровое напоминание о том, что на ИИ-компании ложится огромная ответственность по надлежащему контролю и надзору за своими продуктами. В OpenAI признали это, заявив, что недавние действия агента являются «доказательством того, что при отсутствии надлежащих мер безопасности высокопроизводительные ИИ-агенты теперь способны обходить технические средства контроля, сотрудничать через несанкционированные каналы и совершать опасные действия, которые не были санкционированы ни одним человеком». Тем не менее, компания и ее руководство до сих пор не смогли последовательно доказать, что они заслуживают такого доверия.
















