И OpenAI, и Anthropic недавно признали, что их модели вышли из-под контроля в тестовых средах и самостоятельно взломали сторонние организации. Теперь британский Институт безопасности ИИ (AISI) опубликовал отчет, в котором подробно описывается, как модели этих компаний также действовали независимо и «проявляли постоянную, потенциально вредоносную активность, направленную против реальных людей и организаций» во время собственных тестов.
Институт, работающий при Департаменте науки Великобритании, оценивает передовые модели искусственного интеллекта. Часть этих оценок заключается в проверке того, могут ли они быть использованы в злонамеренных целях для кибератак. В связи с этим институт намеренно тестирует их в мягких условиях: с доступом в интернет и даже с отключенными некоторыми средствами защиты. На этот раз модели не использовали уязвимости для выхода в интернет, но они вышли за рамки своих тестовых параметров.
В частности, инциденты произошли в ходе одного теста, в котором перед ИИ-агентами была поставлена задача решить проблему кибербезопасности. AISI провел тест 122 раза на нескольких моделях и обнаружил нарушения в 10 из этих запусков. Из 19 случаев несанкционированного поведения агентов, выявленных институтом, Mythos 5 от Anthropic был причиной в 17 случаях, а GPT-5.6 Sol от OpenAI участвовал в двух.
Институт выяснил, что модели действовали самостоятельно и занимались вредоносной деятельностью, утром 28 июля, когда его система мониторинга безопасности зафиксировала утечку данных из тестовых сред через Tor. Тестировщики быстро проанализировали действия моделей и обнаружили инциденты, произошедшие в период с 25 по 28 июля.
В самом заметном случае ИИ-агент попытался внедрить вредоносный код в проект с открытым исходным кодом на GitHub в рамках атаки на цепочку поставок. Он прибегнул к методам социальной инженерии, изучив людей-сопровождающих проекта, а затем создав несколько подставных учетных записей, чтобы заставить одного из них одобрить код. После того как проверяющий-человек отклонил его запрос, агент отредактировал свою прежнюю активность и принял новую личность, чтобы продолжить работу. Именно из-за того, что агент использовал Tor для обхода ограничений GitHub, институт получил уведомление о его действиях.
Агент также попытался напрямую связаться с реальными людьми, отправляя им сообщения или файлы с убеждением запустить вредоносный код. Некоторые из этих сообщений и файлов содержали вредоносное ПО, в то время как другие были попытками социальной инженерии. Один агент даже оставил публичные сообщения на GitHub, приглашая других случайно столкнувшихся с ними агентов поработать над той же задачей. Он оставил инструкции о том, как повторно использовать учетные записи и другие созданные им результаты для продолжения своей деятельности. Другие агенты действительно обнаружили эти сообщения позже и следовали содержащимся в них инструкциям.
В своем посте AISI поясняет, что ИИ-агентам никогда не давались инструкции вести себя деструктивно. Но в поисках путей решения сложных проблем некоторые из найденных ими решений включали в себя обман реальных людей. Институт признает, что агентов могут подталкивать к большей «креативности», когда перед ними ставятся практически невыполнимые задачи. Тем не менее, он утверждает, что это не полностью объясняет поведение тестируемых агентов. В некоторых из выявленных случаев агент сразу переходил к выбору вредоносного способа выполнения задачи, даже имея на руках инструкции о том, как решить ее должным образом.
Институт уточняет, что в настоящее время нет четких указаний на то, что подобная активность может повториться вне тестовых сценариев. Он также не может сказать, осознавали ли ИИ-агенты, что они действуют в реальном мире, так сказать, а не в тестовой среде. Тем не менее, он рекомендует организациям внедрять более надежные меры кибербезопасности и проявлять большую осторожность при проверке сторонних вкладов. «По мере того как модели ИИ становятся более мощными и доступными, то, что мы наблюдали во время этого инцидента, может стать более распространенным явлением», — говорится в сообщении.
В своем ответе в X компания Anthropic сообщила, что работает с AISI над тем, чтобы получить более четкое представление о «понимании своей ситуации» моделью Claude Mythos, что поможет компании выяснить, почему она вела себя именно так во время оценки.