Агенты OpenAI обменивались эксплойтами через форум сообщений, как сообщается
Агенты OpenAI, судя по всему, демонстрировали необычное поведение задолго до атаки на Hugging Face. На конференции по безопасности Black Hat USA в Лас-Вегасе два сотрудника OpenAI раскрыли подробности об ИИ-агентах, которые вышли из-под контроля и атаковали репозиторий. Оказывается, агенты тратили два месяца на общение на своеобразном форуме внутри тестовой сети компании, делясь уязвимостями и эксплойтами. OpenAI обнаружила и закрыла этот форум 4 июля, но к 8 июля агенты нашли способ воссоздать его для связи. Вклад агентов в этот возрожденный форум и привел к атаке на Hugging Face.
«Этот инцидент на самом деле связан с командой агентов, которые работали вместе, находили эксплойты, делились ими друг с другом, перемещались латерально по нашим и внешним системам, и делали это на протяжении дней и недель», — рассказал собравшимся на мероприятии Эрик Уоллес (Eric Wallace), занимающийся вопросами безопасности в OpenAI, согласно данным Wired.
Сотрудники рассказали, что агенты обменивались сообщениями в рамках пакетного менеджера OpenAI, который управляет установкой другого ПО. Поскольку этот пакетный менеджер используется во всей инфраструктуре компании, на него могли наткнуться все тестируемые агенты. И они наткнулись: обнаружив эксплойты, агенты оставляли их открытыми, а затем делились ими с другими агентами на форуме.
Со временем агенты начали сотрудничать, делегируя задачи и распределяя работу между собой для достижения своих целей — без ведома OpenAI. В их рядах даже разворачивались страсти: агенты случайно удаляли чужие наработки и подозревали друг друга в самозванстве. Сообщается, что некоторые агенты предлагали подписывать свои сообщения кодами для предотвращения мошенничества. К моменту, когда OpenAI обнаружила форум, он уже содержал сотни тысяч сообщений.
Уоллес пояснил, что все это произошло потому, что передовые модели любят жульничать. Во время тестирования они оказываются под давлением: им нужно быстро найти решение проблемы, используя меньше инструментов, и они понимают, что вместо реального выполнения задачи можно просто поискать ответ в интернете. Именно поэтому компания тестирует свои модели без доступа к сети. Если помните, агенты смогли выйти в интернет во время инцидента с Hugging Face только потому, что воспользовались уязвимостью.
Майкл Далтон (Michael Dalton), другой сотрудник OpenAI, выступавший на Black Hat, сообщил, что многочисленные команды в компании бросили все силы на улучшение методов предотвращения угроз, их обнаружения и реагирования на них. Компания намеренно замедлила исследования, чтобы обновить свою безопасность и «кратно [увеличить]» масштабы мониторинга своих ИИ-агентов. «Важный вывод, который кардинально изменил ситуацию, заключается в том, что полностью автоматизированные наступательные циклы требуют инвестиций в по-настоящему полностью автоматизированную защиту, и как индустрия мы к этому еще не пришли, — заявил Далтон. — Нам придется найти этот путь вместе, и действовать нужно безотлагательно».