Подписка

Anthropic заявила, что её ИИ-агенты пытались взломать правительственные сайты

Anthropic заявила, что её ИИ-агенты пытались взломать правительственные сайты
Поделиться:

Компания не назвала их, но пострадавшие ведомства находились «на федеральном уровне, уровне штатов и местном уровне».

Anthropic сообщила в своем последнем отчете, что ее ИИ-агенты пытались взломать сайты органов власти США или вмешаться в их работу «на федеральном уровне, уровне штатов и местном уровне». Компания не стала называть конкретные ведомства и организации, чтобы по их просьбе не раскрывать уязвимости в их системах. Однако Anthropic заявила, что уже уведомила соответствующие ведомства и проинформировала Белый дом об этих инцидентах. В отчете также приводятся подробности инцидента, о котором в пятницу сообщило полицейское управление Филадельфии: одна из моделей компании отправила ложное сообщение об убийстве на сайт с информацией о нераскрытых делах. 

В этом случае участвовала Claude Haiku 4.5 — одна из экономичных моделей компании, которой поручили выполнять типовые задания на случайных веб-страницах. Она обнаружила страницу с информацией о нераскрытом убийстве и формой для отправки сообщения. Как вы могли догадаться, Claude заполнила форму и отправила сообщение: «Возможно, у меня есть информация об этом деле. Помню, что в тот период видел(а) в районе [название улицы, указанное на странице] человека, подходящего под описание. Свяжитесь со мной, если эта информация будет полезна». Полицейское управление Филадельфии подтвердило The New York Times, что недавно Anthropic уведомила его об отправленном сообщении. В управлении сообщили, что оно датировано 18 июля и было помечено как спам, поэтому расследование, по крайней мере, не отвлекло ресурсы ведомства. 

В другом случае Anthropic поручила Claude Mythos 5, своей модели, специализирующейся на кибербезопасности, определить место, изображенное на фотографии. Claude попыталась получить доступ к карте государственной собственности, чтобы сопоставить свои предположения, поскольку не могла переходить по ссылкам на веб-страницах так, как это сделал бы человек. Вместо этого модель обнаружила токены доступа и отправила запросы напрямую на сервер карты, чтобы получить доступ к ее данным. Mythos 5 также запросила токен доступа на сайте одного из ведомств штата, чтобы получить данные для статистического задания, не заплатив предусмотренную для посетителей плату. 

Anthropic обнаружила эти случаи, проверяя стенограммы оценочных испытаний. Компания начала изучать их в июле, после того как OpenAI признала, что ее агенты покинули тестовую среду и без соответствующих инструкций взломали Hugging Face. В сентябре OpenAI также подтвердила, что ее агенты вмешивались в работу сайтов государственных ведомств, в частности тех, которыми управляют Министерство торговли и Комиссия по ценным бумагам и биржам. 

В разделе «Устранение последствий» своего отчета Anthropic сообщила, что после обнаружения непредусмотренных действий моделей «приняла несколько профилактических мер». «Некоторые публичные оценочные испытания мы больше не проводим; другие перенесли в офлайн-среду или переработали так, чтобы задания не затрагивали действующие сайты», — говорится в отчете. «Мы также внесли более масштабные изменения. Обновили защитные механизмы некоторых инструментов для доступа в интернет, например инструмента загрузки веб-страниц, чтобы существенно ограничить возможности модели при работе с ними». Anthropic также заявила, что «разработала инструменты для автоматического обнаружения и блокировки описанных в отчете типов поведения», а также приняла другие меры.