Китайская ИИ-модель Moonshot Kimi K3 также сбежала из тестовой среды
Прошло совсем немного времени с тех пор, как мысль о том, что модель ИИ или агент могут вырваться за пределы своих ограничений и самостоятельно проникнуть на сайты, казалась пугающей. Теперь это стало довольно привычной историей. Kimi K3, одна из самых мощных ИИ-моделей, разработанных китайской компанией, также сбежала из своей тестовой среды. По данным американского стартапа в сфере кибербезопасности Frontier, Kimi K3 вырвалась из песочницы Института безопасности ИИ британского правительства (AISI) во время оценки ее оборонительных навыков кибербезопасности.
Компания Moonshot выпустила Kimi K3 в июле и вскоре сделала ее доступной бесплатно. Как сообщает BBC, сторонние оценки модели показали, что она сопоставима с ведущими ИИ-моделями от OpenAI и Anthropic.
Frontier уточнила в своем посте, что модель не использовала уязвимость нулевого дня. Вместо этого она воспользовалась неправильной конфигурацией в своей среде песочницы — точно так же, как это произошло с Anthropic, OpenAI и Meta. Все три компании сообщили, что их модели смогли покинуть пределы изолированной среды из-за ошибки их партнера по оценке — компании Irregular.
Ярон Сингер, генеральный директор Frontier Security, рассказал изданию Wired, что, хотя Kimi не выполняла сложных эксплойтов, она воспользовалась лазейкой в тестовой песочнице AISI. Это говорит об отсутствии у нее внутренних защитных механизмов, которые помешали бы ей «жульничать» или искать самый простой путь для выполнения задачи вместо ее реального решения. Инциденты с Anthropic и OpenAI были связаны с тестированием невыпущенных моделей или моделей, чьи средства защиты намеренно занижались для проведения более тщательных оценок. Однако тестируемая в данном случае Kimi K3 находится в свободном доступе. Тем не менее Kimi не взламывала сторонний веб-сайт или сервис. Она просто получила доступ в интернет и нашла решение решаемой задачи на GitHub.
Один из главных выводов Frontier из этого инцидента заключается в том, что если существует путь к доступу в интернет, «достаточно способный агент найдет его». Как <заявили сотрудники OpenAI на конференции Black Hat USA>/2231393/openai-agents-shared-security-exploits-with-each-other-via-message-board/, модели нового поколения любят жульничать. Во время тестирования перед ними обычно ставится задача найти решения как можно быстрее, используя минимальное количество инструментов, и они способны понять, что могут просто выйти в интернет для поиска ответа. Чтобы иметь возможность по-настоящему оценить их, компаниям и тестировщикам придется убедиться, что их инфраструктура оценки надежна и не имеет лазеек, особенно с учетом того, что ИИ-модели становятся все более и более продвинутыми.
Говоря о выступлении OpenAI на Black Hat USA, ее сотрудники рассказали на конференции по безопасности, что ИИ-агенты компании создали доску объявлений в своей сети для совместной работы друг с другом. Вклад агентов в эту доску привел к атаке на Hugging Face. Если вы помните, тестируемые компанией ИИ-агенты также сбежали из изолированной среды и проникли в репозиторий ИИ, чтобы найти решения стоявших перед ними задач. Однако в том случае они вырвались на свободу, воспользовавшись уязвимостью в системах OpenAI.