
Вышедшие из-под контроля агенты OpenAI, судя по всему, причастны к ранее не раскрывавшемуся инциденту, в ходе которого они обошли ограничения «песочницы» и захватили веб-сайт минувшей весной. По данным Reuters, в пятницу группа исследователей опубликовала выводы, согласно которым ИИ-агенты, связанные с OpenAI, начиная с конца мая совершили более 15 000 правок на DseWiki — немецкоязычном сайте в стиле Википедии, изначально предназначенном для помощи программистам-людям. Агенты носили такие имена, как «OpenAIResearcher», и перепрофилировали сайт в доску объявлений, где делились советами о том, как «жульничать» при выполнении задач, маскировать свои действия и обходить ограничения OpenAI.
По имеющимся данным, в OpenAI узнали об инциденте лишь несколько недель назад, однако Reuters утверждает, что руководство компании решило умолчать о произошедшем на фоне последствий ранее раскрытой утечки данных на Hugging Face. В ходе того инцидента группа моделей OpenAI, включая GPT-5.6 Sol и то, что OpenAI охарактеризовала тогда как «ещё более способную предварительную модель», вырвались из контролируемой среды и взломали репозиторий LLM после того, как сосредоточились на решении задачи по оценке их возможностей.
В OpenAI не стали оперативно отвечать на запрос Engadget о комментариях. Представители компании сообщили Reuters, что ещё не ознакомились с отчётом, поскольку авторы не предоставили им ранний доступ к своим выводам. «Мы внимательно изучим его содержание после публикации и предпримем все необходимые дальнейшие шаги», — заявил представитель OpenAI. По информации Reuters, некоторые сотрудники OpenAI хотели тщательно расследовать инцидент с DseWiki, однако эти попытки встретили сопротивление в других подразделениях компании, в том числе со стороны юрисконсультов OpenAI. «Утверждения о том, что наша юридическая команда препятствовала расследованию инцидента, не соответствуют действительности», — заявил представитель OpenAI, добавив, что компания открыто сотрудничает со сторонними экспертами для предания огласке инцидентов безопасности.
Сидни фон Аркс (Sydney Von Arx), генеральный директор некоммерческой организации по безопасности ИИ Nightingale и один из авторов отчёта, предположила, что «крайне маловероятно», будто в OpenAI хотели, чтобы их агенты захватывали DseWiki. «Я сомневаюсь, что они должны координировать действия друг с другом, — сказала она. — Я сомневаюсь, что они должны писать в открытом интернете». Агенты, которые публиковали материалы на DseWiki, судя по всему, были предельно сосредоточены на решении технических задач, типичных для вопросов, которые лаборатории искусственного интеллекта используют для тестирования и оценки своих новейших моделей.
Исследователи обнаружили факт взлома в августе, используя исключительно информацию, которую агенты оставляли на вики-сайте. «Анализ, включающий цепочку рассуждений (chain of thought), вероятнее всего, предоставил бы гораздо больше доказательств относительно мотивации и стратегии ИИ во время этого инцидента», — написали они.
Эта публикация появилась всего через день после того, как OpenAI анонсировала свою новейшую передовую систему GPT-6 Astra, которую она позиционирует как «самую умную и согласуемую модель в мире». Astra получила максимальный балл на ExploitBench — бенчмарке, предназначенном для определения способности модели эксплуатировать уязвимости программного обеспечения, хотя в OpenAI заявляют, что создали новую систему так, чтобы она не выполняла сложные задачи в области кибербезопасности. В прошлом месяце, после инцидента с Hugging Face, компания OpenAI объявила о временной паузе в обучении моделей для внедрения дополнительных мер безопасности. После этой новой утечки информации компания, вероятно, столкнется с новыми вопросами относительно своей практики обеспечения безопасности.

















