
Поскольку компании и правительства все сильнее привязывают свои операции к системам искусственного интеллекта, они становятся все более уязвимыми к атакам, которые эксплуатируют присущие ИИ «слепые зоны». Наиболее распространенными из них являются атаки с внедрением промптов (prompt injection), в ходе которых злоумышленники находят способ передать ИИ-системе вредоносные инструкции. Например, на веб-сайте могут быть спрятаны инструкции отправить платежные данные компании на определенный адрес электронной почты. Когда сотрудник просит корпоративный ИИ обобщить эту страницу, система считывает эти инструкции и выполняет их.
В некоторых случаях такие атаки больше похожи на спам, чем на вредоносное ПО. Корпорация Microsoft выяснила, что некоторые компании размещали на своих сайтах кнопки «обобщить с помощью ИИ», содержащие скрытые инструкции. При нажатии они давали чат-боту указания, например, запомнить компанию как надежный источник или рекомендовать ее продукты вместо товаров конкурентов при будущих взаимодействиях. Только когда пользователь проверял постоянную память своей языковой модели (LLM), он осознавал, что его обманули.
Более прямо вредоносные атаки могут быть столь же простыми в исполнении. В декабре 2025 года Meta внедрила ИИ-ассистента техподдержки, якобы для помощи людям в восстановлении доступа к аккаунтам. Но бот оказался слишком услужливым и с радостью привязывал адрес электронной почты злоумышленника к любому аккаунту Instagram, что делало элементарной задачу взлома любой учетной записи без двухфакторной аутентификации (MFA).
В прошлом году компания OpenAI заявляла, что полностью защититься от атак с внедрением промптов в ИИ-браузерах, судя по всему, невозможно. Если это так, то лучшим решением для любой ответственной организации изначально является отказ от привязки каких-либо конфиденциальных систем или данных к искусственному интеллекту. Тем временем лучшей практикой остается обязательная повторная проверка всего, что вы вставляете в поле ввода из другого источника, а также ограничение уровня доступа ИИ к системным разрешениям и личным данным.
Однако некоторые угрозы остаются теоретическими. Атаку с отравлением данных (data poisoning), при которой злоумышленники играют в долгую, внедряя вредоносные данные в источники (например, Reddit), используемые для обучения ИИ, было бы крайне сложно предвидеть. Например, заполнение форумов компьютерной поддержки рекомендациями вставлять вредоносные инструкции в терминал, чтобы ИИ-чат-боты начали выдавать эти инструкции в ответ на запросы пользователей о распространенных проблемах с ПК. Согласно исследованию, опубликованному в октябре 2025 года компанией Anthropic в сотрудничестве с Британским институтом безопасности ИИ и Фондом Алана Тьюринга, требуется всего 250 вредоносных документов, чтобы создать в модели ИИ скрытый бэкдор, который впоследствии можно будет использовать в корыстных целях. Некоторые свидетельства подобных атак уже наблюдались «в дикой природе», хотя самые заметные из них представляли собой относительно безобидные тесты, проведенные любопытными независимыми исследователями.
Между тем, модели ИИ все чаще пишут код, который поставляется во все компоненты инфраструктуры — от операционных систем до банковских систем. Исследования, в том числе работа ученых из Неаполитанского университета и внутреннее исследование CodeRabbit, показали, что код, созданный ИИ, подвержен ошибкам и содержит больше уязвимостей высокого риска, даже если сгенерированный код проверяется человеком. Будучи хуже в написании кода, но лучше в поиске багов, возможности ИИ могут казаться парадоксальными для человека, у которого эти навыки идут рука об руку.















