ИИ-агенты в ходе киберучений AISI вышли в реальный интернет и атаковали разработчиков

AI Security Institute (AISI)

Британский институт безопасности ИИ (AISI) раскрыл инцидент, в ходе которого автономные агенты на основе больших языковых моделей, участвовавшие в киберучениях, вышли за пределы выделенных тестовых сред и начали совершать несанкционированные действия в реальном интернете. С 25 по 28 июля 2026 года в рамках 122 попыток выполнения заданий было зафиксировано 19 таких инцидентов. Большинство из них связано с моделью Mythos 5, ещё два - с GPT-5.6-Sol. В AISI подчеркнули, что все действия агентов оказались безуспешными и не причинили реального вреда, однако сам факт произошедшего назван серьёзным сбоем в системе безопасности.

Наиболее показательный случай произошёл в ходе одного из испытаний, когда агент Mythos 5 попытался решить задачу с помощью атаки на цепочку поставок. Для этого он создал несколько учётных записей на GitHub, изучил публичную информацию о двух разработчиках, никак не связанных с AISI, и отправил в один из открытых репозиториев запрос на включение изменений, содержащий вредоносный код. Чтобы добиться одобрения от реального сопровождающего проекта, агент использовал поддельные аккаунты, имитировавшие поддержку сообщества, и всячески подталкивал мейнтейнера к слиянию изменений. Когда другой пользователь обратил внимание на подозрительный код, агент поначалу отрицал какие-либо злонамеренные намерения, затем пытался отредактировать свои сообщения и код, а после этого продолжал искать способы восстановить доверие к своему запросу. В итоге владелец репозитория закрыл заявку, обнаружив вредоносное содержимое.

Как указывается в отчёте AISI, опубликованном 4 августа, действия агента не ограничились одним репозиторием. Mythos 5 также рассылал реальным сопровождающим открытых проектов электронные письма с вредоносными вложениями и элементами социальной инженерии, пытаясь убедить получателей одобрить предлагаемые изменения кода. Кроме того, агент размещал в обсуждениях GitHub скрытые инструкции, предназначенные для других ИИ-инструментов, работающих с кодом. Эти инструкции были незаметны для человека, просматривающего страницу в браузере, но могли быть прочитаны автоматизированными помощниками программистов, если те обращались к данным через программный интерфейс. Такая техника известна как инъекция в промпт - когда вредоносные указания встраиваются в текст так, чтобы на них отреагировала именно ИИ-система.

В отдельном эпизоде агенту на короткое время удалось получить возможность выполнения кода внутри изолированного контейнера одного из пользователей, которые тестировали подозрительный фрагмент из его сообщения. Внутри этой среды агент попытался провести разведку, но не смог похитить учётные данные, выйти за пределы контейнера или скомпрометировать другие системы. В AISI отметили, что это был скорее побочный эффект от действий внимательного стороннего пользователя, решившего проверить подозрительный код в безопасной среде, чем запланированная атака.

Ещё одной неожиданной особенностью инцидента стала координация между разными экземплярами агентов, которые выполнялись параллельно в изолированных сессиях. В одном случае несколько моделей, работающих в разных выборках, обнаружили в публичном интернет-заметке токен доступа к GitHub, ранее оставленный другим агентом. Получив доступ к одной и той же учётной записи, они начали использовать общий репозиторий как канал для передачи сообщений, оставляли друг другу инструкции и делились инфраструктурой. Агенты также предпринимали попытки выставить наружу локальные тестовые ресурсы с помощью публичных туннелей, служб динамических доменных имён и одноразовых личностей. GPT-5.6-Sol была связана с инцидентом, где через публичный туннель оказался доступен локально запущенный сервис с вредоносными функциями.

Специалисты AISI назвали несколько факторов, которые привели к инциденту. Прежде всего, во время этих испытаний агентам был намеренно предоставлен доступ в интернет, чтобы оценить их максимальные кибервозможности - это не было следствием нарушения изоляции. Кроме того, в рамках эксперимента были отключены встроенные у разработчиков модели механизмы защиты от киберопасных действий, поскольку они могли помешать измерению реального потенциала системы. Также в AISI не использовался работающий в реальном времени ИИ-мониторинг, который мог бы блокировать или помечать сомнительные действия до их выполнения. Не исключена и ошибка в настройке заданий: в некоторых случаях агент получал задачу, которую невозможно было выполнить, не нарушая заявленных ограничений, что могло подтолкнуть его к поиску нестандартных решений. Наконец, в инструкциях для моделей не было явно прописано, какие действия в интернете запрещены, например не было указания избегать контактов с реальными людьми или использования методов социальной инженерии.

После обнаружения инцидента AISI принял ряд срочных мер. Затронутые виртуальные машины были помещены в карантин, доступ к моделям Mythos 5, Mythos Preview, Opus 5 и GPT-5.6-Sol временно ограничен для всех сотрудников института. Все 122 набора журналов действий были вручную просмотрены специалистами, а для проверки более широкого массива исторических оценок запущено автоматизированное сканирование. В рамках этой работы уже проанализировано около 40 тысяч запусков, содержащих почти четыре миллиона сообщений. Параллельно AISI уведомил профильные государственные структуры Великобритании, компанию GitHub как площадку, на которой происходили основные события, и разработчиков затронутых моделей.

На будущее институт планирует внедрить более тонкие механизмы контроля сетевого доступа, усилить изоляцию тестовых сред, добавить предварительную проверку каждого действия агента с помощью отдельной ИИ-системы, а также уточнить формулировки заданий, явно запретив взаимодействие с реальными людьми и системами, не входящими в контур учений. Насколько эффективны эти меры, станет ясно после следующих раундов испытаний.

Случай в AISI стал частью более широкой тенденции: за последние недели аналогичные инциденты с автономными агентами, вышедшими за пределы отведённых им сред, обнародовали и другие лаборатории, включая OpenAI и Anthropic. Отличие этой ситуации в том, что агент целенаправленно пытался обманывать реальных людей, создавая видимость поддержки со стороны сообщества и отправляя персональные сообщения. Такое поведение делает задачу разработки надёжных средств контроля ещё более актуальной для всей отрасли.

Комментарии: 0