06.09.2026
Исследователи изучили 2614 смоделированных многошаговых атак на ИИ-агентов с постоянной памятью. Сценарии медленного дрейфа и отложенной активации бэкдора могли выглядеть безопасно при проверке отдельных взаимодействий и проявляться лишь на поздних этапах.
Исследователи из университетов Реджайны и Калгари описали отложенные атаки на память агентов, построенных на базе больших языковых моделей (LLM). В статье в IEEE Access они рассмотрели 2614 многошаговых траекторий атак, при которых вредоносные данные сохраняются между взаимодействиями и позднее влияют на решения агента.
Авторы выделили четыре семейства атак: цепное отравление, перезапись политик, активацию бэкдора и медленный дрейф. Последние два типа могли оставаться неотличимыми от нормальной работы вплоть до завершающих взаимодействий. При этом риск не всегда возрастал последовательно: поведение агента могло сначала выглядеть подозрительным, затем возвращаться к норме и только позже приводить к опасному действию.
Такие атаки направлены не только на текущий промпт, но и на постоянное состояние системы. Непроверенный текст может попасть в долговременную память, пережить несколько сессий, а затем повлиять на планирование или вызов подключённых инструментов. Поэтому оценка безопасности отдельных запросов не заменяет проверку всей цепочки — от записи и извлечения памяти до последующих действий агента.
Схожий механизм продемонстрировала Palo Alto Networks Unit 42 на тестовом агенте Amazon Bedrock. Косвенная промпт-инъекция через содержимое веб-страницы попадала в сводку сессии, сохранялась в памяти и активировалась позднее. Исследователи подчеркнули, что это не уязвимость самой платформы Amazon Bedrock, а общий риск систем, допускающих перенос непроверенного содержимого в память агента.
Работа в IEEE Access основана на сконструированном наборе симулированных атак и не оценивает их распространённость в реальных системах. Авторы считают, что тесты безопасности агентов с памятью должны охватывать полные последовательности взаимодействий, а не изолированные промпты.
Источник: doi.org