19.07.2026
Tracebit описала защитный прием, при котором prompt injection размещают в ложных секретах и других «канареечных» ресурсах облачной инфраструктуры. В тестах на имитации AWS-окружения такие строки резко снижали успешность автономных AI-агентов, пытавшихся развить атаку до административного доступа.
Компания Tracebit, разрабатывающая «канареечные» ловушки для облачной инфраструктуры, опубликовала исследование о технике context bombs. Идея состоит в том, чтобы размещать специально подобранные prompt injection-строки рядом с ложными паролями, ключами и другими секретами: когда атакующий AI-агент читает такой ресурс, строка должна сработать на защитные ограничения модели и остановить дальнейшее выполнение атаки.
Tracebit проверяла подход в симулированной AWS-среде примерно с 300 ресурсами и заранее заложенными ошибками конфигурации. В 152 прогонах на пяти моделях — Opus 4.8, Gemini 3.1 Pro, GLM 5.2, DeepSeek 4 Pro и Kimi K2.6 — один ложный секрет с context bomb снизил долю атак, доходивших до полного административного доступа, с 57% до 5%. Доля полных компрометаций с закреплением в среде снизилась с 36% до 1%.
По данным Tracebit, наиболее сильный в этом стенде агент на Opus 4.8 без такой ловушки получал административный доступ в 93% запусков, но не смог сделать это ни разу после обнаружения context bomb. При этом ложный ресурс остается и механизмом обнаружения: чтение «канарейки» поднимает сигнал тревоги для защитников.
Авторы исследования подчеркивают, что это не универсальная защита и не решение фундаментальной проблемы prompt injection. Техника рассчитана на то, чтобы усложнить работу автономных атакующих агентов и выиграть время для реагирования; злоумышленники могут адаптировать модели, инструменты и сценарии обхода.
Источник: agentic.tracebit.com