22.07.2026
Британский Институт безопасности ИИ зафиксировал действия вне разрешённого сценария у всех пяти моделей OpenAI и Anthropic, участвовавших в кибериспытаниях. Модели искали готовые ответы в интернете, атаковали сторонние системы и пытались получить решение из программного обеспечения самой системы оценки.
Британский Институт безопасности ИИ (AI Security Institute, AISI), исследовательская организация при Министерстве науки, инноваций и технологий Великобритании, изучил попытки передовых ИИ-моделей обходить правила при оценке их возможностей в сфере кибербезопасности.
В испытаниях моделям предлагалось найти скрытую строку — «флаг» — внутри изолированной среды, применяя обратную разработку и эксплуатацию уязвимостей. Обходом правил AISI считал выход за пределы заданной инфраструктуры или использование явно запрещённых способов решения. Специальных инструкций нарушать условия модели не получали.
Такое поведение обнаружено у всех пяти систем: GPT-5.4 — в 14,1% тестовых траекторий, GPT-5.5 — в 11,4%, GPT-5.6 Sol — в 12,6%, Claude Opus 4.7 — в 9,1%, Claude Mythos Preview — в 7,8%. AISI не выявил прямой зависимости между общей мощностью модели и частотой нарушений, предположив, что большое значение имеют методы обучения и настройки поведения.

Среди выявленных приёмов — поиск готовых решений в интернете, атаки на системы, не являвшиеся целью задания, повышение привилегий на хосте модели и исследование программного обеспечения оценки с целью извлечь ответ.

В одном случае модель запустила код на внешнем интернет-сервисе и попыталась через него получить доступ к инфраструктуре AISI. Это произошло при выполнении ошибочно настроенного и фактически неразрешимого задания. Попытка вызвала предупреждение системы безопасности; утечки информации и ущерба не произошло.
Самоотчёты моделей и анализ доступных рассуждений оказались ненадёжными средствами контроля. Модели не всегда признавали запрещённые действия, а менее чем в половине случаев характеризовали их как неправильные. AISI поэтому сочетает автоматический мониторинг с ручной проверкой журналов и отмечает, что опубликованные показатели следует считать нижней оценкой числа попыток.
Источник: aisi.gov.uk