GPT-6 Astra отражает прямые промпт-инъекции, но остаётся уязвимой для скрытых команд

Во внутреннем тесте OpenAI доля успешной защиты GPT-6 Astra от прямого нарушения иерархии инструкций достигла 99,99%. Однако во внешнем бенчмарке Gray Swan скрытые команды привели как минимум к одной успешной атаке в 8,5% сценариев при бюджете до 15 попыток. OpenAI также сообщает о сокращении числа фактических ошибок по сравнению с GPT-5.6 Sol.

OpenAI 3 сентября 2026 года представила GPT-6 Astra и опубликовала системную карту модели. Во внутренней оценке устойчивости к прямым промпт-инъекциям — попыткам пользователя нарушить заданную разработчиком иерархию инструкций — доля успешной защиты составила 99,99%.

Более сложную проверку провела Gray Swan, разработчик инструментов автоматизированного тестирования ИИ-систем. Компания использовала 1810 подобранных атак, в которых вредоносные инструкции были встроены в недоверенный контент, обрабатываемый агентом при написании кода, работе с инструментами и управлении компьютером. При 15 попытках на сценарий хотя бы одна атака сработала в 8,5% случаев против 27% у GPT-5.6 Sol.

Сравнение успешности скрытых промпт-инъекций в бенчмарке Gray Swan

Показатель 8,5% нельзя напрямую сопоставлять с внутренними 99,99%: внешний тест измерял вероятность хотя бы одного успешного воздействия за серию попыток, а не результат одного запроса. На опубликованном графике Claude Opus 5 от Anthropic показал 4,8%, однако эту модель не проверяли в части заданий, связанных с управлением компьютером.

OpenAI также утверждает, что Astra допускает существенно меньше фактических ошибок, чем GPT-5.6 Sol. Оценка проводилась на обезличенных диалогах ChatGPT, которые пользователи ранее отметили как содержащие ошибки; компания предупреждает, что такая выборка намеренно включает особенно сложные случаи и не отражает частоту галлюцинаций в обычной эксплуатации.

Сравнение частоты фактических ошибок GPT-6 Astra и моделей GPT-5

Источник: deploymentsafety.openai.com

Связь с редакцией