26.07.2026
Внутренний тест Anthropic охватывал 129 браузерных сред с адаптивными атаками: при включённом Auto Mode ни одна промпт-инъекция не достигла цели. В экспериментальной конфигурации без дополнительных средств защиты доля успешных атак на Opus 5 составила 3,7%, поэтому результат показывает эффективность общего защитного контура, но не означает полного устранения уязвимости.
Anthropic сообщила в системной карте Claude Opus 5, что модель с включённым Auto Mode не пропустила ни одной промпт-инъекции в 129 браузерных сценариях. Тест проводился в среде Claude Cowork, а атакующий получал по десять попыток на каждый сценарий.
Промпт-инъекция — это скрытая вредоносная инструкция на веб-странице, в документе или другом содержимом, которое обрабатывает ИИ-агент. Auto Mode сочетает два независимых уровня защиты: проверку поступающих к модели данных и классификатор, блокирующий потенциально опасные действия агента.
Без дополнительных защит успешными оказались 3,7% атак на Opus 5 с расширенным рассуждением и 4,3% — без него. Нулевой результат с Auto Mode также показали Claude Sonnet 5 и Claude Mythos 5, тогда как Opus 4.8 допустил успешную атаку в одном из 129 сценариев. В отдельном тесте Gray Swan IPI без внешних средств защиты вероятность успешной атаки на Opus 5 за 15 попыток составила 2%, поэтому данные пока не подтверждают полную неуязвимость браузерных агентов.
Источник: anthropic.com