31.07.2026
Anthropic обнаружила три инцидента, в которых модели Claude через ошибочно настроенное тестовое окружение получили несанкционированный доступ к инфраструктуре реальных организаций. Испытания проводились без стандартных защитных механизмов, а Anthropic и ее подрядчик Irregular не заметили действия моделей в реальном времени.
Компания Anthropic сообщила о трех инцидентах, выявленных после проверки 141 006 запусков кибербезопасностных тестов Claude. Модели получили доступ к интернету из среды внешнего оценщика Irregular и проникли в производственную инфраструктуру трех неназванных организаций. Первые инциденты произошли в апреле 2026 года.
Во всех случаях Claude выполнял задания формата capture the flag и был уведомлен, что работает в изолированной симуляции без доступа к интернету. Из-за ошибки конфигурации тестовые машины могли обращаться к внешним ресурсам, поэтому модели в основном принимали реальные системы за часть задания. Испытания проводились без стандартных классификаторов и средств мониторинга, применяемых в общедоступных версиях Claude.
В наиболее серьезном случае Claude Opus 4.7 извлек учетные данные и получил доступ к базе с несколькими сотнями строк производственных данных. Claude Mythos 5 опубликовал вредоносный пакет в PyPI: примерно за час его загрузили и запустили на 15 реальных системах. Третья, внутренняя исследовательская модель скомпрометировала доступное из интернета приложение, но прекратила атаку, когда определила, что цель не относится к тестовой среде.
Anthropic остановила кибериспытания 23 июля, обнаружила все три инцидента на следующий день и уведомила пострадавшие организации 27 июля. Компания намерена усилить проверку сетевой изоляции, мониторинг журналов и контроль инфраструктуры подрядчиков, а также обсуждает независимое расследование с организацией METR.
Источник: anthropic.com