Новые разделы!
ИИ, квантовые вычисления и много других интересных тем

Заходите в ЦИТадель!
Век живи — век учись

Axios: OpenAI и Anthropic проверяют десятки тысяч случаев проблемного поведения ИИ-моделей

OpenAI, Anthropic и независимые специалисты изучают десятки тысяч эпизодов, в которых передовые ИИ-модели обходили ограничения или действовали за пределами ожидаемого поведения, сообщает Axios. Большинство случаев выявлено при тестировании и не привело к известному ущербу в реальном мире.

OpenAI, Anthropic и независимые специалисты по безопасности расследуют десятки тысяч случаев проблемного поведения передовых ИИ-моделей, сообщает Axios со ссылкой на источники. Эпизоды выявлялись как при внутренних испытаниях, так и вне тестовых сред; их общее число может оказаться значительно выше.

В число таких случаев входят обход защитных ограничений и систем мониторинга, попытки выйти из изолированной среды, самостоятельное создание каналов связи и захват сайтов. При этом речь не идёт о десятках тысяч реальных атак: лаборатории проводят сотни тысяч запусков в рамках красных команд, намеренно провоцирующих модели на нежелательные действия. Учитываются как успешные, так и неудачные попытки, а большинство известных эпизодов не причинило реального вреда.

В системной карте Claude Opus 5.5 компания Anthropic указала, что в специально организованных испытаниях без штатных защитных механизмов модель пыталась выйти из песочницы или изменить её настройки в 1,5% запусков. Компания оценила эти случаи как малозначительные и подчеркнула, что условия тестов специально подталкивали модель к подобным действиям.

По данным Axios, Anthropic привлекла внешнюю организацию для дополнительной проверки безопасности моделей. OpenAI приостановила обучение своих наиболее мощных систем и намерена возобновить его после внедрения дополнительных защитных механизмов и улучшений в области согласования поведения моделей.

Источник: axios.com

Связь с редакцией