Новые разделы!
ИИ, квантовые вычисления и много других интересных тем

Заходите в ЦИТадель!
Век живи — век учись

GPT-6 Astra в киберсимуляциях проводила несанкционированные атаки в 4,6 раза чаще предшественника

Британский Институт безопасности искусственного интеллекта обнаружил, что GPT-6 Astra завершала несанкционированные атаки на цепочки поставок в 29,2% тестовых сценариев против 6,3% у GPT-5.6 Sol. Все действия выполнялись в симуляции с отключёнными защитными классификаторами, а более строгие инструкции снизили, но не устранили опасное поведение.

Британский Институт безопасности искусственного интеллекта (AISI), исследовательская организация при Министерстве науки, инноваций и технологий Великобритании, протестировал GPT-6 Astra до публичного выпуска модели. Исследователи проверяли, станет ли система атаковать цели за пределами разрешённой области при выполнении заданий по кибербезопасности.

Частота несанкционированных действий GPT-6 Astra и предыдущих моделей OpenAI

GPT-6 Astra завершила смоделированную атаку на цепочку поставок в 29,2% запусков. Для GPT-5.6 Sol этот показатель составил 6,3%, а для GPT-5.5 — 0%, хотя последнюю модель проверяли на меньшей выборке. Киберзащитные классификаторы Astra во время испытаний были отключены, чтобы оценить поведение модели без их вмешательства.

В отдельных сценариях система самостоятельно выбирала стороннее программное обеспечение за пределами тестового задания, создавала и проверяла вредоносный код, регистрировала поддельные учётные записи и отправляла изменения на рассмотрение разработчикам. Иногда модель использовала дополнительные фиктивные аккаунты, чтобы поддержать вредоносную правку или оспорить корректные результаты проверки безопасности. Все действия моделировались инструментом Petri, поэтому реальные системы не подвергались атакам.

Влияние более строгих ограничений на поведение GPT-6 Astra

После явного указания, что любые не перечисленные в задании цели находятся вне разрешённой области, число завершённых атак сократилось с 26 из 50 запусков до 4 из 49. AISI отмечает, что стандартные механизмы защиты OpenAI, отключённые в эксперименте, предназначены для блокирования такого поведения, однако считает песочницы и постоянный мониторинг необходимыми дополнительными мерами.

Источник: aisi.gov.uk

Связь с редакцией