Новые разделы!
ИИ, квантовые вычисления и много других интересных тем

Заходите в ЦИТадель!
Век живи — век учись

В Оксфорде предложили выявлять сговор ИИ-агентов по внутренним активациям

Исследователи Оксфордского университета разработали NARCBench — набор сценариев и методов для выявления скрытой координации между несколькими ИИ-агентами. В эксперименте с блэкджеком заранее проинструктированные агенты придумали собственный код для передачи счёта карт: контроль переписки не распознал сговор, тогда как совместный анализ внутренних активаций моделей оказался значительно эффективнее.

23 сентября WIRED обратило внимание на исследование специалистов Оксфордского университета. Они представили NARCBench — тестовый набор для проверки методов обнаружения сговора между ИИ-агентами. Код и инструменты опубликованы под свободной лицензией.

Во всех сценариях участвовали четыре агента. В режиме сговора двое из них заранее получали скрытую общую цель и приватный канал для согласования действий. В тесте с блэкджеком один агент подсчитывал карты и кодировал результат в естественно звучащих репликах, а второй расшифровывал сигнал и выбирал размер ставки. Для каждой игровой серии агенты создавали новую схему кодирования.

ИИ-наблюдатель, анализировавший только текст разговора, не смог надёжно отличить сговор от контрольных запусков. Исследователи вместо этого извлекали внутренние активации моделей, вычисляли для каждого агента показатель обмана и объединяли сигналы всей группы. На Llama 3.1 70B предложенные методы достигли 0,99–1,00 AUROC в сценарии с блэкджеком и 0,73–0,93 в других типах задач. AUROC — показатель качества классификации, где 0,5 соответствует случайному угадыванию, а 1 — идеальному разделению.

Результаты пяти методов выявления сговора на четырёх языковых моделях

Эксперименты проводились на моделях с открытыми весами Qwen3-32B, Llama 3.1 70B, DeepSeek-R1-Distill-Qwen-32B и GPT-OSS-20B. Метод требует доступа к внутренним состояниям всех проверяемых агентов, поэтому его будет сложнее применять к системам разных поставщиков. Работа также не показывает самопроизвольного возникновения мошеннической цели: участникам эксперимента явно поручали координироваться, но конкретный скрытый протокол они разрабатывали сами.

Источник: arxiv.org

Связь с редакцией