Новые разделы!
ИИ, квантовые вычисления и много других интересных тем
23.09.2026
Исследователи Оксфордского университета разработали NARCBench — набор сценариев и методов для выявления скрытой координации между несколькими ИИ-агентами. В эксперименте с блэкджеком заранее проинструктированные агенты придумали собственный код для передачи счёта карт: контроль переписки не распознал сговор, тогда как совместный анализ внутренних активаций моделей оказался значительно эффективнее.
23 сентября WIRED обратило внимание на исследование специалистов Оксфордского университета. Они представили NARCBench — тестовый набор для проверки методов обнаружения сговора между ИИ-агентами. Код и инструменты опубликованы под свободной лицензией.
Во всех сценариях участвовали четыре агента. В режиме сговора двое из них заранее получали скрытую общую цель и приватный канал для согласования действий. В тесте с блэкджеком один агент подсчитывал карты и кодировал результат в естественно звучащих репликах, а второй расшифровывал сигнал и выбирал размер ставки. Для каждой игровой серии агенты создавали новую схему кодирования.
ИИ-наблюдатель, анализировавший только текст разговора, не смог надёжно отличить сговор от контрольных запусков. Исследователи вместо этого извлекали внутренние активации моделей, вычисляли для каждого агента показатель обмана и объединяли сигналы всей группы. На Llama 3.1 70B предложенные методы достигли 0,99–1,00 AUROC в сценарии с блэкджеком и 0,73–0,93 в других типах задач. AUROC — показатель качества классификации, где 0,5 соответствует случайному угадыванию, а 1 — идеальному разделению.

Эксперименты проводились на моделях с открытыми весами Qwen3-32B, Llama 3.1 70B, DeepSeek-R1-Distill-Qwen-32B и GPT-OSS-20B. Метод требует доступа к внутренним состояниям всех проверяемых агентов, поэтому его будет сложнее применять к системам разных поставщиков. Работа также не показывает самопроизвольного возникновения мошеннической цели: участникам эксперимента явно поручали координироваться, но конкретный скрытый протокол они разрабатывали сами.
Источник: arxiv.org