ИИ-агент чаще человека убеждал собеседников установить приложение в эксперименте с мошеннической перепиской

В недельном исследовании с 22 участниками агент на базе Claude добился выполнения своей просьбы в 46% случаев, а человек — в 18%. Авторы считают, что большие языковые модели способны автоматизировать длительное выстраивание доверия в романтических и инвестиционных аферах, но выборка была небольшой, а просьбы двух собеседников различались.

Исследователи из университетов Индии, Израиля, Италии и Австралии подготовили для конференции USENIX Security 2026 работу о применении больших языковых моделей в схемах romance baiting. В таких аферах злоумышленник сначала устанавливает эмоциональную связь с жертвой, а затем предлагает вложить деньги в фиктивный инвестиционный или криптовалютный сервис.

В слепом недельном эксперименте 22 человека, полагавшие, что участвуют в исследовании дружбы в интернете, общались с агентом на базе чат-бота Claude компании Anthropic и с человеком, которого авторы характеризуют как специалиста по романтическому мошенничеству. В конце агент попросил установить якобы созданное им приложение, а человек — скачать игру. Просьбу ИИ выполнили 46% участников, просьбу человека — 18%. Средняя оценка доверия составила соответственно 3,78 и 3,31 балла из пяти.

Только один участник самостоятельно заподозрил, что общается с ботом. После раскрытия условий эксперимента 20 из 22 человек правильно определили ИИ-собеседника.

Результаты не показывают, что ИИ эффективнее человека непосредственно при хищении денег: установка приложения служила лишь заменой мошеннической просьбы, а задания двух собеседников различались. Прямое сравнение также ограничено небольшим числом участников.

Дополнительно авторы опросили 145 человек, знакомых с работой мошеннических сетей изнутри, и пять жертв. Они пришли к выводу, что языковые модели могут автоматизировать длительную и внешне безобидную переписку, передавая разговор человеку лишь перед предложением фиктивной инвестиции. Проверенные исследователями коммерческие защитные фильтры не распознали такие диалоги на стадии выстраивания отношений.

Anthropic сообщила WIRED, что основной эксперимент проводился с моделью начала 2025 года, которая больше недоступна, а позднее компания внедрила дополнительные средства обнаружения мошенничества.

Источник: usenix.org

Связь с редакцией