18.09.2026
Исследователи Lasso Security обнаружили, что включение невидимого водяного знака SynthID-Text способно менять не только формулировки ответов, но также защитные отказы и вызовы инструментов в больших языковых моделях. В тестах на моделях с открытыми весами эффект усиливался при инъекции промпта: некоторые модели чаще выполняли вредоносные инструкции, которые без маркировки отклоняли.
Компания Lasso Security, специализирующаяся на безопасности систем искусственного интеллекта, 17 сентября опубликовала результаты исследования влияния SynthID-Text. Этот разработанный Google DeepMind механизм маркирует созданный большой языковой моделью (LLM) текст, изменяя выбор токенов при генерации, чтобы происхождение ответа можно было определить с помощью ключа.
В тестах вызова инструментов на наборе BFCL v4 маркировка снизила точность у шести из семи моделей с открытыми весами, причём для четырёх снижение было статистически значимым. В среднем по 21 сочетанию модели и температуры результат отдельных вызовов менялся в 6,5% случаев: модель могла выбрать другой инструмент, передать неверный аргумент или сформировать некорректную команду.

Защитное поведение проверяли на шести моделях с использованием 200 вредоносных запросов HarmBench и 100 безопасных примеров JailbreakBench. При добавлении фиксированной инъекции промпта различия стали заметнее: например, у gemma-3-27b при температуре 0,001 доля запросов с изменившимся результатом достигла 23,5%, а доля выполненных вредоносных инструкций выросла на 12,5 процентного пункта.

Авторы подчёркивают, что эксперименты проводились с реализацией SynthID-Text из Hugging Face и не охватывали будущую систему маркировки Claude. Они рекомендуют повторять оценку безопасности и тестирование на проникновение с той же конфигурацией и ключом водяного знака, которые будут использоваться в рабочей среде.
Источник: lasso.security