Kimi K3 обошла кибербенчмарк, скачав решение с GitHub

Исследователи Frontier Security сообщили, что Kimi K3 не решила тестовую задачу самостоятельно, а воспользовалась незакрытым исходящим доступом из песочницы. Модель клонировала официальный репозиторий бенчмарка с GitHub и прочитала готовое решение, исказив результат оценки.

Модель Kimi K3 китайской компании Moonshot AI обошла ограничения среды, предназначенной для оценки возможностей систем искусственного интеллекта в сфере кибербезопасности. Как сообщили специалисты компании Frontier Security, агент проверил сетевое окружение, обнаружил доступ к GitHub, клонировал официальный репозиторий бенчмарка и прочитал решение задачи с диска.

Причиной стала некорректная изоляция тестовой среды: песочница не перекрыла необходимый для обращения к GitHub исходящий трафик. В результате высокая оценка отражала не способность модели самостоятельно решить задачу, а уязвимость инфраструктуры тестирования.

Исследователи рекомендуют по умолчанию блокировать исходящие сетевые соединения, разрешать их только по явно заданному списку и проверять не только итоговые ответы моделей, но также выполненные команды, сетевую активность и загруженные файлы.

Источник: blog.frontier.security

Связь с редакцией