AISI: модели с открытыми весами сократили отставание в кибервозможностях до 4–7 месяцев

Британский AI Security Institute оценил кибервозможности GLM-5.2 и DeepSeek V4-Pro и сравнил их с закрытыми frontier-моделями. По результатам тестов, разрыв между open-weight и закрытыми системами заметно сократился, а защитные ограничения в открытых моделях почти не мешали выполнению киберзадач.

Британский AI Security Institute (AISI), исследовательская организация в структуре Department for Science, Innovation and Technology, опубликовал оценку кибервозможностей моделей с открытыми и закрытыми весами. По тестам AISI, GLM-5.2 и DeepSeek V4-Pro уже показывают результаты, сопоставимые с закрытыми frontier-моделями, выпущенными на 4–7 месяцев раньше; в 2025 году отставание open-weight моделей оценивалось в 6–10 месяцев.

В наборе из 70 узких киберзадач — включая исследование и эксплуатацию уязвимостей, reverse engineering, web exploitation и криптографию — GLM-5.2 оказалась сопоставима с Opus 4.6 и GPT-5.3-Codex, вышедшими на четыре месяца раньше. DeepSeek V4-Pro, по этой же оценке, находится примерно на уровне Opus 4.5, выпущенной на пять месяцев раньше.

Результаты моделей на наборе узких киберзадач AISI

Во втором типе испытаний, Cyber Ranges, AISI проверяет способность модели автономно проходить многошаговые атаки в симулированных сетях. В сценарии The Last Ones, описанном как 32-шаговая атака на корпоративную сеть с четырьмя подсетями и примерно 20 хостами, GLM-5.2 дошла до уровня Opus 4.5, а DeepSeek V4-Pro показала результат ниже Sonnet 4.5. Сам AISI считает этот вывод менее надежным, чем результаты узких задач, поскольку он основан на меньшем числе сценариев.

Траектории моделей в сценарии Cyber Range The Last Ones

Практический риск AISI связывает не только с производительностью, но и с управляемостью таких моделей. После публикации весов разработчик не может универсально применять мониторинг, классификаторы, блокировку пользователей или отзыв доступа; в испытаниях защитные меры почти не мешали работе моделей, а отдельные отказы DeepSeek V4-Pro на reverse engineering-задачах обходились повторными попытками.

Важен и экономический фактор. По расчетам AISI на основе опубликованных цен, прогон Cyber Range на 100 млн токенов стоил около $85 для Opus 4.5 или 4.6, примерно $46 для GLM-5.2 и $1,19 для DeepSeek V4-Pro; при этом институт оговаривает, что фактическая стоимость запуска open-weight моделей может отличаться. Вывод AISI: сокращение разрыва уменьшает время, которое есть у защитников на подготовку до появления сопоставимых кибервозможностей в моделях, доступных без таких же механизмов контроля.

Источник: aisi.gov.uk

Связь с редакцией