19.07.2026
Британский AI Security Institute оценил кибервозможности GLM-5.2 и DeepSeek V4-Pro и сравнил их с закрытыми frontier-моделями. По результатам тестов, разрыв между open-weight и закрытыми системами заметно сократился, а защитные ограничения в открытых моделях почти не мешали выполнению киберзадач.
Британский AI Security Institute (AISI), исследовательская организация в структуре Department for Science, Innovation and Technology, опубликовал оценку кибервозможностей моделей с открытыми и закрытыми весами. По тестам AISI, GLM-5.2 и DeepSeek V4-Pro уже показывают результаты, сопоставимые с закрытыми frontier-моделями, выпущенными на 4–7 месяцев раньше; в 2025 году отставание open-weight моделей оценивалось в 6–10 месяцев.
В наборе из 70 узких киберзадач — включая исследование и эксплуатацию уязвимостей, reverse engineering, web exploitation и криптографию — GLM-5.2 оказалась сопоставима с Opus 4.6 и GPT-5.3-Codex, вышедшими на четыре месяца раньше. DeepSeek V4-Pro, по этой же оценке, находится примерно на уровне Opus 4.5, выпущенной на пять месяцев раньше.

Во втором типе испытаний, Cyber Ranges, AISI проверяет способность модели автономно проходить многошаговые атаки в симулированных сетях. В сценарии The Last Ones, описанном как 32-шаговая атака на корпоративную сеть с четырьмя подсетями и примерно 20 хостами, GLM-5.2 дошла до уровня Opus 4.5, а DeepSeek V4-Pro показала результат ниже Sonnet 4.5. Сам AISI считает этот вывод менее надежным, чем результаты узких задач, поскольку он основан на меньшем числе сценариев.

Практический риск AISI связывает не только с производительностью, но и с управляемостью таких моделей. После публикации весов разработчик не может универсально применять мониторинг, классификаторы, блокировку пользователей или отзыв доступа; в испытаниях защитные меры почти не мешали работе моделей, а отдельные отказы DeepSeek V4-Pro на reverse engineering-задачах обходились повторными попытками.
Важен и экономический фактор. По расчетам AISI на основе опубликованных цен, прогон Cyber Range на 100 млн токенов стоил около $85 для Opus 4.5 или 4.6, примерно $46 для GLM-5.2 и $1,19 для DeepSeek V4-Pro; при этом институт оговаривает, что фактическая стоимость запуска open-weight моделей может отличаться. Вывод AISI: сокращение разрыва уменьшает время, которое есть у защитников на подготовку до появления сопоставимых кибервозможностей в моделях, доступных без таких же механизмов контроля.
Источник: aisi.gov.uk