Новые разделы!
ИИ, квантовые вычисления и много других интересных тем
11.10.2026
Vals AI сравнила одиночных ИИ-агентов и команды агентов при разработке 50 веб-приложений. Командный режим повысил расходы в 1,8–5,1 раза, а статистически значимый прирост качества зафиксирован только в одном из четырех сравнений.
Компания Vals AI, занимающаяся оценкой ИИ-моделей, протестировала GPT 6 Sol и Claude Opus 5.5 в одиночном и командном режимах на бенчмарке Vibe Code Bench. Модели создавали 50 полноценных веб-приложений по техническим заданиям, а результат оценивался автоматическими тестами интерфейса.
Использование нескольких агентов увеличило среднюю стоимость выполнения задания в 1,8–5,1 раза. Из четырех сравнений статистически значимое улучшение показала только команда GPT 6 Sol при среднем уровне вычислительных усилий: ее результат вырос на 7,3 процентного пункта. В остальных конфигурациях разница составила от −0,3 до +3,4 пункта и не была статистически значимой.
Самой дорогой оказалась команда Claude Opus 5.5 с максимальным уровнем усилий: средняя стоимость приложения достигла $122 против $23,77 у одиночного агента, а медианное время работы выросло со 74,7 до 174,1 минуты. При этом разница в качестве — 93,2% против 89,8% — не была статистически значимой.
Авторы предупреждают, что результаты относятся к одному бенчмарку, а каждая конфигурация запускалась только один раз. Эффективность команд агентов может зависеть от модели, характера задачи и возможности разделить работу на независимые части.
Источник: vals.ai