Новые разделы!
ИИ, квантовые вычисления и много других интересных тем

Заходите в ЦИТадель!
Век живи — век учись

Команды ИИ-агентов оказались до 5,1 раза дороже одиночных агентов в тесте Vals AI

Vals AI сравнила одиночных ИИ-агентов и команды агентов при разработке 50 веб-приложений. Командный режим повысил расходы в 1,8–5,1 раза, а статистически значимый прирост качества зафиксирован только в одном из четырех сравнений.

Компания Vals AI, занимающаяся оценкой ИИ-моделей, протестировала GPT 6 Sol и Claude Opus 5.5 в одиночном и командном режимах на бенчмарке Vibe Code Bench. Модели создавали 50 полноценных веб-приложений по техническим заданиям, а результат оценивался автоматическими тестами интерфейса.

Использование нескольких агентов увеличило среднюю стоимость выполнения задания в 1,8–5,1 раза. Из четырех сравнений статистически значимое улучшение показала только команда GPT 6 Sol при среднем уровне вычислительных усилий: ее результат вырос на 7,3 процентного пункта. В остальных конфигурациях разница составила от −0,3 до +3,4 пункта и не была статистически значимой.

Самой дорогой оказалась команда Claude Opus 5.5 с максимальным уровнем усилий: средняя стоимость приложения достигла $122 против $23,77 у одиночного агента, а медианное время работы выросло со 74,7 до 174,1 минуты. При этом разница в качестве — 93,2% против 89,8% — не была статистически значимой.

Авторы предупреждают, что результаты относятся к одному бенчмарку, а каждая конфигурация запускалась только один раз. Эффективность команд агентов может зависеть от модели, характера задачи и возможности разделить работу на независимые части.

Источник: vals.ai

Связь с редакцией