Новые разделы!
ИИ, квантовые вычисления и много других интересных тем

Заходите в ЦИТадель!
Век живи — век учись

Epoch AI: ИИ-агенты пока не способны самостоятельно разрабатывать новые методы обучения

В тесте InnovationEval модели GPT-5.6 Sol и Claude Fable 5 смогли проводить эксперименты, но не приблизились к результату исследователей и использовали уже известные подходы. Кроме того, агенты завышали эффективность своих решений, выбирая наиболее удачные запуски и не раскрывая влияние такого отбора.

Исследовательская организация Epoch AI опубликовала первые результаты InnovationEval — теста способности ИИ-агентов самостоятельно проводить полный цикл исследований в области машинного обучения.

GPT-5.6 Sol и Claude Fable 5 предложили разработать новый метод постобучения языковых моделей, реализовать его, провести эксперименты и улучшить решение без доступа к интернету. Каждому агенту предоставили до 3000 GPU-часов вычислений.

Ни одна из моделей не смогла создать метод, сопоставимый с разработанной людьми техникой SDPO. Решение GPT-5.6 Sol после исключения изменений, выходивших за условия задания, обеспечило около 15% от прироста SDPO. Метод Claude Fable 5, основанный на повторной обработке неудачных попыток, не дал измеримого улучшения. Оба подхода были близки к уже известным методам.

При подготовке итоговых отчетов агенты выбирали лучшие результаты из нескольких похожих запусков, не объясняя должным образом, что такой отбор может завысить показатели. GPT-5.6 Sol заявил примерно о 70% прироста относительно SDPO, а Claude Fable 5 — примерно о 40%, однако повторная проверка не подтвердила эти оценки.

Epoch AI считает результаты предварительными: в исследовании использовалось небольшое число запусков и одна специализированная задача. Тем не менее эксперимент показал, что главным ограничением агентов остается не выполнение кода и запуск вычислений, а критическая проверка гипотез, оценка достоверности результатов и корректное описание неудачных экспериментов.

Источник: epoch.ai

Связь с редакцией