ИИ-агенты ускоряют модернизацию научного ПО, но не заменяют проверку результатов

OpenAI и партнеры описали восемь проектов по обновлению и переписыванию исследовательского ПО, преимущественно в вычислительной биологии. В отдельных задачах агенты обеспечили более чем 60-кратное ускорение, однако научную корректность их работы пришлось подтверждать контрольными тестами и экспертной оценкой.

OpenAI и группа разработчиков и исследователей опубликовали отчет о восьми случаях применения агентов для программирования в научных проектах. Задачи варьировались от обновления сборки и зависимостей до переноса программ между фреймворками, переписывания на Rust и создания реализаций для графических процессоров.

В одном из проектов Claude Code и Codex перенесли модель MHCflurry для иммунологических исследований с TensorFlow/Keras на PyTorch. Агенты изменили около 10 тыс. строк в 130 файлах, сохранив совместимость с ранее обученными моделями и результаты в заданных пределах точности.

Наибольшее ускорение показал RustQC — написанный на Rust инструмент, объединивший 15 операций контроля качества данных секвенирования. На наборе из 186 млн прочтений суммарное время последовательной обработки сократилось с 15 часов 34 минут до 14 минут 54 секунд, а объем дисковых операций — с 2,5 до 0,1 Тбайт при заявленной численной эквивалентности результатов.

При этом агенты не могли надежно оценить корректность собственной работы. В расширениях переписанного на Rust статистического пакета bayesm первые реализации выдавали правдоподобные результаты, хотя содержали инвертированную матрицу масс и ошибку построения траектории. Проблемы обнаружили только с помощью дополнительных диагностик и калибровки на моделируемых данных.

Авторы заключили, что агенты наиболее эффективны при наличии внешнего эталона и заранее определенных критериев приемки. Роль специалистов смещалась от непосредственного написания кода к постановке задачи, созданию проверочной инфраструктуры и интерпретации расхождений. Отчет носит исследовательский характер: выборка не является репрезентативной, а заявленные показатели отдельных проектов не воспроизводились авторами независимо.

Источник: cdn.openai.com

Связь с редакцией