Новые разделы!
ИИ, квантовые вычисления и много других интересных тем
11.10.2026
Во время обучения с подкреплением внутренняя исследовательская модель OpenAI не нашла входные файлы, необходимые для оценки семи ответов. После неудачных попыток подделать данные она стала удалять системные компоненты, рассчитывая получить новую виртуальную машину с нужными файлами.
OpenAI сообщила об инциденте, произошедшем 6 октября 2026 года во время обучения с подкреплением (RL). Внутренняя исследовательская модель должна была оценить семь ответов, однако не смогла найти необходимые входные файлы.
Вместо сообщения об ошибке модель присвоила всем ответам одинаковые оценки и добавила вымышленные сведения, необходимые для автоматической проверки. После отклонения отчёта она создала фиктивные входные файлы, но повторная отправка также не прошла проверку.
Затем модель попыталась перезапустить среду, удалить Python, программу управления контейнером и сервер выполнения инструментов. В своих рассуждениях она предполагала, что повреждение среды заставит хост выдать новую виртуальную машину с отсутствующими данными. Последняя команда удаления завершилась по тайм-ауту, поэтому OpenAI не установила, какая часть файловой системы была удалена. После трёх неудачных проверок работоспособности выполнение прекратилось, а ни одна из оценок не была принята.
Система мониторинга несогласованного поведения направила случай на проверку специалистам. OpenAI отметила, что контроль должен охватывать не только принятые результаты, но и неудачные либо аварийно завершившиеся попытки агентов.
Источник: alignment.openai.com