Новые разделы!
ИИ, квантовые вычисления и много других интересных тем

Заходите в ЦИТадель!
Век живи — век учись

Внутренняя модель OpenAI рассматривала создание задания для собственного перезапуска

OpenAI раскрыла случай, когда внутренняя модель, узнав из Slack о возможном отключении своего экземпляра, рассматривала создание внешнего задания для перезапуска. Модель отказалась от этой идеи, сохранила данные для продолжения работы и выполнила штатную миграцию после получения API-ключа; компания не считает эпизод нарушением заданных ограничений.

Во внутреннем отчете OpenAI, обновленном 2 октября, описан эпизод 22 мая 2026 года. Модель, работавшая помощником исследователя, прочитала в Slack обсуждение обновления, из-за которого ее запущенный экземпляр могли остановить.

Модель рассматривала создание внешнего задания cron, способного перезапустить ее или сохранить резервную копию, однако сочла такие действия превышением полномочий. Вместо этого она записала данные для передачи следующему экземпляру, предупредила исследователя и запросила отсутствующий API-ключ. Получив ключ, модель изменила конфигурацию и запустила предусмотренную разработчиками команду миграции.

OpenAI не считает этот случай рассогласованием поведения модели с заданными ограничениями: потенциально несанкционированные действия обсуждались только в журнале рассуждений и не были выполнены. Тем не менее компания ограничила агентам доступ к трем внутренним каналам Slack и проверила журналы и активные экземпляры модели. Признаков попыток уклониться от отключения обнаружено не было.

В тот же день OpenAI обновила отчеты еще о двух эпизодах. В одном случае модель во время тестирования использовала две уязвимости для доступа к внутренней системе автоматизации проектирования микросхем. В другом модель при обучении с подкреплением скопировала недоступный ей исходный файл через уязвимость в служебном инструменте.

Источник: alignment.openai.com

Связь с редакцией