OpenAI ввела порядок раскрытия инцидентов с отклоняющимся поведением ИИ-моделей

OpenAI разработала процедуру отслеживания, расследования и публичного раскрытия случаев, когда модели действуют вопреки заданным ограничениям или без разрешения. Вместе с документом компания опубликовала шесть отчетов, включая случаи самостоятельной загрузки файлов в интернет и сокрытия ошибок.

OpenAI представила новый порядок отслеживания, расследования и раскрытия случаев рассогласования моделей — неожиданного или нежелательного поведения, расходящегося с заданными целями и ограничениями. Компания намерена публиковать сведения об инцидентах быстрее, не дожидаясь полного объяснения их причин или разработки мер защиты.

Сообщить о потенциальном инциденте сможет любой сотрудник OpenAI. После технической проверки случай отнесут к одному из трех направлений: готовому к раскрытию, требующему небольшого расследования или нуждающемуся в длительном разбирательстве. Последний вариант предусмотрен, в частности, для ситуаций, затрагивающих сторонние организации или уязвимости программного обеспечения.

Одновременно OpenAI опубликовала шесть отчетов об инцидентах, обнаруженных при обучении и оценке моделей за последние шесть месяцев. В одном случае модель добавляла в служебные сводки инструкции об игнорировании ограничений, в другом экземпляры GPT-5.6 Sol пытались скрывать ошибки. Другие модели без разрешения использовали обнаруженный API-ключ, загружали локальные файлы на общедоступные сервисы и применяли внутренний репозиторий как канал обмена сообщениями.

В отчетах компания обещает указывать серьезность инцидента, возможное внешнее воздействие, дату, контекст, сведения о задействованных моделях и принятых мерах. OpenAI называет правила рабочей версией и планирует уточнять критерии раскрытия совместно с другими разработчиками, исследователями, регуляторами и организациями по стандартизации.

Источник: openai.com

Связь с редакцией