13.08.2026
Исследователи IIT Bombay и Adobe Research предложили инверсную языковую модель, реконструирующую вероятный запрос по одному ответу без доступа к весам исходной модели. В опытах с Qwen3-0.6B Chat точное совпадение достигло 64,77%, но при переносе на GPT-4o показатель снизился до 11,36%.
Специалисты Индийского технологического института в Бомбее (IIT Bombay) и исследовательского подразделения Adobe представили метод Previous-Token Prediction (PTP, предсказание предыдущего токена) для восстановления запросов к большим языковым моделям по тексту их ответов.
Авторы обучают инверсную языковую модель с нуля на синтетических последовательностях, получаемых через обращения к целевой LLM. Вместо следующего токена она предсказывает предыдущие, двигаясь от ответа к вероятному запросу. Метод не требует доступа к весам, логитам и внутренним представлениям исходной модели, а на этапе реконструкции ему достаточно одного ответа.
При работе с чат-версией Qwen3-0.6B от Alibaba точное совпадение с исходным запросом составило в среднем 64,77%. При применении инверсной модели, обученной на Qwen, к ответам GPT-4o от OpenAI результат снизился до 11,36% точных совпадений, хотя восстановленные запросы нередко сохраняли общий смысл оригинала.
PTP потенциально может использоваться для извлечения конфиденциальных инструкций или пользовательских запросов из опубликованных ответов. Однако авторы не демонстрировали атаку на производственные сервисы и не проверяли длинные многоабзацные системные промпты. Метод также зависит от токенизатора и требует значительного числа запросов для создания обучающего корпуса.
Источник: arxiv.org