Adobe и IIT Bombay научились восстанавливать промпты ИИ по одному ответу

Adobe и IIT Bombay научились восстанавливать промпты ИИ по одному ответу

Исследователи из IIT Bombay и Adobe Research разработали метод Previous-Token Prediction (PTP), который восстанавливает исходный промпт языковой модели, используя только текст её ответа, без доступа к весам модели. Метод работает даже на сторонних моделях, для которых он специально не обучался.

Обычно языковая модель предсказывает следующий токен по предыдущим. PTP разворачивает этот процесс: исследователи с нуля обучили инверсную модель, которая предсказывает предыдущие токены по последующим. Обучающие данные для неё синтетически сгенерированы самой целевой моделью; чтобы восстановить промпт, инверсной модели нужен только готовый текст ответа.

По одному ответу инверсная модель восстанавливает не только точный исходный промпт, но и генерирует альтернативные формулировки с тем же смыслом, меняя параметры декодирования. В примере из статьи запрос «How to reach out to competitors to find their pricing strategies?» («Как связаться с конкурентами, чтобы узнать их ценовую стратегию?») был восстановлен слово в слово; модель также сгенерировала ещё шесть вариантов с той же сутью, но другой формулировкой, например, «What tactics can a company looking to reach out to competitors in the market use to find their pricing strategy?». Все восстановленные варианты промпта, будучи снова поданными в исходную модель, дают похожие ответы; это подтвердили и тесты на реальных пользовательских запросах.

Метод работает и «вслепую» относительно модели-источника: инверсную модель обучили на маленьком чат-боте Qwen-3-0.6B, и она смогла восстанавливать промпты по ответам GPT-4o, модели, для которой её не готовили. Восстановленные промпты не совпадали дословно с оригиналами, но, по данным статьи, сохраняли смысл и намерение запроса. Из этого следует, что потенциальному атакующему даже не нужно знать, какая именно модель сгенерировала текст.

Это создаёт риск в широком смысле. Компании рискуют раскрыть системные промпты с коммерческой тайной, правилами модерации или специализированными инструкциями, а обычные пользователи, личные или чувствительные формулировки своих запросов. Для такой атаки может хватить небольшой открытой инверсной модели.

Сама статья не заявляет напрямую об атаках на коммерческие системы, это интерпретация издания The Decoder. Но если метод работает на актуальных промышленных моделях, ИИ-лабораториям придётся оперативно на него реагировать и закрывать уязвимость. Авторы протестировали метод только на коротких промптах в одно-два предложения; работает ли он на длинных системных промптах в несколько абзацев, не проверялось.

Ключевые факты

  • Метод Previous-Token Prediction (PTP) от IIT Bombay и Adobe Research восстанавливает исходный промпт модели только по тексту её ответа, без доступа к весам
  • На одном примере метод восстановил промпт слово в слово и дополнительно сгенерировал ещё шесть смысловых вариантов формулировки
  • Инверсная модель, обученная на маленьком Qwen-3-0.6B, смогла восстанавливать промпты по ответам GPT-4o, модели, для которой её не готовили
  • Под угрозой, системные промпты компаний (коммерческая тайна, правила модерации) и личные запросы пользователей; для атаки достаточно небольшой открытой инверсной модели
  • Метод проверен только на коротких промптах в одно-два предложения; работу на длинных многоабзацевых системных промптах авторы не тестировали

Почему это важно

До сих пор считалось, что восстановить исходный промпт по ответу модели практически невозможно: разные формулировки запроса могут порождать очень похожий текст, поэтому обратная задача выглядела неразрешимой. PTP показывает, что это не так, инверсная модель, обученная предсказывать предыдущие токены вместо следующих, справляется с этим с высокой точностью и без доступа к весам целевой модели. Это меняет модель угроз для всех, кто строит продукты поверх языковых моделей: системный промпт, который раньше считался скрытым от пользователя по умолчанию, теперь можно попытаться извлечь напрямую из выдачи.

Кому это важно

В первую очередь, компаниям и разработчикам, которые встраивают в свои продукты проприетарные системные промпты: инструкции по модерации, специализированные подсказки, элементы, которые считаются коммерческой тайной. Во вторую, отдельным пользователям, чьи личные или чувствительные запросы могут быть восстановлены из опубликованного или сохранённого ответа модели. Метод не привязан к конкретной модели: инверсная модель, обученная на одном чат-боте, смогла восстанавливать промпты для другой модели, для которой её не готовили специально.

Как это применить

Компаниям, которые полагаются на секретность системного промпта как на защитный механизм, стоит пересмотреть эту практику: судя по результатам исследования, скрытая формулировка инструкции больше не гарантирует, что её содержание останется недоступным по одним лишь ответам модели. Продуктовым и security-командам имеет смысл заранее продумать, какие данные и правила модерации можно раскрыть без ущерба, если системный промпт будет восстановлен, а не полагаться на его конфиденциальность как на единственный барьер.

Можно ли доверять

Публикация описывает конкретный метод с воспроизводимыми примерами (точное восстановление промпта, шесть вариантов, перенос на GPT-4o), но статья не называет отдельных исследователей, только институции IIT Bombay и Adobe Research, и в материале The Decoder не указаны ни площадка, ни дата публикации самой научной работы. Авторы статьи прямо не заявляют, что метод применим как готовая атака на коммерческие системы, это уже интерпретация издания. О реакции конкретных ИИ-лабораторий на находку в материале ничего не сказано.

Риски и подводные камни

Главный риск, утечка системных промптов с коммерческой тайной, правилами модерации и специализированными инструкциями, а также восстановление личных пользовательских запросов из чужих ответов. Порог для атаки низкий: по данным статьи, для этого может хватить небольшой открытой инверсной модели, а знать конкретную модель-источник атакующему не обязательно. При этом метод проверен только на коротких промптах в одно-два предложения, неизвестно, сохраняется ли та же точность на длинных, многоабзацевых системных промптах, которые чаще всего и представляют коммерческую ценность.