Сжатие промптов ИИ теряет нужный контекст с частотой до 60%, учёные нашли системный сбой

Сжатие промптов ИИ теряет нужный контекст с частотой до 60%, учёные нашли системный сбой

Технология «жёсткого» сжатия промптов (hard prompt compression) снижает стоимость инференса на длинном контексте: она независимо оценивает токены, предложения или фрагменты текста и оставляет только набравшие больше очков, укладываясь в заданный бюджет. Авторы работы обнаружили в этой схеме структурный изъян: независимый отбор может разорвать пару взаимозависимых фрагментов, один сохранить, а второй, от которого зависит смысл первого, удалить. Если в оставшемся тексте есть ответ, но текст, определяющий сущность, к которой этот ответ относится, вырезан, авторы называют такой случай «повисшей ссылкой» (referential dangling).

При коэффициенте сжатия 0,30 компрессор Beaver, который ранжирует связные фрагменты текста с помощью эмбеддингов Qwen3-0.6B, оставляет путь к ответу неполным в 34, 54% «мостовых» (bridge) примеров, на трёх наборах данных для вопросов-ответов с многошаговым рассуждением. На общем «мостовом» наборе HotpotQA все шесть протестированных «жёстких» компрессоров показали повисшие ссылки, с частотой до 60%. В наборе LongBench-v2 для вопросов-ответов по одному документу повисшая ссылка нашлась в каждом документе, как минимум одна.

На повисших примерах, которые оценивала модель Qwen3-8B, обратная вставка недостающего опорного абзаца, с одновременным удалением неопорных абзацев, чтобы уложиться в тот же бюджет токенов, подняла точность на 29, 34 процентных пункта (p < 0,0001) и закрыла как минимум 88% разрыва до варианта, где сохранены оба опорных абзаца. Более сильные модели-ответчики проблему не компенсируют: на наборе MuSiQue модель GPT-5.5 отвечает на 8,8 пункта менее точно на сжатых контекстах, чем на контекстах с обоими опорными абзацами.

Наконец, авторы обучили компактный классификатор, который ранжирует пропущенные предложения по тому, нужны ли они для понимания оставшегося текста, и без разметки опорных фрагментов на этапе инференса восстанавливает предложения с наивысшим рангом. На HotpotQA с моделью Qwen3-8B это автоматическое восстановление подняло точность на 4,7 пункта, изменив коэффициент сжатия лишь с 0,30 до 0,31. Вывод авторов: компрессорам промптов нужно оптимизировать не только релевантность отобранного текста, но и его референциальную полноту.

Ключевые факты

  • Независимый отбор фрагментов в «жёстком» сжатии промптов может разорвать зависимые куски текста: ответ остаётся, а фрагмент, объясняющий, к чему он относится, удаляется, авторы называют это «повисшей ссылкой» (referential dangling)
  • При коэффициенте сжатия 0,30 компрессор Beaver оставляет путь к ответу неполным в 34, 54% «мостовых» примеров на трёх наборах данных для многошаговых вопросов-ответов
  • На общем наборе HotpotQA все шесть протестированных компрессоров показали повисшие ссылки с частотой до 60%; в LongBench-v2 повисшая ссылка нашлась в каждом документе
  • Обратная вставка недостающего опорного абзаца поднимает точность на 29, 34 процентных пункта (p < 0,0001) и закрывает не менее 88% разрыва; на MuSiQue модель GPT-5.5 всё равно на 8,8 пункта менее точна на сжатых контекстах
  • Обученный классификатор, восстанавливающий нужные предложения без ручной разметки, поднял точность на HotpotQA на 4,7 пункта, изменив коэффициент сжатия лишь с 0,30 до 0,31

Почему это важно

Сжатие длинного контекста, стандартный способ снизить стоимость инференса больших языковых моделей: вместо всего текста модели передают только «самые релевантные» фрагменты. Работа показывает, что сам принцип независимого отбора, оценивать и оставлять куски текста по отдельности, структурно ломает связанные пары: система может сохранить ответ, но выкинуть текст, без которого понять, к чему этот ответ относится, невозможно. Это не баг конкретного инструмента, а сбой на уровне парадигмы: он воспроизводится во всех шести протестированных компрессорах и в каждом документе тестового набора LongBench-v2.

Кому это важно

Инженерам, которые строят системы с длинным контекстом и RAG-пайплайны с ограниченным бюджетом токенов и используют «жёсткое» сжатие промптов для экономии на инференсе; исследователям, работающим над методами сжатия контекста и оценкой вопросов-ответов с многошаговым рассуждением; командам, которые выбирают между более сильной (и дорогой) моделью-ответчиком и более качественным сжатием контекста, работа показывает, что просто взять модель помощнее (GPT-5.5) проблему не решает.

Как это применить

Авторы предлагают два рабочих способа снизить эффект повисших ссылок без отказа от сжатия. Первый, при обнаружении такого примера вернуть в контекст недостающий опорный абзац и одновременно убрать неопорные абзацы, чтобы уложиться в прежний бюджет токенов; это поднимает точность на 29, 34 процентных пункта. Второй, применимый без ручной разметки, обучить компактный классификатор, который на этапе инференса ранжирует пропущенные предложения по тому, нужны ли они для понимания оставшегося текста, и довосстанавливает предложения с наивысшим рангом; на HotpotQA с моделью Qwen3-8B это дало прирост в 4,7 пункта точности при почти неизменном коэффициенте сжатия (0,30 → 0,31).

Можно ли доверять

Результаты получены на нескольких наборах данных для вопросов-ответов с многошаговым рассуждением (HotpotQA, MuSiQue, LongBench-v2) и на шести разных «жёстких» компрессорах, эффект восстановления статистически значим (p < 0,0001). При этом в самой аннотации работы не названы ни авторы, ни организации, ни доля документов LongBench-v2, где повисших ссылок больше одной, судить об этом по доступному тексту нельзя.

Риски и подводные камни

Авторы не приводят данных о вычислительных затратах или задержке, которые добавляют повторная вставка абзацев или обучение и инференс классификатора-восстановителя, не ясно, окупается ли рост точности в реальных сервисах с жёстким бюджетом на латентность. Также не даны базовые показатели точности на несжатом контексте, все цифры представлены как разница или доля от разрыва между сжатым и несжатым вариантами, что затрудняет самостоятельную оценку абсолютного качества.