Учёные описали «отравление контекста», почему языковые модели теряют нужный факт в длинном тексте

Исследователи предложили теоретическое объяснение того, почему языковые модели с длинным контекстным окном хуже находят нужный факт, если вокруг него добавляется посторонний, но похожий по форме текст. Они называют это явление «отравлением контекста» (context poisoning) и описывают его как экстремальное вмешательство во внимание модели: оценка релевантности решающего факта ограничена сверху, а максимальная оценка среди «отвлекающих» фрагментов растёт вместе с их числом.

В рамках модели поиска через softmax авторы вывели верхнюю границу для конечной выборки: чтобы удержать точность выше базового уровня, отрыв решающего факта от «отвлекающих» фрагментов (evidence margin) должен расти как Ω(√log N), где N, не длина контекста сама по себе, а число эффективных «отвлекающих» фрагментов. Анализ связывает деградацию с тремя причинами: подменой оценок (score aliasing), позиционной путаницей (positional aliasing) и «размытием» softmax при росте числа кандидатов.

В контролируемых экспериментах точность поиска решающего факта падала по мере роста общего объёма контекста, если в него были встроены «трудные» отвлекающие фрагменты (hard negatives). Наибольшее падение точности среди проверенных вариантов давали отвлекающие фрагменты, совпадающие по формату с искомым фактом. Отдельный приём, retrieval gating (предварительная фильтрация перед поиском), улучшал использование доказательств, но его польза зависела от того, не теряются ли при этом релевантные фрагменты (полнота, recall).

На основе этих результатов авторы предлагают направления для защиты: «бутылочные горлышки доказательств» (evidence bottlenecks), устойчивые к подмене представления, архитектуры «сначала найти, потом рассуждать» (retrieve-then-reason), память с проверкой через верификатор и контрастивное обучение, направленное против «отравления» (anti-poison training).

Ключевые факты

  • Работа формализует «отравление контекста» как экстремальное вмешательство во внимание: оценка решающего факта ограничена сверху, а максимум среди отвлекающих фрагментов растёт с их числом.
  • Выведена теоретическая граница: чтобы держать точность выше базового уровня, отрыв решающего факта от «шума» должен расти как Ω(√log N) от числа эффективных отвлекающих фрагментов, а не от длины контекста напрямую.
  • В экспериментах точность поиска падает с ростом контекста при встроенных «трудных» отвлекающих фрагментах, особенно совпадающих по формату с искомым фактом.
  • Retrieval gating (предварительная фильтрация) улучшает использование доказательств, но только если не теряет нужные фрагменты.
  • Предложены меры защиты: «бутылочные горлышки доказательств», устойчивые к подмене представления, архитектуры retrieve-then-reason, верифицируемая память, контрастивное anti-poison обучение.

Почему это важно

Рост контекстного окна долго подавался как прямой путь к тому, чтобы модель «помнила» и использовала весь поданный ей материал. Эта работа даёт формальное объяснение обратному эффекту: сам факт добавления большого количества похожего, но нерелевантного текста снижает шанс, что модель опознает решающий факт, и показывает это не только на экспериментах, но и как математическую границу для softmax-механизма поиска.

Кому это важно

В первую очередь, командам, которые строят системы с длинным контекстом и поиском по документам (RAG, агентные системы с большой памятью, юридический и медицинский анализ документов): именно там в контекст неизбежно попадает много похожего, но постороннего текста. Также работа адресована исследователям архитектур внимания и авторам бенчмарков для длинного контекста.

Как это применить

Авторы формулируют не готовый инструмент, а набор архитектурных принципов: сужать поток документов до «бутылочного горлышка доказательств» перед тем, как модель рассуждает над ними; использовать представления, устойчивые к подмене похожих фрагментов; строить конвейер «сначала найти, потом рассуждать» вместо того, чтобы отдавать модели весь контекст целиком; добавлять верификатор, который перепроверяет память модели; и обучать модель контрастивно, на примерах с намеренно похожими отвлекающими фрагментами.

Можно ли доверять

Источник, препринт на arXiv, то есть работа не прошла (или пока не прошла) рецензирование в журнале или на конференции. В самом тексте аннотации не названы ни авторы, ни их институциональная принадлежность, ни конкретные модели или датасеты, на которых ставились эксперименты, судить о применимости выводов к конкретным продуктовым LLM по одной аннотации нельзя. При этом заявленная теоретическая граница выведена аналитически, а экспериментальная часть описана как контролируемая, хотя числовые значения точности в тексте не приведены, сравнения даны только качественно («наибольшее падение»).

Риски и подводные камни

Граница Ω(√log N), асимптотическая математическая оценка, а не измеренная величина деградации на реальных моделях, и в аннотации нет данных о том, на каком масштабе контекста и с какими моделями эффект уже практически заметен. Retrieval gating, предложенный как смягчение, сам создаёт компромисс: агрессивная фильтрация может отсекать нужные фрагменты вместе с отвлекающими. Наконец, ни сроков, ни готовности предложенных архитектурных мер к практическому внедрению источник не указывает.