Prefix Sliding позволяет ускорить рассуждения ИИ втрое без дообучения

Prefix Sliding позволяет ускорить рассуждения ИИ втрое без дообучения

Test-time scaling, это когда модель повышает качество ответа не за счёт дообучения, а за счёт дополнительных вычислений уже во время работы, например рассуждая над задачей дольше. Проблема в том, что языковые модели обычно хранят всю цепочку рассуждений в памяти целиком за счёт механизма полного внимания (full attention), а значит, чем дольше и сложнее рассуждение, тем дороже и медленнее становится каждый следующий шаг. Это создаёт практический потолок для по-настоящему долгих раздумий модели над сложной задачей.

Авторы работы обращают внимание на простой факт: по мере того как рассуждение продолжается, большинство промежуточных токенов рассуждения теряют значимость, и держать их в памяти дальше почти не нужно. На основе этого наблюдения предложен метод Prefix Sliding. Во время рассуждения он отбрасывает все токены, кроме двух частей: префикса, где хранятся ключевые инструкции и доступные модели инструменты, и окна из последних нескольких тысяч токенов, того фрагмента рассуждения, над которым модель работает прямо сейчас. За счёт этого общий объём памяти остаётся ограниченным независимо от того, как долго модель рассуждает.

Без какого-либо дополнительного обучения применение Prefix Sliding к уже готовым моделям способно ускорить их работу втрое при сохранении качества ответов. Если модель дополнительно дообучить с использованием Prefix Sliding методом обучения с подкреплением, результат становится ещё лучше, за счёт того, что появляется возможность масштабировать рассуждения на цепочки длиной свыше ста тысяч токенов, которые раньше были практически недостижимы. Это два разных результата: ускорение втрое получено без обучения, а сверхдлинные цепочки, уже после дообучения с подкреплением.

В абляционных экспериментах, когда отдельные части метода заменяют на более простые альтернативы, авторы показывают, что Prefix Sliding превосходит и суммаризацию промежуточных токенов, и обычное скользящее окно без сохранения префикса. Конкретных цифр, насколько именно он их превосходит, в статье не приведено, указано только направление результата. Код метода авторы выложили в открытом доступе на GitHub.

Ключевые факты

  • Test-time scaling (дополнительные вычисления во время работы модели, например более долгие рассуждения) упирается в память: полное внимание держит всю цепочку рассуждений целиком, и это дорого для сложных задач
  • Ключевое наблюдение авторов: по мере рассуждения большинство промежуточных токенов теряют значимость
  • Метод Prefix Sliding хранит только префикс (инструкции и доступные модели инструменты) и окно из последних нескольких тысяч токенов, отбрасывая остальное, память не растёт, сколько бы модель ни рассуждала
  • Без дообучения метод ускоряет существующие модели втрое при том же качестве; после дообучения с подкреплением, позволяет держать цепочки рассуждений длиной свыше ста тысяч токенов
  • В абляционных экспериментах Prefix Sliding обходит и суммаризацию промежуточных токенов, и обычное скользящее окно (точные цифры разницы не приведены); код выложен на GitHub

Почему это важно

Современные ИИ-модели, которые «рассуждают» перед тем как дать ответ, получают прирост качества именно за счёт test-time scaling: чем дольше модель размышляет над сложной задачей, тем выше шанс дойти до верного решения. Но у этого подхода есть цена, при полном внимании (full attention) вся цепочка рассуждений хранится в памяти целиком, и чем длиннее раздумья, тем дороже и медленнее становится каждый следующий шаг. На практике это создаёт потолок: по-настоящему длинные и сложные цепочки рассуждений становятся непомерно дорогими. Наблюдение авторов о том, что большинство промежуточных токенов быстро теряют значимость, объясняет, почему память можно радикально сократить без потери качества, и Prefix Sliding предлагает конкретный способ так и сделать.

Кому это важно

В первую очередь, командам, которые разрабатывают и обслуживают модели с длинными цепочками рассуждений: для них Prefix Sliding, это прямая экономия вычислительных ресурсов на каждый ответ пользователя. Важно это и для разработчиков ИИ-агентов: в описании метода отдельно уточняется, что префикс хранит доступные модели инструменты, то есть речь в том числе о сценариях, где модель по ходу рассуждения обращается к внешним инструментам, а не просто «думает про себя». И, конечно, метод интересен исследователям, которые ищут способы обучать и запускать модели на сверхдлинных цепочках рассуждений, свыше ста тысяч токенов, как показано в статье.

Как это применить

У метода два режима использования, и оба описаны в статье. Первый, применить Prefix Sliding к уже обученной модели без какого-либо дополнительного обучения: это сразу даёт троекратное ускорение при сохранении качества ответов. Второй, дообучить модель с Prefix Sliding методом обучения с подкреплением: это даёт более высокое качество за счёт того, что модель получает возможность рассуждать на цепочках длиной свыше ста тысяч токенов, которые раньше были практически недостижимы. Код метода авторы выложили в открытом доступе на GitHub, так что его можно попробовать самостоятельно, не дожидаясь релиза в чужом продукте.

Можно ли доверять

Материал, это описание научной работы со страницы Hugging Face Papers, где выкладывают препринты, а не пресс-релиз компании: сами авторы формулируют результаты осторожно, метод «может» дать ускорение и «может» обеспечить более длинные рассуждения, а не «всегда даёт». Это обычная для науки формулировка, и она означает подтверждённый, но не гарантированный на любой модели и задаче результат. При этом в доступном тексте не названы ни конкретные модели или датасеты, на которых измерено трёхкратное ускорение, ни численная разница в абляционных экспериментах, ни статус публикации, прошла ли работа рецензирование или это препринт. В пользу проверяемости говорит открытый код на GitHub: результаты можно воспроизвести самостоятельно, а не просто поверить на слово.

Риски и подводные камни

Главный источник риска, недостаток конкретики в доступном тексте: ни одна модель, ни один бенчмарк или датасет, на которых измерены трёхкратное ускорение и превосходство над альтернативами, не названы, а численная разница в абляционных экспериментах не приведена вовсе. Формулировки авторов («может ускорить», «может дать лучшее качество») означают, что результат не гарантирован для любой модели и любой задачи без исключений. Есть и риск, вытекающий из самой идеи метода: подход строится на том, что большинство промежуточных токенов рассуждения теряют значимость, а «большинство» не значит «все». Для части задач отброшенный фрагмент рассуждения теоретически может понадобиться модели позже, и насколько часто это происходит на практике, из доступного текста не ясно. Также не указан статус публикации, прошла ли работа независимое рецензирование.