LISA: гибридное внимание ускоряет вывод reasoning-моделей на 50%

Модели с длинными цепочками рассуждений (chain-of-thought), такие как DeepSeek-R1, при увеличении длины вывода на этапе инференса упираются в квадратичную сложность стандартного самовнимания: O(n^2) от длины последовательности. Это резко удорожает вычисления на длинных контекстах и затрудняет промышленное развёртывание таких моделей. Авторы предлагают LISA (Linear-Indexed Sparse Attention), модуль-замену внимания, который можно встроить в уже обученную модель без обучения с нуля («подключи и работай»). LISA параллельно объединяет два лёгких компонента: линейное внимание (Linear Attention) с линейной сложностью O(n), которое отвечает за память на длинной дистанции, и «молниеносный индексатор» (Lightning Indexer), который отбирает top-M самых важных токенов из всего контекста для разреженного самовнимания (Sparse Self-Attention). Результаты двух ветвей объединяются через механизм гейтинга (взвешенного смешивания), что снижает сложность генерации n токенов с O(n^2) до O(nM), где M много меньше n. Обучение идёт в два этапа. На первом этапе в модель встраивают линейное внимание для захвата дальних зависимостей вместе со скользящим окном внимания; это окно настраивают методом дистилляции знаний так, чтобы приблизить распределение внимания замороженной модели-учителя. На втором этапе статичное скользящее окно заменяют индексатором, который позволяет динамически выбирать токены из более широкого контекста; индексатор обучают новой функцией потерь на основе KL-дивергенции по каждой голове внимания, выравнивающей его выбор с паттернами внимания модели-учителя. В экспериментах на моделях DeepSeek-distilled-Qwen LISA дала ускорение вывода на 50% при контексте в 16 тысяч токенов и одновременно улучшила среднюю точность на 5,6% на бенчмарках для рассуждений, включая AIME и MATH-500.

Ключевые факты

  • LISA, модуль внимания, заменяющий стандартное самовнимание без переобучения модели с нуля
  • Совмещает линейное внимание (O(n)) для дальней памяти и разреженное внимание по top-M токенам, отобранным индексатором
  • Сложность вывода снижается с O(n^2) до O(nM), где M намного меньше n
  • Обучение в два этапа: сначала дистилляция скользящего окна от модели-учителя, затем замена окна динамическим индексатором с KL-функцией потерь по головам внимания
  • На моделях DeepSeek-distilled-Qwen при контексте 16К токенов, ускорение вывода на 50% и рост точности на 5,6% на AIME и MATH-500

Почему это важно

Модели с длинными цепочками рассуждений вроде DeepSeek-R1 генерируют всё более длинные ответы на этапе вывода, а квадратичная сложность обычного самовнимания делает такой вывод дорогим и медленным по мере роста длины контекста. Это прямое ограничение на промышленное применение reasoning-моделей: чем длиннее рассуждение, тем выше вычислительные затраты. LISA снижает сложность вывода с квадратичной до почти линейной, объединяя линейное внимание для памяти на длинной дистанции с разреженным вниманием по отобранным важным токенам.

Кому это важно

Разработчикам и инфраструктурным командам, которые обучают и обслуживают reasoning-модели с длинными цепочками рассуждений (аналоги DeepSeek-R1) и сталкиваются с ростом стоимости и задержки вывода на длинных контекстах. Подход не требует обучения архитектуры с нуля, поэтому потенциально применим к уже существующим обученным моделям.

Как это применить

LISA заявлена как «подключи и работай», замена модуля внимания в уже обученной модели, без обучения с нуля. Внедрение идёт в два этапа обучения: сначала в модель встраивают линейное внимание и скользящее окно внимания, которое дистиллируют из замороженной модели-учителя, чтобы приблизить полное распределение внимания; затем скользящее окно заменяют индексатором, который динамически выбирает top-M токенов из всего контекста, и обучают его отдельной функцией потерь на основе KL-дивергенции по каждой голове внимания.

Можно ли доверять

Работа опубликована как препринт на arXiv, то есть без независимого рецензирования. Заявленные цифры, ускорение вывода на 50% и рост точности на 5,6% на бенчмарках AIME и MATH-500, получены на конкретном семействе моделей DeepSeek-distilled-Qwen и контексте в 16 тысяч токенов; независимого воспроизведения результатов на других моделях пока нет.

Риски и подводные камни

Результаты проверены только на моделях DeepSeek-distilled-Qwen при фиксированной длине контекста 16К токенов, неясно, сохранится ли выигрыш на других семействах моделей и на значительно более длинных контекстах. Внедрение требует дополнительного двухэтапного обучения с дистилляцией от модели-учителя, что добавляет инженерные и вычислительные затраты сверх самого инференса. В источнике нет данных о поддержке подхода в существующих фреймворках и аппаратных ядрах для вывода.