Учёные нашли два типа «массивных активаций» в гибридных LLM с линейным вниманием, пики и плато

Учёные нашли два типа «массивных активаций» в гибридных LLM с линейным вниманием, пики и плато

«Массивные активации», отдельные аномально большие по величине активации внутри модели, уже описаны в обычных LLM с полным вниманием. Авторы новой работы проверили, что происходит с этим явлением в гибридных архитектурах, которые чередуют слои линейного внимания со слоями полного внимания по всей глубине сети, и представляют, по их собственному описанию, первое системное исследование массивных активаций именно для этого класса моделей.

Работа выявила две устойчивые формы, привязанные к самой архитектуре модели. Первая, «пики перед вниманием» (PAS): непосредственно перед каждым слоем полного внимания величина активаций резко подскакивает. Вторая, «плато между пиками» (ISP): повышенное значение не гасится сразу после пика, а сохраняется на всём протяжении промежуточных слоёв линейного внимания вплоть до следующего слоя полного внимания, образуя своего рода плато. Чем плотнее в архитектуре расставлены слои полного внимания, тем сильнее соседние пики срастаются через такие плато, а в пределе, когда полное внимание используется на каждом слое, вся картина стягивается в ту самую устойчивую морфологию массивных активаций, которая уже известна по обычным, негибридным LLM с полным вниманием.

Закономерность проверена не на одной модели: авторы подтвердили её на пяти архитектурах линейного внимания, шести вариантах гибридизации (то есть способах комбинировать слои линейного и полного внимания) и пяти доменах данных, а также на репрезентативных открытых гибридных моделях с суммарным числом параметров от 1,2 до 397 млрд. Конкретные названия архитектур, моделей и доменов данных в тексте аннотации не приводятся.

Отдельно авторы провели контролируемое предобучение гибридных моделей на архитектуре линейного внимания GDN, с нуля, на масштабах с суммарным числом параметров до 1,3 млрд, чтобы проверить, как на пики и плато влияет гейтирование. Обе формы возникают уже на раннем этапе обучения и по-разному реагируют на разные гейты. Гейтирование на выходе слоёв полного внимания резко снижает абсолютную величину пиков и плато, но не убирает саму послойную организацию, пики и плато остаются на своих местах, просто становятся меньше. А удаление гейтов внутри самой архитектуры GDN даёт лишь умеренное усиление величины, то есть эффект гейтирования в слоях полного внимания оказался заметно сильнее, чем эффект гейтов линейного внимания.

Механистически авторы связывают оба паттерна одним общим жизненным циклом активации, различающимся только моментом её «отмены»: анализ систематических выбросов показывает, что PAS формируется по локализованной схеме «запись, сток, отмена», тогда как продолжительное существование ISP связано именно с отложенной отменой. В пределе, когда в модели используется только полное внимание, та же логика воспроизводит устойчивую морфологию массивных активаций, характерную для обычных LLM с полным вниманием.

Код для воспроизведения анализа выложен в открытом доступе на GitHub (StartluxLabs/Massive-Activations-HLA). Первым в списке авторов на странице материала указан Zunhai Su; полный состав соавторов, организация, площадка и статус рецензирования в тексте аннотации не названы, как и сравнения с предыдущими работами, кроме собственной формулировки авторов «первое системное исследование».

Ключевые факты

  • Массивные активации в гибридных LLM с линейным вниманием складываются в две устойчивые формы: пики перед каждым слоем полного внимания (PAS) и плато, которые сохраняются в промежуточных слоях линейного внимания между ними (ISP).
  • Закономерность подтверждена на пяти архитектурах линейного внимания, шести вариантах гибридизации, пяти доменах данных и открытых моделях с суммарным числом параметров от 1,2 до 397 млрд.
  • Чем плотнее в архитектуре расставлены слои полного внимания, тем сильнее пики срастаются через плато, в пределе получается та же устойчивая морфология активаций, что и в обычных LLM с полным вниманием.
  • Контролируемое предобучение гибридных моделей на архитектуре GDN (с суммарным числом параметров до 1,3 млрд) показало: гейтирование на выходе слоёв полного внимания резко снижает величину пиков и плато, а удаление гейтов GDN даёт лишь умеренное усиление, реакция асимметрична.
  • Авторы объясняют оба паттерна общим циклом с разным моментом отмены активации: у PAS отмена происходит локально и быстро («запись, сток, отмена»), у ISP, с задержкой; код анализа выложен в открытом доступе на GitHub.

Почему это важно

Массивные активации, отдельные аномально большие по величине активации внутри модели, уже описаны в обычных LLM с полным вниманием, но в гибридных архитектурах, которые чередуют слои линейного внимания с более редкими слоями полного внимания, это явление до сих пор системно не изучали. Главный результат: массивные активации в таких моделях организованы не хаотично, а привязаны к самой архитектуре. Они резко подскакивают непосредственно перед каждым слоем полного внимания, это пики (PAS), и не гаснут сразу, а тянутся плато через промежуточные слои линейного внимания до следующего пика, это ISP. Ещё важнее связующий результат: чем плотнее в модели расставлены слои полного внимания, тем сильнее соседние пики срастаются через такие плато, и в пределе, когда полное внимание используется на каждом слое, вся картина стягивается в ту самую устойчивую морфологию массивных активаций, которая уже известна по обычным, негибридным LLM с полным вниманием. Так поведение гибридных архитектур впервые напрямую увязывается с уже накопленным знанием о полном внимании.

Кому это важно

Прежде всего, исследователям и инженерам, которые разрабатывают или анализируют гибридные архитектуры линейного внимания: работа даёт конкретный, воспроизводимый способ описать, где именно в сети концентрируются массивные активации и как на них влияет гейтирование, как на выходе слоёв полного внимания, так и внутри самой архитектуры линейного внимания (в статье это проверено на примере GDN). Полезна она и специалистам по интерпретируемости и внутреннему устройству LLM в целом: механистическое объяснение через единый жизненный цикл активации с разным моментом «отмены» даёт общую рамку сразу для обычных и для гибридных моделей, а не два отдельных описания. Наконец, код анализа выложен в открытом доступе на GitHub, так что команда, работающая со своей гибридной моделью, может напрямую проверить, воспроизводятся ли у неё те же пики и плато.

Как это применить

Практический вход в работу, открытый код на GitHub (StartluxLabs/Massive-Activations-HLA): по нему можно повторить анализ массивных активаций на своей гибридной модели. Из контролируемого эксперимента следует и конкретный рычаг: в предобучении гибридов на архитектуре GDN (с суммарным числом параметров до 1,3 млрд) гейтирование на выходе слоёв полного внимания резко снижает абсолютную величину пиков и плато, не убирая их послойную организацию, то есть этим гейтированием можно управлять именно масштабом всплесков. Удаление же гейтов внутри самой архитектуры GDN даёт лишь умеренное усиление величины: этот рычаг заметно слабее. Судя по этому эксперименту, если нужно смягчить массивные активации в гибридной модели, в первую очередь стоит смотреть на гейтирование в слоях полного внимания, а не в слоях линейного внимания.

Можно ли доверять

Материал, аннотация научной работы, размещённая на HuggingFace Papers; исходный текст полный, без признаков урезанной выжимки. В пользу выводов, необычно широкий охват проверки: закономерность подтверждена на пяти архитектурах линейного внимания, шести вариантах гибридизации, пяти доменах данных и открытых моделях с суммарным числом параметров от 1,2 до 397 млрд, а отдельный контролируемый эксперимент по предобучению (до 1,3 млрд параметров) специально изолирует эффект гейтирования. Есть и открытый код, значит, результат может перепроверить кто угодно на своей модели. При этом в самом тексте аннотации не названы ни конкретные архитектуры, модели и домены данных, участвовавшие в проверке, ни авторы (кроме первого в списке, Zunhai Su), ни организация, ни площадка и статус рецензирования; сравнения с предыдущими работами, помимо собственной формулировки авторов «первое системное исследование», в тексте тоже нет.

Риски и подводные камни

Все утверждения о влиянии гейтирования, качественные, а не числовые: «резко снижает», «умеренное усиление», точных цифр, во сколько раз меняется величина активаций, в тексте нет. Контролируемый эксперимент с гейтированием проведён только на одной архитектуре (GDN) и только до масштаба 1,3 млрд параметров, переносится ли этот вывод на другие архитектуры линейного внимания или на модели ближе к верхней границе в 397 млрд параметров, в тексте не проверено. Аннотация также не называет ни конкретные архитектуры, модели и домены данных, участвовавшие в общей проверке, ни авторский коллектив целиком, ни организацию, ни площадку публикации, ни статус рецензирования, часть контекста, обычно нужного для оценки веса работы, без обращения к полному тексту статьи недоступна.

«PAS формируется по локализованной схеме «запись, сток, отмена», а продолжительное существование ISP объясняется отложенной отменой активации.»

— авторы исследования