Исследователи нашли асимметрию в обновлениях трансформеров, она повышает устойчивость редактирования моделей

Исследователи нашли асимметрию в обновлениях трансформеров, она повышает устойчивость редактирования моделей

На каждом слое трансформера блоки внимания и MLP добавляют к представлению токена (скрытому состоянию) новое слагаемое, это стандартный принцип остаточного соединения. Авторы работы предлагают взглянуть на эти добавки как на геометрию: любое такое слагаемое можно разложить на составляющую, параллельную уже существующему направлению представления (она просто усиливает то, что уже есть), и составляющую, перпендикулярную ему (она вносит действительно новое направление). Это разложение авторы применяют систематически, как к обновлениям от внимания и MLP, так и к тому, как внимание агрегирует значения (values) других токенов.

Первый результат: на предобученных моделях доля параллельной составляющей в обновлениях оказалась существенной, и это уже сверх того, что и без того сохраняет направление само остаточное (тождественное) соединение. Иными словами, заметная часть того, что блоки внимания и MLP как будто добавляют «нового» к представлению, на деле просто усиливает уже имеющееся направление, а не привносит принципиально другую информацию. В тексте работы не названы конкретные модели, на которых проверялся эффект, сказано только «на предобученных моделях».

Дальше разложение применяется в двух разных пространствах. Первое, пространство скрытого состояния: в нём раскладываются сами обновления от внимания и MLP, поступающие в остаточный поток. Второе, пространство значений внимания (value): в нём взвешенная сумма значений всех токенов, которую выдаёт механизм внимания, раскладывается относительно направления собственного значения текущего токена, то есть отдельно смотрят, что во внимании токен получает от самого себя, а что, от остальных.

Главный практический результат, про точечное редактирование модели. Если брать пространство значений внимания, убрать из совокупного значения вклад самого токена (оставить только агрегат от остальных токенов) и масштабировать в нём именно параллельную составляющую, такая правка оказывается заметно устойчивее, чем аналогичное масштабирование в пространстве скрытого состояния или манипуляции с перпендикулярной составляющей в любом из двух пространств. При этом прямой «сигнал о себе», то, что токен через внимание передаёт сам себе, остаётся нетронутым, меняется только то, что токен получает от остальных. Речь именно о сравнении разных вариантов редактирования внутри одного и того же метода разложения, а не о сравнении с редактирующими техниками из других работ, таких сравнений в тексте нет.

То же разложение применили не к самим обновлениям, а к ошибке, которую вносит сжатие модели: разнице между обновлениями сжатой и несжатой версии. Оказалось, что перпендикулярная составляющая этой ошибки гораздо чётче различает разные методы сжатия между собой, чем параллельная, то есть перпендикулярная ошибка может служить более чувствительным индикатором при сравнении способов сжатия. Какие именно методы сжатия сравнивались, в тексте не уточняется.

Третий результат, про обучение с нуля. Если во время предобучения модели с нуля намеренно подавлять параллельную составляющую полного агрегированного обновления (в этот раз без исключения собственного вклада токена), это снижает потери на валидационной выборке в ходе обучения и улучшает средние результаты на прикладных задачах после предобучения; сильнее всего эффект, именно у варианта, где подавление применяется в пространстве значений внимания, а не в пространстве скрытого состояния. Конкретные цифры улучшений, датасет, размер модели и бюджет обучения в тексте не приводятся.

Авторы подчёркивают, что все три результата, устойчивость редактирования, диагностика сжатия и вмешательство во время обучения, получены из одного и того же геометрического разложения обновлений на параллельную и перпендикулярную составляющие. Код к работе выложен в открытом репозитории на GitHub.

Ключевые факты

  • Метод: обновления, которые слои внимания и MLP добавляют к представлению токена, раскладываются на параллельную (усиливающую текущее направление) и перпендикулярную (вносящую новое направление) составляющие, в пространстве скрытого состояния и отдельно в пространстве значений внимания.
  • На предобученных моделях параллельная составляющая обновлений оказалась существенной сверх того, что и так сохраняет тождественное остаточное соединение, то есть заметная часть «новых» добавок на деле усиливает уже имеющееся направление представления.
  • Для точечного редактирования модели устойчивее всего масштабировать параллельную составляющую агрегата значений внимания от остальных токенов (без собственного вклада токена), это заметно надёжнее, чем правки в пространстве скрытого состояния или манипуляции с перпендикулярной составляющей, и не трогает прямой «сигнал о себе».
  • Тот же геометрический разбор ошибки от сжатия модели показывает: перпендикулярная составляющая ошибки чётче различает разные методы сжатия между собой, чем параллельная.
  • При предобучении модели с нуля подавление параллельной составляющей полного агрегированного обновления снижает потери на валидации и улучшает средние результаты на прикладных задачах, сильнее всего в варианте с пространством значений внимания.

Почему это важно

Работа предлагает единую геометрическую рамку, разложение любого обновления представления на параллельную и перпендикулярную составляющие, и показывает, что эта рамка не остаётся чисто описательной, а связывается сразу с тремя разными практическими задачами: насколько надёжно можно точечно редактировать модель, как сравнивать между собой методы сжатия и как улучшить само предобучение. Особенно неочевиден первый результат: значительная часть того, что блоки внимания и MLP добавляют к представлению на каждом слое, оказывается не новой информацией, а усилением уже существующего направления, это меняет интуицию о том, что вообще делают эти слои внутри трансформера.

Кому это важно

В первую очередь, тем, кто занимается редактированием уже обученных моделей (точечной правкой конкретных фактов или поведения без переобучения): работа даёт конкретный, проверенный на устойчивость рецепт, какую именно составляющую и в каком пространстве стоит трогать. Во вторую, командам, которые сравнивают между собой методы сжатия моделей (какие именно, в тексте не названы): перпендикулярная ошибка обновлений предлагается как более чувствительный индикатор различий между методами, чем параллельная. В третью, тем, кто предобучает модели с нуля и ищет дешёвые приёмы улучшить сам процесс обучения: подавление параллельной составляющей во время обучения улучшило и потери на валидации, и результаты на прикладных задачах. Шире, это материал для всех, кто занимается геометрией и интерпретируемостью внутренних представлений трансформеров.

Как это применить

Работа описывает три отдельных приёма поверх одного и того же разложения. Для редактирования: в пространстве значений внимания исключить из совокупного значения собственный вклад токена и масштабировать параллельную составляющую оставшегося (агрегата от остальных токенов), так правка не трогает прямой «сигнал о себе» и остаётся устойчивее, чем правка в пространстве скрытого состояния или манипуляции с перпендикулярной составляющей. Для диагностики сжатия: сравнивать методы не по общей ошибке обновлений, а по её перпендикулярной составляющей, она заметнее разводит методы между собой. Для предобучения: подавлять параллельную составляющую полного агрегированного обновления, в идеале, именно в пространстве значений внимания, где эффект оказался сильнее всего. Авторы опубликовали код в открытом репозитории на GitHub, так что разложение и эксперименты можно воспроизвести и проверить на своих моделях.

Можно ли доверять

Материал, препринт на HuggingFace Papers, по сути зеркало arXiv; в тексте аннотации нет ни имён авторов, ни их организации, ни даты публикации. Ключевая особенность именно этой аннотации: в ней вообще нет ни одной цифры, ни долей, ни значений потерь, ни результатов бенчмарков. Все выводы («существенные», «заметно устойчивее», «сильнее всего») сформулированы качественно и пока опираются только на слова самих авторов; какие именно предобученные модели, датасеты, методы сжатия и бенчмарки использовались в экспериментах, аннотация тоже не раскрывает. Оценить реальный размер эффекта или воспроизводимость результатов по этому тексту нельзя, для этого нужен полный текст статьи с цифрами.

Риски и подводные камни

Главный риск, в аннотации нет ни одной количественной оценки, поэтому неясно, насколько велики на самом деле эффекты, которые описаны только словами («существенно», «заметно», «сильнее всего»). Неизвестен охват экспериментов: сколько именно предобученных моделей и какой архитектуры проверялись, поэтому не ясно, насколько результат общий, а насколько специфичен для конкретных моделей из работы. Приём для редактирования проверен на неуточнённых «точечных правках», не сказано, распространяется ли устойчивость на все виды редактирования (например, правку фактов против правки поведения или стиля) или только на те, что тестировали авторы. Эффект от подавления параллельной составляющей показан именно при предобучении с нуля; переносится ли он на дообучение уже готовых моделей или на другой масштаб, в тексте не сказано, как не названы ни размер моделей, ни датасет, ни бюджет обучения.