Учёные предложили GeoSteer, метод геодезической оптимизации для управления активациями языковых моделей
Управление активациями (activation steering), облегчённый способ менять поведение больших языковых моделей (LLM): вместо дообучения модели её скрытые активации точечно правят прямо во время работы модели, не трогая веса. Одно из направлений здесь, управление с сохранением нормы активации: оно стремится изменить поведение модели, не меняя норму (длину) вектора активации, потому что, как объясняют авторы, произвольное изменение нормы повышает риск коллапса и деградации представлений модели. По их словам, у существующих методов такого рода два ограничения: направление правки задаётся заранее и фиксируется, а сама правка выполняется за один шаг, из-за этого метод может не улавливать сложную структуру, в которой на самом деле распределены активации.
Чтобы снять оба ограничения, авторы предлагают GeoSteer, метод, который переформулирует управление активациями как задачу римановой оптимизации. Вместо одной фиксированной правки GeoSteer ведёт активацию к нужному поведению последовательностью малых геодезических шагов, шагов по кратчайшему пути, которые делаются прямо на многообразии представлений (representation manifold), геометрическом пространстве, где, как предполагается, расположены активации модели. Чтобы не задавать направление правки заранее, метод сначала обучает нелинейную целевую функцию прямо в пространстве активаций: она отличает активации, ведущие к нужному поведению, от тех, что к нему не ведут, а затем именно эта функция адаптивно направляет каждый отдельный геодезический шаг. По утверждению авторов, такая многошаговая схема делает управление более плавным, устойчивым и последовательным, чем одношаговые методы, и при этом на всём пути сохраняет норму активации неизменной.
GeoSteer проверили на трёх тестовых наборах, TruthfulQA, RealToxicityPrompts и UltraFeedback, и, по данным авторов, на всех трёх метод стабильно превосходит современные методы управления активациями, взятые для сравнения как базовые. При этом сам текст работы не приводит ни конкретных цифр этого превосходства (точность, показатель токсичности, доля побед или величина отрыва от базовых методов), ни названий конкретных базовых методов, с которыми сравнивали, ни того, на какой языковой модели или моделях ставился эксперимент.
Вывод авторов: замена заранее заданных одношаговых правок на адаптивную оптимизацию, учитывающую геометрию пространства активаций, делает управление с сохранением нормы активации эффективнее. Это препринт на arXiv: в тексте аннотации не указаны ни авторы, ни организация, ни дата публикации. Не раскрыты и детали реализации, число геодезических шагов, их размер и другие гиперпараметры оптимизации не приводятся, а риманова метрика и само многообразие представлений не определены за пределами общего названия «риманова оптимизация».
Ключевые факты
- GeoSteer формулирует управление активациями языковых моделей как задачу римановой оптимизации: вместо одной жёсткой правки активация двигается к нужному поведению серией малых геодезических шагов на многообразии представлений.
- Метод обучает нелинейную целевую функцию прямо в пространстве активаций, которая отличает желательные активации от нежелательных, и использует эту функцию, чтобы адаптивно направлять каждый геодезический шаг, вместо того чтобы задавать направление правки заранее.
- По словам авторов, многошаговая схема GeoSteer даёт более плавное, устойчивое и последовательное управление поведением модели, чем одношаговые методы, и сохраняет норму активации неизменной.
- На тестах TruthfulQA, RealToxicityPrompts и UltraFeedback GeoSteer, по данным авторов, стабильно превосходит современные методы управления активациями, но конкретные цифры отрыва, названия сравниваемых базовых методов и использованная языковая модель в тексте не приводятся.
- Это препринт на arXiv без указания авторов, организации и даты публикации; не раскрыты также число геодезических шагов, гиперпараметры оптимизации и точное определение римановой метрики и многообразия представлений.
Почему это важно
Большинство способов изменить то, что выдаёт языковая модель, дообучение (fine-tuning) или обучение с подкреплением на основе обратной связи людей (RLHF), требуют переобучения модели. Управление активациями привлекательно тем, что работает во время работы модели: оно правит скрытые внутренние активации напрямую, не трогая веса. Сохранять при этом норму активации неизменной важно потому, что, как утверждают авторы, произвольное изменение нормы повышает риск коллапса и деградации представлений, то есть сама правка может испортить то, что выдаёт модель. Главная претензия авторов к прежним методам управления с сохранением нормы в том, что они выбирают направление правки заранее и применяют его одним шагом, а это, по их словам, может не улавливать сложную структуру пространства, в котором на самом деле расположены активации. Предложение GeoSteer, превратить управление активациями в оптимизационную задачу, решаемую за несколько малых шагов вместо одного большого, под управлением функции, которая не задаётся вручную, а выучена на данных.
Кому это важно
Прямая аудитория, исследователи и инженеры, которые занимаются интерпретируемостью моделей, согласованием (alignment) их поведения с целями пользователя и контролем поведения больших языковых моделей, и используют управление активациями как более лёгкую альтернативу дообучению или RLHF. Особенно это касается тех, кто уже применяет прежние методы управления с сохранением нормы активации, именно с этим классом методов GeoSteer себя сравнивает: аргумент авторов в том, что заранее заданные одношаговые правки сохраняют норму, но плохо учитывают реальную структуру пространства активаций. Для команд, которые управляют поведением моделей другими способами, дообучением, промптингом или фильтрами на выходе, материал имеет не прямое, а скорее ориентирующее значение.
Как это применить
GeoSteer устроен в два этапа. Сначала он обучает нелинейную целевую функцию прямо в пространстве активаций, её задача отличать «желательные» активации, которые дают нужное поведение модели, от «нежелательных». Затем, вместо одной правки по заранее заданному направлению, метод рассматривает пространство активаций как искривлённое многообразие и ведёт активацию к нужной области последовательностью малых геодезических шагов, шагов по кратчайшему пути, допустимому геометрией этого многообразия, а каждый шаг направляет уже обученная целевая функция. Именно постановка всей процедуры как римановой оптимизации позволяет делать несколько малых, учитывающих геометрию шагов вместо одной большой заранее заданной правки и одновременно удерживает норму активации неизменной на всём пути. Сколько именно геодезических шагов делается, какой у них размер и какие ещё гиперпараметры оптимизации использованы, в тексте работы не указано.
Можно ли доверять
Это препринт на arXiv: в тексте аннотации не указаны ни авторы, ни организация, ни дата публикации, поэтому оценить репутацию авторов по имеющимся данным нельзя. Авторы утверждают, что GeoSteer стабильно превосходит современные методы управления активациями на трёх тестах, TruthfulQA, RealToxicityPrompts и UltraFeedback, но сам текст не приводит ни точности, ни показателя токсичности, ни доли побед, ни величины отрыва от сравниваемых методов, и не называет, какие именно базовые методы участвовали в сравнении. Без этих цифр читатель не может самостоятельно оценить, насколько велико заявленное превосходство и как именно оно измерялось: утверждение остаётся качественным, а не проверяемым по тексту.
Риски и подводные камни
В тексте отсутствует ряд деталей реализации: не названа языковая модель или семейство моделей, на которых проверяли GeoSteer, не указаны число геодезических шагов и другие гиперпараметры оптимизации, а риманова метрика и само многообразие представлений не определены за пределами общего названия «риманова оптимизация». Не названы и авторы с организацией, поэтому нельзя связать работу с конкретным человеком или лабораторией по одному этому тексту. Вместе эти пробелы ограничивают независимую проверку и не позволяют судить, насколько результат обобщается за пределы трёх протестированных бенчмарков.
«Эти результаты говорят о том, что управление с сохранением нормы активации можно сделать эффективнее, заменив заранее заданные одношаговые правки адаптивной оптимизацией, учитывающей геометрию пространства.»
— авторы работы