Учёные предложили ComPO, метод выравнивания LLM нулевого порядка

Учёные предложили ComPO, метод выравнивания LLM нулевого порядка

Прямые методы выравнивания предпочтений (вроде DPO) популярны из-за вычислительной и памятной эффективности, но страдают от эффекта "смещения правдоподобия" (likelihood displacement): на парах предпочтений с небольшим разрывом в правдоподобии они плохо извлекают полезный сигнал. Авторы предлагают и анализируют ComPO (Comparison-based Preference Optimization), метод выравнивания нулевого порядка, построенный на оракулах сравнения. Вместо того чтобы напрямую оптимизировать дифференцируемую функцию потерь на парах предпочтений, ComPO извлекает из этих пар только направление изменения.

Для базовой офлайн-схемы метода авторы доказывают гарантию сходимости, при условиях гладкости целевой функции, разреженности градиента и совместимости оракула сравнения со скрытой (латентной) целевой функцией. Отдельно представлен онлайн-вариант ComPO: он сохраняет офлайновый механизм сравнения, но добавляет контроль через обратную KL-дивергенцию относительно референсной политики, используя неразмеченные генерации самой обучаемой политики. Для базовой ограниченной (constrained) схемы онлайн-варианта авторы доказывают отдельную гарантию качества, исходя из "покрытия" (coverage) предпочтений при тонкой настройке: она опирается на локальное покрытие данных и точность попарной модели вознаграждения на данных, близких к обучающему распределению.

Метод проверен экспериментально на пяти семействах моделей: Mistral, Llama, Gemma-2, Qwen3 и Gemma-3. По заявлению авторов, ComPO превосходит существующие прямые методы выравнивания, в том числе по показателю win rate с учётом длины ответа (length-controlled win rate). Попарная диагностика результатов согласуется с гипотезой, что метод смягчает эффект смещения правдоподобия. Конкретных числовых значений улучшений (проценты, разница в очках) в тексте источника не приведено, только качественное описание результатов.

Ключевые факты

  • ComPO, метод выравнивания LLM нулевого порядка на основе оракулов сравнения, а не прямой оптимизации дифференцируемой функции потерь
  • Мотивация, эффект "смещения правдоподобия": на парах предпочтений с малым разрывом прямые методы (типа DPO) плохо извлекают сигнал
  • Для базовой офлайн-схемы доказана гарантия сходимости при условиях гладкости, разреженности градиента и совместимости оракула с латентной целью
  • Онлайн-вариант добавляет контроль через обратную KL-дивергенцию к референсной политике на неразмеченных генерациях; для него доказана отдельная гарантия качества исходя из покрытия данных
  • Проверка на пяти семействах моделей (Mistral, Llama, Gemma-2, Qwen3, Gemma-3) показала улучшения относительно существующих прямых методов, включая length-controlled win rate

Почему это важно

Смещение правдоподобия, известная слабость прямых методов выравнивания предпочтений (DPO и его родственники): на парах ответов с небольшой разницей в правдоподобии модель получает слабый или искажённый обучающий сигнал, а прямая оптимизация дифференцируемой функции потерь на таких парах может даже снижать вероятность предпочтённого ответа вместо её повышения. ComPO предлагает альтернативу, извлекать из пары предпочтений не градиент функции потерь, а направление через оракул сравнения, и подкрепляет это теоретической гарантией сходимости, а не только эмпирикой. Это работа по фундаментальной механике выравнивания, а не про конкретный продукт.

Кому это важно

Исследователям и инженерам, которые строят пайплайны выравнивания и тонкой настройки языковых моделей по предпочтениям (RLHF-подобные процедуры, DPO и его альтернативы), особенно тем, кто уже сталкивался с деградацией качества из-за смещения правдоподобия на сложных парах предпочтений.

Как это применить

В тексте источника нет описания готового инструмента, кода или релиза, это метод и его теоретический анализ. Практически применимы две схемы: офлайн-вариант ComPO работает на заранее собранном датасете пар предпочтений через оракул сравнения; онлайн-вариант дополнительно генерирует ответы текущей политикой и сдерживает её через обратную KL-дивергенцию относительно референсной модели. Условия, при которых работают доказанные гарантии (гладкость, разреженность градиента, покрытие данных), нужно проверять применительно к конкретной задаче, а не считать универсальными.

Можно ли доверять

Работа даёт формальные гарантии, сходимости для офлайн-схемы и качества для ограниченной онлайн-схемы, но каждая при явно оговорённых технических условиях, а не безусловно. Эмпирически метод проверен на пяти разных семействах моделей (Mistral, Llama, Gemma-2, Qwen3, Gemma-3), что расширяет базу для доверия по сравнению с проверкой на одной модели. При этом в доступном тексте источника нет конкретных числовых результатов (величины улучшений win rate), имён авторов или организаций, а также даты публикации, это данные аннотации к препринту, без деталей исследования и рецензирования.

Риски и подводные камни

Доказанные гарантии сходимости и качества держатся на условиях (гладкость целевой функции, разреженность градиента, совместимость оракула с латентной целью для офлайн-схемы; локальное покрытие данных и точность попарной модели вознаграждения для онлайн-схемы), которые на практике могут не выполняться. Источник не приводит числовых значений улучшений, только факт превосходства над прямыми методами в общих формулировках, поэтому масштаб эффекта из текста не оценить. Нет и сведений о том, опубликован ли код или веса моделей.