Обучение с подкреплением сужает охват решений у ИИ-агентов: «налог на заострение»

Обучение с подкреплением сужает охват решений у ИИ-агентов: «налог на заострение»

В статье с Hugging Face (papers/2610.01509) проверяется гипотеза о постобучении больших языковых моделей с подкреплением (RL): оно якобы лишь «заостряет» уже имеющееся поведение базовой модели, повышая точность с первой попытки (pass@1) ценой охвата решений (pass@K, то есть доли задач, решённых при K попытках). Раньше такой компромисс наблюдали на математике и программировании. Авторы задаются вопросом, переносится ли он на агентные задачи, где многошаговое использование инструментов и взаимодействие могут требовать способностей, приобретённых именно при постобучении.

Главная находка, которую авторы называют неожиданной: предобученные LLM с лёгкой обвязкой для вывода могут работать как способные агенты. При заметно более низком pass@1 они часто обгоняют свои постобученные версии по охвату решений (pass@K), если у них достаточный бюджет на этапе тестирования.

Механизм, по анализу авторов, такой: постобучение разводит задачи по двум крайностям, «всегда решается» и «никогда не решается». Это повышает эффективность сэмплирования и согласованность ответов, но уменьшает охват решений.

Чтобы измерить эту цену, предложена диагностическая метрика Sharpening Tax («налог на заострение»): она количественно оценивает потерю масштабируемости на этапе тестирования после постобучения. Метрику проверили на 14 парах «базовая / постобученная модель» из четырёх семейств на трёх агентных бенчмарках (всего 42 случая). По словам авторов, налог проявляется в большинстве настроек, оценивается по небольшому числу прогонов (rollouts) и хорошо коррелирует с другими метриками.

Наконец, представлен метод posterior-tempered group sampling (PTGS), простой подключаемый байесовский сэмплер, который подстраивает температуру сэмплирования под каждый промпт в зависимости от оценённой сложности. При использовании во время RL-обучения в двух агентных средах PTGS платит меньший налог, чем базовый вариант с фиксированной температурой: решает больше задач при повторных попытках и одновременно повышает точность с первой попытки.

Ключевые факты

  • Гипотеза «RL лишь заостряет поведение базовой модели» проверена на агентных задачах, а не только на математике и коде.
  • Базовые модели с лёгкой обвязкой для вывода при низком pass@1 часто обгоняют постобученные по pass@K при достаточном бюджете на этапе тестирования.
  • Постобучение разводит задачи на «всегда решаются» и «никогда не решаются»: растут эффективность и согласованность, падает охват решений.
  • Метрика Sharpening Tax измерена на 14 парах моделей из четырёх семейств и трёх агентных бенчмарках (42 случая); налог проявляется в большинстве настроек.
  • Сэмплер PTGS, подстраивающий температуру под сложность промпта, в двух агентных средах платит меньший налог, чем вариант с фиксированной температурой.

Почему это важно

Постобучение с подкреплением стало стандартным путём к сильным агентам, и считается, что оно просто делает модели лучше. Статья показывает обратную сторону: выигрыш в точности с первой попытки может обходиться потерей охвата решений при большом бюджете на повторные попытки. Для агентных задач это не было очевидно, поскольку там могли требоваться навыки, приобретённые только при постобучении.

Кому это важно

Исследователям и командам, которые обучают модели с подкреплением, в первую очередь для агентных сценариев. Также тем, кто выбирает между базовой и постобученной моделью и готов тратить больше вычислений на повторные попытки на этапе тестирования.

Как это применить

Метрика Sharpening Tax, по словам авторов, оценивается по небольшому числу прогонов, поэтому её можно использовать как диагностику потери масштабируемости после постобучения. Сэмплер PTGS описан как простой подключаемый: он подстраивает температуру под оценённую сложность каждого промпта и применялся во время RL-обучения. Сведений о доступности кода в тексте нет.

Можно ли доверять

Это аннотация статьи, пересказанная без доступа к полному тексту. Масштаб проверки заметен (14 пар моделей, три бенчмарка, 42 случая), но в аннотации не названы модели и бенчмарки, нет конкретных значений pass@1, pass@K, размера налога и выигрыша PTGS. Налог описан как распространённый «в большинстве настроек», а не во всех случаях. Выводы стоит проверять по полному тексту.

Риски и подводные камни

Результат относится к сопоставлению базовых и постобученных моделей при достаточном бюджете на этапе тестирования; размер этого бюджета в аннотации не указан. Если повторные попытки дороги или недопустимы, выигрыш в pass@1 от постобучения остаётся практически значимым. Эффект PTGS показан в двух агентных средах, так что обобщать его на другие условия рано.

«Наша неожиданная находка в том, что предобученные LLM с лёгкой обвязкой для вывода могут служить способными агентами.»

— Из аннотации статьи