Эволюционные стратегии обошли GRPO по охвату рассуждений LLM

Эволюционные стратегии обошли GRPO по охвату рассуждений LLM

Исследователи (первый автор, Yunpeng Ba) изучили эволюционные стратегии (Evolution Strategies, ES) как метод посттренинга больших языковых моделей для задач рассуждения, экономный по памяти конкурент популярному Group Relative Policy Optimization (GRPO). До этой работы поведение ES при оптимизации было слабо изучено, поэтому было неясно, в чём именно его преимущество перед GRPO.

Авторы показали теоретически и эмпирически, что ES даёт более широкий охват рассуждений, модель лучше раскрывает заложенные в неё при предобучении способности к рассуждению. Теоретическая часть работы связывает это с ростом расхождения Йенсена-Шеннона (мера разнообразия распределений), спроецированного через верификатор, между членами популяции ES: чем оно выше, тем лучше метрика Pass@K (доля задач, решаемых хотя бы одной из K попыток). Эмпирически авторы отметили, что GRPO страдает от «схлопывания энтропии» (модель со временем генерирует всё менее разнообразные ответы), тогда как ES одновременно улучшает Pass@1 (точность с первой попытки) и превосходит GRPO по Pass@K.

На основе этого наблюдения авторы предложили последовательную стратегию GRPO-ES, которая сочетает сильную сторону GRPO (Pass@1) с преимуществом ES в Pass@K.

Второе ключевое наблюдение касается того, как именно ES меняет модель. Хотя параметры всей модели заметно сдвигаются в ходе обучения ES, реальный прирост качества на задачах обеспечивает лишь небольшое подмножество изменений, те, что имеют наибольшую величину. Авторы называют это «функциональной разреженностью»: масштабный сдвиг параметров не означает, что функционально меняется вся модель. Проверка на отложенных данных показала, что такой сдвиг параметров не обязательно ведёт к катастрофическому забыванию ранее усвоенных навыков.

Наконец, авторы изучили, как настройки метода влияют на его эффективность, и обнаружили, что для более крупных LLM эволюционным стратегиям требуется меньший размер популяции (числа испытаний в поколении). Вывод авторов: ES, это не менее эффективная, но экономная по памяти замена GRPO, а самостоятельная и отличная от него парадигма посттренинга для рассуждений.

В самой аннотации не приведены конкретные числовые значения Pass@1/Pass@K, названия бенчмарков, модели или их размеры, все сравнения даны качественно (выше/ниже, меньше/больше).

Ключевые факты

  • Работа сравнивает эволюционные стратегии (ES) и GRPO как методы дообучения LLM для рассуждений
  • ES не подвержены «схлопыванию энтропии»: улучшают Pass@1 и одновременно превосходят GRPO по Pass@K
  • Более широкий охват рассуждений у ES теоретически связан с ростом расхождения Йенсена-Шеннона в популяции
  • Предложена последовательная стратегия GRPO-ES, объединяющая сильные стороны обоих методов
  • Прирост качества при ES объясняется разреженным подмножеством крупных обновлений параметров, а не сдвигом всей модели; для крупных LLM ES нужна меньшая популяция

Почему это важно

GRPO, сегодняшний стандарт для дообучения LLM с подкреплением на задачах рассуждения, но у него есть известная проблема: модель со временем теряет разнообразие ответов («схлопывание энтропии»), что ограничивает потолок качества. Работа впервые системно объясняет, почему альтернативный метод, эволюционные стратегии, этой проблемы избегает и даёт более широкое покрытие возможных решений, не жертвуя точностью с первой попытки.

Кому это важно

Исследователям и инженерам, которые занимаются посттренингом языковых моделей для рассуждений и логики, а также командам, ищущим экономные по памяти альтернативы RL-методам вроде GRPO при ограниченных вычислительных ресурсах.

Как это применить

Авторы предлагают не выбирать между GRPO и ES, а комбинировать их последовательно: GRPO даёт точность с первой попытки (Pass@1), ES, расширяет охват при нескольких попытках (Pass@K). Отдельная практическая рекомендация: при работе с более крупными моделями для ES стоит уменьшать размер популяции, это единственная конкретная рекомендация по настройке метода, приведённая в аннотации.

Можно ли доверять

Заявления подкреплены и теоретическим анализом (через расхождение Йенсена-Шеннона), и эмпирическими экспериментами, включая проверку на отложенных данных против катастрофического забывания. Однако в самой аннотации нет конкретных чисел (значений Pass@1/Pass@K), названий бенчмарков, моделей или их размеров, сравнения качественные, а сведений об институциональной принадлежности авторов и рецензировании работы нет.

Риски и подводные камни

Отсутствие числовых данных в открытом описании не позволяет оценить масштаб реального преимущества ES над GRPO, «шире охват» и «выше Pass@K» могут означать как существенный, так и незначительный прирост. Выводы сделаны на основе экспериментов авторов и пока не подтверждены независимой проверкой или широким внедрением в индустрии.