DecoEvo: метод совместной эволюции решателя и оценщика поднял точность LLM на 2,8, 5%

Исследователь Цзянван Чэнь с соавторами представил метод DecoEvo (Decoupled Co-Evolution, «раздельная совместная эволюция») для так называемой text-space оптимизации (оптимизации в текстовом пространстве) больших языковых моделей (LLM). Такая оптимизация настраивает модель не через изменение весов, а через редактирование внешних текстовых артефактов, например, промптов или инструкций-"навыков": сама модель остаётся "чёрным ящиком", а изменяемый текст можно прочитать и проверить.
Проблема, которую решает работа: в большинстве существующих text-space методов критерий оценки (рубрика) остаётся неизменным. На открытых задачах без единственного правильного ответа это становится узким местом, как только решающая часть модели ("решатель") подтягивается под критерии, которые измеряет рубрика, любые упущенные в ней измерения качества перестают быть видны системе оптимизации и дальше не улучшаются. Простое "эволюционирование" самой рубрики тоже ненадёжно: если обновления рубрики отбираются по тому, насколько хорошо на них смотрится текущий решатель, кажущийся прогресс может достигаться не улучшением решателя, а тем, что рубрику подгоняют под его слабости, делая её легче.
DecoEvo решает это, совместно развивая два текстовых "навыка", навык-решатель и навык-генератор рубрик, под РАЗНЫМИ, несвязанными друг с другом целями, и без использования эталонных ("золотых") рубрик в процессе оптимизации. Навык-решатель обновляется на основе обратной связи по отдельным критериям. Навык-генератор рубрик пересматривается независимо от общего балла решателя, через два дополнительных вида аудита: покрытие требований задачи и способность рубрики различать сильные и слабые ответы. За счёт такого разделения обновления генератора рубрик фокусируются именно на новых, только что обнаруженных слабостях решателя, а не повторяют упор на критерии, которые решатель уже и так выполняет.
По итогам оценки на официальных наборах метрик каждого бенчмарка DecoEvo обошёл все сравниваемые методы на пяти бенчмарках и трёх базовых LLM, дав в среднем по пяти бенчмаркам относительный прирост 2,8, 5,0% по сравнению с методом SkillOpt.
Ключевые факты
- DecoEvo, метод text-space оптимизации LLM: настройка идёт через редактирование текстовых инструкций ("навыков"), а не весов модели
- Совместно и независимо развиваются два навыка: решатель задач и генератор рубрик (критериев оценки), без эталонных рубрик в процессе
- Навык-решатель обучается на обратной связи по отдельным критериям; навык-генератор рубрик проверяется аудитом покрытия требований и способности различать ответы, независимо от общего балла решателя
- Такое разделение не даёт рубрике "подстраиваться" под текущие слабости решателя, а фокусирует её обновления на новых, ещё не закрытых пробелах
- На пяти бенчмарках и трёх LLM-моделях DecoEvo обошёл все сравниваемые методы, дав в среднем 2,8, 5,0% относительного прироста над SkillOpt
Почему это важно
Большинство методов дообучения языковых моделей через текст (без изменения весов) держат критерий оценки фиксированным. На открытых задачах это создаёт слепую зону: как только модель "натаскивается" под то, что измеряет критерий, всё остальное качество перестаёт улучшаться, потому что система его просто не видит. DecoEvo показывает, что развивать нужно не только решающую часть, но и сам критерий, и делать это раздельными, несвязанными процедурами, иначе критерий начинает подстраиваться под слабости модели вместо того, чтобы их вскрывать.
Кому это важно
Разработчикам систем на базе LLM, которые оптимизируют промпты, инструкции или "навыки" агентов под открытые задачи без единственного правильного ответа (например, сложные тексты, код-ревью, планирование), там, где нельзя просто сверить ответ с эталоном. Также релевантно исследователям, которые строят собственные автоматические рубрики оценки качества ответов LLM.
Как это применить
DecoEvo, исследовательский метод, а не готовый продукт с ценой или лицензией: в источнике нет данных о релизе кода, доступности или стоимости использования. Практический смысл, в архитектуре: если система дообучает и решателя, и критерий его оценки одновременно, важно развивать их через независимые сигналы (аудит покрытия требований и различающей способности рубрики), а не давать критерию подстраиваться под текущий балл решателя.
Можно ли доверять
Результаты получены по официальным протоколам оценки пяти отдельных бенчмарков и на трёх разных базовых LLM, что снижает риск случайного совпадения на одной модели или одном наборе данных. Заявленный прирост, умеренный (2,8, 5,0% относительно метода SkillOpt), а не прорывной, что скорее говорит в пользу правдоподобности результата. Независимой верификации за пределами самой работы в источнике не приводится.
Риски и подводные камни
Прирост в 2,8, 5,0% относительный, а не абсолютный, и получен по сравнению с одним конкретным методом (SkillOpt), при сравнении с другими подходами разница может отличаться. Метод по-прежнему требует отдельного процесса оптимизации и аудита рубрик, что добавляет вычислительные затраты по сравнению с фиксированной оценкой. В источнике не раскрыты детали устойчивости метода на задачах вне пяти протестированных бенчмарков.