Co-RL: ИИ-модели учат друг друга рассуждать без разметки

Обучение с подкреплением (RL), один из самых эффективных способов улучшить рассуждения языковых и мультимодальных моделей, но лучшие результаты обычно требуют размеченных «правильных ответов» (verifiable reward). Такая разметка дорога, а по мере того как модели решают всё более сложные задачи, людям становится всё труднее самим проверять правильность ответов, размеченных данных попросту не хватает. Альтернатива без разметки, self-rewarding RL, когда модель сама оценивает свои же ответы и на этой оценке учится. Проблема в том, что при обучении только на собственной обратной связи модель закрепляет свои же ошибки и смещения (biases), теряет разнообразие ответов и в итоге скатывается к однотипным, «схлопнувшимся» решениям (training collapse).
Авторы предлагают Co-RL: вместо одной модели, оценивающей саму себя, несколько независимых моделей, без общих параметров, обучаются одновременно, и каждая получает сигнал награды не от себя, а от своих партнёров по группе. Ключевой момент, разнообразие этой группы: разные семейства моделей, разные размеры и по-разному переформулированные обучающие примеры. Такая неоднородность снижает коррелированные ошибки, которые и запускают самоусиливающийся цикл деградации при self-rewarding-подходе. За счёт этого Co-RL стабильно улучшает качество рассуждений, сохраняет разнообразие ответов моделей и не даёт обучению схлопнуться.
По заявлению авторов, Co-RL превосходит базовые модели и прежние подходы без разметки, а по качеству сравним с методами, использующими размеченные данные supervised-обучения, при этом без единой размеченной метки. В экспериментах на семи текстовых бенчмарках для языковых моделей (LLM) метод дал средний прирост 3,0, 8,6%; на четырёх мультимодальных бенчмарках для моделей «изображение + текст» (VLM), 2,3, 7,2%. Код Co-RL выложен в открытый доступ на GitHub (DrStranded/Co-RL).
Ключевые факты
- Co-RL, метод RL-обучения, в котором несколько независимых моделей без общих параметров тренируют друг друга, а не сами себя
- Разнообразие группы моделей (разные семейства, размеры, переформулированные примеры) снижает коррелированные ошибки и предотвращает схлопывание обучения
- Прирост качества: 3,0, 8,6% на семи текстовых бенчмарках для LLM и 2,3, 7,2% на четырёх мультимодальных бенчмарках для VLM
- По заявлению авторов, метод не уступает supervised-подходам, использующим размеченные данные, хотя сам их не требует
- Код опубликован в открытом доступе на GitHub
Почему это важно
RL, один из главных рычагов улучшения рассуждений у современных моделей, но лучшие результаты завязаны на размеченные «правильные ответы», которых с ростом сложности задач становится всё меньше, людям всё труднее самим их проверять. Self-rewarding RL снимает зависимость от разметки, но ценой качества: модель, оценивающая саму себя, закрепляет собственные ошибки и скатывается к однотипным ответам вплоть до полного схлопывания обучения. Co-RL показывает, что этой ловушки можно избежать, если награду модели получают не от себя, а от разнородной группы других моделей, и при этом выходят на уровень supervised-методов без единой размеченной метки.
Кому это важно
В первую очередь, командам, которые обучают рассуждающие языковые и мультимодальные модели в областях, где размеченных данных мало или получать их дорого: например, когда задачи уже настолько сложны, что человеку трудно самому проверить правильность ответа. Подход применим как к чисто текстовым LLM, так и к мультимодальным VLM, авторы показывают прирост в обоих доменах.
Как это применить
Код Co-RL выложен в открытом доступе на GitHub (DrStranded/Co-RL). Суть метода: одновременно обучается несколько независимых моделей без общих параметров, каждая получает сигнал награды от остальных участников группы. Авторы подчёркивают, что выигрыш даёт именно разнородность этой группы, разные семейства моделей, разные размеры и по-разному переформулированные версии одних и тех же обучающих примеров: это снижает вероятность того, что все модели одновременно ошибутся одинаково.
Можно ли доверять
Текст статьи не называет ни авторов, ни организацию, ни площадку и дату публикации, сведения об авторстве в карточке материала (например, имя первого автора) в самом тексте статьи не встречаются. Указаны только агрегированные диапазоны прироста (3,0, 8,6% и 2,3, 7,2%) без разбивки по отдельным из семи текстовых и четырёх мультимодальных бенчмарков, и без данных о размерах моделей, объёме данных или вычислительных затратах на обучение. Сам механизм, по которому модели формируют друг для друга награды, в тексте не раскрыт подробно, сказано лишь, что награда «выводится от партнёров по группе».
Риски и подводные камни
Одновременное обучение нескольких независимых моделей вместо одной ощутимо увеличивает вычислительные затраты, а точных цифр по этим затратам авторы не приводят. Заявленные результаты, самоотчёт авторов работы, без независимой проверки третьей стороной и без раскрытия результатов по отдельным бенчмаркам, что затрудняет оценку, насколько прирост устойчив на разных типах задач. Механизм формирования наград между моделями описан на уровне идеи, а не деталей, не исключено, что на практике он чувствителен к тому, насколько именно подобрана разнородность группы моделей.