Co-RL: команда ИИ-моделей научилась рассуждать без разметки

Co-RL: команда ИИ-моделей научилась рассуждать без разметки

Обучение с подкреплением (RL) давно повышает способность языковых и мультимодальных (текст и изображение) моделей рассуждать, но самые сильные результаты такого обучения по-прежнему опираются на эталонную разметку, например, на проверяемую награду, когда правильность ответа в математике или в коде можно однозначно установить. Такая разметка дорога в получении и становится всё более редкой по мере того, как способности моделей к рассуждению обгоняют то, что способен надёжно оценить человек. RL с самооценкой (self-rewarding RL) снижает эту зависимость: модель сама оценивает собственные ответы и получает награду на основе этой оценки. Но обучение только на собственной обратной связи модели закрепляет её же смещения и слабые места, снижает разнообразие ответов и в итоге приводит к однообразным ответам и коллапсу обучения.

Авторы работы показывают, что рассуждение без эталонной разметки может появиться через совместное (кооперативное) обучение нескольких моделей. Они представляют Co-RL, фреймворк, в котором несколько независимых моделей без общих параметров одновременно обучаются методом RL, получая награду не от самих себя, а от оценок «соседей» по группе. Дальше авторы показывают: чем разнороднее состав этой группы, за счёт разных семейств моделей, разных размеров и по-разному перефразированных обучающих примеров, тем меньше совпадающих (коррелирующих) ошибок, которые и запускают самоусиливающуюся обратную связь: одна и та же ошибка выглядит «подтверждённой», если её повторяют сразу несколько моделей группы. Такое разнообразие стабильно улучшает качество рассуждений, сохраняет разнообразие поведения моделей и не даёт обучению схлопнуться.

И в чисто текстовых, и в мультимодальных задачах Co-RL стабильно превосходит базовые модели и предыдущие методы, работающие без разметки, а по сравнению с обучением с учителем (то есть с использованием эталонной разметки), не уступает ему или превосходит его, при этом сам не используя вообще никакой эталонной разметки. В цифрах: средний прирост составил 3,0-8,6% на семи чисто текстовых бенчмарках для языковых моделей (LLM) и 2,3-7,2% на четырёх мультимодальных бенчмарках для VLM, оба показателя измерены относительно базовых моделей и предыдущих методов без разметки. Конкретные названия бенчмарков, число моделей в группе, а также семейства и размеры этих моделей в тексте не раскрываются. Код фреймворка авторы выложили в открытом доступе на GitHub.

Ключевые факты

  • Co-RL, фреймворк, в котором несколько независимых моделей без общих параметров одновременно обучаются через RL и получают награду от оценок друг друга, а не от эталонной разметки или самооценки.
  • Чисто самооценочное обучение (модель оценивает сама себя) закрепляет её смещения и слабые места, снижает разнообразие ответов и может привести к коллапсу обучения, эту проблему авторы решают за счёт разнородности группы моделей.
  • Чем разнороднее группа, разные семейства и размеры моделей, по-разному перефразированные обучающие примеры, тем меньше совпадающих ошибок, которые иначе взаимно подкрепляют друг друга и превращаются в самоусиливающуюся обратную связь.
  • На семи чисто текстовых бенчмарках для языковых моделей средний прирост составил 3,0-8,6%, на четырёх мультимодальных бенчмарках для VLM, 2,3-7,2%, оба показателя относительно базовых моделей и предыдущих методов без разметки.
  • По сравнению с обучением с учителем (на эталонной разметке) Co-RL не уступает ему или превосходит его, при этом сам метод вообще не использует эталонную разметку; код выложен в открытом доступе на GitHub.

Почему это важно

Обучение с подкреплением, один из главных инструментов, которым сейчас поднимают качество рассуждений у языковых и мультимодальных моделей, но самые сильные результаты такого обучения держатся на эталонной разметке: проверяемой награде, когда правильность ответа можно однозначно установить, например в математике или в коде. По мере того как модели начинают рассуждать на уровне, который сложно проверить даже человеку, такой разметки становится всё меньше, а её подготовка обходится всё дороже. Обучение по самооценке снимает часть этой зависимости, но поскольку модель обучается на собственной обратной связи, она же закрепляет и свои слабые места, поэтому со временем ответы становятся однообразнее, а обучение может попросту схлопнуться. Co-RL предлагает третий путь: вместо одной модели, оценивающей саму себя, разнородная группа моделей, оценивающих друг друга, и именно эта разнородность, по данным авторов, не даёт обучению коллапсировать и на ряде бенчмарков выводит результат на уровень обучения с учителем или выше, без единого эталонного ответа.

Кому это важно

В первую очередь, командам и лабораториям, которые обучают рассуждающие языковые или мультимодальные модели там, где эталонной разметки или проверяемой награды мало или нет вовсе: открытые (open-ended) задачи, области, где правильный ответ не проверяется автоматически, или темы, которые уже опережают возможности разметчиков-людей. Полезно и тем, кто настороженно относится к обучению моделей на собственных или чужих ИИ-ответах, где риск однообразия и коллапса обучения известен как самостоятельная проблема: Co-RL напрямую адресует именно её, а не борется с ней постфактум.

Как это применить

Схема, которую описывают авторы: вместо одной модели с самооценкой собрать группу из нескольких независимых моделей без общих параметров, по возможности разных семейств и размеров, и обучать их одновременно методом RL, где каждая модель получает награду не за собственную оценку своих ответов, а по оценкам остальных участников группы; вдобавок обучающие примеры для разных моделей стоит по-разному перефразировать, это тоже часть той же разнородности. Код фреймворка опубликован на GitHub, что позволяет проверить реализацию напрямую; при этом из текста аннотации не видно ни числа моделей в группе, ни того, какие именно семейства и размеры моделей и какие именно семь текстовых и четыре мультимодальных бенчмарка использовались в проверке.

Можно ли доверять

Источник, аннотация научной работы (препринт), опубликованная через Hugging Face Papers: она не называет ни авторов, ни организацию, ни дату публикации. Прирост в 3,0-8,6% и 2,3-7,2% дан только как усреднённый показатель сразу по нескольким бенчмаркам, без абсолютных цифр точности и без названий конкретных бенчмарков, а число моделей в группе и их конкретные семейства и размеры тоже не раскрыты, по одной аннотации воспроизвести эксперимент нельзя. При этом авторы выложили код в открытом доступе на GitHub, а сама конструкция, награда от независимых моделей вместо самооценки, логически обоснована и проверяема, а не просто рекламная формулировка. Статус рецензирования в самой аннотации не указан, а публикация в виде препринта на HuggingFace Papers/arXiv сама по себе не подтверждает прохождение рецензирования, поэтому цифры стоит считать предварительными до независимой проверки.

Риски и подводные камни

Аннотация не говорит, сколько именно моделей входит в группу, какие конкретно семейства и размеры моделей в ней сочетались и какие именно семь текстовых и четыре мультимодальных бенчмарка использовались для проверки, без этих деталей результат сложно воспроизвести или перенести на другой набор моделей. По сравнению с обучением с учителем авторы говорят только о том, что Co-RL «не уступает ему или превосходит его», а не о стабильном превосходстве, то есть отказ от разметки не гарантирует выигрыша над классическим обучением с учителем в каждом отдельном случае. Алгоритм RL, лежащий в основе обучения, в тексте не назван, указано только общее «RL».