CodeMidas превращает исходный код проектов в RL-среды для обучения ИИ-агентов программированию

Чтобы обучать ИИ-агентов писать код методом обучения с подкреплением (RL), нужны разнообразные задачи с надёжной проверкой решения. Открытые кодовые базы, богатый источник таких задач, но существующие методы обычно строят их из issue (описаний багов и задач на GitHub) и коммитов, а это сужает круг того, что вообще можно извлечь. Авторы представили CodeMidas, агентный конвейер, который превращает уже реализованную в открытом коде функциональность в исполняемые RL-среды, используя в качестве входных данных только сам исходный код, без issue и коммитов.
CodeMidas задействует агентов на каждом этапе построения среды: сначала агенты исследуют реализованную в кодовой базе функциональность и формулируют по ней поведенческие спецификации (что код должен делать), затем строят тесты, опирающиеся на реальное исполнение исходного кода, и наконец проверяют и отфильтровывают кандидатов в задачи через исполняемые проверки и повторные прогоны решений (rollouts).
В результате получился датасет из 5545 обучающих задач, собранных из 3185 открытых кодовых баз на 23 языках программирования и в 15 технических областях. Авторы обучили на этих задачах модель MiMo-V2.5 методом GRPO (Group Relative Policy Optimization) и получили прирост на всех пяти проверенных бенчмарках: устранение багов по issue (бенчмарк DeepSWE) выросло на 11,7%, построение программ целиком (ProgramBench), на 17%, работа в терминале (Terminal-Bench v2.1), на 8,5%. Названия двух оставшихся бенчмарков и абсолютные баллы по всем пяти в источнике не приводятся, даны только относительные улучшения по трём из них.
Дополнительные эксперименты (абляции) показали: чем больше качественных обучающих задач, тем выше итоговая производительность модели. Анализ траекторий работы агента после RL-обучения показал изменение поведения в лучшую сторону, агент чаще исследует кодовую базу перед тем, как действовать, и разнообразнее самостоятельно проверяет свои решения. Авторы делают вывод, что исходный код сам по себе, масштабируемая основа для построения RL-сред, которые улучшают агентов-программистов на разнородных задачах разработки.
Ключевые факты
- CodeMidas строит RL-среды для обучения кодинг-агентов только из исходного кода открытых проектов, без issue и коммитов, которые ограничивали прежние методы
- Итоговый датасет, 5545 обучающих задач из 3185 открытых кодовых баз, 23 языка программирования, 15 технических областей
- Модель MiMo-V2.5, обученная на этих задачах методом GRPO, прибавила на всех пяти бенчмарках: DeepSWE (устранение багов) +11,7%, ProgramBench (построение программ) +17%, Terminal-Bench v2.1 (работа в терминале) +8,5%
- Абляционные эксперименты: чем больше качественных задач в обучении, тем выше итоговый результат
- Анализ траекторий: после RL-обучения агент чаще исследует кодовую базу и разнообразнее проверяет собственные решения
Почему это важно
Главное ограничение при обучении кодинг-агентов методом RL, нехватка разнообразных задач с надёжной автоматической проверкой. Прежние подходы извлекали такие задачи из issue и коммитов реальных репозиториев, а это резко сужает выборку: далеко не в каждом проекте есть история issue, пригодная для превращения в тренировочную задачу. CodeMidas снимает это ограничение: агентный конвейер строит задачи прямо из уже реализованной в коде функциональности, а не из истории разработки. Это делает потенциальный источник задач намного шире, им становится вообще любой открытый исходный код, а не только те проекты, где велась подходящая работа с issue.
Кому это важно
В первую очередь, командам, которые обучают или дообучают модели-кодинг-агенты методом обучения с подкреплением: им нужен постоянный приток разнообразных, надёжно проверяемых задач, а именно это узкое место снимает CodeMidas. Полезно и исследователям RL-сред в целом, подход показывает, как распределять вычислительный агентный бюджет между этапами построения среды (спецификация, тестирование, фильтрация), а не тратить его на один этап.
Как это применить
Конвейер устроен в три шага. Сначала агенты исследуют функциональность кодовой базы и формулируют по ней поведенческие спецификации, что именно код должен делать. Затем на основе этих спецификаций строятся тесты, опирающиеся на реальное исполнение оригинального кода, а не на предположения о его поведении. Наконец кандидаты в задачи проверяются и отфильтровываются исполняемыми проверками и повторными прогонами решений, так отсеиваются задачи с ненадёжной или случайной проверкой. Итоговые задачи затем используются как обучающие среды при RL-тренировке модели (в статье, MiMo-V2.5 методом GRPO). Публикует ли команда сам датасет или код конвейера в открытом доступе, источник не уточняет.
Можно ли доверять
Источник, карточка препринта на Hugging Face Papers, полный текст аннотации доступен и обработан целиком, при этом у поста скромный охват (38 отметок, 1 комментарий), а имена авторов и их организации в самом тексте не указаны. Приведённые проценты улучшения, относительные (плюс к прежнему результату), а абсолютные баллы моделей на всех пяти бенчмарках в источнике не приводятся, как и названия двух бенчмарков сверх названных трёх. Прямого числового сравнения с другими методами построения RL-сред тоже нет, только общее указание, что те опираются на issue и коммиты. Стоимость вычислений и время, потребовавшиеся на сам конвейер, в тексте не названы.
Риски и подводные камни
Заявленный прирост, это улучшение относительно собственной базовой модели авторов, а не сравнение с результатами конкурирующих методов построения RL-сред на одних и тех же бенчмарках, поэтому судить, насколько CodeMidas лучше существующих подходов в абсолютных цифрах, по этому тексту нельзя. Вывод абляций («больше качественных задач, выше результат») логичен, но остаётся статистическим наблюдением на данных самих авторов, а не независимо подтверждённым фактом. Отдельный риск для практического применения, неизвестная стоимость самого конвейера: сколько агентного вычислительного бюджета уходит на построение одной такой RL-среды, в источнике не сказано, а значит оценить экономическую целесообразность подхода по сравнению с ручной разметкой задач пока не из чего.