MindForge поднял точность Qwen3.6-27B в написании кода с нуля до 49,51%

Агенты для кодинга неплохо справляются с задачами по изменению существующего кода, исправлением багов и добавлением функций. Но написание полноценной программы с нуля остаётся почти нерешённой задачей: даже топовые (frontier) модели полностью решают менее 1% задач бенчмарка ProgramBench, где нужно построить программу с чистого листа. Авторы объясняют это отсутствием масштабируемых тренировочных сред, которые охватывали бы весь жизненный цикл разработки ПО целиком, существующие фреймворки для построения таких сред покрывают лишь одну фазу разработки.
Чтобы закрыть этот пробел, исследователи представили MindForge, автоматизированный конвейер, который превращает открытые консольные программы (open-source CLI-программы) в так называемые source-free среды: модели на вход дают только скомпилированный эталонный исполняемый файл и документацию к нему, а не исходный код. Это заставляет модель реализовывать программу по спецификации и наблюдаемому поведению, а не подсматривать готовое решение в исходниках.
С помощью MindForge авторы построили тренировочные среды на основе репозиториев, не пересекающихся с теми, что используются в ProgramBench (чтобы исключить утечку тестовых данных), и собрали набор траекторий синтеза программ, используя модель GLM-5.2 в роли модели-учителя, генерирующей эти траектории. На этих данных дообучили модель Qwen3.6-27B: её средний показатель прохождения тестов на ProgramBench вырос с 37,98% до 49,51%, что сопоставимо с результатами существенно более крупных топовых моделей.
Кроме того, дообученная модель стабильно превзошла базовую версию на всех семи «невиданных» (не участвовавших в обучении) бенчмарках по инженерии ПО, они охватывают генерацию и перевод целых репозиториев на большом горизонте, исправление багов, добавление функций и разрешение issue на разных языках программирования. Абсолютный прирост составил: 31,00 пункта на RepoZero-C2Rust, 14,16 на DeepSWE, 10,70/4,56 на NL2Repo-Bench (с тестами / без тестов соответственно), 5,04 на SWE-bench Verified, 5,93 на SWE-bench Pro, 5,22 на SWE-bench Multilingual и 4,94 на FeatBench.
Ключевые факты
- Даже топовые модели полностью решают менее 1% задач ProgramBench на написание программы с нуля, авторы связывают это с нехваткой тренировочных сред, охватывающих весь жизненный цикл разработки
- MindForge, конвейер, который превращает открытые консольные программы в source-free среды: модели видна только скомпилированная эталонная программа и документация, а не исходный код
- Траектории синтеза программ для обучения сгенерированы моделью-учителем GLM-5.2 на репозиториях, не пересекающихся с ProgramBench
- Дообучение Qwen3.6-27B на этих данных подняло средний результат на ProgramBench с 37,98% до 49,51%, до уровня существенно более крупных топовых моделей
- Дообученная модель улучшила результат на всех семи независимых бенчмарках инженерии ПО, с приростом от 4,56 пункта (NL2Repo-Bench без тестов) до 31,00 пункта (RepoZero-C2Rust)
Почему это важно
Написание программы с нуля, куда более редкая тема для тренировки моделей, чем правка существующего кода: по данным авторов, даже топовые модели решают меньше 1% таких задач на ProgramBench, потому что готовых масштабируемых сред для тренировки на полном цикле разработки почти нет. MindForge закрывает именно эту нехватку данных, а не выпускает готовую модель или продукт.
Кому это важно
Работа адресована исследовательским командам, которые обучают или дообучают модели для кодинга и агентов-разработчиков, особенно тем, кто хочет получить от компактной модели (27B параметров) результат, близкий к куда более крупным топовым моделям, без полного отказа от контроля над данными обучения.
Как это применить
MindForge, не продукт с ценой или лицензией, а исследовательский метод и конвейер построения тренировочных сред: берётся открытая консольная программа, из неё убирается исходный код, оставляется только скомпилированный эталон и документация, модель-учитель (в работе, GLM-5.2) генерирует траектории решения, на них дообучается целевая модель (в работе, Qwen3.6-27B). Практическая ценность, в самом рецепте данных, который можно повторить на своих репозиториях.
Можно ли доверять
Материал, препринт-статья на Hugging Face Papers, авторские имена и организация в тексте не названы, обсуждение собрало 22 балла и всего 3 комментария, заметный, но не резонансный отклик сообщества. Все цифры прироста взяты из текста статьи и не проверены независимо; сведений о числе тренировочных сред, размере датасета и затраченных вычислениях в тексте нет.
Риски и подводные камни
Все результаты, самоотчёт авторов на собственном наборе бенчмарков, без независимого воспроизведения. Итоговые 49,51% на ProgramBench, по-прежнему меньше половины задач, то есть даже с MindForge написание программы с нуля остаётся для модели такого масштаба скорее исключением, чем нормой. Неясно и то, какие именно топовые модели брались за ориентир «существенно более крупных» при сравнении результатов.