Repo0, фреймворк для генерации кода «с нуля» с приростом до 30 процентных пунктов

Repo0, фреймворк для генерации кода «с нуля» с приростом до 30 процентных пунктов

Большинство существующих агентных систем для генерации кода исходят из того, что архитектура репозитория уже задана, и агент лишь достраивает код в её рамках. Это предположение не работает в задаче «генерации с нуля» (zero-to-all code generation), где агенту нужно построить весь программный проект напрямую из текстового описания требований, и при этом самому выстраивать и сохранять модульную архитектуру репозитория на протяжении всей разработки.

Авторы представляют Repo0, фреймворк непрерывной структурной эволюции архитектуры для такой генерации «с нуля». Repo0 хранит явное состояние архитектуры в виде «двойного» ориентированного ациклического графа (Dual-DAG): граф уровня требований, граф уровня компонентов и связь выравнивания между ними. Отталкиваясь от текстовых требований, фреймворк итеративно эволюционирует границы компонентов через структурные действия, ориентируясь на метрики модульности, пока архитектура не достигнет «структурной сходимости». После этого сошедшаяся архитектура направляет генерацию кода методом разработки через тестирование (test-driven development).

Repo0 проверили на шести реальных репозиториях из бенчмарка RepoCraft, используя в качестве базовых моделей GPT-5 mini и DeepSeek V3.2. Во всех настройках Repo0 показал самое высокое покрытие функциональности (Functionality Coverage) и самую высокую долю пройденных тестов (Pass Rate) среди сравниваемых подходов. По сравнению с RPG, как обозначено в источнике, сильнейшим из существовавших базовых подходов к планированию репозитория, Repo0 даёт прирост до 20,08 процентных пунктов по покрытию функциональности и до 29,74 процентных пунктов по доле пройденных тестов. Абсолютные значения обеих метрик в тексте не приводятся, только эти приросты относительно RPG.

Абляционный анализ и разбор процесса структурной эволюции дополнительно подтверждают, что вклад в результат вносит каждый из трёх элементов подхода: явное архитектурное состояние Dual-DAG, эволюция структуры, направляемая метриками модульности, и явно фиксируемая точка структурной сходимости.

Ключевые факты

  • Repo0, фреймворк для «генерации кода с нуля»: агент строит весь программный проект по текстовому описанию требований, сохраняя модульную архитектуру репозитория на протяжении всей разработки.
  • В основе, Dual-DAG: граф уровня требований, граф уровня компонентов и связь выравнивания между ними; архитектура итеративно эволюционирует по метрикам модульности до «структурной сходимости», после чего код генерируется методом test-driven development.
  • На бенчмарке из шести реальных репозиториев RepoCraft (базовые модели GPT-5 mini и DeepSeek V3.2) Repo0 показал самое высокое покрытие функциональности и самую высокую долю пройденных тестов среди всех сравниваемых подходов.
  • По сравнению с RPG, сильнейшим из существовавших подходов к планированию репозитория, Repo0 даёт прирост до 20,08 процентных пунктов по покрытию функциональности и до 29,74 процентных пунктов по доле пройденных тестов.
  • Абляционный анализ подтвердил вклад каждого из трёх элементов подхода: архитектурного состояния Dual-DAG, эволюции структуры по метрикам модульности и явной фиксации точки сходимости.

Почему это важно

Обычные агенты для генерации кода достраивают код в рамках уже заданной архитектуры репозитория. Задача «генерации с нуля» устроена иначе: агенту нужно одновременно писать код и выстраивать саму архитектуру проекта, сохраняя её модульность на всём протяжении разработки, без этого растущий проект быстро теряет структуру. Repo0 предлагает явный механизм непрерывной эволюции архитектуры (Dual-DAG с метриками модульности и точкой сходимости) вместо того, чтобы полагаться на неявные архитектурные решения модели, и показывает на бенчмарке заметный отрыв от предыдущего сильнейшего подхода, до 20 процентных пунктов по покрытию функциональности и до 30 процентных пунктов по доле пройденных тестов.

Кому это важно

Разработчикам агентных систем для автоматической генерации кода и инструментов «текст → рабочий проект», а также исследователям, которые занимаются архитектурным планированием репозиториев для LLM-агентов: Repo0 даёт конкретную конструкцию (Dual-DAG, метрики модульности, критерий структурной сходимости) и результаты на публичном бенчмарке RepoCraft, с которыми можно сравнивать новые подходы.

Как это применить

Работа исследовательская: готового публичного инструмента, кода или API в тексте не описано. Практически применимый вывод, сам архитектурный принцип: держать явное состояние архитектуры отдельно от исходных требований, эволюционировать его по метрикам модульности до фиксируемой точки сходимости и только после этого переходить к генерации кода через test-driven development, а не смешивать проектирование архитектуры и написание кода в одном непрерывном процессе.

Можно ли доверять

Оценка проведена на бенчмарке RepoCraft из шести реальных репозиториев с двумя разными базовыми моделями (GPT-5 mini и DeepSeek V3.2), что снижает риск подгонки результата под одну конкретную модель. Repo0 сравнивается с RPG, в тексте он обозначен только как «сильнейший базовый подход к планированию репозитория», без дальнейшего описания метода. Абсолютные значения покрытия функциональности и доли пройденных тестов в тексте не приведены, указаны только приросты в процентных пунктах относительно RPG, поэтому судить об итоговом абсолютном качестве сгенерированного кода по одному этому источнику нельзя. Имена авторов и их принадлежность к организациям, а также место и дата публикации в доступном тексте не указаны.

Риски и подводные камни

Заявленный прирост, это разница между Repo0 и одним конкретным базовым методом (RPG), а не абсолютный уровень качества сгенерированного кода: даже самая высокая доля пройденных тестов среди сравниваемых подходов не означает, что код готов к продакшену без ревью. Результаты получены на шести репозиториях одного бенчмарка, насколько они переносятся на более крупные, менее типичные или сильно отличающиеся по домену проекты, из текста не следует.