Terminal-Universe: фреймворк воссоздаёт терминальные среды из логов ИИ-агентов

Проблема, которую решает работа: логов работы терминальных кодинг-агентов накопилось много, а вот реалистичных исполняемых сред для их дообучения, мало. Авторы утверждают, что именно среда, а не отдельная трасса, нужна для дообучения агентов: среду можно многократно переопрашивать, получая много проверяемых задач и обратную связь от исполнения, тогда как трасса, это единственный застывший пример.
Вместо того чтобы строить среды с нуля, авторы заметили: история вызовов инструментов внутри уже существующих трасс сама раскрывает структуру и содержимое той среды, в которой агент работал, значит, среду можно восстановить прямо из трассы. На этом строится фреймворк Terminal-Universe. Он проигрывает заново файловые операции, зафиксированные в трассе, и откатывает файлы к состоянию до правок агента, так получается частичное рабочее пространство. Затем отдельный «агент-дополнитель» достраивает недостающие файлы и зависимости. На восстановленном пространстве фреймворк и воссоздаёт исходную задачу трассы, и синтезирует совершенно новые.
Задачи масштабируются по двум осям. По ширине: система находит направленные зависимости между разными восстановленными средами и составляет межпроектные запросы, охватывающие сразу несколько кодовых баз, так же, как в реальной разработке. По глубине: изначально однораундовый запрос превращается в многораундовую сессию, где отдельный «агент-пользователь» имитирует уточнение требований и итеративную обратную связь.
Применив метод к публичным трассам терминальных агентов, авторы получили 37,3 тыс. сред, пригодных для формирования задач. Дообучение модели Qwen3.5-27B на этом корпусе подняло однораундовый результат на бенчмарке Terminal-Bench 2.1 на 11,9 балла и многораундовый результат на бенчмарке EvoCode-Bench v2 MT@4, на 13,8 балла.
Ключевые факты
- Terminal-Universe проигрывает файловые операции из трассы агента, откатывает файлы до состояния «до правки» и получает частичное рабочее пространство; отдельный «агент-дополнитель» достраивает недостающие файлы и зависимости.
- На восстановленном пространстве фреймворк одновременно воссоздаёт исходную задачу трассы и синтезирует новые.
- Масштабирование по ширине: межпроектные запросы, охватывающие несколько кодовых баз через выявленные зависимости между средами.
- Масштабирование по глубине: однораундовый запрос превращается в многораундовую сессию с «агентом-пользователем», имитирующим уточнение требований.
- Итог применения к публичным трассам, 37,3 тыс. пригодных сред; дообучение Qwen3.5-27B на этом корпусе дало +11,9 балла на Terminal-Bench 2.1 (один раунд) и +13,8 балла на EvoCode-Bench v2 MT@4 (несколько раундов).
Почему это важно
Дообучение агентов, работающих в терминале, упирается не в нехватку логов их работы, а в нехватку исполняемых сред: логи фиксируют один-единственный застывший эпизод, а для проверяемого обучения нужна среда, которую можно переопрашивать снова и снова, получая обратную связь от реального исполнения кода. Terminal-Universe закрывает этот разрыв не сбором новых сред вручную, а извлечением их из уже накопленных трасс: сама история файловых операций внутри трассы описывает, в каком окружении работал агент, и это окружение можно восстановить.
Кому это важно
В первую очередь тем, кто занимается пост-обучением кодинг- и терминальных агентов и сталкивается с дефицитом качественных исполняемых сред для этого; авторам и пользователям бенчмарков вроде Terminal-Bench, на которых измеряется эффект; шире, исследователям, которые ищут способ превратить уже собранные архивы трасс агентов в источник дообучающих данных, не собирая среды заново.
Как это применить
Подход воспроизводим как методика: взять зафиксированную в трассе историю файловых операций, откатить состояние файлов до правок агента, дополнить получившееся частичное рабочее пространство недостающими файлами и зависимостями через отдельного агента, а затем на этом пространстве генерировать задачи вширь (межпроектные запросы по нескольким кодовым базам) и вглубь (многораундовые сессии с имитацией уточнений от пользователя). В источнике не указаны ни дата релиза, ни доступность кода, данных или чекпоинтов Terminal-Universe, воспроизводить метод пока можно только по описанию в статье.
Можно ли доверять
Источник, научная публикация (карточка на Hugging Face Papers), в аннотации не указаны ни имена авторов, ни организации. Заявленный эффект, прирост на двух конкретных бенчмарках, Terminal-Bench 2.1 и EvoCode-Bench v2 MT@4, при дообучении одной модели, Qwen3.5-27B; в аннотации не приведены ни исходные, ни итоговые абсолютные баллы на этих бенчмарках, только величина прироста, и не указан размер или источник исходного пула трасс, из которых собирались среды.
Риски и подводные камни
Без абсолютных баллов «до» и «после» трудно оценить, насколько велик прирост в 11,9 и 13,8 балла относительно уровня самих бенчмарков. Эффект проверен на одной модели (Qwen3.5-27B) и двух бенчмарках, обобщение на другие модели и задачи аннотацией не подтверждено. Раскрытые в аннотации детали не включают ни план публикации кода и данных, ни объём исходного набора трасс, из которого выращивались 37,3 тыс. сред, это ограничивает независимую проверку и повторение результата.