DisCo дистиллирует репозитории GitHub в навыки для ИИ-агентов, прирост до 134,3% на бенчмарках

Автономные агенты всё чаще ведут исследования по машинному обучению целиком, от постановки задачи до эксперимента. Такой агент строится из модели-основы и «обвязки» (harness) для планирования, выполнения, памяти и проверки, но предметное know-how, то, что отличает знание метода от умения заставить его работать, остаётся вне архитектуры агента. Авторы называют это операционным знанием: оно есть в репозиториях и статьях, но записано для человека и слишком объёмно, чтобы грузить его целиком в рамках одной задачи.
Авторы представляют DisCo, исследовательского агента, который сам создаёт и использует навыки. Дистилляция знания идёт в двух формах: task-agnostic, сжатие широко используемых репозиториев поля в переиспользуемые навыки впрок, и task-oriented, навыки под конкретную задачу. Применив task-agnostic-дистилляцию ко всей открытой экосистеме, авторы собрали библиотеку AREX-Skill Library: 5000+ проверенных навыков, дистиллированных из 1000 широко используемых ML-репозиториев, организованных в 20 областей и 178 семейств возможностей.
При фиксированных модели-основе (GPT-5.5), обвязке и бюджете на выполнение задач ниже по цепочке агент с навыками показал результат выше того же агента без навыков: на 134,3% на MLE-bench, на 34,4% на PaperBench, на 9,2% на FrontierCS и на 14,0% на PassNet. По утверждению авторов, прирост объясняется именно добавлением дистиллированного операционного контекста при прочих равных условиях эксперимента.
Ключевые факты
- DisCo, исследовательский ИИ-агент, который сам дистиллирует GitHub-репозитории в компактные проверенные навыки и использует их в работе.
- Библиотека AREX-Skill Library: 5000+ проверенных навыков из 1000 широко используемых ML-репозиториев, разложенных на 20 областей и 178 семейств возможностей.
- При фиксированных модели-основе GPT-5.5, обвязке агента и бюджете выполнения агент с навыками обошёл тот же агент без навыков на 134,3% на MLE-bench, 34,4% на PaperBench, 9,2% на FrontierCS и 14,0% на PassNet.
- Дистилляция идёт в двух формах: task-agnostic, впрок, под всю открытую экосистему репозиториев, и task-oriented, под конкретную задачу.
Почему это важно
Агенты, которые ведут ML-исследования end-to-end, опираются на модель и обвязку для планирования и проверки, но предметное know-how, как реально заставить метод работать, в эту архитектуру не входит: оно разбросано по репозиториям и статьям, написанным для людей и слишком объёмным, чтобы агент держал их в контексте задачи. DisCo показывает, что это знание можно один раз дистиллировать в компактные проверенные навыки и переиспользовать в разных запусках вместо того, чтобы агент каждый раз заново «открывал» его сам. При прочих равных условиях (та же модель-основа, та же обвязка, тот же бюджет) это дало измеримый прирост, вплоть до 134,3% на MLE-bench.
Кому это важно
Тем, кто строит автономных агентов для ML-исследований и инженерных задач: разработчикам агентных харнессов, командам, оценивающим агентов на бенчмарках вроде MLE-bench или PaperBench, и всем, кто работает с базами знаний и навыков для ИИ-систем, идея «дистиллировать репозиторий в навык» переносится за пределы одной лишь ML-области.
Как это применить
Подход описан в двух режимах: task-agnostic-дистилляция впрок, прогнать через неё широко используемые репозитории целой экосистемы и получить переиспользуемую библиотеку навыков (так и была собрана AREX-Skill Library из 1000 репозиториев), и task-oriented, дистиллировать навыки под конкретную задачу на лету. В источнике не указаны ни дата релиза, ни лицензия, ни доступность кода или самой библиотеки, судить о том, можно ли уже воспользоваться DisCo или AREX-Skill Library, по тексту нельзя.
Можно ли доверять
Сравнение методологически корректно поставлено: модель-основа (GPT-5.5), обвязка агента и бюджет выполнения зафиксированы в обеих ветках эксперимента, различается только наличие навыков, это изолирует переменную, которой авторы приписывают эффект. Вместе с тем в тексте не названы ни авторы, ни институции, ни то, как именно проверялись (verified) навыки в библиотеке, независимо оценить методологию верификации по имеющемуся источнику невозможно.
Риски и подводные камни
Источник не называет ни авторов, ни организацию за DisCo, что ограничивает проверяемость заявленных цифр. Не описано, как именно устроена проверка (verification) навыков в AREX-Skill Library и что считается «проверенным» навыком. Сравнение проведено только с той же версией агента без навыков, с другими исследовательскими агентами или альтернативными подходами к операционному знанию сопоставления нет. Наконец, состав 20 областей и 178 семейств возможностей не раскрыт, только числа, без разбивки по содержанию.