AutoDesign обошёл Claude Design в генерации постеров по научным статьям

Яксинь Ло с соавторами представили AutoDesign, фреймворк, в котором мета-оптимизатор харнесса (системы правил и инструментов, управляющей моделью) направляет кодового агента на рекурсивное улучшение этого харнесса по обратной связи от прогонов задачи. Подход опирается на человеческие представления о том, каким должен быть хороший дизайн, и решает проблему, которую авторы формулируют так: существующие подходы к харнессам статичны и не умеют накапливать переиспользуемый опыт для самоулучшения.
Чтобы проверить фреймворк на практике, авторы выбрали задачу превращения научной статьи в постер (плакат для конференции) и построили для неё бенчмарк PosterBench. Он состоит из основного трека на 100 статей из пяти научных дисциплин и отдельного набора PosterBench-mini на 10 статей, общего подмножества для контролируемых сравнений между системами.
На основном треке PosterBench AutoDesign набрал 78,32 балла, это лучший результат среди всех проверенных систем, на 7,45 балла выше, чем у закрытой коммерческой системы Claude Design. В отдельном эксперименте на семи контролируемых конфигурациях «кодовый агент + модель» добавление обученного харнесса DesignHarness подняло средний балл PosterBench с 54,99 до 67,39 (+12,4%).
В режиме полностью автономного долгого цикла работы AutoDesign делает 253 обращения к инструментам и 11 итераций правок за 40 минут, укладываясь при этом менее чем в $3, и по оценке людей выходит на средний уровень качества постера для конференции. Отдельное слепое исследование с участием людей (оценщики не знали, какая система выдала какой постер) показало, что среди всех проверенных систем AutoDesign получил наибольшее предпочтение людей.
Ключевые факты
- AutoDesign, фреймворк, где мета-оптимизатор харнесса направляет кодового агента на рекурсивное самоулучшение харнесса по обратной связи от прогонов, с опорой на человеческие представления о хорошем дизайне
- Для проверки авторы построили бенчмарк PosterBench: основной трек из 100 статей по пяти дисциплинам плюс подмножество PosterBench-mini из 10 статей
- На основном треке PosterBench AutoDesign набрал 78,32 балла, лучший результат среди систем, на 7,45 балла выше закрытой коммерческой системы Claude Design
- На семи контролируемых конфигурациях «агент + модель» добавление обученного харнесса DesignHarness подняло средний балл с 54,99 до 67,39 (+12,4%)
- В автономном режиме AutoDesign делает 253 вызова инструментов и 11 правок за 40 минут менее чем за $3 и получает наибольшее предпочтение людей в слепом сравнении систем
Почему это важно
Работа отвечает на конкретную проблему: харнесс, набор правил, промптов и инструментов, который управляет тем, как модель решает задачу, обычно проектируется один раз и остаётся неизменным. AutoDesign делает харнесс объектом обучения: отдельный мета-оптимизатор смотрит на результаты прогонов и сам переписывает харнесс кодового агента, чтобы тот работал лучше в следующий раз. На задаче генерации постеров это дало не просто прирост качества, а превосходство над названной в статье закрытой коммерческой системой Claude Design.
Кому это важно
В первую очередь, исследователям и инженерам, которые строят долгие автономные агентные цепочки (много шагов, инструментов и правок подряд) и упираются в то, что харнесс агента приходится дорабатывать вручную после каждой неудачи. Также значимо для команд, занятых автоматизацией превращения научных и других текстовых материалов в визуальные форматы: статьи, отчёты, презентации.
Как это применить
Авторы публикуют оба варианта бенчмарка, PosterBench (100 статей, пять дисциплин) и PosterBench-mini (10 статей), как инструмент для сравнения систем генерации постеров и, шире, как площадку для проверки идеи самоулучшающегося харнесса на других задачах. Экономика полностью автономного цикла, 253 вызова инструментов и 11 правок за 40 минут и меньше $3, говорит о том, что подход по стоимости укладывается в рамки практического использования, а не только лабораторной демонстрации.
Можно ли доверять
Источник, аннотация научной статьи на HuggingFace Papers, в которой не указаны ни полный список авторов и их принадлежность, ни дата публикации. Все числовые результаты (в том числе сравнение с Claude Design и итоги слепого исследования с участием людей), это самоотчёт авторов на бенчмарке, который они сами же и создали; независимой проверки этих цифр третьей стороной в тексте нет.
Риски и подводные камни
Сравнение опирается на один бенчмарк узкой предметной области, превращение статьи в постер, и не факт, что выигрыш переносится на другие агентные задачи. В аннотации не раскрыто, из чего именно состоит обученный харнесс DesignHarness и какие семь конфигураций «агент + модель» тестировались, а также не описано, как устроена система сравнения Claude Design, это ограничивает возможность независимо повторить или оспорить результат.