Designer-RSI: агент для дизайна поднял успех задач с 72,7% до 99,3% без дообучения

Профессиональный графический дизайн, длинная многошаговая задача для ИИ-агента: результат складывается из множества взаимозависимых действий, а надёжного автоматического способа оценить качество итога нет. Авторы предложили фреймворк непрерывной адаптации: топовая модель с зафиксированными весами (её саму не дообучают) управляет профессиональным дизайн-редактором через более чем 230 инструментов, а рядом работает внешняя «процедурная память», база текстовых инструкций (навыков) на естественном языке, которая сама копится и уточняется по опыту выполненных задач, без изменения весов модели и без разметки человеком.
Память растёт двумя способами. «Расширение» добавляет новые навыки под повторяющиеся подзадачи, которые память ещё не покрывает. «Углубление» переписывает уже имеющиеся навыки, сверяя их с собственными удачными и неудачными прогонами агента. Принять правку в память может только парный фильтр: он пропускает изменение, лишь если оно устраняет прежние провалы и при этом не портит уже подтверждённые успешные случаи.
За пять раундов на 1406 реальных пользовательских брифах и 1869 автоматически оценённых траекториях база навыков выросла со 76 (изначально выведенных из документации инструментов) до 139. Доля успешно выполненных задач по метрике GenEval2 на модели Claude-Sonnet-4 поднялась с 72,7% до 99,3% (авторы указывают это как рост на 11,99 балла по качеству генерации). По четырём специализированным дизайн-бенчмаркам агент с процедурной памятью обыгрывает агента без неё в 61,8% случаев на Claude-Sonnet-4 и в 67,6% случаев на Claude-Opus-4.6.
Отдельно проверили вклад каждого механизма памяти на 200 отложенных брифах из бенчмарка на основе реального пользовательского трафика: только расширение даёт 49,4% побед над агентом без памяти, только углубление, 48,6%, а их сочетание, уже 58,5% (статистическая значимость p = 0,025). То есть оба механизма по отдельности дают близкий, скромный эффект, а вместе усиливают друг друга.
Вывод авторов: процедурная память на естественном языке, практичный способ непрерывно дообучать поведение агента там, где обратная связь шумная и не поддаётся автоматической проверке, как в дизайне.
Ключевые факты
- Designer-RSI: агент на базе модели с фиксированными весами (без дообучения) управляет дизайн-редактором через 230+ инструментов, а рядом растёт внешняя память текстовых навыков
- Память расширяется (новые навыки под непокрытые подзадачи) и углубляется (правка старых навыков по удачным/неудачным прогонам); правки в память проходят только через парный фильтр, не допускающий регресса
- За 5 раундов на 1406 реальных брифах и 1869 оценённых траекториях база навыков выросла с 76 до 139, а успех выполнения задач (GenEval2) на Claude-Sonnet-4, с 72,7% до 99,3%
- На четырёх специализированных бенчмарках агент с памятью выигрывает у агента без неё в 61,8% случаев на Claude-Sonnet-4 и в 67,6% на Claude-Opus-4.6
- На 200 отложенных брифах расширение и углубление по отдельности дают 49,4% и 48,6% побед, а вместе, 58,5% (p = 0,025)
Почему это важно
В дизайне, как и во многих агентных задачах, нет надёжного автоматического судьи качества, оценить результат «на лету» нечем, а разметка человеком дорога и медленна. Designer-RSI показывает способ непрерывно улучшать поведение агента без единого обновления весов модели и без единой ручной разметки: вся адаптация происходит на уровне внешней текстовой памяти навыков, которую пополняет и правит сам агент по своим же прогонам.
Кому это важно
Тем, кто строит агентные системы для задач без чёткого автоматического критерия успеха, не только дизайн, но и любые долгие многошаговые процессы с инструментами и субъективным качеством результата. Подход интересен и разработчикам инструментов на базе больших моделей: он даёт способ адаптировать поведение агента к реальному профилю запросов пользователей без дообучения самой модели.
Как это применить
Механизм описан как две операции над банком навыков: добавление новых текстовых инструкций под подзадачи, которые агент раньше не покрывал, и переписывание существующих инструкций по итогам удачных и неудачных попыток. Ключевая деталь, правки проходят через контроль, который принимает изменение, только если оно чинит прежние провалы и не портит уже работающие случаи; это защищает от отката качества при обучении на новых данных.
Можно ли доверять
Источник, карточка препринта на Hugging Face Papers с абстрактом статьи; сама методология построена на измеримых числах (доли успеха, win rate, p-значение) и описанном протоколе из пяти раундов на реальных брифах. При этом в доступном тексте не указаны ни авторская организация/аффиляция, ни сроки эксперимента, ни то, публикуются ли код, память навыков или набор из 1406 брифов в открытом доступе, эти детали для независимой проверки в источнике попросту отсутствуют.
Риски и подводные камни
Все сравнения даны только против собственного базового агента без памяти навыков, сопоставления с другими методами непрерывного обучения или другими системами агентной памяти в источнике нет, так что относительное преимущество подхода по отношению к альтернативам с рынка оценить нельзя. Не раскрыты стоимость и задержка работы такой системы в проде, а также неясно, насколько результаты, полученные на дизайн-бенчмарках, перенесутся на другие предметные области.
«Процедурная память, практичный путь к непрерывной адаптации агентов в условиях зашумлённой, непроверяемой обратной связи.»
— авторы работы