ToolArtist: модель научили самой решать, рисовать или искать

ToolArtist: модель научили самой решать, рисовать или искать

Модели генерации изображений по тексту (text-to-image, T2I) визуально сильны, но плохо справляются с задачами открытого мира, теми, что требуют сложного понимания смысла запроса, многошаговых рассуждений и обращения к внешним знаниям о мире, которых нет в самой модели. Прежние попытки сделать генерацию изображений «агентной» решали эту проблему лишь наполовину: либо весь процесс жёстко прописывали заранее, либо агент управлял только частью процесса, а остальное оставалось на фиксированной логике. В обоих случаях рассуждение, обращение к инструментам и само рисование не координируются одной и той же «головой», решения принимаются раздельно, а не единой политикой.

Восемь исследователей, Цзяхао Чжао, Сяоминь Юй, Чжунсян Сунь, Фэнвэй Тэн, Чэнвэй Цинь, Сяобинь Ху, Цзюнь Сюй и Шуйчэн Янь, опубликовали 5 августа 2026 года статью с моделью ToolArtist: полностью агентной моделью генерации изображений, полученной дообучением уже существующей унифицированной мультимодальной модели (Unified Multimodal Model, UMM). Какая именно базовая модель использована, в статье не уточняется. ToolArtist динамически координирует рассуждение, обращение к внешним инструментам и собственно генерацию картинки в рамках одной единой политики: модель сама решает на каждом шаге, что делать дальше, вместо того чтобы следовать заранее прописанному сценарию.

Обучение состоит из двух этапов. На этапе SFT (контролируемого дообучения) авторы сначала снабдили отдельного агента-«учителя» инструментами поиска и отдельным инструментом генерации изображений и собрали траектории его работы: подумал, поискал, нарисовал. Затем эти траектории превратили в данные для обучения UMM так, что явный вызов инструмента рисования в них скрыт, а само получившееся изображение оставлено. Так модель учится воспринимать рисование как собственное действие, а не как обращение к внешнему инструменту.

На этапе обучения с подкреплением (RL) авторы построили собственную агентную RL-инфраструктуру для UMM-моделей и предложили метод RAD-GRPO (Reason-Act-Draw GRPO, «рассуждай-действуй-рисуй»), вариант GRPO с двумя дополняющими друг друга наградами: за соответствие результата замыслу запроса (intent) и за качество самого изображения (quality). Обе награды используются вместе, чтобы совместно оптимизировать рассуждение, вызов инструментов и рисование, а не обучать их по отдельности.

По словам авторов, эксперименты показывают: если отдать агенту-политике весь процесс генерации изображений открытого мира целиком, результат стабильно превосходит и модели с жёстко прописанным сценарием, и модели, где агент управляет лишь частью процесса. Конкретных цифр, названий бенчмарков или систем для сравнения в тексте статьи не приведено, авторы говорят об этом преимуществе в общих словах.

Авторы заявляют, что выкладывают в открытый доступ обучающие данные и полную инфраструктуру дообучения. При этом на момент публикации страница статьи на Hugging Face не показывает ни одной привязанной модели, датасета или демо-пространства и не указывает институт или университет ни для одного из восьми авторов. Статья вышла как препринт, ссылки на странице ведут только на arXiv и на PDF, и 6 августа 2026 года возглавила раздел Hugging Face Daily Papers с 31 голосом «за» от пользователей.

Ключевые факты

  • ToolArtist, полностью агентная модель генерации изображений: одна обученная политика сама решает, рассуждать ли дальше, обратиться ли к инструменту поиска или сразу нарисовать картинку, вместо жёстко прописанного порядка шагов.
  • Статью о модели опубликовали 5 августа 2026 года восемь исследователей, Цзяхао Чжао, Сяоминь Юй, Чжунсян Сунь, Фэнвэй Тэн, Чэнвэй Цинь, Сяобинь Ху, Цзюнь Сюй и Шуйчэн Янь; организация или университет ни для одного из них на странице Hugging Face не указаны.
  • Обучение, в два этапа: сначала SFT на траекториях агента-«учителя» с инструментами поиска и рисования (вызов инструмента рисования в данных скрыт, изображение, оставлено), затем RL с новым методом RAD-GRPO (Reason-Act-Draw GRPO), который совмещает награду за соответствие замыслу и награду за качество изображения.
  • По утверждению авторов, в их экспериментах полностью агентный подход стабильно превосходит модели с жёстким сценарием и модели с частичным агентным контролем; конкретных цифр, бенчмарков или систем сравнения в тексте статьи нет.
  • Авторы заявляют о выпуске обучающих данных и инфраструктуры дообучения в открытый доступ, но на момент публикации на странице статьи на Hugging Face не привязано ни одной модели, датасета или демо-пространства; 6 августа 2026 года статья возглавила Hugging Face Daily Papers с 31 голосом «за».

Почему это важно

Современные модели генерации изображений по тексту визуально сильны, но плохо справляются с задачами открытого мира, теми, что требуют сложного понимания смысла запроса, многошаговых рассуждений и обращения к внешним знаниям, которых нет в самой модели. Прежние попытки сделать генерацию изображений «агентной» решали эту проблему лишь наполовину: либо процесс жёстко прописывали заранее, и агент лишь выполнял фиксированные шаги, либо агент управлял только частью процесса, а остальное оставалось на фиксированной логике. В обоих случаях рассуждение, обращение к инструментам (например, к поиску) и само рисование координируются разными механизмами, а не одной «головой», решения по ходу работы не согласованы между собой. ToolArtist предлагает отдать агенту весь процесс целиком: рассуждать, искать и рисовать под управлением одной обученной политики, которая сама решает, что делать на каждом шаге.

Кому это важно

В первую очередь, инженерам и исследователям, которые строят мультимодальные ИИ-агенты и системы генерации изображений с обращением к внешним источникам: статья описывает конкретный рецепт обучения (SFT на скрытых траекториях инструментов плюс RL с RAD-GRPO), а не абстрактную идею. Полезна она и командам, которые уже работают с унифицированными мультимодальными моделями (UMM) и хотят добавить агентное поведение, не прописывая сценарий вручную шаг за шагом. Конечным пользователям генераторов изображений статья пока мало что даёт напрямую: базовая модель, на которой обучен ToolArtist, не названа, сравнения с конкретными системами и числовые результаты в тексте отсутствуют, а обещанные авторами данные и инфраструктура на странице статьи пока не привязаны ни к одной модели, датасету или демо-пространству.

Как это применить

Рецепт авторов состоит из двух этапов. Сначала (SFT) они снабжают отдельного агента-«учителя» инструментами поиска и отдельным инструментом генерации изображений и записывают траектории его работы, рассуждение, обращение к инструментам, результат. Эти траектории затем переводят в данные для обучения UMM так, что явный вызов инструмента рисования из них убирают, а само сгенерированное изображение оставляют: в результате модель учится рисовать так, будто это её собственное действие, а не вызов внешнего инструмента. Дальше (RL), обучение с подкреплением на собственной агентной RL-инфраструктуре авторов, с новым методом RAD-GRPO: одна награда проверяет, соответствует ли результат замыслу запроса, другая, насколько хорошо само изображение, и обе награды оптимизируются совместно. Авторы говорят, что выкладывают в открытый доступ обучающие данные и весь код инфраструктуры дообучения, но на момент публикации статьи на её странице на Hugging Face не привязано ни одной модели, датасета или демо-пространства, опробовать рецепт готовыми материалами пока не на чем.

Можно ли доверять

Это свежий препринт: ссылки на странице ведут только на arXiv и на PDF, о рецензировании на этой странице ничего не сказано. Ни для одного из восьми авторов на странице Hugging Face не указана организация или университет. Сама аннотация не называет ни базовую UMM-модель, ни бенчмарки, ни конкретные системы для сравнения, ни единой цифры результата, фраза о том, что полностью агентный подход «стабильно превосходит» альтернативы, это собственная формулировка авторов по итогам их же экспериментов, а не независимо проверяемый результат. При этом 6 августа 2026 года статья возглавила раздел Hugging Face Daily Papers с 31 голосом «за» от пользователей, это показатель интереса сообщества к теме, а не замена рецензированию или независимой проверке заявленного превосходства.

Риски и подводные камни

Когда рассуждение, выбор инструмента и рисование отданы одной и той же обученной политике, ошибка на любом из шагов, например, если агент нашёл при поиске неточную или нерелевантную информацию, может напрямую попасть в итоговое изображение без отдельной проверки на промежуточном шаге. Метод обучения намеренно скрывает из данных сам факт вызова инструмента рисования, оставляя только результат: это помогает модели рисовать так, будто она делает это сама, но одновременно означает, что по поведению модели снаружи не всегда можно понять, в какой мере на итоговую картинку повлиял внешний поиск. Заявление о том, что полностью агентный подход стабильно выигрывает у альтернатив, пока не подкреплено в тексте статьи ни одной цифрой, названием бенчмарка или конкретной системой сравнения, судить о реальном размере и устойчивости выигрыша можно будет только после публикации обещанных данных и инфраструктуры и независимой проверки на их основе.