JarvisHub: открытый харнесс для мультимодальных творческих ИИ-агентов на канвасе

JarvisHub: открытый харнесс для мультимодальных творческих ИИ-агентов на канвасе

Исследователи во главе с Yunlong Lin представили JarvisHub, открытый харнесс (каркас-инфраструктуру) для творческих ИИ-агентов, рассчитанный на долгую многошаговую мультимодальную работу, а не на одноразовую генерацию картинки или видео по одному промпту. Авторы отмечают: современные генеративные модели умеют делать качественные изображения, видео, аудио, элементы интерфейса, раскадровки и слайды, но реальная творческая работа, это не изолированный обмен «промпт-результат». Она включает референсы, черновики, альтернативные варианты, правки, неудачные попытки, связи между версиями, действия инструментов, оценочные сигналы и обратную связь человека, то есть постоянно меняющееся состояние проекта. По словам авторов, существующие промпт-, чат- и нод-ориентированные системы генерации поддерживают такое состояние лишь частично: они теряют промежуточный контекст, полагаются на линейный диалог или требуют вручную заданных workflow (рабочих цепочек). Новые коммерческие системы уже двигаются в сторону агентов-помощников в творческом производстве, но их закрытая архитектура не даёт изучить, как агент представляет контекст, выбирает инструменты, правит артефакты, восстанавливается после сбоев и удерживает согласованность работы во времени. JarvisHub решает эту проблему тем, что делает редактируемый канвас (рабочее полотно) рабочим пространством пользователя, внешней памятью агента, пространством его действий и общим состоянием проекта одновременно. Мультимодальные артефакты, зависимости между ними, версии и обратная связь представлены как типизированные узлы и связи канваса. Архитектура состоит из трёх слоёв: состояние канваса, протокольный мост (protocol bridge, связующий уровень между канвасом и агентом) и runtime (среда исполнения) агента. Благодаря этому агент действует в инспектируемом и редактируемом творческом состоянии: пользователь в любой момент может заглянуть внутрь, скорректировать или вмешаться. Авторы позиционируют это как шаг от разовых обращений к инструментам к устойчивой, управляемой человеком творческой автоматизации, где агент постепенно планирует, генерирует, правит и организует мультимодальные проекты.

Ключевые факты

  • JarvisHub, открытый харнесс для творческих ИИ-агентов, где редактируемый канвас служит одновременно рабочим пространством пользователя, внешней памятью агента, пространством его действий и общим состоянием проекта.
  • Мультимодальные артефакты (изображения, видео, аудио, UI-элементы, раскадровки, слайды), их версии, зависимости и обратная связь представлены как типизированные узлы и связи на канвасе.
  • Архитектура трёхслойная: состояние канваса, протокольный мост между канвасом и агентом, и runtime самого агента.
  • В отличие от закрытых коммерческих систем, открытая архитектура позволяет изучать, как агент выбирает инструменты, хранит контекст, восстанавливается после ошибок и держит согласованность на протяжении долгой работы.
  • Пользователь сохраняет возможность в любой момент инспектировать, направлять и вмешиваться в процесс, агент не работает в закрытом чёрном ящике.

Почему это важно

Творческий ИИ смещается от разовой генерации одного изображения или видео к долгой многошаговой мультимодальной работе. Авторы указывают, что существующие промпт-, чат- и нод-системы плохо удерживают состояние проекта: теряют промежуточный контекст, зависят от линейного диалога или требуют ручных workflow. JarvisHub предлагает архитектуру, где всё это состояние, черновики, версии, зависимости, обратная связь, хранится явно и открыто на канвасе, а не теряется между шагами.

Кому это важно

Работа адресована исследователям и разработчикам, создающим инструменты и агентов для мультимодального творческого производства, изображений, видео, аудио, UI, раскадровок, слайд-презентаций. Также она важна тем, кто изучает архитектуру ИИ-агентов в целом: открытый харнесс даёт возможность разбирать механику агента, которую закрытые коммерческие системы скрывают.

Как это применить

Практический вклад, сама архитектура: канвас как общее состояние проекта плюс три слоя (состояние канваса, протокольный мост, runtime агента). Разработчики творческих инструментов могут использовать эту схему как основу для построения собственных агентов, которые планируют, генерируют, правят и организуют мультимодальные проекты, оставляя пользователю контроль на каждом шаге.

Можно ли доверять

Материал, открытая исследовательская работа (препринт), автор Yunlong Lin с соавторами, опубликованная через HuggingFace Papers. Это ранняя стадия: на момент публикации у поста скромные метрики (27 очков, 1 комментарий), заметной обкатки на практике пока не описано. Ценность работы, в самой открытой архитектуре и возможности её изучать, а не в подтверждённых результатах масштабного внедрения.

Риски и подводные камни

Как исследовательский харнесс, JarvisHub пока не проверен на большом реальном объёме творческих проектов, и авторы сами формулируют задачу скорее как открытие поля для изучения, чем как готовое решение. Открытая архитектура заведомо отстаёт по полировке от закрытых коммерческих систем, которые авторы упоминают как ориентир. Остаются открытыми вопросы масштабируемости канваса при большом числе артефактов и версий, а также того, насколько легко реальным пользователям будет вмешиваться в работу агента без перегрузки интерфейса.