VibeWorlding: GPT-5.5 не справился с тестом на создание 3D-миров, open-source модели обошли его

VibeWorlding: GPT-5.5 не справился с тестом на создание 3D-миров, open-source модели обошли его

Яньсун Нин (Yansong Ning) с соавторами представили VibeWorlding, унифицированный фреймворк для оценки и обучения мультимодальных ИИ-агентов, которые должны самостоятельно строить интерактивный 3D-мир по запросу пользователя: понимать намерение, планировать раскладку сцены, вызывать 3D-инструменты и учитывать мультимодальную обратную связь в ходе многошагового взаимодействия со средой. Авторы отмечают, что существующие способы оценки таких агентов проверяют их в основном на упрощённых, «идеальных» запросах и не позволяют системно сравнить, как агенты понимают намерение пользователя, пользуются 3D-инструментами и рассуждают над текстовой и визуальной информацией о мире.

Для системной проверки авторы собрали бенчмарк VWE-BENCH: 2 616 качественных 3D-ассетов, 323 размеченных вручную исходных 3D-мира (заготовки сцен) и 6 828 сгенерированных в обратном порядке мультимодальных пользовательских запросов. Запросы разделены на проверяемые, с эталонным ответом, и непроверяемые, которые оцениваются по детально прописанным критериям (рубрикам).

Дополнительно авторы построили VibeWorlding-Gym, совместную среду для мультимодального RL-дообучения. Она включает: (1) песочницу, в которой поиск ассетов, их редактирование и рендер изображений объединены в виде MCP-инструментов, и (2) верификатор по рубрикам, который одновременно проверяет физическую реализуемость сцены и то, выполнено ли намерение пользователя; этот же верификатор служит источником награды для RL-обучения и одновременно инструментом честного сравнения моделей.

Эксперименты показали, что современные топовые мультимодальные модели ещё далеки от решения этой задачи: даже GPT-5.5 и Qwen3.8-Max показывают успех ниже 60%. Авторы связывают это узкое место с неточным редактированием 3D-мира. При этом RL-дообучение смягчает эту слабость и позволяет открытым моделям обойти закрытые топовые: VibeWorlder-8B сопоставима по качеству с топовыми моделями, а флагманская VibeWorlder-30B-A3B показывает лучший общий результат по метрике Pass@1 среди всех протестированных моделей.

Ключевые факты

  • VibeWorlding, фреймворк для оценки и RL-обучения мультимодальных агентов, которые по текстовому запросу строят интерактивный 3D-мир: понимают намерение, планируют сцену, вызывают 3D-инструменты и учитывают обратную связь.
  • Бенчмарк VWE-BENCH включает 2 616 3D-ассетов, 323 размеченных вручную исходных 3D-мира и 6 828 сгенерированных мультимодальных запросов, часть с эталонными ответами, часть оценивается по рубрикам.
  • VibeWorlding-Gym, среда для RL-дообучения: песочница с MCP-инструментами для поиска/редактирования ассетов и рендера, плюс верификатор по физической реализуемости и выполнению намерения пользователя.
  • Топовые модели GPT-5.5 и Qwen3.8-Max показывают успех ниже 60%, авторы называют узким местом неточное редактирование 3D-мира.
  • После RL-дообучения открытые модели авторов обходят закрытые: VibeWorlder-8B сопоставима с топовыми моделями, а VibeWorlder-30B-A3B, лучший результат по Pass@1 среди всех протестированных моделей.

Почему это важно

Большинство существующих способов оценки ИИ-агентов, строящих 3D-сцены, тестирует их на упрощённых, «идеальных» запросах и не позволяет системно сравнить, как агенты понимают намерение пользователя, пользуются 3D-инструментами и рассуждают над текстовой и визуальной информацией о мире. VibeWorlding закрывает этот пробел: единый бенчмарк (VWE-BENCH) и среда для RL-обучения (VibeWorlding-Gym) проверяют весь цикл, от запроса до готовой интерактивной сцены, на тысячах реалистичных запросов, а не на игрушечных примерах.

Кому это важно

Разработчикам мультимодальных агентов и RL-исследователям, как готовый бенчмарк и среда для тренировки и сравнения моделей на задаче построения 3D-миров. Командам, которые делают инструменты генерации 3D-контента и игровых или симуляционных сцен по текстовому описанию, как ориентир, где именно современные модели, включая топовые закрытые, проседают. Тем, кто оценивает прогресс мультимодальных агентов в целом, как пример методологии оценки agent-задач через многошаговое взаимодействие со средой и верификатор по рубрикам.

Как это применить

Работа даёт три конкретных артефакта: бенчмарк VWE-BENCH (2 616 3D-ассетов, 323 исходных 3D-мира, 6 828 запросов) для замера качества собственных агентов; среду VibeWorlding-Gym с MCP-инструментами и верификатором по рубрикам, как готовую площадку для RL-дообучения агентов на задаче построения 3D-миров; и две обученные так открытые модели, VibeWorlder-8B и VibeWorlder-30B-A3B, которые можно использовать или взять за отправную точку. В источнике не указаны ни дата релиза, ни доступность кода, ни ссылки на скачивание датасета или моделей, это стоит уточнять отдельно перед практическим применением.

Можно ли доверять

Это препринт на Hugging Face Papers, а не публикация, прошедшая рецензирование в журнале или на конференции, выводы получены самими авторами на их же бенчмарке, независимой проверки третьей стороной в источнике нет. В аннотации не назван состав авторов, кроме первого (Яньсун Нин), и не указаны аффилиации. Точные числовые значения Pass@1 для VibeWorlder-8B и VibeWorlder-30B-A3B в аннотации не приведены, названо лишь качественно, что первая модель «сопоставима» с топовыми, а вторая показывает «лучший результат».

Риски и подводные камни

Бенчмарк и метод верификации построены и настроены самими авторами, есть риск, что бенчмарк неявно подстроен под их собственный подход к RL-обучению, а на других задачах или средах разрыв между открытыми и закрытыми моделями может не подтвердиться. В аннотации нет данных о том, сколько всего моделей протестировано и кто входит в список сравнения, кроме GPT-5.5 и Qwen3.8-Max, оценить полноту сравнения по одному абстракту нельзя. Формулировка «успех ниже 60%» размыта: насколько именно ниже у каждой из двух моделей по отдельности, не указано.