Code-as-World: физический мир представили как исполняемый код

Code-as-World: физический мир представили как исполняемый код

Современные визуально-языковые модели (VLM) умеют распознавать и объяснять физические события на видео и картинках, но, по словам авторов работы, им не хватает явных представлений о механизмах, которые стоят за этими событиями: состояниях объектов, физических параметрах, законах динамики. Без этого модель не может надёжно рассуждать о том, как мир будет развиваться дальше и как он отреагирует на вмешательство извне.

Авторы предлагают решение, парадигму Code-as-World («мир как код»). Идея в том, чтобы представлять физическую композицию сцены, её развитие во времени и визуальный облик не описанием на естественном языке, а исполняемым кодом. По утверждению авторов, такое представление получается компактным, количественно обоснованным (числа и параметры зашиты в код, а не размыты в тексте) и управляемым, код можно выполнить, отрендерить и проверить.

Чтобы строить такие представления из реальных данных, текстовых описаний или видео, авторы разработали агентный цикл открытия (agentic discovery loop), вдохновлённый абдуктивным рассуждением. Агент выдвигает гипотезу об исполняемом мире, выполняет соответствующий код, рендерит результат, проверяет, насколько он соответствует исходным наблюдениям, и итеративно уточняет гипотезу, пока представление не станет достаточно точным.

В качестве практического применения авторы использовали уже проверенные исполняемые миры как источник масштабируемого физического обучающего сигнала для визуально-языковых моделей, так была получена модель Code-as-World-VL, обученная количественному физическому рассуждению. По данным авторов, она достигает передового результата (SOTA) на бенчмарке QuantiPhy и превосходит ведущие проприетарные модели. Авторы называют это подтверждением того, что исполняемые представления мира могут стать масштабируемой основой для физического интеллекта в целом.

Ключевые факты

  • Проблема: VLM распознают физические события, но не строят явных представлений механизмов, состояний объектов, физических параметров, законов динамики, нужных для рассуждений о том, как мир меняется и реагирует на вмешательства
  • Решение, парадигма Code-as-World: физическая композиция, динамика и визуальный облик мира кодируются как исполняемый код, компактное, количественно обоснованное и управляемое представление
  • Представления строятся агентным циклом открытия по мотивам абдуктивного рассуждения: агент выдвигает гипотезу, выполняет код, рендерит, проверяет соответствие наблюдениям и итеративно уточняет, по текстовым описаниям или реальному видео
  • Проверенные исполняемые миры использовали как масштабируемый источник обучающего сигнала для визуально-языковых моделей, так получена модель Code-as-World-VL для количественного физического рассуждения
  • Code-as-World-VL, по данным авторов, достигает передового результата на бенчмарке QuantiPhy и превосходит ведущие проприетарные модели

Почему это важно

Большинство визуально-языковых моделей описывают физику мира словами, а слова не считаются и не проверяются. Code-as-World предлагает другой уровень абстракции: представлять сцену не пересказом, а исполняемым кодом, который можно запустить, отрендерить и сверить с наблюдением. Это стирает границу между «моделью, которая объясняет физику» и «моделью, которая физику симулирует»: код одновременно и объяснение, и проверяемая, количественно точная гипотеза о том, как устроен мир.

Кому это важно

Работа адресована прежде всего исследователям физического и количественного рассуждения в визуально-языковых моделях, а также тем, кто занимается воплощённым ИИ (embodied AI) и робототехникой, где модели нужно не просто описать сцену, а предсказать, как она изменится при действии. Полезна она и разработчикам бенчмарков вроде QuantiPhy, задача которых, измерять именно количественную физическую точность, а не общую узнаваемость объектов.

Как это применить

Практическое применение, которое описывают сами авторы, не прямое использование готового продукта, а метод обучения: проверенные исполняемые представления мира служат источником масштабируемого физического обучающего сигнала для тренировки VLM, что и дало модель Code-as-World-VL. В тексте абстракта не сказано, публикуют ли авторы код, саму модель или данные, судить об этом по имеющемуся материалу нельзя.

Можно ли доверять

Материал, это абстракт статьи со страницы Hugging Face Papers; сам текст прочитан и проверен фактурой, расхождений с фактурой нет. Но в доступном тексте нет имён авторов и их институтов, нет данных о месте и дате публикации или рецензировании, и, что важнее всего, нет ни одной конкретной цифры по результатам на QuantiPhy, заявление о передовом результате и превосходстве над проприетарными моделями делают сами авторы, без опубликованных числовых показателей в доступном фрагменте.

Риски и подводные камни

Главный риск, отсутствие проверяемых цифр: без чисел нельзя оценить, насколько велик заявленный отрыв от проприетарных моделей и на каких именно задачах QuantiPhy он достигнут. Нет информации об открытии кода, модели или данных, что затрудняет независимую проверку и воспроизведение результата. Наконец, эффективность подхода зависит от того, насколько богат класс физических явлений, которые вообще можно корректно выразить исполняемым кодом, абстракт не раскрывает границ применимости метода.