Mental World Modeling научил ИИ угадывать мысли и намерения людей

Mental World Modeling научил ИИ угадывать мысли и намерения людей

Новые модели мира (world model), Sora, Genie 3, JEPA, Marble, предсказывают, как изменится сцена после действия, но моделируют только физический слой: объекты, положения, движение, взаимные перекрытия. Что человек в этой сцене думает, хочет или считает социально уместным, в состоянии модели не попадает. Авторы новой статьи утверждают: для сервисных роботов, медицинских ассистентов и совместных агентов этого недостаточно, потому что поведение людей в первую очередь определяют именно скрытые психические состояния.

Свою мысль они иллюстрируют простым примером: если чашку человека переставили в шкаф, пока он не смотрел, чисто физическая модель мира сочтёт сцену нормальной, но предскажет неверное следующее действие. Только модель, которая отслеживает убеждение человека о том, где чашка, способна объяснить, что он будет делать на самом деле.

Авторы предложили фреймворк Mental World Modeling (MWM), опубликованный на GitHub. Он расширяет классические модели мира психическими переменными: убеждения, внимание, цели, намерения, эмоции, нормы и социальные отношения. Целевой агент видит только частичный эгоцентрический вид сцены, тогда как модель мира хранит полное состояние. Каждое действие в MWM раскладывается на физический носитель, например, речь, указание или захват предмета, и психическую нагрузку, например, утешение, обман или отказ. Один и тот же жест (подвинуть чашку по столу) может быть извинением, обманом или заботой, различить их способна только модель, хранящая соответствующие переменные. Авторы прямо не утверждают, что моделируют сознание: психические состояния в MWM, это гипотезы, выведенные из поведения и контекста, а не измерения, и системы на основе фреймворка должны представлять неопределённость и держать свои допущения прозрачными.

Чтобы проверить теорию, исследователи построили MENTIS, модульный конвейер, не требующий дополнительного обучения. Он разбивает процесс на шесть шагов: сначала сцена разбирается и строится эгоцентрический вид, затем варианты действий делятся на физическую и психическую составляющие, а получившиеся состояния параллельно симулируются. Каждую ветку оценивают по трём критериям, физическая правдоподобность, психическая согласованность и социальная уместность, после чего конвейер принимает детерминированное решение. Каждый этап записывает машиночитаемый промежуточный результат, поэтому ошибку можно проследить до конкретного шага.

Для оценки авторы собрали Menti-Bench, датасет из 448 сцен принятия решений: 320 текстовых описаний, 100 историй в картинках и 28 аудиовидеоклипов. В каждой сцене, шесть вариантов ответа и созданное человеком эталонное решение, которое фиксирует не только правильное действие, но и лежащие в его основе психические и физические состояния. В 78 процентах сцен участвуют минимум два персонажа.

Команда протестировала восемь языковых моделей: пять от OpenAI (в их числе GPT-5.6-Sol и GPT-4.1) и три от Anthropic (Claude Fable 5, Claude Opus 4.8, Claude Haiku 4.5). Метрика точности, F1, объединяющая точность и полноту для выбранного действия. С каждым добавленным слоем моделирования показатель растёт: прямые ответы моделей дают в среднем 63,3 балла; самосогласованность (модель отвечает на один вопрос шесть раз и выбирает самый частый ответ) поднимает результат до 77,9; полный конвейер MWM достигает 87,9; люди по тому же протоколу показывают 98,5. Выигрыш нельзя получить простым многократным сэмплированием прямого ответа: самая слабая модель с MWM (GPT-4.1, 84,9 балла) обходит самую сильную модель на прямых ответах с самосогласованностью (GPT-5.6-Sol, 83,6 балла).

Дополнительные тесты подтверждают ключевые допущения фреймворка. Без психического канала модели в среднем теряют 12,1 балла, без физического, 16,5 балла. Если физический и психический переходы предсказываются независимо, а не совместно, теряется 6,4 балла. Эффект психического моделирования сильнее всего именно там, где предсказывает теория: в сценах с межличностным взаимодействием F1 растёт на 26,4 балла, а в сценах, сосредоточенных на объектах, только на 14,0. Более слабые базовые модели выигрывают от явной структуры сильнее, чем более сильные: разрыв между MWM и прямыми ответами составляет 28 баллов для GPT-4.1 и только 21 балл для GPT-5.6-Sol.

Чтобы понять, откуда берётся оставшийся разрыв с человеческим результатом, авторы поочерёдно заменяли отдельные этапы конвейера человеческим эталонным решением. Самый большой прирост от одного этапа дала подстановка идеальных переходов состояния (+3,5 балла), за ней, идеальное начальное состояние (+2,8) и идеальное наблюдение (+1,7). Когда все промежуточные шаги заменены эталонным решением, конвейер достигает 97 баллов. Около 80 процентов оставшегося разрыва связано с ошибками предсказания на промежуточных этапах, в первую очередь, в симуляции перехода состояния. По мнению авторов, именно с неё и стоит начинать дальнейшие улучшения: сложность не в описании текущего состояния, а в симуляции того, как меняется совместный физическо-психический мир.

Вопрос психических состояний упирается в область, где языковые модели традиционно слабы: команда из лаборатории FAIR Meta вместе с университетами Вашингтона и Карнеги, Меллона уже показывала, что модели проваливают сложные тесты на понимание чужих намерений (theory of mind) и справляются с отслеживанием состояния мира ещё хуже, чем с приписыванием убеждений. MWM накладывает психические состояния на модель извне, через конвейер предобработки; внутри самих моделей, впрочем, формируется что-то похожее и без внешней надстройки, Anthropic обнаружила внутри Claude своего рода внутренний черновик, хранящий словоподобные мысли, которые никогда не выводятся наружу и без которых рассуждение из нескольких шагов ломается.

Модели мира считаются главной ставкой ИИ-индустрии после чисто языковых моделей. Демис Хассабис, недавно покинувший пост операционного главы Google DeepMind, говорит, что тратит на эту тему большую часть исследовательского времени, и ожидает для таких систем «момента ChatGPT»; инвесторы вкладывают сотни миллионов в стартапы вроде Odyssey. Но что именно считать моделью мира, до сих пор предмет спора: международная команда под руководством Пекинского университета недавно предложила более узкое определение, исключающее модели «текст-в-видео» вроде Sora, поскольку у них нет обратной связи с реальным миром; Ян Лекун годами утверждает, что генеративный подход, тупиковый путь, и продвигает абстрактные представления. Новая статья, напротив, объединяет Sora, Genie и JEPA в одно семейство и упрекает их все в одном и том же пробеле.

Ключевые факты

  • Фреймворк Mental World Modeling (MWM) добавляет к физическому состоянию модели мира психические переменные, убеждения, намерения, эмоции, нормы, и делит каждое действие на физический носитель и психическую нагрузку.
  • Training-free конвейер MENTIS из шести шагов симулирует варианты действий и оценивает их по физической правдоподобности, психической согласованности и социальной уместности.
  • На бенчмарке Menti-Bench (448 сцен) из восьми протестированных языковых моделей полный MWM поднимает F1 с 63,3 (прямые ответы) и 77,9 (самосогласованность) до 87,9 против 98,5 у людей.
  • Слабейшая модель с MWM (GPT-4.1, 84,9 балла) обходит сильнейшую модель без него (GPT-5.6-Sol с самосогласованностью, 83,6); эффект сильнее в межличностных сценах (+26,4 балла), чем в сценах с объектами (+14,0).
  • Главное узкое место, симуляция перехода состояния: на неё приходится основная часть оставшегося разрыва с человеком (при полной замене эталоном конвейер даёт 97 баллов, около 80% разрыва, ошибки промежуточных этапов).

Почему это важно

Существующие модели мира, Sora, Genie 3, JEPA, Marble, воспроизводят только физику сцены: объекты, положения, движение. Что человек думает, хочет или считает уместным, в их состоянии не отражается, а именно скрытые психические состояния в первую очередь определяют поведение людей. Показательный пример авторов: если чашку переставили в шкаф, пока человек не смотрел, чисто физическая модель сочтёт сцену нормальной, но предскажет неверное следующее действие, только модель, отслеживающая убеждение человека о местонахождении чашки, объясняет, что он сделает на самом деле. MWM закрывает именно этот пробел, и результат измерим: полный конвейер поднимает точность предсказания действий (F1) с 63,3 до 87,9 балла.

Кому это важно

В первую очередь, разработчикам сервисных роботов, медицинских ассистентов и любых совместных агентов, которым нужно предсказывать поведение человека, а не только физику сцены. Дальше, исследователям моделей мира и theory-of-mind в целом: статья явно спорит с текущим поколением систем (Sora, Genie, JEPA) и с тем, как вообще определяют «модель мира», в этот спор включены Демис Хассабис (ожидает «момент ChatGPT» для моделей мира), Ян Лекун (считает генеративный подход тупиковым) и команда Пекинского университета с более узким определением. Наконец, это релевантно инвесторам, вкладывающим в стартапы по моделям мира вроде Odyssey.

Как это применить

Референсная реализация MWM, конвейер MENTIS, который не требует дополнительного обучения и накладывается поверх существующих моделей мира. Он разбит на шесть шагов: разбор сцены и построение эгоцентрического вида агента, разделение вариантов действия на физическую и психическую составляющие, параллельная симуляция получившихся состояний, оценка каждой ветки по трём критериям (физическая правдоподобность, психическая согласованность, социальная уместность) и детерминированное итоговое решение. Каждый шаг пишет машиночитаемый промежуточный результат, что позволяет проследить ошибку до конкретного этапа. Код опубликован на GitHub.

Можно ли доверять

Источник читается как полноценный разбор научной работы: приведены методология бенчмарка Menti-Bench (448 сцен трёх типов, шесть вариантов ответа, эталонные решения человека), усреднённые результаты по восьми моделям и серия абляционных экспериментов, подтверждающих собственные допущения авторов. При этом в статье не названы ни авторы работы, ни их институциональная принадлежность, ни площадка публикации (кроме GitHub), ни дата; из восьми протестированных моделей числовые F1-показатели приведены только для GPT-4.1 и GPT-5.6-Sol, без доверительных интервалов или проверки статистической значимости различий; не описано, как именно строились и валидировались человеческие эталонные решения, и не указан источник финансирования исследования.

Риски и подводные камни

Сами авторы предупреждают: MWM не моделирует сознание, а психические состояния в нём, это гипотезы, выведенные из поведения и контекста, а не измерения; системы на основе фреймворка должны явно представлять неопределённость, а не выдавать догадки за факт. Остаётся и нерешённый спор о самом определении «модели мира», Ян Лекун годами считает генеративный подход тупиковым, а команда Пекинского университета вовсе исключает text-to-video модели вроде Sora из этой категории. Наконец, собственные эксперименты авторов показывают, что до человеческого уровня фреймворку ещё далеко: узкое место, симуляция перехода состояния, на которую приходится большая часть оставшегося разрыва с эталоном.

«момент ChatGPT»

— Демис Хассабис, о моделях мира

Компания Meta Platforms признана экстремистской организацией, её деятельность на территории РФ запрещена.