Исследователи представили EvolvingWorld: фреймворк для эволюции ИИ-персонажей и миров

Группа исследователей опубликовала на Hugging Face работу EvolvingWorld, фреймворк и тестовый набор (бенчмарк) для симуляции интерактивных литературных миров, в которых персонажи и сам мир меняются совместно на протяжении долгого времени. Авторы указывают на проблему существующих систем: те либо имитируют статичную личность персонажа без развития, либо генерируют изолированные сцены, но не связывают их в единую эволюционирующую историю. EvolvingWorld моделирует симуляцию как длительный процесс, где персонажи взаимодействуют, сцены сменяют друг друга, а состояния персонажей и мира постоянно обновляются и сохраняются.
В отличие от предыдущих систем с жёсткой заранее заданной структурой данных, EvolvingWorld использует открытую схему (open-schema), позволяющую применять фреймворк к самым разным литературным вселенным, а не к одному фиксированному сеттингу. Архитектура состоит из двух связанных модулей: «Персонаж-агент» (Character Agent) отвечает за ролевое поведение сразу нескольких персонажей и за постоянное развитие их профилей, а модель мира (World Model) на основе большой языковой модели поддерживает состояние, как глобальное, так и на уровне отдельных локаций и объектов, и продвигает сюжет вперёд. На этой архитектуре авторы сформулировали 7 обучаемых задач: инициализация сцены, генерация взаимодействий и обновление состояния.
Для обучения и проверки фреймворка команда собрала датасет из 57 книг, получив 138 596 обучающих примеров с разметкой и 222 тестовых «снимка» состояния мира. Отдельно авторы предложили протокол оценки на уровне целых траекторий симуляции с использованием LLM в роли судьи (LLM-as-Judge), по 10 измерениям и 20 метрикам. По результатам экспериментов EvolvingWorld улучшает качество долгих симуляций именно за счёт того, что удерживает развитие персонажей и мира согласованным и связным на протяжении всей истории.
Ключевые факты
- Проблема: существующие системы либо имитируют статичного персонажа без развития, либо генерируют разрозненные сцены без единой сюжетной линии
- Решение, EvolvingWorld: открытая схема данных (open-schema) плюс два связанных модуля, «Персонаж-агент» для нескольких ролей и модель мира на основе LLM для состояния локаций и объектов
- На архитектуре сформулировано 7 обучаемых задач: инициализация сцены, генерация взаимодействий, обновление состояния
- Датасет собран из 57 книг: 138 596 обучающих примеров и 222 тестовых снимка состояния мира
- Предложен протокол оценки целых траекторий через LLM-судью (LLM-as-Judge) по 10 измерениям и 20 метрикам; эксперименты показывают улучшение согласованности долгих симуляций
Почему это важно
Большинство систем ролевой игры с ИИ либо держат персонажа «замороженным» в одной и той же личности, либо генерируют отдельные сцены, которые не складываются в связную историю. EvolvingWorld предлагает архитектурный ответ на обе проблемы сразу: персонаж и окружающий его мир обновляются вместе и запоминают, что уже произошло, это шаг к ИИ-агентам, способным вести долгие, а не одноразовые сюжеты.
Кому это важно
В первую очередь, разработчикам ИИ-агентов и ролевых/компаньон-приложений, командам, которые строят генеративные интерактивные истории и текстовые игры, а также исследователям в области симуляции миров и оценки долгосрочного поведения языковых моделей.
Как это применить
EvolvingWorld, исследовательский фреймворк и бенчмарк, а не готовый коммерческий продукт: он вводит открытую схему состояния, набор из 7 обучаемых задач и датасет из 57 книг. Разработчикам, которые строят собственных ролевых агентов или генераторы интерактивной прозы, методология полезна как образец архитектуры (разделение «агент персонажа» / «модель мира») и как источник данных и метрик для собственной оценки, при условии, что код и датасет будут открыты публично, чего в тексте публикации явно не указано.
Можно ли доверять
Материал, научная публикация на Hugging Face (75 отметок, 2 комментария), в описании первым указан автор Цин Цзун (Qing Zong), судя по формату публикации, за ней стоит более широкая исследовательская команда, а не один человек. Цифры по датасету (57 книг, 138 596 примеров, 222 снимка) и структура задач заявлены самими авторами; независимого подтверждения результатов вне самой публикации в тексте нет.
Риски и подводные камни
Оценка качества симуляции построена на LLM-судье (LLM-as-Judge), такой протокол сам по себе подвержен предвзятости модели-оценщика, и авторы не приводят в тексте сравнения с независимой человеческой оценкой. Неясно, насколько подход обобщается на литературные жанры и языки за пределами 57 книг обучающей выборки, и не указано, публикуются ли код и датасет в открытом доступе.