Evoke, модель мира с внешней памятью для бесконечного видео

Evoke, модель мира с внешней памятью для бесконечного видео

Группа исследователей, Yuanyang Yin, Gongxuan Wang, Yifan Zhan, Chuanhao Li, Kaipeng Zhang и Feng Zhao, опубликовала на arXiv препринт «Alaya-EVOKE: From Linear-Scaling Supervision to Endless World» (дословно: «От супервизии с линейным масштабированием, к бесконечному миру»; arXiv:2608.13546, раздел Computer Vision and Pattern Recognition, подан 13 августа 2026 года). В работе представлена Evoke, именно так систему называют на протяжении всего текста аннотации, интерактивная модель мира: система, которая генерирует видео сцены в ответ на действия пользователя.

Авторы формулируют исходное противоречие: интерактивная модель мира должна одновременно удерживать в памяти всё, что произошло раньше, быстро отвечать на ввод и оставаться связной на сколь угодно длинной дистанции, но эти три требования конфликтуют между собой. Если хранить всю историю сцены в контексте денойзера (генеративной сети, которая на каждом шаге диффузии превращает шум в кадр) или в KV-кэше, затраты растут вместе с сессией, и приходится выбирать между её длиной и объёмом того, что модель помнит. А низкая задержка отклика требует генерации за малое число шагов, но качество такой «малошаговой» модели ограничено моделью-«учителем», на которой её обучали.

Evoke снимает оба ограничения раздельно. Во-первых, состояние сцены (геометрия) хранится не в контексте сети, а во внешнем банке состояний, индексируемом по положению камеры: оттуда достаётся только информация, нужная для текущего ракурса, поэтому контекст генеративной сети остаётся ограниченным по размеру, сколько бы ни длилась сессия. Во-вторых, вместо того чтобы использовать учителя просто как готовый генератор, авторы перепроектировали его специально для супервизии длинных последовательностей: его механизм внимания разреженный и сочетает три части, группировку кадров по сегментам, выборку отдельных удалённых кадров из прошлого и глобальное состояние на основе линейного внимания. За счёт этого память и вычисления растут линейно с длиной сессии, а не быстрее, и учитель способен обеспечивать супервизию по-настоящему длинных горизонтов.

Такая длинная супервизия обнажает эффект, который короткие окна маскируют: «дрейф» контента, несоответствия накапливаются со временем и становятся заметны на длинной дистанции, хотя в пределах любого короткого фрагмента всё выглядит правдоподобно. При этом посегментное кондиционирование позволяет менять промпт и запускать события в любой точке последовательности.

Обе способности, устойчивость к дрейфу на длинной дистанции и генерация за малое число шагов, переносятся в финальную «студенческую» модель через тридцатисекундную задачу сопоставления распределений, применённую к последовательностям, сгенерированным по технике self-forcing (модель дообучается на кадрах, сгенерированных ею самой, а не на эталонных). Итоговый «студент» генерирует видео за три шага и не использует classifier-free guidance, вспомогательную технику, которая обычно улучшает качество генерации ценой дополнительных вычислений; при этом устойчивость к долгосрочному дрейфу становится выше, а отклик на посегментные изменения условий сохраняется.

По заявленным измерениям: на одном ускорителе H200 при разрешении 384×640 пикселей каждый сегмент видео длительностью 1,5 секунды генерируется за 2,11 секунды. Как трёхшаговая модель мира Evoke, по словам авторов, показывает результат уровня state-of-the-art на бенчмарке WBench и остаётся конкурентоспособной на VBench-Long и VBench-2.0, конкретные числовые показатели и объект сравнения аннотация не приводит. Систему авторы описывают как поддерживающую «открытую, непрерывно продолжающуюся генерацию», то, что вынесено в заголовок статьи как «бесконечный мир» (Endless World); при этом ни максимальная длина сессии, ни код, ни веса модели, ни датасет в источнике не упомянуты.

Ключевые факты

  • Evoke, исследовательская модель мира для интерактивной генерации видео: система одновременно должна помнить историю сцены, быстро отвечать на действия пользователя и оставаться связной на длинной дистанции, раньше эти три требования конфликтовали друг с другом.
  • Состояние сцены хранится не в контексте генеративной сети, а во внешнем банке состояний, индексируемом по камере: контекст сети остаётся ограниченным по размеру независимо от длины сессии.
  • Модель-«учитель» перепроектирована для супервизии длинных последовательностей: разреженное внимание сочетает группировку кадров по сегментам, выборку удалённых кадров и глобальное состояние на линейном внимании, память и вычисления растут линейно, а не быстрее.
  • Обе способности, устойчивость к дрейфу и скорость, переносятся в трёхшаговую модель-«студента» без classifier-free guidance через 30-секундную задачу сопоставления распределений поверх self-forcing.
  • На одном ускорителе H200 при разрешении 384×640 каждый сегмент видео длительностью 1,5 секунды генерируется за 2,11 секунды; Evoke заявлена state-of-the-art на WBench и конкурентоспособной на VBench-Long и VBench-2.0, без конкретных чисел и объекта сравнения.

Почему это важно

Авторы формулируют проблему прямо в начале работы: интерактивная модель мира, система, которая генерирует видео сцены в ответ на действия пользователя, должна одновременно удерживать в памяти всё, что произошло раньше, быстро отвечать на ввод и оставаться связной на сколь угодно длинной дистанции. Эти три требования конфликтуют: если хранить всю историю в контексте генеративной сети, затраты растут вместе с сессией и приходится выбирать между её длиной и объёмом памяти, а быстрый отклик требует «малошаговой» генерации, качество которой ограничено моделью-учителем, на которой её обучили. Новизна Evoke, не единый трюк, а разделение этих задач между разными частями системы: память сцены вынесена во внешний банк состояний и не растёт вместе с контекстом сети, модель-учитель отдельно перестроена для супервизии длинных последовательностей с линейным, а не растущим быстрее, ростом затрат, и только затем обе способности сжимаются в быструю трёхшаговую модель. Это исследовательская архитектура без релиза, но сам ход, разнести «что помнить» и «как быстро генерировать» по разным компонентам вместо одной сети, отвечающей за всё сразу, потенциально переносим и на другие генеративные видеомодели и модели мира, упирающиеся в тот же конфликт памяти, скорости и длины.

Кому это важно

В первую очередь, исследователям и инженерам, которые строят генеративные видеомодели и модели мира и уже упираются в тот же компромисс между памятью, скоростью и длиной сессии. Полезно и тем, кто занимается дистилляцией диффузионных моделей в «малошаговые»: конкретный рецепт, сопоставление распределений поверх self-forcing, даёт готовый ориентир для похожей задачи. Код, веса модели и датасет в источнике не упомянуты, поэтому для конечных пользователей или разработчиков продуктов на основе Evoke здесь пока нет ничего практического, это материал для тех, кто читает архитектуру, а не подключает готовый API.

Как это применить

Готового применения нет: ни кода, ни весов модели, ни датасета, ни ссылки на демонстрационную страницу источник не упоминает, это описание архитектуры и метода обучения, а не готовый инструмент. Для тех, кто работает над похожими задачами, в статье описан переносимый рецепт из трёх частей: вынести персистентную часть состояния (здесь, геометрию сцены) во внешний банк состояний, индексируемый по камере, вместо того чтобы держать её в контексте генеративной сети; для модели-учителя, которая обеспечивает супервизию длинных последовательностей, сочетать разреженное внимание, группировку по сегментам, выборку удалённых кадров и глобальное состояние на линейном внимании, чтобы затраты росли линейно, а не быстрее; переносить итоговую устойчивость и скорость в финальную модель через задачу сопоставления распределений поверх self-forcing, а не обучать быструю модель с нуля.

Можно ли доверять

Источник, препринт на arXiv (раздел Computer Vision and Pattern Recognition, cs.CV), поданный 13 августа 2026 года, то есть без независимого рецензирования на момент публикации. Институциональная принадлежность ни одного из шести авторов в источнике не указана. Заявления о результатах, «state-of-the-art на WBench» и «конкурентоспособность на VBench-Long и VBench-2.0», качественные: ни конкретных числовых показателей, ни названия систем для сравнения аннотация не приводит, проверить их напрямую по тексту нельзя. Код, веса модели и датасет не опубликованы, значит результаты нельзя воспроизвести независимо на основе одной только статьи. Это обычная ситуация для свежего препринта, но именно поэтому формулировки «state-of-the-art» и «бесконечный мир» стоит читать как заявление авторов, а не как подтверждённый факт.

Риски и подводные камни

Сами авторы признают: длинная супервизия «обнажает» дрейф контента, со временем накапливаются несоответствия, заметные на длинной дистанции, даже когда в пределах короткого окна всё выглядит правдоподобно. Финальная модель, по формулировке источника, лишь «повышает устойчивость» к этому дрейфу, а не устраняет его, проблема ослаблена, но не решена окончательно. Заявленная скорость, 2,11 секунды на сегмент видео длительностью 1,5 секунды, измерена на одном ускорителе H200, это дата-центровое оборудование, а не потребительское, так что судить о более широкой доступности метода по этим цифрам нельзя. Насколько долго система реально способна работать без деградации, источник не говорит: указаны только тайминг на один сегмент и тридцатисекундное окно обучающей задачи, а не предельная или проверенная продолжительность самой «бесконечной» сессии, формулировка «endless world» в заголовке остаётся заявкой авторов, а не измеренным результатом.

«Интерактивные модели мира должны одновременно обеспечивать устойчивую память, быстрый отклик и генерацию на длинном горизонте, но эти требования вступают в противоречие друг с другом.»

— из аннотации arXiv:2608.13546