Runway показала потоковую генерацию ИИ-видео в реальном времени

Runway поделилась исследованием технологии генерации видео в реальном времени: вместо того чтобы вводить запрос и ждать готовый ролик, пользователь как бы транслирует видео по мере того, как его описывает, и может тут же вносить правки. Сегодняшние видео-модели работают пошагово, запрос, ожидание в несколько секунд или минут, готовый ролик; если результат не устроил, всё начинается заново. По словам Runway, пользователи регулярно жалуются, что больше всего времени уходит именно на генерацию и переделку видео, поэтому компания хочет свести к минимуму время до первого кадра, а дальше выдавать видео потоком по мере того, как его описывает пользователь.

Впервые такой подход Runway показала в марте, в продукте Runway Characters. В основе лежит GWM-1, первая «модель мира» (General World Model) компании, представленная в декабре 2025 года. GWM-1 построена поверх модели Gen-4.5, генерирует видео покадрово и принимает движения камеры, команды роботам или аудио как управляющие сигналы. Также на Gen-4.5 основан показанный несколько недель назад Solaris, система, которая покадрово генерирует пользовательский интерфейс и реагирует на клики или голосовые команды.

Runway утверждает, что генерация в реальном времени сокращает разрыв между идеей и её воплощением: с мгновенной обратной связью пользователь тратит время не на ожидание, а на управление видео. Отдельно компания указывает на экономию: более быстрые модели тратят меньше времени GPU, а значит дешевле в расчёте на единицу вывода, именно эта стоимость при заданном качестве определяет, какие сценарии применения вообще имеют экономический смысл. Мгновенная генерация снижает этот порог и делает выгодными сценарии, которые раньше не окупались; конкретных цифр экономии в материале не приводится.

Центральная техническая проблема, которую называет Runway, покадровое накопление ошибок. Текстовая модель может поправить себя посреди фразы, а видео-модель строит каждый кадр на основе предыдущего, поэтому мелкие визуальные ошибки со временем разрастаются в заметные искажения. Runway описывает это как ключевую сложность LLM-подобных подходов к видео и решает её, обучая модель на её собственных, в том числе неидеальных, выходах, а не только на «чистых» примерах, так модель учится исправлять свои отклонения, а не усиливать их. Похожий приём для своей модели реального времени MirageLSD использовал стартап Decart, намеренно показывая модели искажённые изображения при обучении. Google DeepMind сообщает, что её модель мира Genie 3 удерживает согласованность интерактивных миров несколько минут при 24 кадрах в секунду в разрешении 720p.

По словам Runway, генерация в реальном времени переносит вычислительную нагрузку с обучения на использование: модель должна выдавать каждый кадр достаточно быстро, чтобы успевать за воспроизведением, работая при этом на оборудовании, которое одновременно делят несколько сессий.

Самым перспективным долгосрочным применением ИИ-генерации видео в Runway называют интерактивные сценарии. По словам компании, образование, игры и робототехника нуждаются в видео, которое реагирует так же быстро, как за ним наблюдает человек. Оценка того, как роботы или беспилотные автомобили ведут себя в мире, тоже требует сред, которые генерируются в реальном времени и мгновенно реагируют на нестандартные ситуации. Ранее Runway уже представляла GWM Robotics, вариант GWM-1, который генерирует синтетические обучающие данные для роботов. Похожим путём идёт Waymo: её Waymo World Model основана на Genie 3 и адаптирована для дорожного движения, что позволяет моделировать ситуации, которых флот компании никогда не встречал вживую, вроде столкновения со слоном, торнадо или затопленным жилым кварталом. По данным Waymo, беспилотник Waymo Driver проезжает миллиарды миль в виртуальных мирах ещё до того, как встречает похожие сценарии на дорогах общего пользования.

В марте Runway также показала исследовательский прототип модели реального времени, разработанный совместно с Nvidia и представленный на конференции чипмейкера GTC. Прототип работает на платформе Vera Rubin и рассчитан на то, чтобы выдавать первый кадр менее чем за 100 миллисекунд. Сроков выхода технологии в открытый доступ Runway не называет.

Ключевые факты

  • Runway показала исследование потоковой генерации видео в реальном времени на модели GWM-1 (представлена в декабре 2025 года): пользователь видит и правит ролик по мере описания, не дожидаясь готового результата
  • Главная техническая проблема, покадровое накопление ошибок; Runway решает её, обучая модель на её собственных, в том числе неидеальных, выходах, а не только на «чистых» примерах
  • Компания указывает на экономию GPU-времени у более быстрых моделей, что делает выгодными ранее нерентабельные сценарии применения, но конкретных цифр не называет
  • Похожие подходы есть у стартапа Decart (модель MirageLSD) и Google DeepMind (Genie 3 держит согласованность интерактивных миров несколько минут при 24 кадрах в секунду в 720p); Waymo адаптирует Genie 3 для симуляции дорожных ситуаций
  • В марте Runway с Nvidia показала прототип на платформе Vera Rubin с целью выдавать первый кадр менее чем за 100 миллисекунд; сроков выхода компания не называет

Почему это важно

Сегодняшние видео-модели работают шагами: запрос, ожидание в несколько секунд или минут, готовый ролик, а если результат не устроил, всё начинается заново. Runway хочет убрать это ожидание и превратить генерацию в поток, которым пользователь управляет в реальном времени, вместо того чтобы получать видео как законченный артефакт.

Кому это важно

Разработчикам интерактивных приложений, игр, образовательных продуктов, интерфейсов вроде показанного Runway Solaris. Отдельно компания называет робототехнику и беспилотные автомобили: у Runway уже есть GWM Robotics, вариант GWM-1 для синтетических данных обучения роботов, а Waymo на основе родственной технологии Genie 3 строит собственную World Model для симуляции дорожных ситуаций.

Как это применить

Пока речь об исследовательском прототипе, а не о готовом продукте, срока выхода Runway не называет. Но подход уже обкатывается в смежных проектах компании: Runway Characters (март), интерфейс Solaris на базе Gen-4.5 и прототип с Nvidia на платформе Vera Rubin, нацеленный на первый кадр быстрее 100 миллисекунд.

Можно ли доверять

Материал основан на собственном рассказе Runway о её исследованиях; независимых цифр по стоимости или скорости в источнике нет, про экономию GPU-времени сказано в общем виде, без конкретных цифр. При этом направление подтверждают и другие игроки: похожие приёмы обучения на собственных выходах использует стартап Decart (MirageLSD), а сопоставимые модели мира развивают Google DeepMind (Genie 3) и Waymo.

Риски и подводные камни

Центральная техническая сложность, покадровое накопление ошибок: видео-модель строит каждый кадр на основе предыдущего, и мелкие искажения могут со временем перерасти в заметные артефакты, чего не происходит с текстовыми моделями, способными поправить себя на лету. Runway называет это ключевой проблемой LLM-подобных подходов к видео и решает её обучением модели на собственных, не всегда безошибочных, выходах.