Alibaba выпустила Wan3.0: ИИ-видео до 30 секунд из текста и документов

Компания Alibaba открыла бета-доступ к своей модели генерации видео Wan3.0. Модель делает ролики длиной до 30 секунд, это вдвое больше, чем у предыдущей версии Wan2.5. На вход Wan3.0 принимает текст, изображения, видео, аудио, а также документы: PDF, веб-страницы и презентации PowerPoint, превращая статичные данные в динамичное видео. Модель сама подсказывает оптимальную длину ролика исходя из запроса пользователя и включает инструмент для удлинения уже готовых видео.
Wan3.0 обрабатывает текст, изображения, видео и аудио одновременно: в один запрос можно включить до десяти изображений, пять видеофрагментов и пять аудиоклипов.
По заявлению Alibaba, модель решает типичную для ИИ-видео проблему, визуальный дрейф и искажения, особенно в лицах и элементах интерфейса: Wan3.0 точнее сохраняет детали референсных материалов, персонажей, предметы и расположение объектов в пространстве.
Доступ к модели открыт через сайт wan.video, Alibaba Cloud Model Studio и по API на Qwen Cloud. Есть два тарифа: Standard (сейчас со скидкой 30%) и более быстрый Prime; точные цены в источнике не названы.
Alibaba позиционирует Wan3.0 для широкого круга задач: ускорение кинопроизводства, создание коротких драм и роликов для соцсетей, для авторов контента; превращение текста и изображений в маркетинговые и обучающие видео, для бизнеса; генерация реалистичных симуляций для обучения беспилотных автомобилей и роботов, для технологических разработчиков.
Релиз выходит на фоне резкого роста расходов Alibaba на ИИ: компания уже объявила о крупнейшем размещении акций среди гонконгских листинговых компаний, чтобы профинансировать ИИ-инициативы, а неделей ранее отчиталась о падении квартальной прибыли на 75% год к году, вызванном возросшими вложениями в ИИ.
Ключевые факты
- Wan3.0 доступна в бета-версии и генерирует видео длиной до 30 секунд, вдвое больше, чем у Wan2.5.
- Модель принимает текст, изображения, видео, аудио, PDF, веб-страницы и презентации PowerPoint; в одном запросе, до 10 изображений, 5 видео и 5 аудиоклипов.
- По заявлению Alibaba, Wan3.0 лучше сохраняет консистентность деталей, персонажей, предметов, расположения объектов, снижая типичные для ИИ-видео искажения лиц и интерфейсов.
- Доступ, через wan.video, Alibaba Cloud Model Studio и API Qwen Cloud; тарифы Standard (сейчас скидка 30%) и более быстрый Prime.
- Целевые сценарии, кинопроизводство, ролики для соцсетей, маркетинговые и обучающие видео для бизнеса, симуляции для обучения беспилотных автомобилей и роботов; релиз совпал с падением квартальной прибыли Alibaba на 75% год к году на фоне роста ИИ-инвестиций.
Почему это важно
Wan3.0, заметный шаг в развитии генеративного видео: удвоенная длина ролика (до 30 секунд) и приём документов (PDF, веб-страниц, презентаций PowerPoint) как исходных данных расширяют то, что можно превратить в видео одним запросом. Релиз выходит на фоне резкого наращивания Alibaba расходов на ИИ, компания одновременно привлекает капитал через крупнейшее размещение акций среди гонконгских листинговых компаний и фиксирует падение квартальной прибыли на 75% год к году, то есть делает на генеративное видео крупную ставку, несмотря на текущие финансовые издержки.
Кому это важно
Авторам контента и студиям, ускорение производства фильмов, коротких драм и роликов для соцсетей. Бизнесу, превращение текстов и изображений в маркетинговые и обучающие видео без съёмок. Разработчикам автономных систем, генерация реалистичных симуляций для обучения беспилотных автомобилей и роботов. Тем, кто отслеживает рынок генеративного видео, очередной релиз Alibaba с удвоенной длиной ролика и расширенным мультимодальным вводом (текст, изображения, видео, аудио, документы).
Как это применить
Доступ к Wan3.0 открыт в трёх местах: сайт wan.video, Alibaba Cloud Model Studio и API на платформе Qwen Cloud. Действуют два тарифа, Standard (сейчас со скидкой 30%) и более быстрый Prime; точные цены в источнике не приводятся. В один запрос можно добавить до десяти изображений, пять видеофрагментов и пять аудиоклипов, а также документ, PDF, веб-страницу или презентацию PowerPoint. Модель сама подсказывает оптимальную длину ролика под запрос, а отдельный инструмент позволяет удлинить уже готовое видео, не пересоздавая его с нуля.
Можно ли доверять
Источник, The Decoder, специализированное ИИ-издание; заявления о качестве и удобстве Wan3.0 (снижение визуального дрейфа, консистентность деталей) исходят от самой Alibaba и независимо в статье не проверены, других сторон или независимых тестов материал не приводит. Точная дата запуска беты, цены тарифов и сумма, привлечённая через размещение акций, в источнике не названы.
Риски и подводные камни
Более длинное и правдоподобное ИИ-видео из текста и документов повышает риск убедительных подделок и дезинформации, особенно учитывая заявленную цель, более консистентные, «реалистичные» кадры. Улучшения в борьбе с визуальным дрейфом подтверждены только словами Alibaba, без независимых тестов. Для симуляций, на которых предлагается обучать беспилотные автомобили и роботов, источник не поясняет, насколько сгенерированные сцены соответствуют реальным условиям, эта эффективность остаётся непроверенной.