Google выпустила Gemini Omni 1.1 Flash: продление сцен до 40 секунд и апскейл до 4K

Google выпустила Gemini Omni 1.1 Flash: продление сцен до 40 секунд и апскейл до 4K

Google выпустила Gemini Omni 1.1 Flash, обновление генеративной видеомодели Gemini Omni с набором новых инструментов управления для разработчиков. По словам компании, обновление делает Omni 1.1 готовой к профессиональному использованию через Gemini API в Google AI Studio: генеративное видео становится более управляемым, быстрее дорабатывается и лучше подходит для реального производственного процесса, будь то видеоредакторы, творческие инструменты или программы для монтажа.

Главное новое умение, продление сцен: модель может продолжить уже существующее видео с того места, где оно закончилось, и теперь анализирует до 10 секунд предшествующего контекста вместо только последней секунды, как у прежних моделей. Это даёт более стабильную визуальную согласованность и связность повествования и позволяет наращивать ролик шагами по 10 секунд вплоть до суммарной длины в 40 секунд. Отдельно можно задать первый и последний кадр отрезка, Omni 1.1 сгенерирует непрерывное видео между этими двумя кадрами, что подходит для сложных облётов камерой, зум-переходов и бесшовных зацикленных клипов.

Для черновиков Google добавила облегчённый режим рендеринга в разрешении 360p: по данным компании, такие превью генерируются до 60% быстрее и стоят втрое дешевле, чем стандартное разрешение 720p у Omni 1.1, оценка основана на сравнении пропускной способности системы для 360p и 720p. Это ускоряет прототипирование, раскадровку и черновые итерации. Для финального результата, наоборот, доступен апскейл до 1080p или 4K, то есть видео высокого разрешения, готовое к профессиональному использованию.

Ещё одно новое умение, референсные видео как часть мультимодального промпта: можно передать до 3 секунд референсного ролика, чтобы сохранить визуальный контекст и узнаваемость персонажа в новой сцене. В примере Google так объединили в одном непрерывном кадре трёх разных персонажей, собаку, осьминога и медведя, каждый из которых исполняет танец из своего отдельного референсного видео. Gemini Omni 1.1 Flash уже доступна разработчикам через Gemini API в Google AI Studio, а предприятиям, через API платформы Gemini Enterprise Agent Platform; у Google есть официальная документация, подборка примеров использования и гайды по промптам для интеграции продления сцен, референсов по видео и апскейла в собственные приложения. Помимо API, с сегодняшнего дня Omni 1.1 доступна всем подписчикам Google AI Plus, Pro и Ultra по всему миру в Google Flow, а продление сцен, этим же подписчикам в приложении Gemini.

Ключевые факты

  • Google выпустила Gemini Omni 1.1 Flash, обновлённую генеративную видеомодель, доступную разработчикам через Gemini API в Google AI Studio и предприятиям через платформу Gemini Enterprise Agent Platform.
  • Продление сцен: модель анализирует до 10 секунд предыдущего контекста вместо одной последней секунды у прежних моделей и наращивает видео шагами по 10 секунд вплоть до 40 секунд суммарной длины.
  • Можно задать первый и последний кадр отрезка для плавных переходов и сложных движений камеры, а готовое видео, апскейлить до 1080p или 4K.
  • Черновой режим в разрешении 360p работает до 60% быстрее и стоит втрое дешевле стандартного 720p, для быстрого прототипирования и раскадровки.
  • Модель принимает до 3 секунд референсного видео как часть промпта для сохранения персонажей; с сегодняшнего дня Omni 1.1 доступна всем подписчикам Google AI Plus, Pro и Ultra в Google Flow, а продление сцен, в приложении Gemini.

Почему это важно

Обновление переводит генеративное видео из категории эффектных демо в категорию рабочего инструмента с точным управлением. Раньше видеомодели в основном выдавали короткий ролик по промпту почти без возможности направленно его доработать; Gemini Omni 1.1 Flash добавляет именно то, чего для реального производства не хватало, заданный первый и последний кадр вместо угадывания движения камеры, продление сцены с учётом заметно большего контекста вместо резкой потери связности, отдельный дешёвый режим для черновиков и отдельный качественный, для финала. Вместе это превращает генерацию видео из разового эксперимента в этап производственного процесса, который можно контролировать и предсказуемо повторять.

Кому это важно

Разработчикам, которые строят инструменты и сервисы генеративного видео поверх Gemini API, включая доступ к платформе Gemini Enterprise Agent Platform для корпоративных сценариев. Видеомонтажёрам, рекламным и медиакомандам, которым нужна быстрая раскадровка в дешёвом режиме 360p и качественный финальный рендер в 4K без смены инструмента. Массовым пользователям Google AI, подписчикам тарифов Plus, Pro и Ultra, которым с сегодняшнего дня доступны и Omni 1.1 в Google Flow, и продление сцен в приложении Gemini.

Как это применить

Через Gemini API в Google AI Studio, указав модель gemini-omni-1.1-flash: для продления сцены передать previous_interaction_id предыдущего ролика, для чернового прогона выставить в response_format разрешение 360p, а для чистового результата запросить апскейл до 1080p или 4K. Переход между двумя кадрами и референсные видео (до 3 секунд) передаются как часть того же мультимодального запроса interactions.create. У Google есть официальная документация, подборка примеров и гайды по промптам под каждый из этих сценариев. Предприятиям та же модель доступна через API платформы Gemini Enterprise Agent Platform. Без программирования Omni 1.1 доступна в Google Flow, а продление сцен, в приложении Gemini, но только по подписке Google AI Plus, Pro или Ultra.

Можно ли доверять

Источник, официальный блог Google для разработчиков (blog.google), первоисточник о собственном продукте компании, а не независимый обзор. Цифра «до 60% быстрее» у 360p-режима идёт со сноской: она получена из сравнения пропускной способности системы для 360p и 720p, а не гарантирует такой выигрыш для каждого конкретного рендера. Независимого теста или стороннего бенчмарка в материале нет. Конкретных цифр стоимости в тексте тоже нет, таблица цен упомянута только как подпись к изображению, сами цифры в статье не приведены, так что реальную стоимость использования по этому материалу не проверить. Никто из сотрудников Google в тексте не назван и не процитирован, всё изложено от лица компании.

Риски и подводные камни

Все количественные обещания в материале, «до 60% быстрее», «до 40 секунд», «до 4K», «до 10 секунд контекста», это верхняя граница, а не гарантия для каждого конкретного запуска. Продление сцены даже с более длинным контекстом остаётся генерацией, а не монтажом: Google говорит об «улучшенной» согласованности, а не о её полном сохранении, так что за несколько последовательных продлений сцена может постепенно уходить от первоначального сюжета. Перенос персонажа по референсному видео, показанный в статье на примере с танцем, по своей природе годится и для того, чтобы перенести чужую внешность или пластику движений на другого персонажа без участия самого человека, риск, который стоит учитывать при использовании функции. Конкретных цифр стоимости в тексте нет, кроме относительного сравнения 360p и 720p, поэтому оценить реальный бюджет на использование Omni 1.1 в проде по одному этому материалу нельзя.

«Эти обновления делают генеративное видео более управляемым, ускоряют его доработку и делают более пригодным для использования в реальных проектах.»

— Google, блог о Gemini Omni 1.1 Flash