MiniMax выпустила H3, видеомодель с открытыми весами, 2K и стереозвуком

MiniMax выпустила H3, видеомодель с открытыми весами, 2K и стереозвуком

MiniMax выпустила H3, омнимодальную видеомодель с открытыми весами. Это третье поколение линейки после Hailuo 01 и Hailuo 02, и первая модель, которую компания выпускает с открытыми весами. В тот же день, «с нулевого дня», ComfyUI добавила нативную поддержку H3.

Модель принимает на входе текст, изображение, видео или аудио и генерирует видео разрешением до 2K и длительностью до 15 секунд. Звук создаётся в том же проходе, что и видео, а не накладывается поверх постфактум, и всегда выводится в стерео. H3 поддерживает несколько режимов: генерацию по тексту, оживление статичного изображения, задание первого и последнего кадра с заполнением промежуточного движения моделью, а также перенос по референсам, субъекта, движения камеры или голоса из одного материала в другой ролик. По утверждению Comfy, ключевая способность модели, понимание мультимодального контекста: она сводит воедино изображения, аудио и видео, объясняя их взаимосвязь через промпт, вместо того чтобы решать эти задачи по отдельности.

Запуск такой модели на потребительском железе потребовал отдельной инженерной работы команды Comfy. Веса модуляции, около 40% от общего числа параметров модели, обрезали и заменили функционально эквивалентной таблицей соответствий, что резко сократило объём памяти без потери качества вывода, как утверждает Comfy. Дополнительно веса поставляются с эффективным int8-квантованием, а собственные вычислительные ядра снижают пиковое потребление видеопамяти при инференсе. В сумме общий объём памяти сократился на 66%, с 123,6 ГБ в полной точности до 42,5 ГБ у самых компактных вариантов модели. В сочетании с динамической выгрузкой в оперативную память это позволяет запускать модель поколения 2K-видео локально на видеокарте уровня RTX 3060.

Чтобы начать работу, нужно обновить ComfyUI до версии 0.30.0 или выше (либо воспользоваться Comfy Cloud), скачать готовые workflow-шаблоны из библиотеки и веса модели, они выложены на Hugging Face под именем Comfy-Org/MiniMax-H3, после чего написать промпт и подключить нужные кадры или референсы.

Ключевые факты

  • MiniMax выпустила H3, свою первую видеомодель с открытыми весами, третье поколение линейки после Hailuo 01 и Hailuo 02
  • Модель генерирует видео разрешением до 2K и длительностью до 15 секунд с нативным стереозвуком, созданным в одном проходе с видео
  • ComfyUI добавила поддержку H3 в день релиза и сократила потребление памяти на 66%, с 123,6 ГБ до 42,5 ГБ у младших вариантов
  • Благодаря обрезке весов модуляции (~40% параметров) и int8-квантованию модель может работать локально на бытовой видеокарте вроде RTX 3060
  • Поддерживаются генерация по тексту, оживление изображения, задание первого/последнего кадра и перенос субъекта, движения или голоса по референсам

Почему это важно

Открытые веса у омнимодальной видеомодели со встроенным стереозвуком, редкость: обычно такие возможности доступны только в закрытых коммерческих сервисах. Здесь к этому добавляется инженерная работа ComfyUI, которая в день релиза сократила требования к памяти на две трети и сделала возможным запуск 2K-видеомодели на массовой игровой видеокарте, а не только на дата-центровых ускорителях.

Кому это важно

Тем, кто занимается генеративным видео и работает с ComfyUI: независимым авторам, студиям без доступа к дорогим GPU-кластерам, разработчикам, которые строят собственные видеопайплайны и хотят запускать модель локально, а не через платный облачный API.

Как это применить

Нужно обновить ComfyUI до версии 0.30.0 или новее либо воспользоваться Comfy Cloud, скачать готовые workflow-шаблоны из библиотеки, а веса модели загрузить с Hugging Face (Comfy-Org/MiniMax-H3) в нужную папку моделей. Дальше, написать промпт, подключить кадры или референсные изображения/видео/аудио и запустить генерацию.

Можно ли доверять

Источник, собственный блог Comfy, партнёра по интеграции, а не независимый обзор. Заявление об отсутствии потери качества после обрезки весов и квантования сделано самой командой Comfy и не подкреплено сторонними бенчмарками или сравнением с другими открытыми видеомоделями.

Риски и подводные камни

В материале не указаны условия лицензии и стоимость использования открытых весов, только сам факт их открытости. Данных о независимой проверке качества после сжатия модели нет: снижение объёма памяти на 66% и обрезка ~40% параметров теоретически могут сказываться на отдельных сценариях, даже если общее заявление об «отсутствии потери качества» верно.