MiniMax-H3: Саймон Уиллисон запустил омни-модальную модель на Apple Silicon

Компания MiniMax два дня назад выпустила MiniMax-H3, модель, которую сама описывает как «универсальную, омни-модальную генеративную систему»: на практике она принимает на входе текст, изображения, аудио и видео и на их основе генерирует видеоролики длиной до 15 секунд со встроенным звуком. PipeNetwork портировала модель под фреймворк MLX, чтобы её можно было запускать локально на чипах Apple Silicon.
Разработчик Саймон Уиллисон опробовал этот порт на своём MacBook Pro с чипом M5 Max. Он скачал веса модели MiniMax-H3 и MLX-версию от PipeNetwork, в сумме около 115 ГБ файлов, а затем запустил генерацию Python-скриптом по текстовому запросу «радужный скунс перепрыгивает через замшелое бревно в супермаркете». Создание одного 15-секундного ролика заняло чуть меньше 45 минут.
По словам Уиллисона, само видео получилось впечатляющим, но звуковая дорожка вышла странной, похожей на бессвязную речь, потому что он не задал модели никаких указаний по поводу того, каким должен быть звук. У модели есть отдельное руководство по промптингу с подробными инструкциями, как добиться нужного результата для аудио, но перед экспериментом Уиллисон его не читал.
Ключевые факты
- MiniMax выпустила MiniMax-H3, омни-модальную генеративную модель: она принимает текст, изображения, аудио и видео и генерирует видеоролики длиной до 15 секунд со встроенным звуком
- PipeNetwork портировала модель под MLX для запуска на чипах Apple Silicon
- Саймон Уиллисон запустил модель на MacBook Pro с чипом M5 Max, скачав около 115 ГБ файлов модели
- Генерация одного 15-секундного видеоклипа заняла чуть меньше 45 минут
- Видео получилось впечатляющим, но звук вышел похожим на бессвязную речь, поскольку Уиллисон не задал промпт для аудио и заранее не читал руководство по промптингу
Почему это важно
MiniMax выпустила крупную омни-модальную генеративную модель, которая одновременно принимает несколько типов входных данных и генерирует видео со звуком, сочетание, редкое для моделей, доступных для локального запуска. То, что энтузиаст смог развернуть её на потребительском Mac всего через два дня после релиза благодаря независимому порту PipeNetwork, показывает, насколько быстро сообщество адаптирует новые модели под доступное железо.
Кому это важно
Разработчикам и исследователям, работающим с генерацией видео и аудио, а также владельцам компьютеров на Apple Silicon, которые хотят экспериментировать с крупными генеративными моделями локально, без облачных GPU.
Как это применить
Модель можно запустить локально связкой Hugging Face Hub и MLX: скачать веса MiniMax-H3 и MLX-порт от PipeNetwork (в сумме около 115 ГБ) и запустить генерацию Python-скриптом. На MacBook Pro с M5 Max создание одного 15-секундного клипа заняло около 45 минут, стоит заранее рассчитывать время и место на диске под конкретную задачу. Чтобы управлять звуковой дорожкой, а не получить на выходе бессвязную речь, нужно заранее изучить отдельное руководство по промптингу для аудио.
Можно ли доверять
Источник, личный пост-эксперимент разработчика Саймона Уиллисона, который сам скачал и запустил модель и показал итоговое видео с озвучкой. Это прямое наблюдение из первых рук, а не пересказ пресс-релиза, что повышает доверие к описанным шагам и результату.
Риски и подводные камни
В источнике нет данных о цене или условиях коммерческого использования MiniMax-H3, о сравнении с другими генеративными моделями, о работе на не-Apple железе или других чипах Apple Silicon, а также нет объективной оценки качества видео, только личное впечатление автора. Звуковая дорожка без явного промпта получается непригодной, а прогон одного ролика требует скачивания около 115 ГБ данных и почти 45 минут вычислений.
«универсальная, омни-модальная генеративная система»
— MiniMax, самоописание модели MiniMax-H3