Black Forest Labs открыла ранний доступ к FLUX 3, модели для видео, фото и звука

Black Forest Labs открыла ранний доступ к FLUX 3, модели для видео, фото и звука

Black Forest Labs представила FLUX 3, новую мультимодальную базовую модель, которая учится одновременно на изображениях, видео и звуке в рамках одной архитектуры вместо отдельных моделей под каждый тип данных. По мысли разработчиков, ни одна модальность в отдельности не даёт полной картины мира: изображение фиксирует пространственную структуру в конкретный момент, видео добавляет измерение времени и физические законы движения, звук раскрывает причинно-следственные связи между механическими явлениями и акустикой, а язык связывает всё это с целями и инструкциями. Совместное обучение сразу на всех модальностях даёт дополнительные перекрёстные ограничения, звук должен соответствовать удару, движение должно подчиняться массе, будущее должно вытекать из прошлого, и именно это, по замыслу компании, приближает модель к реальному пониманию физического мира. В основе FLUX 3 лежит подход Self-Flow, метод совместного согласования генерации и понимания мультимодальных данных в рамках одной архитектуры; под него компания существенно нарастила объём вычислений и обучающих данных.

Первой в ранний доступ вышла видеочасть, FLUX 3 Video. Модель генерирует ролики со встроенным звуком длиной до 20 секунд за один проход и поддерживает: генерацию видео по текстовому описанию; анимацию по стартовому кадру или по референсным изображениям; перенос ключевых элементов, например, персонажа, из исходного клипа в новую сцену (видео-в-видео); продолжение видео и звука по входному ролику; управляемые переходы между заданными ключевыми кадрами; мультиязычные диалоги; широкий диапазон визуальных стилей и соотношений сторон; объединение отдельных клипов в более длинные многосценные последовательности; качественную генерацию типографики и анимированного текста. За счёт визуальных референсов персонажи остаются узнаваемыми даже в сценах длиной в несколько минут. В предварительных внутренних тестах на 10-секундных клипах 720p со звуком FLUX 3 выигрывала сравнения у Grok Imagine Video до 69% случаев, у Kling v3 Pro, в 60%, у Happy Horse v1, в 59%, у Happy Horse 1.1, в 57%, у Seedance 2.0 и Gemini Omni Flash, в 52%, у Runway Gen-4.5, в 77%, у Luma Ray 3.2, в 93%. Сама компания подчёркивает, что и модель, и инструментарий вокруг неё ещё в разработке, поэтому результаты предварительные и должны улучшиться.

Часть FLUX 3 Image пока в разработке и должна открыться в ранний доступ в ближайшие недели. По предварительным замерам на промежуточном этапе обучения модель уже заметно лучше прежних версий FLUX справляется со сложными промптами, поддерживает широкий набор стилей, соотношений сторон и разрешений, а также заметно точнее генерирует текст на нескольких языках.

Понимание мира у FLUX 3 распространяется и на предсказание действий. Компания развивает два направления: встраивает предсказание действий прямо в модель, масштабируя первоначальные наработки Self-Flow, и использует предобученный видео-бэкбон FLUX 3 как основу, учитывающую динамику мира, под которую можно дообучать отдельные модели действий на ограниченном наборе задачных данных. Первым партнёром с ранним доступом стала робототехническая компания mimic robotics: вместе с Black Forest Labs она создала FLUX-mimic, модель «видео-действие», которая объединяет бэкбон FLUX 3 с опытом mimic в обучении роботов сложным манипуляциям и в промышленном внедрении; эта связка уже проверяется на реальных производственных задачах Audi.

Дальнейший вывод FLUX 3 на рынок компания планирует поэтапно: каждая возможность сначала проходит фазу раннего доступа для отладки, сбора обратной связи и проверки безопасности. В план входят генерация и редактирование видео со звуком через API и приватный доступ к весам (FLUX 3 Video); предсказание действий через отобранных исследовательских и коммерческих партнёров, начиная с mimic robotics (FLUX-mimic и FLUX 3 Action); генерация и редактирование изображений через API и приватный доступ к весам (FLUX 3 Image); отдельный выпуск с открытыми весами мультимодального бэкбона для создания контента и предсказания действий (FLUX 3 Dev). Компания обещает позже раскрыть больше технических деталей подхода и сообщает, что набирает сотрудников в Германии и США.

Ключевые факты

  • Black Forest Labs открыла ранний доступ к FLUX 3, мультимодальной модели, которая в архитектуре Self-Flow учится сразу на видео, изображениях и звуке.
  • FLUX 3 Video генерирует ролики со встроенным звуком длиной до 20 секунд за один проход: текст в видео, анимация по кадру, перенос персонажа в новую сцену, склейка клипов в многосценные ролики.
  • В предварительных внутренних тестах на 10-секундных клипах 720p FLUX 3 выигрывала у Runway Gen-4.5 в 77% сравнений и у Luma Ray 3.2 в 93%, но компания называет эти цифры ранними и предварительными.
  • Модель предсказывает физические действия: с mimic robotics создана FLUX-mimic для роботов-манипуляторов, уже проверяется на производственных задачах Audi.
  • План выпуска: видео и изображения, через API и приватный доступ к весам, предсказание действий, через отобранных партнёров, версия с открытыми весами FLUX 3 Dev выйдет позже.

Почему это важно

FLUX 3, первая модель Black Forest Labs, целиком построенная на принципе совместного обучения по видео, изображениям и звуку через их взаимные ограничения, а не на отдельных моделях под каждый тип данных. Компания подаёт это как шаг к моделям, которые «воспринимают, предсказывают и действуют» в физической и цифровой среде, то есть не просто к более качественной генерации роликов, а к более общему пониманию мира. Ранние внутренние сравнения показывают заметный отрыв от части конкурентов (например, 77% против Runway Gen-4.5 и 93% против Luma Ray 3.2); если это подтвердится на независимых тестах, FLUX 3 станет заявкой на лидерство в генерации видео со звуком в одной модели, а не в связке отдельных инструментов.

Кому это важно

Авторам и монтажёрам, которые делают видео и изображения с озвучкой одним инструментом вместо связки нескольких сервисов; разработчикам, которые будут подключать API или приватный доступ к весам; исследователям и робототехническим компаниям, которым интересно предсказание физических действий, пример такого партнёрства уже есть с mimic robotics и Audi; конкурентам в генерации видео (Runway, Luma, Kling, Grok Imagine, Gemini Omni Flash и другим), с которыми Black Forest Labs сама сравнивает FLUX 3 в своих тестах.

Как это применить

Пока открыт ранний доступ только к видеочасти, FLUX 3 Video, и получить его можно по индивидуальной заявке через контактную форму на сайте компании, а не всем желающим. Часть для изображений, FLUX 3 Image, должна открыться в ранний доступ в ближайшие недели. Доступ к предсказанию действий (FLUX-mimic и FLUX 3 Action) пока ограничен отобранными исследовательскими и коммерческими партнёрами, первой стала mimic robotics. В перспективе Black Forest Labs обещает API и приватный доступ к весам для видео и изображений, а также отдельный выпуск с открытыми весами, FLUX 3 Dev, для тех, кто хочет запускать модель самостоятельно.

Можно ли доверять

Все проценты побед над конкурентами, собственные предварительные замеры Black Forest Labs на ограниченном наборе 10-секундных клипов 720p, а не независимый бенчмарк; сама компания оговаривает, что оценки ранние и результаты должны улучшиться по ходу разработки. Для части с изображениями конкретных цифр вообще не приведено, только общее утверждение об улучшении относительно прежних версий FLUX. До независимой проверки и выхода из статуса раннего доступа к заявленным цифрам стоит относиться как к предварительным ориентирам компании, а не к финальным характеристикам продукта.

Риски и подводные камни

Сама компания подчёркивает, что и модель, и инструментарий вокруг неё ещё в разработке, то есть заявленные возможности и текущие оценки могут измениться до полноценного релиза. Конкретных сроков выхода из раннего доступа для большинства возможностей в тексте нет, только общее «в ближайшие недели и месяцы», а доступ пока даётся по заявке, а не всем желающим. Практический риск для разработчиков и партнёров, зависимость от постепенно открывающегося API и приватного доступа к весам: полноценно встроить FLUX 3 в свои продукты можно будет только по мере того, как Black Forest Labs будет поэтапно открывать соответствующие возможности.

«Звук должен соответствовать удару, движение должно подчиняться массе, будущее должно вытекать из прошлого.»

— Black Forest Labs, блог о FLUX 3