PhysBrain 1.5, открытая модель для роботов, сравнялась с GPT-6-Astra и Gemini 3.6 Flash

Исследователи представили PhysBrain 1.5, единую модель, которая одновременно понимает физическую среду, генерирует действия и предсказывает, как эта среда изменится дальше. Идея отталкивается от самого цикла физического мира: наблюдение, взаимодействие и последующее изменение среды, и авторы сводят способности, отвечающие за каждое из этих звеньев, в одну общую систему обучения, а не держат их как три отдельные модели.
В основе PhysBrain 1.5 лежит визуально-языковая модель общего назначения. Поверх неё языковые ответы, движения рабочего органа робота и плотные (попиксельные) визуальные цели кодируются как дискретные последовательности токенов и обучаются совместно, авторегрессивным предсказанием следующего токена, тем же способом, каким языковые модели предсказывают следующее слово. Обучение состоит из двух этапов. На предобучении вся «физическая» часть знаний модели берётся исключительно из видео с людьми: система разбивает такие видео на эпизоды, привязанные к конкретной задаче, и сопоставляет смысловой и пространственный контекст с восстановленным движением и тем, что происходит в кадре дальше. Затем модель дообучают на смеси трёх источников, демонстраций человека, траекторий настоящих роботов и опыта, полученного в симуляции.
На 28 тестах на понимание физического мира версия PhysBrain 1.5 с 8 млрд параметров набрала в среднем 72,5 балла, это новый рекорд среди открытых моделей и уровень ведущих закрытых моделей, включая GPT-6-Astra и Gemini 3.6 Flash (точные баллы этих моделей-конкурентов в статье не приводятся). Из 28 тестов на 14 модель показала лучший результат среди всех открытых аналогов, и при этом не потеряла общие мультимодальные способности, то есть осталась пригодна для обычных задач с картинками и текстом, а не только для физических сценариев.
Кроме числовых тестов, авторы приводят качественные примеры: модель умеет генерировать траектории движения рабочего органа и предсказывать будущие кадры сцены сразу в трёх согласованных между собой представлениях, обычном RGB-изображении, карте глубины и маске, выделяющей робота на сцене.
Ключевые факты
- PhysBrain 1.5, единая модель, которая в одной архитектуре понимает физическую среду, генерирует движения рабочего органа робота и предсказывает будущие состояния сцены; построена поверх визуально-языковой модели.
- На 28 тестах на понимание физического мира версия с 8 млрд параметров набрала в среднем 72,5 балла, новый рекорд среди открытых моделей.
- Из этих 28 тестов на 14 модель показала лучший результат среди открытых моделей, сохранив при этом общие мультимодальные способности.
- По среднему баллу модель вышла на уровень закрытых моделей GPT-6-Astra и Gemini 3.6 Flash, точные баллы этих конкурентов в статье не приведены.
- Предобучение построено целиком на видео с людьми, дообучение, на смеси демонстраций человека, траекторий роботов и данных из симуляции; отдельно показано, что модель может предсказывать будущие кадры сцены в RGB, карте глубины и маске робота.
Почему это важно
Моделей, которые одновременно понимают язык и зрение, генерируют физические действия и предсказывают, как изменится сцена, на рынке немного, и почти все такие системы, закрытые продукты крупных лабораторий. PhysBrain 1.5, заявка на то, что открытая модель может играть в этой же лиге: на 28 тестах на понимание физического мира она не просто лидирует среди открытых аналогов, а выходит на уровень названных в статье закрытых моделей GPT-6-Astra и Gemini 3.6 Flash. Показательна и сама архитектура: вместо отдельных моделей под зрение, язык и управление роботом PhysBrain 1.5 кодирует речь, движения рабочего органа и визуальные цели одним общим словарём токенов и учится всему сразу, авторы описывают это как переход «от визуально-языковых моделей к физическим базовым моделям».
Кому это важно
В первую очередь, исследователям и инженерам, которые строят модели для роботов и физического ИИ: PhysBrain 1.5 задаёт ориентир, каких результатов сейчас можно добиться открытой моделью на 8 млрд параметров, и показывает конкретную рабочую схему обучения, предобучение на видео с людьми и дообучение на демонстрациях, траекториях роботов и данных из симуляции. Важно это и тем, кто сравнивает открытые и закрытые модели для физических задач: раз открытая модель вышла на уровень GPT-6-Astra и Gemini 3.6 Flash сразу на 28 тестах, это довод в пользу того, чтобы такие открытые варианты вообще рассматривать всерьёз. Тем, кто применяет визуально-языковые модели для обычных задач с картинками и текстом, важно, что PhysBrain 1.5 не жертвует этими способностями ради физических: авторы прямо отмечают, что общие мультимодальные умения сохранились.
Как это применить
Публикация на Hugging Face Papers описывает метод и результаты, а не готовый к использованию релиз: в тексте не сказано, выложены ли веса модели, код или обучающие данные и на каких условиях лицензии, судить о практическом внедрении по самой статье пока нельзя. Из статьи можно забрать саму идею и архитектурную схему: кодировать язык, движения рабочего органа робота и визуальные цели как один поток дискретных токенов и обучать их совместно авторегрессивным предсказанием следующего токена, а затем дообучать на смеси демонстраций человека, траекторий робота и данных симуляции. Тем, кому нужна сама модель, а не только идея, стоит проверять страницу проекта отдельно, она этим пересказом не покрывается.
Можно ли доверять
Все цифры, из собственной статьи авторов, независимой проверки в тексте нет: сравнение с GPT-6-Astra и Gemini 3.6 Flash даётся как «на уровне», но точные баллы этих моделей нигде не приведены, поэтому оценить размер разрыва (или его отсутствие) по самой статье нельзя. Сам текст не называет ни авторов, ни организацию, стоящую за проектом: по данным агрегатора Hugging Face, работа отмечена как принадлежащая «DeepCybo Team», но в тексте статьи это название не встречается. Не указаны объём вычислений, размер обучающих данных и длительность обучения, оценить воспроизводимость и затратность результата тоже не по чему. Из 28 тестов модель лидирует среди открытых аналогов на 14, какая ситуация на оставшихся 14, статья не поясняет.
Риски и подводные камни
Главный риск, это самоотчёт без независимой проверки: какие именно 28 тестов использованы и какие 14 из них модель выигрывает, в статье поимённо не перечислено, так что повторить измерение независимо нельзя. Формулировка «на уровне GPT-6-Astra и Gemini 3.6 Flash» качественная, без цифр, неясно, на скольких тестах достигнут именно паритет, а не отставание. Модель учится предсказывать и генерировать движения рабочего органа робота, а цена ошибки у системы, управляющей физическим устройством, выше, чем у чат-модели: неточный прогноз движения или сцены при переносе в реальный контур управления способен привести к повреждению оборудования или окружения. Наконец, статья не говорит, выложены ли веса и код модели, пока это не прояснится, независимая проверка заявленных результатов сообществом невозможна.