Reka AI выпустила Rho-1: одна нейросеть на 19 млрд параметров для текста, видео и управления роботами

Reka AI выпустила Rho-1: одна нейросеть на 19 млрд параметров для текста, видео и управления роботами

Reka AI выпустила исследовательскую версию (research preview) Rho-1. Это омни-модель на 19 миллиардов параметров: одна нейросеть обрабатывает и генерирует текст, изображения, видео и действия для управления роботами.

По описанию The Decoder, большинство ИИ-систем передают задачи специализированным моделям. Rho-1 устроена иначе: все модальности идут в ней токенами в одном общем контекстном окне, без вызова инструментов и внешних моделей. Модель генерирует непрерывное видео в реальном времени и реагирует на новые инструкции на лету, не перезапускаясь.

Те же веса, которые предсказывают изображения с камер, управляют и движениями робота. Чтобы обойти нехватку обучающих данных по роботам, Reka AI построила модель обратной динамики (inverse dynamics model), которая извлекает управляющие сигналы из обычных видео из интернета. Обучение Rho-1 заняло около трёх месяцев на 320 GPU H100.

Для Reka AI мультимодальность не новость: в апреле 2024 года компания выпустила Reka Core, мультимодальную языковую модель, которая на бенчмарках соперничала с GPT-4, Claude 3 и Gemini Ultra. Издание помещает релиз в контекст более широкого движения исследований ИИ к так называемым мировым моделям (world models).

Ключевые факты

  • Rho-1, исследовательская версия омни-модели Reka AI на 19 млрд параметров: текст, изображения, видео и управление роботами в одной нейросети.
  • Все модальности идут токенами в одном общем контекстном окне, без вызова инструментов и внешних моделей.
  • Модель генерирует непрерывное видео в реальном времени и принимает новые инструкции на лету; одни и те же веса предсказывают кадры с камер и управляют роботом.
  • Из-за нехватки данных по роботам Reka AI обучила модель обратной динамики, извлекающую управляющие сигналы из обычных интернет-видео.
  • Обучение: около трёх месяцев на 320 GPU H100.

Почему это важно

Rho-1, попытка собрать в одной сети то, что обычно делают разные специализированные модели: понимание и генерацию текста, изображений и видео плюс управление роботом. По описанию The Decoder, релиз вписывается в общий поворот исследований ИИ к мировым моделям. Для Reka AI это продолжение мультимодальной линии после Reka Core (апрель 2024).

Кому это важно

Исследователям мультимодальных моделей и мировых моделей, а также тем, кто занимается робототехникой и ищет способы обойти дефицит обучающих данных: подход с извлечением управляющих сигналов из обычных видео как раз про это.

Как это применить

Пока это исследовательская версия. В источнике нет сведений о доступе, лицензии, выпуске весов или цене, поэтому практически применять модель сейчас не получится, стоит следить за дальнейшими анонсами Reka AI.

Можно ли доверять

Источник, The Decoder, он пересказывает релиз Reka AI. Бенчмарков и сравнений для Rho-1 в тексте нет, независимых проверок заявленных возможностей (видео в реальном времени, управление роботом) тоже не приведено. Заявления о возможностях стоит считать описанием разработчика до появления тестов.

Риски и подводные камни

В источнике не указано, какие роботы и какие задачи тестировались, нет данных о качестве и сравнении с другими моделями. Не названы объём обучающих данных, длина контекста и детали архитектуры. Качество управляющих сигналов, извлечённых из интернет-видео, в тексте не оценивается.