JEPA-Anything: одна архитектура предсказания для семи разных научных областей

JEPA-Anything: одна архитектура предсказания для семи разных научных областей

Исследователи представили JEPA-Anything, архитектуру предсказания, не привязанную к конкретной предметной области. Она расширяет joint-embedding predictive architectures (JEPA, архитектуры с предсказанием в пространстве скрытых представлений) методом ортогональной предиктивной факторизации (OPF): скрытое представление цели раскладывается на независимые (ортогональные) составляющие, каждая из них обучается по своему собственному пути, а затем результаты собираются обратно в единую предсказательную модель.

Архитектуру проверили на семи разных областях: зрение, биология, клинические траектории пациентов, управление (control), молекулярная динамика, физические поля и погода. Эксперименты охватили обучение представлений, предсказание последствий вмешательств, обобщение на данные вне обучающего распределения и предсказание на длинном горизонте: 10 сопоставимых задач по динамике, прогноз более 1000 клинических событий и 100-шаговые прогоны молекулярной динамики для четырёх систем.

При сравнении с сопоставимыми базовыми моделями JEPA (без факторизации) JEPA-Anything улучшила метрики на всех 10 задачах по динамике и снизила ошибку предсказания последствий отдельного вмешательства в игре Interventional Pong на 34,8%. В молекулярной динамике модель показала наименьшую ошибку, как на один шаг вперёд, так и на всём 100-шаговом прогоне, во всех четырёх проверенных системах.

Отдельно авторы показывают выход за рамки предсказания: биологическое вмешательство, которое модель выделила как значимый фактор, получило экспериментальное подтверждение, в сокультурах клеток, органоидах, выращенных из ткани пациентов, фрагментах опухоли и на мышах. В задаче с орбитальным движением скрытые представления модели сами восстановили кеплеровский показатель степени масштабирования, подобранный по данным наклон составил -1,4991, что близко к теоретическому значению закона Кеплера. Код проекта выложен на GitHub.

Ключевые факты

  • JEPA-Anything, архитектура на основе ортогональной предиктивной факторизации (OPF), которая расширяет JEPA и учится единым способом предсказывать будущее в разных предметных областях
  • Проверена на семи областях: зрение, биология, клинические траектории, управление, молекулярная динамика, физические поля, погода
  • На всех 10 сопоставимых задачах по динамике превзошла обычные модели JEPA; ошибка предсказания последствий вмешательства в игре Interventional Pong снижена на 34,8%
  • На молекулярной динамике, наименьшая ошибка (и на один шаг, и на 100-шаговом прогоне) среди сравниваемых методов во всех четырёх системах; отдельно спрогнозировано более 1000 клинических событий
  • Биологическое вмешательство, выделенное моделью, подтвердилось экспериментально на клетках, органоидах, фрагментах опухоли и мышах; скрытые представления самостоятельно восстановили кеплеровский показатель масштабирования (наклон -1,4991); код открыт на GitHub

Почему это важно

Предсказательные модели обычно строят отдельно под каждую область: своя модель для видео, своя для биологии, своя для погоды. JEPA-Anything проверяет идею, что за этим может стоять один общий принцип, предсказание в пространстве скрытых представлений, разложенном на независимые факторы. Если единая архитектура действительно переносится между настолько разными областями (от клеточной биологии до движения планетных орбит), это шаг к более универсальным моделям мира, которые не нужно проектировать заново под каждую задачу.

Кому это важно

В первую очередь, исследователям, которые строят предсказательные и мировые модели (world models) для робототехники и управления, вычислительной биологии, физического моделирования и климатических прогнозов. Также релевантно инженерам, работающим над архитектурами, которые должны переноситься между модальностями без ручной перенастройки под каждую из них.

Как это применить

Код проекта выложен в открытом доступе на GitHub, так что архитектуру можно воспроизвести и опробовать на своих данных. Сама идея, раскладывать скрытое представление задачи на независимые факторы и обучать их по отдельным путям, применима как общий приём при проектировании предсказательных моделей, а не только в рамках представленных семи областей.

Можно ли доверять

Это препринт: в тексте не названы ни авторы (кроме первого автора, указанного в карточке публикации), ни организация, ни место публикации, статус рецензирования не указан. Сравнение проведено только с «сопоставимыми базовыми моделями JEPA», с методами вне этого семейства архитектур результаты не сопоставлялись, и это стоит учитывать при оценке заявленного превосходства.

Риски и подводные камни

Заявленные улучшения приведены как агрегированные показатели по каждой из семи областей, но подробной разбивки результатов по большинству из них (зрение, биология, управление, физические поля, погода) в тексте нет, есть только сводные цифры и два подробно расписанных случая (динамика и молекулы). Биологическая часть, предварительная валидация на клетках, органоидах и мышах, а не клинические данные, и переносить её выводы на людей рано.