ReactHuman: бенчмарк показал, что ИИ-модели проваливают реакцию на бытовые опасности

ReactHuman: бенчмарк показал, что ИИ-модели проваливают реакцию на бытовые опасности

Существующие тесты «физической интуиции» ИИ-моделей устроены пассивно: модель либо отвечает на вопросы по видео, либо решает неспешные задачи вроде навигации по комнате или перестановки предметов. Ни один из них не проверяет, способна ли модель превратить понимание физики в мгновенное, критичное для безопасности действие, например, поймать соскальзывающую тарелку или увернуться от падающего ножа. ReactHuman, первый бенчмарк, устроенный именно так: оцениваемая мультимодальная модель (MLLM) выступает «мозгом» симулированного человекоподобного робота, которому в быту внезапно угрожает опасность.

Бенчмарк охватывает 17 семейств событий и больше 1000 побитово воспроизводимых сцен. Эталонные («правильные») исходы для каждой сцены выводятся из симуляции твёрдых тел с частотой 240 Гц, без ручной разметки. Среди сцен есть намеренно обманчивые предметы, чья физика противоречит внешнему виду: поролоновая наковальня и стальное яблоко, то есть лёгкий предмет выглядит как тяжёлый, и наоборот. Каждый выбранный моделью план действий физически проигрывается в симуляции до конца, так что у решения есть наблюдаемые последствия, а не только формальная оценка.

Оценка построена на пяти метриках, которые сводятся к трём осям: насколько реакция разумна, насколько она безопасна и насколько физически обоснована. На этом бенчмарке протестировали семь показательных мультимодальных моделей. Результат: реактивная безопасность далека от решённой задачи. Модели неправильно обращаются примерно с каждой третьей из предложенных опасностей. Вместо того чтобы исходить из конкретной наблюдаемой сцены, модели действуют по заранее «зашитым» шаблонам поведения; они доверяют внешнему виду предмета больше, чем его реальному движению, и поэтому проваливаются именно на обманчивых объектах. Даже когда модель выбирает в целом верное действие, она промахивается с точкой перехвата на масштабе метра. Ключевой вывод: ни один из этих провалов не сокращается с ростом размера модели. Авторы предлагают ReactHuman не только как диагностический инструмент, но и как масштабируемый источник обучающих данных для физически обоснованных, безопасных воплощённых (embodied) агентов.

Ключевые факты

  • ReactHuman, первый бенчмарк, который проверяет не пассивное понимание физики, а мгновенную реакцию ИИ-модели на внезапную бытовую опасность в роли «мозга» человекоподобного робота
  • 17 семейств событий, более 1000 побитово воспроизводимых сцен с эталоном из симуляции твёрдых тел на 240 Гц, включая обманчивые объекты (поролоновая наковальня, стальное яблоко)
  • Оценка по пяти метрикам вдоль трёх осей: разумность, безопасность и физическая обоснованность реакции; каждый план действий физически проигрывается до конца
  • Семь протестированных мультимодальных моделей неправильно обращаются примерно с каждой третьей опасностью, доверяют внешнему виду предмета больше, чем его движению, и промахиваются с точкой перехвата на масштабе метра
  • Ни один из этих провалов не уменьшается с увеличением размера модели

Почему это важно

До сих пор тесты «физической интуиции» ИИ либо задавали модели вопросы по видео, либо ставили перед ней неспешные задачи, навигацию, перестановку предметов. Ни один не проверял главное для домашнего робота требование: способность за доли секунды превратить понимание физики в безопасное действие, когда тарелка соскальзывает или падает нож. ReactHuman закрывает именно этот пробел, это первый бенчмарк, где ИИ-модель ставится в роль «мозга» симулированного человекоподобного робота в момент внезапной опасности.

Кому это важно

Разработчикам мультимодальных моделей и воплощённых (embodied) агентов, которые метят в бытовую робототехнику: бенчмарк напрямую измеряет то самое качество, без которого домашнего робота нельзя выпускать рядом с людьми, безопасную реакцию на неожиданность. Важен он и исследователям безопасности ИИ, которые ищут метрики за пределами точности ответов на вопросы.

Как это применить

ReactHuman задуман не только как измерительный инструмент, но и как источник обучающих сигналов: авторы описывают его как масштабируемый способ дообучать модели в сторону физически обоснованного, безопасного поведения. Сам бенчмарк доступен по ссылке на Hugging Face, которую приводят авторы.

Можно ли доверять

Методология выглядит строгой: эталонные исходы получены не вручную и не оценкой на глаз, а из симуляции твёрдых тел с частотой 240 Гц, сцены побитово воспроизводимы, а каждый выбранный моделью план физически доигрывается в симуляции до конца, оценивается не формальный выбор действия, а его реальные физические последствия. Обманчивые объекты (лёгкий предмет, который выглядит тяжёлым, и наоборот) специально усложняют задачу так, чтобы модель не могла проехать на поверхностных шаблонах.

Риски и подводные камни

Главный тревожный вывод, ни один из выявленных провалов не сокращается с ростом масштаба модели. Это значит, что реактивную безопасность нельзя получить «бесплатно» просто за счёт более мощной модели, нужны отдельные архитектурные решения или методы обучения. Кроме того, модели систематически доверяют внешнему виду предмета больше, чем его фактическому движению и действуют по фиксированным шаблонам, а не по наблюдаемой сцене, для реального домашнего робота это означает риск неверной реакции именно в нестандартной, но при этом наиболее опасной ситуации.