APM-Bench: новый бенчмарк проверяет, помнят ли ИИ-ассистенты видео прошлых сессий

APM-Bench: новый бенчмарк проверяет, помнят ли ИИ-ассистенты видео прошлых сессий

Авторы работы исходят из того, что потоковым видеомоделям, которые должны служить персональными ассистентами в реальной жизни, нужна постоянная (персистентная) память: она хранит прошлый опыт для последующего использования. По их мнению, существующие бенчмарки и методы для потокового видео часто ориентированы на отдельные непрерывные ролики или короткие клипы. Но реальное взаимодействие прерывисто, и память должна сохраняться между перерывами.

Чтобы закрыть этот пробел, авторы представляют APM-Bench. Он переформулирует реальное потоковое взаимодействие как многосессионные «жизненные траектории». В бенчмарке 549 сессий, 104 траектории и 2 719 кандидатов; вопросы бывают как объективными, так и открытыми. Каждая сессия, это видео с детальной разметкой, а сессии внутри одной траектории связаны близкими по смыслу занятиями. Модель с помощью постоянной памяти отвечает на вопросы о прошлых сессиях и выдаёт проактивные реплики, не теряя взаимодействия в реальном времени.

Это порождает ряд требований: память должна быть сохраняемой, избирательно удерживать информацию, подставляться в нужный момент и оставаться эффективной. Кроме того, из-за конечного объёма хранилища нужные свидетельства могут оказаться недоступны, и ассистент должен распознавать отсутствие данных. Поэтому авторы проверяют, признают ли модели недостаток свидетельств.

В оценку вошли универсальные видеомодели при разных протоколах работы с памятью и разнообразные специализированные системы потоковой памяти. Вывод авторов: наблюдается чёткий компромисс между полезностью, задержкой и объёмом хранилища, существующие методы пока не могут одновременно обеспечить надёжное долговременное припоминание, низкие накладные расходы и эффективную проактивную помощь между сессиями. Авторы видят в APM-Bench всесторонний испытательный стенд для разработки и сравнения систем постоянной памяти в реалистичных потоковых условиях и надеются, что он подтолкнёт к работам, совместно учитывающим полезность, задержку и хранилище.

Ключевые факты

  • APM-Bench проверяет долговременную память потоковых видеоассистентов между отдельными сессиями, а не на одном ролике или коротком клипе.
  • Состав: 549 сессий (видео с детальной разметкой), 104 траектории и 2 719 кандидатов, включая объективные и открытые вопросы.
  • Модели должны отвечать на вопросы о прошлых сессиях, давать проактивные подсказки и признавать, когда свидетельств не хватает.
  • Оценены универсальные видеомодели при разных протоколах памяти и специализированные системы потоковой памяти.
  • Главный вывод авторов: проявляется компромисс между полезностью, задержкой и объёмом хранилища; ни один существующий метод не выигрывает по всем трём.

Почему это важно

Ассистент, который помогает человеку в повседневной жизни по видео, должен помнить, что было в прошлых эпизодах, а не только в текущем. По утверждению авторов, существующие бенчмарки смотрят на отдельные непрерывные видео или короткие клипы и упускают прерывистость реальных взаимодействий. APM-Bench задаёт для этого отдельную измеряемую постановку.

Кому это важно

Исследователям потоковых видеомоделей и систем памяти для ассистентов, а также командам, которые сравнивают подходы к хранению и подстановке прошлого опыта. Авторы позиционируют бенчмарк как испытательный стенд для разработки и сравнения таких систем.

Как это применить

Бенчмарк можно использовать как тестовую площадку для сравнения систем постоянной памяти в реалистичных потоковых условиях, оценивая их одновременно по полезности, задержке и объёму хранилища. В тексте источника нет ссылки на данные, код и лицензию, поэтому условия доступа нужно уточнять отдельно.

Можно ли доверять

Это описание самого бенчмарка и выводов его авторов. В доступном тексте нет результатов по конкретным моделям и системам, названий оцениваемых систем, а также авторов и организаций, так что вывод о компромиссе «полезность, задержка, хранилище» проверить по тексту нельзя. Размер этого компромисса в цифрах не приводится.

Риски и подводные камни

Конечное хранилище означает, что нужные свидетельства могут быть недоступны, и от модели требуется признавать недостаток данных, а не выдумывать ответ. Кроме того, память должна подставляться в нужный момент и не замедлять работу в реальном времени. По выводу авторов, существующие методы пока не справляются со всеми этими требованиями сразу.