RenderRank: реранкер оценивает документы по картинкам и экономит токены

RenderRank: реранкер оценивает документы по картинкам и экономит токены

Реранкер, модель, которая переупорядочивает найденные по запросу документы по релевантности. Для каждого запроса ему приходится оценивать сразу много документов-кандидатов, поэтому длина входа умножается на число кандидатов. В новой статье предложен RenderRank: вместо привычной последовательности текстовых токенов он получает документ, отрисованный как изображение, и кодирует его визуально-языковой моделью в виде сжатых визуальных токенов. По утверждению авторов, такое представление короче текстового, а экономия токенов работает при оценке каждого кандидата.

Обучение идёт в два этапа. Сначала оценки релевантности, которые модель выдаёт по визуальному входу, выравнивают с оценками текстовой модели-учителя. Затем уточняют относительные оценки положительных и отрицательных документов для одного и того же запроса.

Результаты на 11 наборах данных из BEIR: RenderRank использует на 16,5, 35,5% меньше входных токенов и получает средний NDCG@10 равный 55,96. По этому показателю он опережает все проверенные текстовые базовые модели размером меньше 4 млрд параметров и некоторые более крупные.

На четырёх наборах с длинными документами средний NDCG@10 равен 88,27, при этом среднее число входных токенов примерно вдвое меньше, чем у проверенных текстовых реранкеров. В этом режиме пропускная способность RenderRank в 1,70 раза выше самой высокой средней пропускной способности среди проверенных базовых моделей. Авторы делают вывод, что сжатые визуальные представления пригодны для точной оценки релевантности и могут служить альтернативой текстовым токенам в реранкинге.

Ключевые факты

  • RenderRank оценивает релевантность документа по его изображению (сжатые визуальные токены), а не по тексту.
  • На 11 наборах BEIR: на 16,5, 35,5% меньше входных токенов и средний NDCG@10 55,96.
  • По этому показателю лучше всех проверенных текстовых моделей меньше 4 млрд параметров и некоторых более крупных.
  • На четырёх наборах с длинными документами: NDCG@10 88,27, примерно вдвое меньше токенов, пропускная способность в 1,70 раза выше лучшей среди проверенных базовых моделей.
  • Обучение двухэтапное: выравнивание с текстовой моделью-учителем, затем уточнение оценок положительных и отрицательных документов для одного запроса.

Почему это важно

Реранкинг оценивает много кандидатов на каждый запрос, поэтому любое сокращение длины входа умножается на число кандидатов. Работа предлагает подавать документ не текстовыми токенами, а сжатыми визуальными, и показывает, что при этом точность остаётся на уровне текстовых моделей, а скорость на длинных документах растёт.

Кому это важно

Тем, кто строит поиск и системы с извлечением информации (retrieval), особенно по длинным документам, и кого волнует стоимость и скорость второго этапа ранжирования. Также интересно исследователям визуально-языковых моделей: это пример их применения для оценки релевантности текста.

Как это применить

Напрямую применять пока нечего: в тексте аннотации не названы ни база модели, ни размер RenderRank, ни выпуск кода или весов. Идея для практики, рассмотреть отрисовку текста в изображение как способ сократить вход реранкера и проверить её на собственных данных.

Можно ли доверять

Все цифры, из аннотации статьи и приведены как заявление авторов; независимой проверки в источнике нет. Сравнение идёт с «проверенными» текстовыми базовыми моделями, но их названия и размеры не перечислены, поэтому оценить силу сравнения по аннотации нельзя. Базовые значения NDCG@10 для сопоставления с 55,96 и 88,27 не приведены.

Риски и подводные камни

Превосходство по качеству заявлено для моделей меньше 4 млрд параметров и «некоторых более крупных»: опережает ли RenderRank в среднем текстовые реранкеры от 4 млрд, из аннотации неясно. Условия замера пропускной способности не описаны, а выигрыш в 1,70 раза относится к режиму длинных документов, а не ко всем наборам.