CORE: дистилляция риранкера научила ИИ-эмбеддинги различать похожие сцены

Модели эмбеддингов на основе мультимодальных языковых моделей (MLLM) плохо справляются с композиционным поиском: они путают сцены, где присутствуют одни и те же понятия, но по-разному связанные с объектами признаки. При этом та же базовая модель, если применить её не как кодировщик эмбеддингов, а как риранкер с перекрёстным вниманием (cross-attention), эти различия распознаёт правильно. Отсюда идея авторов: перенести («дистиллировать») композиционные суждения риранкера в модель эмбеддингов.
Так появился метод CORE. Он строит списки кандидатов, охватывающие пять уровней композиционного соответствия, и вводит новую функцию потерь, Rank-KL, которая обучает модель эмбеддингов воспроизводить тонкое ранжирование, которое даёт риранкер. Дополнительно авторы предложили градуированный протокол оценки и на нём при одинаковых данных и бюджете обучения сравнили три подхода: контрастивное обучение, попарный метод CoSENT и списочный Rank-KL. Сравнение показало: и CoSENT, и Rank-KL используют многоуровневую разметку эффективнее контрастивного обучения, а Rank-KL в итоге показывает лучший результат.
На трёх бенчмарках композиционного рассуждения, COLA, SUGARCREPE++ и NEGBENCH, модель CORE-RERANKER-8B набирает 82,7% суммарного среднего балла, обходя названный в тексте риранкер Jina-Reranker на 10,7 балла. Модель CORE-EMBED-8B показывает лучший суммарный средний результат, 0,666, среди всех протестированных в работе моделей эмбеддингов; с какими именно конкурентами она сравнивалась, в тексте не уточняется. Прирост переносится и на отдельный бенчмарк MCMR, не снижая при этом качество обычного поиска на COCO и Flickr30K, то есть точность в сложных композиционных случаях выросла не за счёт обычного поиска.
Ключевые факты
- Эмбеддинг-модели на основе MLLM путают сцены с одинаковыми понятиями, но по-разному привязанными к объектам признаками, а та же базовая модель, если использовать её как риранкер с перекрёстным вниманием, эти случаи различает верно.
- Метод CORE строит списки кандидатов на пяти уровнях композиционного соответствия и обучает модель эмбеддингов функцией потерь Rank-KL воспроизводить тонкое ранжирование риранкера.
- На градуированном протоколе оценки при равных данных и бюджете Rank-KL и попарный метод CoSENT эффективнее используют многоуровневую разметку, чем контрастивное обучение; Rank-KL показывает лучший результат в целом.
- На трёх бенчмарках композиционного рассуждения (COLA, SUGARCREPE++, NEGBENCH) CORE-RERANKER-8B набирает 82,7% суммарного среднего балла, на 10,7 балла больше, чем Jina-Reranker; CORE-EMBED-8B показывает лучший результат (0,666) среди протестированных моделей эмбеддингов.
- Прирост переносится на бенчмарк MCMR и не снижает качество обычного поиска на COCO и Flickr30K.
Почему это важно
Композиционные ошибки, когда эмбеддинг-модель различает отдельные понятия в сцене, но не то, к какому именно объекту какой признак относится, известное слабое место MLLM-эмбеддингов: они сжимают всю сцену в один вектор без пословного сопоставления запроса и кандидата. Риранкер, сравнивающий пару запрос-кандидат целиком через перекрёстное внимание, эту привязку различает; эмбеддинг, кодирующий каждую сторону отдельно, нет. Работа показывает, что этот разрыв можно закрыть не переделкой архитектуры эмбеддинга, а обучающим сигналом: подражанием тонкому ранжированию риранкера через функцию потерь Rank-KL. Если это работает надёжно, у поисковых систем на эмбеддингах появляется способ избавиться от известного класса ошибок, не жертвуя скоростью, ради которой эмбеддинги и используются вместо риранкеров.
Кому это важно
В первую очередь, командам, которые строят мультимодальный поиск поверх эмбеддингов (изображение-текст, сцена-запрос и подобное): для них принципиальна связка «быстро, потому что эмбеддинги индексируются один раз и сравниваются векторно», тогда как риранкеры точнее, но годятся только на небольшой шорт-лист кандидатов, каждую пару приходится прогонять через модель заново. Также это важно исследователям композиционного понимания в мультимодальных моделях: авторы дают отдельный градуированный протокол оценки и сравнение трёх способов обучения при равном бюджете данных, готовый ориентир для чужих экспериментов на эту же тему.
Как это применить
В самой аннотации нет ни ссылки на код или веса моделей, ни лицензии, ни площадки, где результаты выйдут отдельной публикацией, то есть на момент этого текста CORE не про то, что можно скачать и подключить. Практический смысл сейчас, в самом рецепте: если у вас уже есть риранкер с перекрёстным вниманием на той же базовой модели, что и эмбеддинг, им можно сгенерировать многоуровневые ранжированные списки кандидатов и дообучить модель эмбеддингов на них функцией потерь Rank-KL вместо привычного контрастивного обучения, авторы показывают, что так многоуровневая (градуированная) разметка используется эффективнее, чем при бинарном «подходит/не подходит».
Можно ли доверять
Проверить результаты по самой аннотации нельзя: она не называет ни авторов, ни организацию, стоящую за работой. Материал представлен на Hugging Face Papers; отдельное место публикации, конференция, журнал, препринт-сервер, в тексте не указано. Сравнение для риранкера, конкретное и именованное: Jina-Reranker, реальная существующая модель, разрыв в 10,7 балла на трёх названных бенчмарках. Для модели эмбеддингов сравнение слабее: сказано только, что 0,666, лучший результат «среди всех протестированных моделей эмбеддингов», без перечисления, с чем именно сравнивали.
Риски и подводные камни
Из аннотации, без домысливания, остаются открытыми: что именно означает «8B» в названиях моделей (расшифровки параметра в тексте нет), как считается «суммарный средний балл» из трёх бенчмарков и каковы результаты по каждому из них отдельно, и какие конкретно модели входят в группу сравнения для результата 0,666. Для контрастивного обучения и CoSENT в тексте нет абсолютных цифр, только то, что оба уступают Rank-KL, без величины разрыва. Дальше названных в тексте шести бенчмарков (COLA, SUGARCREPE++, NEGBENCH, MCMR, COCO, Flickr30K) выводы об универсальности метода источник не подтверждает.