Shopee подняла GMV на пользователя на 1,75% новой моделью рекомендаций

Промышленные рекомендательные системы всё чаще строят по схеме «сначала предобучение, потом перенос»: модель обучают на истории поведения пользователей, а затем адаптируют под конкретную задачу, например, поиск или ленту товаров. Проблема в том, что поведение пользователей со временем меняется (дрейф поведенческого распределения), и это ставит два вопроса: чему именно учить модель на последовательностях действий пользователя и как переносить уже выученное знание, когда предобученную модель приходится регулярно обновлять заново. Цзысюань Ван с соавторами предложили метод Knowledge-Geometry Decoupling (KGD, «разделение знания и геометрии»), который решает обе проблемы.
Первая часть решения касается того, чему учить модель. Стандартное предсказание следующего действия, заимствованное из языковых моделей, считает любые соседние в последовательности действия зависимыми друг от друга, из-за этого модель может выучить случайные, ложные связи между действиями из разных, не связанных между собой сессий пользователя. Авторы предложили Behavioral Multi-Token Prediction (BMTP), предсказание сразу нескольких будущих поведенческих шагов: в качестве обучающего сигнала модель использует только те будущие товары, которые действительно связаны с текущим по смыслу или по совместной встречаемости, а не все подряд по порядку. Это даёт более чистое и лучше переносимое знание о поведении пользователей.
Вторая часть решения, как переносить это знание при регулярном обновлении модели. Предобученное знание о поведении и специфичная для конкретной задачи «геометрия» модели предъявляют противоречивые требования к одним и тем же параметрам: оптимизация под задачу портит общее поведенческое знание, и наоборот. KGD разводит их по разным наборам параметров: обновляемый энкодер хранит поведенческое знание и может свободно дообучаться на новых данных, а отдельный модуль под конкретную задачу считывает состояния энкодера только на чтение, через перекрёстное внимание (cross-attention), без обратного влияния на энкодер, и вносит собственные, специфичные для задачи поправки через Anchored Calibration Residual (ACR), калибровочную добавку, которая математически ортогональна предобученным эмбеддингам и потому не искажает их. За счёт такого разделения энкодер можно непрерывно переобучать на свежих данных, не ломая уже выученную задачу и не сталкивая градиенты двух целей друг с другом.
На восьми публичных бенчмарках KGD обходит сильные базовые методы того же класса на 4, 12%. На 90-дневном потоке продакшен-данных KGD сохраняет это преимущество на всём периоде, тогда как у базовых моделей за то же время прироста не наблюдается, то есть метод не только точнее в моменте, но и устойчивее к дрейфу поведения со временем.
KGD полностью развёрнут в продакшене Shopee. В живом A/B-тесте на главной странице поиска (Shopee Homepage Search) метод поднял GMV (англ. gross merchandise value, объём продаж на платформе) на одного пользователя на 1,75% и рекламную выручку на 1,53%, по словам авторов, это подтверждает высокую практическую ценность метода. Базовую реализацию KGD они выложили в открытом доступе на GitHub, в репозитории FuCongResearchSquad/KGD4REC.
Ключевые факты
- Проблема: в потоковых рекомендательных системах поведение пользователей меняется со временем (дрейф поведенческого распределения), неясно, чему учить модель на истории действий и как переносить уже выученное знание при регулярном обновлении предобученной модели.
- Для «чему учить» авторы предложили Behavioral Multi-Token Prediction (BMTP): вместо стандартного предсказания следующего действия модель учится только на будущих товарах, реально связанных с текущим по смыслу или совместной встречаемости, а не на всех подряд.
- Для «как переносить» KGD разводит параметры на обновляемый энкодер (хранит поведенческое знание, свободно дообучается) и модуль под задачу (читает энкодер только на чтение через перекрёстное внимание, вносит поправки Anchored Calibration Residual, ортогональные предобученным эмбеддингам).
- KGD превосходит сильные базовые методы того же класса на 4, 12% на восьми публичных бенчмарках и сохраняет преимущество на 90-дневном продакшен-потоке данных, где у базовых моделей прироста не наблюдается.
- KGD полностью развёрнут в Shopee: в живом A/B-тесте на главной странице поиска GMV на пользователя вырос на 1,75%, рекламная выручка, на 1,53%; базовая реализация выложена на GitHub (FuCongResearchSquad/KGD4REC).
Почему это важно
Промышленные рекомендательные системы стареют вместе с поведением пользователей: модель, обученную один раз, либо периодически переобучают с нуля, дорого, либо дообучают инкрементально, и тогда новое знание часто портит то, что модель уже умела делать для конкретной задачи. KGD предлагает архитектурный ответ на эту проблему: развести «что модель знает о поведении» и «как она решает конкретную задачу» по разным, не мешающим друг другу наборам параметров. В отличие от типичной академической статьи, здесь результат подтверждён не только на статичных бенчмарках, но и на 90-дневном потоке живых продакшен-данных и в A/B-тесте на реальной платформе, а это заметно более строгая проверка, чем разовый замер на фиксированном датасете.
Кому это важно
В первую очередь, инженерам и исследователям, которые строят рекомендательные системы в промышленном масштабе: поиск и ленту товаров в e-commerce, рекомендации контента, ранжирование рекламы, везде, где модель работает на потоке постоянно меняющихся данных о поведении и её нужно регулярно обновлять, не теряя качества по уже настроенным задачам. Также, командам, которые занимаются непрерывным обучением (continual learning) и борьбой с деградацией уже настроенных задач при дообучении: KGD даёт архитектурный рецепт, проверенный на живом трафике, а не только теоретическую идею. Продуктовым командам и командам роста в e-commerce интересна прямая связь между архитектурой модели рекомендаций и ростом GMV и рекламной выручки.
Как это применить
Авторы выложили базовую реализацию KGD в открытом доступе на GitHub, в репозитории FuCongResearchSquad/KGD4REC, инженерные команды могут изучить код и оценить, насколько архитектура ложится на их собственный стек. Практическая идея, которую можно взять независимо от деталей реализации: разделить модель рекомендаций на «обновляемую» часть (энкодер, который регулярно дообучается на свежих поведенческих данных) и «стабильную» часть (модуль под конкретную задачу, который читает состояния энкодера только на чтение и вносит небольшие поправки, ортогональные предобученным весам). Это снижает риск, что обновление одной части модели сломает уже настроенную для задачи логику, особенно там, где уже применяется схема «сначала предобучение, потом перенос» и стоит задача регулярного дообучения без потери качества по продакшен-метрикам, как в случае Shopee Homepage Search.
Можно ли доверять
Работа опубликована как препринт на HuggingFace Papers; сама аннотация не называет ни авторов, ни организацию-разработчика, имя первого автора, Цзысюань Ван (Zixuan Wang), взято из метаданных страницы, а не из текста аннотации, и о независимой рецензии речи не идёт. При этом уровень проверки выше обычного для академической статьи: помимо восьми публичных бенчмарков, метод проверен на 90-дневном продакшен-потоке и полностью развёрнут в Shopee, а цифры A/B-теста, рост GMV на пользователя и рекламной выручки, получены на реальном трафике, а не смоделированы. Сами цифры сообщают авторы работы; независимого подтверждения со стороны Shopee или третьих сторон в тексте нет, а абсолютные показатели базовых моделей и даты внедрения и проведения A/B-теста источник не приводит, есть только относительный прирост.
Риски и подводные камни
Источник не раскрывает размер модели KGD, объём обучающих данных и вычислительные затраты на поддержание двух отдельных наборов параметров, для команды, которая планирует повторить архитектуру, это существенные неизвестные, способные сильно повлиять на стоимость внедрения. Прирост 4, 12% на бенчмарках, диапазон, а не одно число: выигрыш заметно различается между задачами и датасетами, и нет гарантии, что на новом сценарии он окажется ближе к верхней или нижней границе. Результаты A/B-теста получены на одной платформе и в одном сценарии, поиск на главной странице Shopee, и неясно, насколько прирост в 1,75% и 1,53% воспроизводится в других доменах, например в рекомендациях контента или в каталогах с меньшим объёмом данных о поведении для дообучения энкодера.