Taobao запустила RecGPT-V3: система рекомендаций экономит 52,4% вычислений

Taobao запустила RecGPT-V3: система рекомендаций экономит 52,4% вычислений

Taobao (входит в Alibaba) представила третье поколение своей системы рекомендаций на больших языковых моделях, RecGPT-V3. Первая версия, RecGPT-V1, перевела рекомендации с сопоставления паттернов поведения на рассуждение о намерениях пользователя. RecGPT-V2 масштабировал этот подход через координацию нескольких ИИ-агентов. Обе версии уже работают в продакшене и стабильно улучшают опыт пользователей и коммерческие показатели.

При эксплуатации на реальном масштабе команда столкнулась с тремя проблемами. Во-первых, модель работала без состояния (stateless): каждый запрос заново обрабатывал всю историю поведения пользователя, впустую тратя вычисления и теряя результаты прошлого анализа. Во-вторых, возник информационный бутылочное горлышко между текстовыми тегами и товарами: теги на естественном языке, это «протекающий» канал связи между пониманием пользователя и конкретными товарами. В-третьих, явное пошаговое рассуждение модели (цепочка рассуждений, chain-of-thought) было слишком длинным и создавало неприемлемую задержку и затраты на вычисления.

RecGPT-V3 решает все три проблемы. Модель стала «с состоянием» (stateful) и гибридно-модальной: она рассуждает и на естественном языке, для общих знаний о мире, и на семантических идентификаторах (Semantic ID, SID), для точной привязки к конкретным товарам. Компонент Memory Hub хранит структурированную, постоянно обновляемую память о пользователе, сжимая длинную историю поведения в компактные единицы; это снижает вычисления на моделирование пользователя на 55,8%. Гибридно-модальная базовая модель позволяет LLM совместно рассуждать над текстовыми тегами и SID, открывая широкополосный канал в пространство товаров. Компонент «скрытое рассуждение о намерении» (Latent Intent Reasoning) сворачивает многословные развёрнутые рассуждения в компактные обучаемые латентные токены, которые при этом можно раскодировать обратно в читаемое объяснение; это снижает стоимость выходных токенов в 200 раз.

RecGPT-V3 развёрнута в ленте «Угадай, что тебе нравится» на Taobao и показала стабильный прирост в крупномасштабном онлайн A/B-тесте: количество просмотров товаров (IPV) выросло на 1,28%, кликабельность (CTR), на 1,00%, показатель TC, на 1,97%, оборот товаров (GMV), на 3,97%. При этом суммарное потребление вычислительных ресурсов на обслуживание запросов (end-to-end serving) сократилось на 52,4%.

Ключевые факты

  • RecGPT-V3, третье поколение рекомендательной модели Taobao: V1 работал над пониманием намерений пользователя, V2 масштабировал это через мультиагентное рассуждение, V3 добавил состояние (память) и гибридную модальность.
  • Модель рассуждает одновременно на естественном языке (общие знания) и на семантических ID товаров (точная привязка к конкретному товару).
  • Memory Hub хранит и обновляет структурированную память о пользователе вместо повторной обработки всей истории на каждый запрос, экономия вычислений на моделирование пользователя 55,8%.
  • Latent Intent Reasoning сжимает длинные цепочки рассуждений в компактные латентные токены, снижая стоимость выходных токенов в 200 раз.
  • В онлайн A/B-тесте в ленте «Угадай, что тебе нравится»: GMV +3,97%, TC +1,97%, IPV +1,28%, CTR +1,00%, суммарные ресурсы на обслуживание запросов сократились на 52,4%.

Почему это важно

RecGPT-V3 показывает, куда движутся LLM-рекомендательные системы промышленного масштаба: от «модель рассуждает и всё» к архитектуре, которая отдельно решает проблему памяти (не пересчитывать историю на каждый запрос), проблему точности (текстовые теги теряют информацию о конкретном товаре, нужен прямой канал через семантические ID) и проблему стоимости рассуждений (явная цепочка мыслей слишком дорога для продакшена). Это конкретный кейс, где все три узких места решены одновременно и проверены на реальном трафике, а не только на офлайн-бенчмарках.

Кому это важно

Инженерам и исследователям, которые строят или эксплуатируют рекомендательные системы на LLM в проде, в первую очередь в e-commerce, но паттерны применимы к любым системам с большой историей поведения пользователя и большим каталогом объектов. Также интересно командам, которые упираются в стоимость инференса из-за длинных цепочек рассуждений у LLM-агентов.

Как это применить

Три идеи из архитектуры можно переносить по отдельности: (1) вести структурированную, постоянно обновляемую память о пользователе вместо повторной обработки полной истории на каждый запрос; (2) дать модели гибридный словарь, сочетание текстовых тегов и компактных семантических идентификаторов объектов, вместо одних только текстовых описаний; (3) для продакшен-инференса сжимать развёрнутые рассуждения модели в латентные токены, сохраняя возможность раскодировать их обратно в читаемое объяснение при необходимости.

Можно ли доверять

Это технический отчёт Taobao/Alibaba, результаты получены на крупномасштабном онлайн A/B-тесте в реальном продакшене (лента «Угадай, что тебе нравится»), а не только на офлайн-метриках, это сильнее типичных лабораторных заявлений. Но отчёт самопубликован компанией, независимой проверки нет, абсолютный масштаб трафика и точный дизайн эксперимента (длительность, размер выборки, статистическая значимость) в тексте не раскрыты.

Риски и подводные камни

Указанные проценты, относительный прирост без базовых абсолютных цифр, оценить реальный эффект в деньгах или пользователях со стороны нельзя. Система обучена и проверена только на данных и поведении пользователей Taobao (китайский рынок e-commerce), перенос архитектуры на другие домены и каталоги не подтверждён. Детали устройства Memory Hub и латентных токенов рассуждения в тексте описаны на уровне идеи, без технических подробностей, достаточных для независимой воспроизводимости.