Taobao Live научила компактную модель подстраиваться под смену обвязки агента

Цифровые ИИ-аватары, виртуальные ведущие, которые в прямом эфире отвечают на вопросы о товаре, вовлекают зрителей и на ходу применяют маркетинговые приёмы, должны работать с низкой задержкой ответа, часто обновлять стратегию и оставаться при этом точными и убедительными. Их агентная обвязка, навыки, хуки, структура промптов, схемы инструментов, обновляется независимо от весов самой модели, и это даёт быструю итерацию продукта. Но здесь есть компромисс: крупная модель подстраивается под новую обвязку без специальной подготовки, но слишком медленная для реального времени; компактная модель укладывается в лимит по задержке, но при обучении подгоняется под одну фиксированную версию обвязки и теряет точность, как только та меняется.
Команда TaoLive AIGC LLM Team предложила метод Harness-Aware Training (HAT), обучение компактных моделей, устойчивое именно к изменению обвязки. Ключевой приём, Harness-State Augmentation (HSA): во время обучения к идентификаторам и содержимому навыков, схемам инструментов, структуре промптов и хук-функциям применяют преобразования, которые не меняют саму задачу, а только её оформление в обвязке. Так модель учится решать задачу по существу, а не запоминать конкретный вид одной версии обвязки. Обучение состоит из трёх этапов: HSA-SFT, модель учится рассуждению и использованию инструментов, повторяя траектории более сильной модели в разных средах; General On-Policy Distillation, восстанавливает способность к обобщению, которую сужает этап SFT; HSA-RL, обучение с подкреплением уже в средах с аугментированной обвязкой, которое напрямую повышает устойчивость к её изменениям.
Результаты авторы приводят по четырём наборам для оценки, но по именам называют только три: Live-Stream QA, Harness-Variant QA и IFEval, какой набор четвёртый, в тексте не указано. На Live-Stream QA у HAT 94,8 балла против 80,3 у базовой модели и 93,0 у лучшей из сравниваемых универсальных нейросетей, компактная HAT-модель обходит на этом тесте и её. На Harness-Variant QA, который проверяет устойчивость именно к смене обвязки, у HAT 94,6 против 75,4 у базовой модели. На тесте следования инструкциям IFEval альтернативный подход, Fixed-Harness SFT, обучение на единственной фиксированной обвязке, просаживает результат на 7,7 пункта относительно базовой модели; HAT такой просадки избегает и показывает 83,5.
На одном GPU NVIDIA H20 итоговая система отвечает за 3,4 секунды медианно (P50) и укладывается в 8,1 секунды в 95% случаев (P95). Систему уже развернули в сервисе цифровых аватаров Taobao Live: онлайновый A/B-тест показал положительный эффект на GMV (совокупную стоимость проданных товаров) и на число просмотров карточек товара, точные цифры прироста авторы не приводят.
Ключевые факты
- Метод Harness-Aware Training (HAT, команда TaoLive AIGC LLM Team) обучает компактные модели адаптироваться к смене обвязки ИИ-агента, навыков, хуков, промптов и инструментов, без переобучения весов после каждого изменения.
- Ключевой приём, Harness-State Augmentation (HSA): обвязку варьируют преобразованиями, которые сохраняют саму задачу; обучение идёт в три этапа, HSA-SFT, General On-Policy Distillation, HSA-RL.
- На Live-Stream QA у HAT 94,8 балла против 80,3 у базовой модели и 93,0 у лучшей универсальной нейросети; на Harness-Variant QA, 94,6 против 75,4 у базовой модели.
- На IFEval альтернативный подход Fixed-Harness SFT теряет 7,7 пункта относительно базовой модели, а HAT этой просадки избегает и набирает 83,5.
- На одном GPU NVIDIA H20 система отвечает за 3,4 секунды медианно (P50) и укладывается в 8,1 секунды в 95% случаев (P95); систему развернули в сервисе цифровых аватаров Taobao Live, где A/B-тест показал рост GMV и просмотров карточек товара без указания точных цифр.
Почему это важно
ИИ-агентные продукты всё чаще строят так, чтобы навыки, инструменты и промпты, обвязку, можно было менять на лету, без переобучения весов модели: это ускоряет итерацию продукта. У этой гибкости есть цена. Крупная модель подстраивается под новую обвязку без специальной подготовки, но она медленная и дорогая для сценариев реального времени вроде прямого эфира с продажами. Компактная модель быстрая, но при обучении подгоняется под одну версию обвязки и теряет точность, как только та меняется, а меняется она часто. HAT предлагает третий путь: заранее обучить компактную модель так, чтобы устойчивость к изменению обвязки, характерная для крупных моделей, появилась у неё при сохранении скорости компактной. Судя по результатам на бенчмарках, это работает: HAT-модель обходит по качеству и лучшую из сравниваемых универсальных нейросетей на одном из тестов.
Кому это важно
Прежде всего, командам, которые строят ИИ-агентов с часто меняющейся обвязкой: службы поддержки, торговых или стриминговых ассистентов, кодинг-агентов, и хотят использовать компактные модели вместо тяжёлых универсальных нейросетей ради задержки и стоимости инференса. Инженерам, которые обучают модель под конкретную агентную обвязку и сталкиваются с тем, что она теряет точность при любом изменении промпта или схемы инструмента. И командам live-коммерции: кейс Taobao Live показывает, что метод уже проверен не только на бенчмарках, но и в продакшене с живым трафиком.
Как это применить
Ядро метода, Harness-State Augmentation (HSA): на этапе обучения к идентификаторам и содержимому навыков, схемам инструментов, структуре промптов и хук-функциям применяют преобразования, которые сохраняют суть задачи, но меняют её оформление в обвязке, так модель не запоминает одну конкретную обвязку, а учится решать задачу поверх любой из её вариаций. Дальше обучение идёт в три этапа: HSA-SFT, модель повторяет траектории более сильной модели в разных средах и учится рассуждению и использованию инструментов; General On-Policy Distillation, восстанавливает общую способность к обобщению, которую сужает этап SFT; HSA-RL, обучение с подкреплением уже в средах с аугментированной обвязкой, которое напрямую тренирует устойчивость к её изменению. Ориентир по задержке: на одном GPU NVIDIA H20 итоговая система отвечает за 3,4 секунды медианно и укладывается в 8,1 секунды в 95% случаев, пример достижимой задержки для компактной модели агента реального времени.
Можно ли доверять
У отчёта есть сильная сторона, редкая для чисто академических публикаций: помимо бенчмарков, метод проверен онлайновым A/B-тестом на реальном продакшен-трафике сервиса цифровых аватаров Taobao Live, и результат по GMV и просмотрам карточек товара положительный, такую метрику труднее подогнать задним числом, чем внутренний бенчмарк. Но в доступном тексте отчёта есть и пробелы. Имена авторов и их институция не названы, известна только группа TaoLive AIGC LLM Team. Авторы говорят об оценке на четырёх наборах данных, но по именам называют лишь три (Live-Stream QA, Harness-Variant QA, IFEval), какой набор четвёртый, не указано. Для «базовой модели», «компактных моделей» и «лучшей универсальной нейросети», с которыми сравнивают HAT, не приведены ни названия, ни размер, это мешает независимо оценить, насколько сильны и честны точки сравнения. Прирост GMV и просмотров по итогам A/B-теста дан только как «положительный», без единой цифры.
Риски и подводные камни
Главный риск для читателя, не с чем сверить цифры: и офлайн-бенчмарки, и результат A/B-теста получены и посчитаны самими авторами, независимой проверки в доступном тексте нет. Прирост GMV и просмотров карточек товара авторы не переводят в конкретные цифры, из отчёта нельзя понять, идёт ли речь о долях процента или о кратном росте, статистическая значимость результата не обсуждается. Задержка 3,4, 8,1 секунды измерена на одном GPU NVIDIA H20, как система ведёт себя при параллельной нагрузке множества одновременных зрителей эфира, то есть в реальном сценарии live-коммерции, отчёт не разбирает. Наконец, сама HSA-аугментация определена как «сохраняющая задачу»: она варьирует именования, схемы и формулировки, но не меняет саму задачу; поведение системы при действительно новых навыках или инструментах, которых не было среди аугментаций на обучении, остаётся за рамками отчёта.