Уортонская школа показала: ИИ-агенты пока не готовы делать покупки за вас

Исследователи Уортонской школы Пенсильванского университета проверили, насколько стабильно шесть современных ИИ-моделей, от компактных версий до топовых, ведут себя в роли персонального агента по покупкам. Всем моделям давали одну и ту же задачу: выбрать фитнес-часы из фиксированного набора товаров. Тестирование шло через симулятор ACES (Agentic e-Commerce Simulator, «симулятор агентной электронной коммерции»): агенту показывали скриншот страницы с товарами, он анализировал изображение, мог обратиться к дополнительным источникам информации и делал выбор.
Уже без единого внешнего источника модели показывали разные базовые предпочтения. Но стоило добавить всего один источник перед страницей товара, и рекомендации резко менялись. Исследователи проверили три источника: тред на Reddit, где советовали Garmin Forerunner 55; обзор Wirecutter, посвящённый Fitbit Inspire 3; и статью издания Strategist про WHOOP 5.0. Сильнее всего на выбор влиял именно Wirecutter: после его обзора вероятность того, что агент порекомендует Fitbit Inspire 3, выросла на 90 процентных пунктов у Claude Opus 4.8 и на 99 процентных пунктов у Gemini 3.5 Flash по сравнению с контрольным условием без внешних источников.
Во втором эксперименте агентам показывали сочетания из двух-трёх источников сразу. Смешение источников не усредняло рекомендации: Wirecutter, как правило, продолжал доминировать всякий раз, когда попадал в набор, хотя сила эффекта менялась от модели к модели. При этом чем больше источников видел агент, тем сильнее становился разброс его решений, изменчивость росла, а не снижалась.
В третьем эксперименте агентам показывали те же три источника, но в разном порядке, и результат менялся даже при полностью одинаковом наборе информации. Сильнее всего от порядка зависел Gemini 3.1 Flash Lite: вероятность выбрать Fitbit Inspire 3 колебалась от 2 до 56 процентных пунктов выше контроля в зависимости от того, в каком порядке шли источники. Claude Haiku 4.5, для сравнения, держался стабильно, в диапазоне 41, 42 процентных пункта. Играет роль и то, как именно подавать источники: у GPT-5.5 вероятность выбрать Fitbit Inspire 3 выросла на 53 процентных пункта при пакетной подаче всех источников разом, и всего на 6 процентных пунктов при последовательной подаче, по одному.
В четвёртом эксперименте исследователи изменили набор товаров так, чтобы один вариант был объективно лучше по всем измеримым параметрам: умные часы с Alexa за $29,99, с рейтингом 5,0 из 5,0 и 430 отзывами, при этом любой другой товар в наборе стоил от $359 и имел меньше отзывов. Затем агенту добавляли короткую фразу о пользователе в «памяти», например «Обожаю походы!». У части моделей эта фраза сдвигала выбор в сторону более дорогого товара, несмотря на явно более выгодный вариант: доля выборов Garmin Vivoactive 5 выросла на 75 процентных пунктов у Claude Opus 4.8, на 37 процентных пунктов у GPT-5.5 и на 36 процентных пунктов у Gemini 3.1 Flash Lite. Устойчивее всех оказалась Gemini 3.5 Flash, она выбирала объективно лучший товар в 86, 92% прогонов независимо от фразы о памяти. У GPT-5 Mini обнаружился неожиданный паттерн: положительная фраза про поход не вызвала значимого сдвига к Garmin Vivoactive 5, а вот отрицательная, «Не люблю походы!», значимо увеличила выбор Fitbit Versa 4.
Вывод для покупателей: доверить выбор ИИ-агенту не значит получить последовательное или оптимальное решение, два человека с одинаковым запросом или один и тот же человек в разные дни могут получить разные рекомендации без видимой причины. Авторы отдельно отмечают, что память в ChatGPT и подобных инструментах способна точно так же непредсказуемо влиять на советы по покупкам. Вывод для продавцов: по словам исследователей, оптимизировать товар под ИИ-агентов будет сложнее, чем под обычный поиск, потому что продавцы не знают, какая модель совершает покупку, что именно она успела прочитать и как устроена её техническая настройка.
Ключевые факты
- Уортонская школа Пенсильванского университета протестировала шесть ИИ-моделей, от компактных до топовых, в роли шопинг-агента, выбирающего фитнес-часы из фиксированного набора товаров, через симулятор ACES.
- Один-единственный источник, обзор Wirecutter, сдвинул вероятность выбора Fitbit Inspire 3 на 90 процентных пунктов у Claude Opus 4.8 и на 99 процентных пунктов у Gemini 3.5 Flash относительно контроля без источников.
- Порядок предъявления одних и тех же трёх источников меняет исход: у Gemini 3.1 Flash Lite разброс от 2 до 56 процентных пунктов, у Claude Haiku 4.5, стабильные 41, 42 пункта; способ подачи тоже важен, у GPT-5.5 пакетная подача источников давала +53 процентных пункта против +6 при последовательной.
- Короткая фраза о пользователе в «памяти» («Обожаю походы!») сдвигала выбор к более дорогому Garmin Vivoactive 5 даже при наличии объективно лучшего товара, умных часов с Alexa за $29,99 с рейтингом 5,0 и 430 отзывами против конкурентов от $359: +75 процентных пунктов у Claude Opus 4.8, +37 у GPT-5.5, +36 у Gemini 3.1 Flash Lite.
- Gemini 3.5 Flash оказалась самой устойчивой моделью, выбирая объективно лучший товар в 86, 92% прогонов независимо от «памяти»; по выводу исследователей, продавцам будет сложнее оптимизировать товары под ИИ-агентов, чем под обычный поиск, поскольку неизвестно, какая модель совершает покупку и что она успела прочитать.
Почему это важно
Идея делегировать покупку ИИ-агенту работает только тогда, когда его решения последовательны и объяснимы. Исследование Уортонской школы показывает обратное: одна и та же модель с одинаковым запросом может дать разные рекомендации в зависимости от того, какой обзор товара она увидела, в каком порядке шли источники и что записано в её «памяти» о пользователе. Это не абстрактный лабораторный эффект: авторы прямо напоминают, что память в ChatGPT и подобных инструментах уже сегодня способна незаметно влиять на то, что агент посоветует купить.
Кому это важно
Людям, которые пользуются памятью в ChatGPT и подобных ассистентах и рассчитывают, что агент подберёт им товар, их итоговый выбор способен незаметно сместиться от одной фразы о личных привычках. Продавцам и маркетологам, по выводу исследователей, продвигать товар для ИИ-агентов будет сложнее, чем для обычного поиска, потому что неизвестно, какая именно модель совершает покупку, что она успела прочитать и как устроен её процесс. Разработчикам самих моделей, в исследовании протестированы шесть систем (Claude Opus 4.8, Claude Haiku 4.5, GPT-5.5, GPT-5 Mini, Gemini 3.5 Flash, Gemini 3.1 Flash Lite), и результаты у них заметно расходятся: например, Gemini 3.5 Flash оказалась намного устойчивее остальных к посторонним источникам и «памяти» о пользователе.
Как это применить
Крупную покупку, которую предлагает ИИ-агент, стоит перепроверять так же, как обычную рекомендацию из интернета, особенно если в диалоге раньше упоминались личные привычки: это и есть «память», которая, по данным исследования, способна перевесить объективно более выгодный вариант. Продавцам имеет смысл учитывать, что авторитетные обзорные издания вроде Wirecutter несоразмерно сильно влияют на выбор агентов, а порядок и способ подачи источников, по одному или пакетом, сам по себе меняет результат: это стоит держать в уме при работе над видимостью товара для ИИ-поиска.
Можно ли доверять
Источник, статья издания The Decoder, пересказывающая исследование специалистов Уортонской школы Пенсильванского университета. В тексте названы конкретные протестированные модели и товары, описана методика (симулятор ACES) и приведены десятки конкретных цифр в процентных пунктах по каждому из четырёх экспериментов, это говорит в пользу добросовестного пересказа реального исследования. При этом статья не называет ни одного исследователя по имени, не даёт ссылку на препринт или публикацию и не указывает дату исследования, так что сверить методику и цифры с первоисточником по этому тексту невозможно.
Риски и подводные камни
Главный риск, асимметрия информации: продавцы не знают, какая модель совершает покупку от имени пользователя, какие источники она видела и в каком порядке, а значит не могут честно подготовить карточку товара, при этом уже видно, что обзоры вроде Wirecutter и порядок подачи источников способны сместить решение агента на десятки процентных пунктов. Для пользователей риск другой: короткая фраза о личных привычках в «памяти» ассистента способна перевесить выбор в сторону более дорогого товара даже при наличии объективно лучшего варианта, и человек может не понимать, почему агент посоветовал именно это.
«Обожаю походы!»
— тестовая фраза-«память» о пользователе из четвёртого эксперимента