ИИ-персоны для прогноза кликов оказались хуже, чем модель без них

Маркетологи всё чаще используют большие языковые модели как «синтетические персоны», просят модель ответить от лица придуманного профиля читателя, чтобы заранее оценить, как аудитория отреагирует на текст объявления или заголовок. Авторы исследования проверили, действительно ли такой приём предсказывает реальное поведение людей лучше, чем модель, отвечающая напрямую, без ролевой игры.

В качестве эталона они взяли архив Upworthy Research Archive, тысячи A/B-тестов заголовков, показанных одной и той же реальной аудитории, с измеренным количеством кликов. Сравнивались два подхода: панель из десяти персон, построенных на демографии реальной аудитории, и вариант без персон, модели просто задавали вопрос, насколько вероятно, что типичный читатель кликнет по заголовку.

Первый результат: большинство A/B-тестов в архиве не дают статистически различимого победителя, поэтому точность предсказаний можно измерить только на надёжной части выборки, 399 тестов из общего массива в тысячи пар. Второй результат, главный и неожиданный: модель без персон ранжирует варианты заметно точнее, чем панель персон. Коэффициент корреляции Кендалла (τ) для варианта без персон, 0,361 (эффект среднего размера), точность попадания в победителя с первой попытки (top-1), 49,2%. У панели персон те же показатели заметно ниже: τ = 0,084, точность top-1, 34,6%; доверительные интервалы двух подходов не пересекаются.

Авторы объясняют это тем, что прямой вопрос обращается к точному усреднённому по популяции знанию модели, а принуждение модели разыгрывать роль конкретной персоны добавляет предвзятость и шум. Результат воспроизвёлся на трёх независимых частях выборки Upworthy, сохранил направление на другом наборе данных, из новостной сферы, а не только Upworthy, и оказался устойчив к смене случайного зерна, формулировки запроса и самой модели: эффект подтвердился на трёх уровнях моделей семейства Gemini и на модели другого разработчика, OpenAI GPT-4.1, где разница между подходами тоже оказалась статистически значимой. Все цифры можно воспроизвести по открытому пакету с данными и кодом, который авторы выложили вместе со статьёй.

Ключевые факты

  • Сравнение шло на реальных данных: тысячи A/B-тестов заголовков из архива Upworthy с измеренными кликами, а не на синтетической оценке.
  • Модель без персон предсказывает победителя A/B-теста заметно точнее панели из десяти персон: коэффициент Кендалла 0,361 против 0,084, точность top-1, 49,2% против 34,6%.
  • Надёжно сравнить методы удалось только на 399 тестах из тысяч, у большинства пар в архиве нет статистически различимого победителя.
  • Результат устойчив к смене модели: подтверждён на трёх уровнях Gemini и на GPT-4.1 от OpenAI, а также на другом, не-Upworthy наборе данных.
  • Авторы делают вывод: для прогноза совокупной вовлечённости аудитории синтетические персоны не просто слабее прямого вопроса, они хуже, чем полное отсутствие персон.

Почему это важно

Маркетинг всё активнее берёт на вооружение идею «синтетических фокус-групп», запуска ИИ-персон вместо реальных пользователей для предварительной проверки текстов и заголовков, опираясь на данные о том, что модели с заданным профилем неплохо имитируют ответы людей. Это исследование бьёт по самой предпосылке: на реальных данных о кликах более сложная и дорогая конструкция с персонами проигрывает самому простому способу, прямому вопросу к модели без всякой ролевой игры.

Кому это важно

Маркетологам, копирайтерам и продуктовым командам, которые тестируют заголовки, объявления и рекламные тексты через ИИ до реального запуска; разработчикам платформ и инструментов для симуляции аудитории на основе персон; исследователям, изучающим, насколько LLM годятся как замена реальным респондентам.

Как это применить

Если задача, предсказать, какой из вариантов текста наберёт больше кликов в среднем по аудитории, исследование советует не усложнять: не строить панель персон, а напрямую спросить модель, насколько вероятно, что типичный читатель кликнет. Именно такой прямой вопрос точнее ранжировал победителей в A/B-тестах, чем ролевая игра от лица придуманных профилей.

Можно ли доверять

Да, с оговоркой на область применения. Результат воспроизведён на трёх независимых частях архива Upworthy, сохранил направление на другом, не-Upworthy наборе новостных данных и устойчив к смене случайного зерна, формулировки запроса и самой модели, проверка прошла на трёх уровнях Gemini и на GPT-4.1 другого разработчика, OpenAI. Авторы опубликовали открытый пакет, по которому все цифры можно пересчитать самостоятельно. Ограничение, предмет теста узкий: заголовки и клики, а не любой маркетинговый текст и не любая метрика вовлечённости.

Риски и подводные камни

Даже лучший метод далёк от идеала: точность попадания в победителя с первой попытки у модели без персон, 49,2%, то есть она всё ещё ошибается примерно в половине случаев. Надёжно сравнить методы удалось лишь на 399 тестах из тысяч в архиве, у большинства пар нет статистически различимого победителя, и это ограничивает, насколько широко можно обобщать вывод. Исследование объясняет отставание персон предвзятостью и шумом от ролевой игры, но не разбирает механизм этого эффекта детально.