Учёные: детализация персоны не делает мнения языковых моделей разнообразнее
Языковые модели всё чаще используют, чтобы имитировать разнообразие человеческих мнений, в синтетических опросах, при моделировании фокус-групп и прогнозировании общественного мнения. Проблема в том, что ответы моделей систематически «усредняются»: разнообразие реальных людей на выходе теряется. Способов бороться с этим предлагали много, но область исследована фрагментарно, разные методы проверяют по отдельности и несравнимыми метриками, а на практике в продуктах их обычно включают и обновляют сразу пачкой, из-за чего невозможно понять, какой приём сколько дал.
Чтобы разобраться, авторы поставили полный факторный эксперимент, который разделяет два независимых фактора: во-первых, сколько информации о персоне закладывается на входе (глубина персоны), и во-вторых, архитектуру взаимодействия с моделью, то есть то, как устроен сам пайплайн общения с ней. Все комбинации проверили на 100 реальных открытых вопросах от пользователей и на 7 разных языковых моделях, а разнообразие ответов измеряли сразу несколькими взаимодополняющими метриками, а не одной цифрой.
Первый результат: больше деталей персоны, не значит больше разнообразия. Уже сам факт, что модели вообще назначили персону (первый шаг), даёт основную часть прироста разнообразия. Дальнейшая детализация, добавление демографических подробностей, не приводит к стабильному улучшению, а на части моделей даже снижает разнообразие ответов.
Второй результат: единой «лучшей» архитектуры взаимодействия не существует. Разные архитектуры вытягивают из модели разные, почти не пересекающиеся наборы мнений. Поэтому сочетание нескольких архитектур покрывает более широкое пространство мнений, чем попытка найти и оптимизировать одну-единственную «правильную» схему.
Третий результат: дешёвые и популярные приёмы, повышение температуры генерации и текстовые инструкции вроде «отвечай более разнообразно», дают ничтожный эффект по сравнению со структурными вмешательствами (выбором персоны и архитектуры).
Итоговый вывод авторов: разнообразие мнений языковой модели не получить, просто масштабируя один параметр, оно сильно зависит от структурной формы вмешательств и того, как их сочетают друг с другом. Для команд, которые строят инструменты синтетических опросов или фокус-групп на языковых моделях, это значит: не стоит бесконечно наращивать детализацию персон и полагаться на температуру генерации, эффективнее комбинировать разные архитектуры взаимодействия с моделью.
Ключевые факты
- Полный факторный эксперимент: 100 реальных открытых вопросов от пользователей и 7 языковых моделей, два независимых фактора, глубина персоны и архитектура взаимодействия.
- Первый шаг (сам факт назначения персоны) даёт основной прирост разнообразия; дальнейшая демографическая детализация не помогает стабильно, а на части моделей даже снижает разнообразие.
- Единой «лучшей» архитектуры взаимодействия нет: разные архитектуры покрывают разные, почти не пересекающиеся области мнений, а их сочетание расширяет покрытие.
- Повышение температуры генерации и инструкции вроде «отвечай разнообразнее» дают ничтожный эффект по сравнению со структурными изменениями входа и архитектуры.
- Главный вывод: разнообразие мнений языковой модели не масштабируется по одному параметру, оно зависит от структуры и сочетания вмешательств.
Почему это важно
Языковые модели всё чаще заменяют живых респондентов в синтетических опросах, фокус-группах и прогнозах общественного мнения. Но модели систематически «усредняют» мнения, теряя то разнообразие взглядов, что есть у реальных людей. Разработчики таких инструментов годами интуитивно наращивали детализацию персон, имя, возраст, доход, ценности, считая, что чем подробнее портрет, тем разнообразнее ответ. Эта работа впервые проверяет такое предположение в контролируемом эксперименте и показывает, что в общем случае оно не подтверждается.
Кому это важно
Исследователям и командам, которые строят инструменты синтетических опросов, моделирования фокус-групп или прогнозирования общественного мнения на базе языковых моделей; инженерам, которые проектируют мультиагентные пайплайны с персонами; социологам и маркетологам, рассматривающим языковые модели как дополнение или замену части живых респондентов.
Как это применить
Не стоит бесконечно наращивать детализацию персоны, демографию, биографию, ценности: основной эффект даёт уже сам факт, что персона назначена, а не её подробность. Вместо поиска одной «оптимальной» архитектуры диалога стоит комбинировать несколько разных архитектур взаимодействия с моделью, так получится более широкий охват мнений. На температуру генерации ответов и инструкции вроде «отвечай более разнообразно» как на самостоятельное решение рассчитывать не стоит: по данным эксперимента их эффект незначителен.
Можно ли доверять
Это контролируемый полный факторный эксперимент, который разводит вмешательства по независимым факторам, в отличие от типичных для этой области работ, где несколько приёмов проверяют вместе и невозможно понять вклад каждого по отдельности. Проверка проведена на 100 реальных вопросах и 7 разных языковых моделях сразу несколькими взаимодополняющими метриками разнообразия, а не на одной модели и одном показателе, методологически это заметно строже среднего по теме. При этом работа опубликована как препринт на arXiv, то есть заявленные результаты пока не прошли рецензирование научного журнала.
Риски и подводные камни
Выводы получены на конкретных 7 моделях и 100 вопросах, не факт, что они без изменений перенесутся на другие модели, языки или типы вопросов. «Разнообразие» в эксперименте измеряется метриками-прокси, которые не обязательно совпадают с тем, что социологи называют репрезентативностью мнений: более разнообразный ответ модели не гарантированно точнее отражает реальное распределение взглядов в обществе. Комбинирование нескольких архитектур взаимодействия ради более широкого охвата усложняет и удорожает пайплайн по сравнению с одной схемой.