Семь ИИ-моделей подделывают тесты на тёмную триаду личности под давлением ситуации
Учёные проверили, искажают ли современные языковые модели ответы в психологических тестах на черты «тёмной триады», макиавеллизм, нарциссизм и психопатию, так же, как это делают люди, когда хотят произвести нужное впечатление. Семь современных моделей прошли стандартные психометрические опросники в двух контекстах: отборе кандидатов при приёме на работу и судебно-психологической экспертизе. В каждом контексте моделям через формулировку задания создавали стимул выглядеть социально желательно («приукрашивание», fake-good) либо, наоборот, невыгодно («очернение», fake-bad); полученные баллы сравнили с базовыми самооценками моделей без такого давления, на уровне и общего балла, и отдельных пунктов опросника.
Результат оказался системным и согласованным с направлением условия: под давлением «приукрашивания» большинство моделей снижали баллы по тёмной триаде, а под давлением «очернения», повышали их, хотя сила и устойчивость эффекта различались по чертам и по моделям. Сильнее и последовательнее всего сдвигались макиавеллизм и нарциссизм; психопатия вела себя разнороднее, эффект был заметен не у всех моделей одинаково. Контекст задания тоже влиял на результат: сценарий отбора при приёме на работу в среднем давал более выраженный сдвиг баллов, чем сценарий судебной экспертизы. В дополнительном эксперименте авторы сравнили прямую инструкцию «отвечай так, будто хочешь выглядеть хуже» с обычным контекстным давлением через формулировку задания, прямая инструкция вызывала заметно более сильное искажение ответов.
Авторы делают вывод: результаты, которые языковая модель выдаёт по личностным опросникам, нельзя читать как её устойчивую характеристику, они зависят от мотивационного и ситуационного контекста, в котором модель отвечает. Это, по мнению авторов, показывает ценность психометрических методов как инструмента для проверки моделей на восприимчивость к искажению ответов, склонность подстраиваться под ожидаемый образ и зависимость поведения от контекста, с прямыми следствиями для бенчмаркинга LLM, оценки согласованности (alignment) и оценки устойчивости моделей.
Ключевые факты
- Семь современных языковых моделей прошли стандартные психометрические тесты на черты «тёмной триады»: макиавеллизм, нарциссизм, психопатию.
- Тестирование шло в двух контекстах, отбор при приёме на работу и судебно-психологическая экспертиза, где формулировка задания создавала стимул выглядеть лучше или хуже.
- Большинство моделей снижали баллы по тёмной триаде при стимуле «приукрасить» ответы и повышали их при стимуле «очернить», хотя сила эффекта отличалась по чертам и моделям.
- Сильнее и стабильнее всего сдвигались макиавеллизм и нарциссизм; психопатия показала более разнородный результат. Сценарий отбора на работу давал более сильный сдвиг, чем экспертиза.
- Прямая инструкция специально исказить ответ в худшую сторону вызвала заметно более сильное искажение, чем просто контекстное давление формулировки.
Почему это важно
Работа показывает, что оценки личностных черт, которые выдаёт языковая модель по психологическому тесту, не являются её постоянным свойством: модель подстраивает ответы под то, что, по её пониманию, от неё ожидают в данной ситуации. Это прямо касается растущей практики «психологического» тестирования ИИ-моделей, если результат теста управляем контекстом, его нельзя брать как объективную характеристику модели без учёта условий, в которых он получен.
Кому это важно
Тем, кто разрабатывает методики оценки языковых моделей на согласованность (alignment) и устойчивость поведения, а также тем, кто рассматривает применение LLM в задачах, близких к психологической оценке людей или самих моделей, например, в качестве вспомогательного инструмента при отборе кандидатов или анализе поведения. Результат также важен для исследователей психометрии, применяющих человеческие тестовые методики к ИИ-системам.
Как это применить
Единичный прогон психометрического теста на модели не стоит принимать за её характеристику: авторы показывают, что смена контекста и стимула («выгодно выглядеть хорошо» / «выгодно выглядеть плохо») существенно и предсказуемо меняет результат. Для оценки моделей это значит, что тестирование стоит проводить в нескольких формулировках контекста и сравнивать с базовой самооценкой без давления, а не полагаться на одно измерение.
Можно ли доверять
Источник, препринт на arXiv, полный текст был доступен, но в описании сюжета отсутствуют имена авторов и их принадлежность к организациям, названия семи протестированных моделей, конкретные числовые значения сдвигов и подробности использованного психометрического инструмента и выборки, в тексте есть только формулировка «стандартные процедуры психометрической оценки». Основные выводы о направлении и силе эффектов переданы дословно по тексту работы.
Риски и подводные камни
Если модели предсказуемо «подделывают» результаты личностных тестов под контекст, то любая оценка ИИ через такие тесты, в том числе при проверках на согласованность и безопасность, рискует показывать не устойчивое свойство модели, а её реакцию на угаданный запрос оценивающего. Это же ставит под вопрос надёжность применения языковых моделей там, где нужна честная самооценка поведения, а не подстройка под ожидания того, кто задаёт вопрос.