PsyAgentBench: бенчмарк показал, что «психологические» эффекты у ИИ-агентов возникают по-разному
Когда языковая модель отвечает так же, как ответил бы человек с определённым когнитивным искажением, это не то же самое, что модель «обладает» этим искажением: ответ может быть просто результатом того, что модель узнала классический психологический эксперимент по формулировке задания (эффект утечки из обучающих данных), а не проявлением устойчивого свойства. Чтобы отделить одно от другого, авторы представили бенчмарк PsyAgentBench, набор классических экспериментов психологии, переигранных на ИИ-агентах.
Каждый эксперимент прогоняется в нескольких сочетаниях условий: парадигму либо прямо называют в промпте (named), либо маскируют под обычную рабочую задачу (blind); формулировка задачи, либо буквальная, учебниковая версия (canonical), либо структурно эквивалентный вариант с изменёнными словами и сценарием, чтобы снизить пересечение с вероятными обучающими данными (counterfactual); дополнительно варьируется заданная «личность» (персона) агента.
Всего протестировано пять завершённых психологических парадигм на до трёх семействах открытых (open-weight) моделей, в сумме выпущено 41 904 испытания. Главный вывод: то, что выглядит как единый «человекоподобный» отклик, на деле возникает по принципиально разным причинам в зависимости от парадигмы. Конформизм по Ашу, эффект резкого переключения: явное упоминание парадигмы в промпте меняет поведение модели gpt-oss-120B с 0% случаев конформизма при замаскированной задаче (blind) до 83,3% при прямом назывании эксперимента (named), то есть модель, по всей видимости, распознаёт классическую задачу и подстраивает ответ под ожидаемый паттерн. Якорение зависит от знания фактов: на проверяемых, реальных фактах эффект якорения не проявился ни разу (exactly zero), а на придуманных, непроверяемых величинах, почти во всех случаях (near total); авторы отмечают, что второй результат в равной мере можно объяснить не искажением, а рациональным использованием единственного доступного сигнала для оценки. Фрейминг усиливается на новом для модели материале именно тогда, когда парадигма явно обозначена. Эффект невозвратных затрат устойчиво не проявился ни в одном из условий. В парадигме распределения по минимальным группам у модели сработал отказ выполнять задание по соображениям безопасности («safety-mediated selection»), и сам этот отказ авторы называют главным результатом по данной парадигме.
Однопредложенная смена персоны агента (agreeableness, доброжелательность/уступчивость), заданная как инструкция, а не как проверенная черта характера, в зависимости от эффекта либо устраняла его, либо ослабляла, либо разворачивала в противоположную сторону. Авторы указывают, что это говорит против единой теории «склонности к искажённым ответам»: подверженность модели психологическим эффектам нельзя описать одним числом.
Отдельно авторы формализуют три причины, по которым классический психологический эксперимент может некорректно переноситься на ИИ-агентов: доминирование заданной персоны над остальными факторами (persona dominance), схлопывание разброса ответов модели в единственный паттерн (population collapse) и отбор через отказ модели выполнять задание по соображениям безопасности (safety selection). Две из этих трёх причин задокументированы в исследовании эмпирически, третья описана только формально. Авторы заключают, что скалярная оценка «склонности к предвзятости» одним числом скрывает эту структуру, и вместо неё предлагают отчитываться профилями воспроизводимости, отдельно по каждой парадигме и условию.
Ключевые факты
- Бенчмарк PsyAgentBench переигрывает 5 классических психологических экспериментов на ИИ-агентах, до 3 семейств открытых моделей, всего 41 904 испытания
- Конформизм по Ашу на gpt-oss-120B: 0% при замаскированной задаче против 83,3% при прямом назывании эксперимента в промпте
- Якорение: эффект отсутствует (exactly zero) на реальных фактах, но почти тотален (near total) на придуманных величинах
- Однопредложенная смена персоны агента устраняет, ослабляет или разворачивает эффект, по-разному для разных парадигм
- Сформулированы три причины, по которым эксперимент может не перенестись на ИИ-агентов: доминирование персоны, схлопывание ответов, отбор через отказ по безопасности
Почему это важно
Работа решает конкретную методологическую проблему оценки ИИ: способность модели воспроизвести классический психологический эффект, конформизм, якорение, фрейминг и другие, обычно засчитывают как признак того, что модель «обладает» этим когнитивным искажением. Авторы показывают, что это смешивает разные явления: модель может просто узнавать по формулировке задания сам психологический эксперимент (эффект утечки данных обучения) и подыгрывать ожидаемому паттерну, а не иметь искажение как устойчивое свойство. Факторный дизайн, задача названа или замаскирована, формулировка буквальная или переписанная, впервые в явном виде разделяет эти два случая, проверено на пяти классических парадигмах и 41 904 испытаниях.
Кому это важно
В первую очередь, тем, кто строит и использует бенчмарки безопасности и оценки поведения ИИ-агентов: то, что для разных эффектов срабатывают разные механизмы (переключение по метке задачи, знание фактов, отказ по безопасности, полное отсутствие эффекта), означает, что единая шкала «склонность модели к предвзятости» способна вводить в заблуждение. Значимо и для разработчиков open-weight моделей семейств вроде gpt-oss-120B, чьи ответы напрямую проверялись в исследовании, и для тех, кто ставит ИИ-агентов в роли с психологически нагруженными решениями, переговоры, оценку рисков, работу по готовым сценариям.
Как это применить
Авторы предлагают конкретную методическую замену: вместо одного скалярного балла «подверженности искажению», отчитываться профилем воспроизводимости по условиям (названа ли парадигма, буквальная или переписанная формулировка задачи, персона агента). Практический вывод для тех, кто тестирует модели: проверять эффект и на замаскированной версии задачи, и на структурно эквивалентном, но лексически непохожем на учебник варианте, иначе легко принять узнавание задания за само искажение. Отдельно стоит учитывать, что смена персоны агента одной инструкцией способна полностью изменить результат теста на психологический эффект, поэтому персону нужно фиксировать и указывать как часть условий эксперимента.
Можно ли доверять
Работа пока опубликована как препринт на arXiv, без указания имён авторов и организаций и без даты в переданном тексте. В нём явно названа только одна из протестированных моделей, gpt-oss-120B; принадлежность двух других семейств открытых моделей в тексте не раскрыта. Методология, факторный дизайн с контролем на утечку обучающих данных и релиз всех 41 904 испытаний, работает на повышение доверия к результатам, но о независимой проверке или рецензировании на момент публикации текста не сообщается.
Риски и подводные камни
Главный риск, обратный пересказ результата: выводы легко упростить до «ИИ либо подвержен психологическим искажениям, либо нет», хотя именно это авторы и опровергают, по их данным, ответ зависит от конкретной парадигмы и условия проверки. Три обозначенных способа, которыми эксперимент может «не перенестись» на ИИ-агентов, доминирование персоны, схлопывание разброса ответов и отбор через отказ, задокументированы эмпирически лишь в двух случаях из трёх; третий описан только формально. Отдельная ловушка интерпретации: отказ модели выполнять задание («safety selection») в парадигме распределения по минимальным группам легко принять за отсутствие искажения, хотя по сути это отдельное явление, модель не демонстрирует эффект не потому, что его нет, а потому что отказывается действовать вовсе. Наконец, результаты получены на открытых (open-weight) моделях, поведение проприетарных передовых моделей в этих же условиях в тексте не проверялось.