Claude, GPT-4o и Llama-3.1 пропускают признаки кризиса у поколения Альфа

Разговорные ИИ-системы, от специализированных терапевтических приложений до чат-ботов общего назначения, стали неформальным источником психологической поддержки для поколения Альфа (родившихся в 2010, 2024 годах): 13,1% американских подростков (5,4 млн человек) уже используют генеративный ИИ для советов по психическому здоровью. Эти системы построены на больших языковых моделях, обученных на обширной психологической литературе, но их безопасность именно для языка этого поколения, гиперболы, ироничного позитива, быстрого смыслового дрейфа значений, контекстной многозначности, никогда не проверялась системно. Авторы предприняли такую проверку после того, как несколько случаев гибели подростков были связаны с их общением с ИИ-чат-ботами (точное число случаев и конкретные продукты в тексте не названы).

Для проверки исследователи создали два новых бенчмарка. Первый, набор из 64 выражений о психическом состоянии на языке поколения Альфа, подтверждённых носителями языка (согласованность ICC = 0,72) и клиницистами (kappa = 0,78). Второй, 75 многоходовых диалогов (780 реплик в сумме), каждый в двух версиях: на стандартном языке и на сленге поколения Альфа. На этом материале протестировали архитектуры языковых моделей, на которых работают и терапевтические приложения, и чат-боты общего назначения: Claude, GPT-4o и Llama-3.1. Результаты приведены в сумме по всем трём моделям, какая из них сильнее, а какая слабее, в тексте не указано.

Главный результат: модели верно понимают 76, 82% лексики поколения Альфа, но верно калибруют клинический риск лишь в 64, 72% случаев, разрыв в 10, 14 процентных пунктов (п.п.), статистически значимый (p < 0,001, d > 0,48). У живых психотерапевтов на том же материале разрыв практически отсутствует, всего 3 п.п., и он статистически незначим (p = 0,22). То есть модели «понимают слова» заметно лучше, чем переводят это понимание в верное суждение о том, насколько реально опасна ситуация. Разрыв одинаково проявляется во всех трёх протестированных архитектурах и резко растёт вместе с неоднозначностью формулировок, с 7 п.п. на самых понятных случаях до 18 п.п. на самых неоднозначных.

Авторы выделили шесть типовых сбоев, ранжированных по величине вызываемого ими разрыва: принятие приуменьшения серьёзности (minimization acceptance), 43 п.п., самый сильный эффект; маскировка сарказмом (sarcasm masking), 29 п.п.; смещение из-за неформального стиля речи (informal style bias), 24 п.п.; неоднозначность при разных уровнях риска (risk-stratified ambiguity), 19 п.п.; смысловой дрейф значений (semantic drift), 19 п.п.; насилие, зависящее от контекста (context-dependent violence), 7 п.п., самый слабый эффект. Паттерны накапливаются: если в одном разговоре сочетаются три и больше, доля пропущенного реального риска достигает 94%.

Лёгкие меры коррекции разрыв не закрывают (что конкретно под ними понимается, в тексте не раскрыто). До уровня живого терапевта модели дотягивает только «тяжёлое усиление» (heavy scaffolding, тоже не детализировано), но обходится это в 6,4 раза дороже базового варианта. При этом в базовом сценарии, без всякой коррекции, модели пропускают 34% реальных сигналов риска; в масштабе это, по оценке авторов, соответствует 146 880 упущенным кризисным случаям в год (охват оценки, вся ли это территория США или мир в целом, в тексте не уточнён).

На основании этого авторы формулируют четыре рекомендации для ИИ-систем, обращённых к подросткам в контексте психического здоровья: обязательное участие человека в контуре принятия решений (human-in-the-loop), ежеквартальная проверка именно на актуальном подростковом сленге, прозрачное раскрытие реальных показателей качества и появление отдельных регуляторных требований для этой категории продуктов.

Ключевые факты

  • Модели понимают 76, 82% сленга поколения Альфа, но верно калибруют клинический риск лишь в 64, 72% случаев, разрыв 10, 14 п.п. (p < 0,001, d > 0,48); у живых терапевтов разрыв всего 3 п.п. и статистически незначим (p = 0,22).
  • Разрыв одинаково проявляется во всех трёх протестированных архитектурах, Claude, GPT-4o и Llama-3.1, и растёт с неоднозначностью формулировок: с 7 п.п. до 18 п.п.
  • Выявлено шесть типовых сбоев; самый тяжёлый, принятие приуменьшения серьёзности (43 п.п.), самый слабый, насилие, зависящее от контекста (7 п.п.); три и более сбоя вместе в одном разговоре дают 94% пропущенного риска.
  • Лёгкие меры коррекции разрыв не закрывают; до уровня человека модели дотягивает только затратное «тяжёлое усиление» (heavy scaffolding), по цене в 6,4 раза выше базового варианта.
  • На базовом уровне модели пропускают 34% реальных сигналов риска, по оценке авторов, это 146 880 упущенных кризисных случаев в год; рекомендации авторов, обязательное участие человека, ежеквартальная проверка на актуальном сленге, прозрачность и профильное регулирование.

Почему это важно

Миллионы подростков уже используют ИИ-чат-боты как неформальный источник психологической поддержки, в США это 13,1% тинейджеров, то есть 5,4 млн человек. Исследование показывает, что системы, на которых строятся эти чат-боты, обладают конкретным и статистически подтверждённым слепым пятном: они заметно лучше понимают, что говорит подросток, чем верно оценивают, насколько опасна его ситуация, особенно когда речь построена на сарказме, преуменьшении или быстро меняющемся сленге. С этим авторы прямо связывают контекст работы: несколько случаев гибели подростков, которые были связаны с общением с ИИ-чат-ботами.

Кому это важно

Компаниям, которые разрабатывают или встраивают терапевтические приложения и чат-боты общего назначения на архитектурах вроде Claude, GPT-4o или Llama-3.1 и понимают, что их продуктом де-факто пользуются как психологической поддержкой несовершеннолетние. Родителям и клиницистам, которые полагаются на такие инструменты или обеспокоены их безопасностью. И регуляторам, авторы прямо призывают к отдельным нормативным требованиям для ИИ-систем психологической поддержки, обращённых к подросткам.

Как это применить

Собственные рекомендации авторов: не полагаться на лёгкие меры коррекции, исследование показывает, что разрыв они не закрывают; для продуктов, обращённых к подросткам в теме психического здоровья, закладывать затратное «тяжёлое усиление» или обязательное участие человека в контуре решений (human-in-the-loop), даже если это в 6,4 раза дороже; пересматривать качество модели ежеквартально именно на актуальном подростковом сленге, поскольку разрыв растёт вместе с неоднозначностью формулировок; прозрачно раскрывать реальные показатели точности вместо того, чтобы полагаться на общую языковую компетентность модели.

Можно ли доверять

Это препринт на arXiv, использующий два специально построенных бенчмарка с заявленной межэкспертной согласованностью (ICC = 0,72 для носителей языка, kappa = 0,78 для клиницистов) и статистической проверкой основных результатов, с p-значениями и размером эффекта (p < 0,001, d > 0,48 для разрыва у моделей; p = 0,22, то есть незначимо, для разрыва у живых терапевтов). Методология для заявленных выводов выглядит основательной. При этом в доступном тексте не указаны ни авторы, ни их институциональная принадлежность, ни точная дата публикации; нет разбивки результатов по каждой из трёх моделей отдельно, осталось неизвестным, отличаются ли Claude, GPT-4o и Llama-3.1 существенно друг от друга; не раскрыто, что конкретно представляют собой «лёгкие меры коррекции» и «тяжёлое усиление»; не назван ни точный источник, ни число случаев гибели подростков, о которых говорится как о мотивации исследования.

Риски и подводные камни

Главный риск, тот самый, что измеряет исследование: терапевтический или обычный чат-бот может звучать понимающе и уместно, но при этом систематически недооценивать, насколько опасна ситуация подростка. Причём хуже всего модели справляются ровно с тем регистром речи, которым чаще всего говорят подростки: сарказмом, преуменьшением и неформальным, быстро меняющимся сленгом, три из шести выявленных типов сбоя привязаны именно к этому. Когда несколько таких сбоев накладываются друг на друга в одном разговоре, доля пропущенного риска, по данным исследования, доходит до 94%. Простого решения нет: по выводам авторов, только затратное «тяжёлое усиление» приближает модель к качеству живого терапевта, а лёгкие меры коррекции не работают.