Nature Human Behaviour: нейросети снижают языковое разнообразие текста на 21, 50%

Учёные опубликовали в журнале Nature Human Behaviour эмпирическое исследование о том, как языковые модели (LLM), используемые в качестве помощников при письме, влияют на языковое разнообразие текстов. Работа состоит из трёх отдельных исследований и охватывает семь наборов данных из разных областей, в сумме проанализировано свыше 880 000 текстов.
Главный вывод: когда нейросеть редактирует или переписывает текст, основное содержание сохраняется, но стиль письма усредняется (гомогенизируется). Вариативность сложности письма статистически значимо снижается, на 21, 50% в зависимости от датасета и модели (p ≤ 0,05). Кроме того, ИИ усиливает языковые черты, свойственные доминирующим группам, и подавляет менее распространённые, конформность стиля берёт верх над индивидуальностью автора. Авторы отмечают, что этот эффект воспроизводится вне зависимости от конкретной модели, формулировки запроса и контекста использования.
Семь датасетов охватывают разные жанры текста: посты Reddit из раздела r/WritingPrompts, аннотации статей с arXiv, заметки издания Patch News, стенограммы выступлений в Конгрессе США, посты в Facebook из проекта YourMorals, диалоги из корпуса Empathic Conversations и корпус личных эссе, доступ к которому ограничен правообладателем. Шесть из семи наборов данных находятся в открытом доступе, один, только по запросу.
Авторы указывают, что находки имеют потенциальные последствия сразу для нескольких областей: диагностических процедур (язык давно используется как маркер психологических и когнитивных состояний), задач персонализации, инструментов оценки кандидатов при найме и сохранения языкового и культурного многообразия, везде, где важно различать индивидуальные особенности речи, а не усреднённый стиль, к которому склоняет ИИ-редактура.
Ключевые факты
- Три исследования, семь наборов данных, свыше 880 000 текстов, оценили влияние ИИ-переписывания на языковое разнообразие
- При редактуре или переписывании нейросетью базовое содержание текста сохраняется, но стиль письма усредняется
- Вариативность сложности письма падает статистически значимо, на 21, 50% в разных датасетах и моделях (p ≤ 0,05)
- ИИ усиливает языковые черты доминирующих групп и подавляет менее распространённые, конформность берёт верх над индивидуальностью
- Эффект держится вне зависимости от конкретной модели, промпта и контекста; авторы называют потенциальные риски для диагностики, найма, персонализации и сохранения языкового многообразия
Почему это важно
Язык, не просто средство коммуникации, а источник данных о личности, психологическом состоянии и социальном контексте человека; на этом строятся методы в психологии, маркетинге и здравоохранении. Исследование даёт крупномасштабное эмпирическое подтверждение того, что массовое использование нейросетей как помощников при письме размывает этот сигнал: письмо становится более единообразным, а индивидуальные языковые особенности, менее заметными.
Кому это важно
Исследователям, использующим язык как маркер психологического и когнитивного состояния (депрессия, снижение когнитивных функций и подобное); специалистам по найму, чьи инструменты оценивают кандидатов по письменным текстам; маркетологам, которые персонализируют коммуникацию на основе стиля письма; лингвистам и социологам, изучающим культурное и языковое разнообразие; и просто людям, которые регулярно пользуются ИИ для редактуры и переписывания собственных текстов.
Как это применить
Результаты, повод осторожнее относиться к текстам, прошедшим ИИ-редактуру, там, где важна естественная языковая вариативность: диагностические и психометрические инструменты, оценка кандидатов по резюме и сопроводительным письмам, любые системы, которые опираются на стиль письма как на индивидуальный признак. Если для вас важно сохранить собственный голос в тексте, стоит ограничивать степень ИИ-переписывания и перечитывать результат, а не принимать правки автоматически.
Можно ли доверять
Работа опубликована в рецензируемом журнале Nature Human Behaviour, опирается на три отдельных исследования и семь независимых наборов данных из разных областей, суммарно свыше 880 000 текстов, а заявленный эффект статистически значим (p ≤ 0,05) и воспроизводится в разных датасетах и моделях. При этом доступный текст, только аннотация и разделы о доступности данных и кода: полный текст статьи закрыт подпиской, поэтому детали методологии (как именно измерялись «языковое разнообразие» и «сложность письма», какие конкретно нейросети использовались) в источнике не раскрываются.
Риски и подводные камни
Авторы прямо называют перечисленные последствия для диагностики, найма и персонализации «потенциальными», источник не описывает механизм, который связывает гомогенизацию стиля с конкретным вредом в каждой из этих областей. Часть используемых данных чувствительна по своей природе (личные посты в Facebook, персональные эссе), но исследование опирается на них в агрегированном виде, с одобрением этических комитетов и без публикации отдельных постов или идентификаторов пользователей.
«Базовое содержание текста при редактуре и переписывании нейросетями сохраняется, но при этом они гомогенизируют стиль письма, усиливают языковые черты, свойственные доминирующим группам, подавляя остальные, и ставят конформность выше индивидуальности.»
— исследование в Nature Human Behaviour
Компания Meta Platforms признана экстремистской организацией, её деятельность на территории РФ запрещена.