Pew Research Center: доля ИИ-текста в сети после ChatGPT превысила треть

Pew Research Center проанализировал почти полмиллиона англоязычных веб-страниц из архива Common Crawl, проверив их на признаки машинного авторства инструментом Open Pangram. В выборке за июль 2026 года явные признаки ИИ-авторства нашлись примерно у 10% всех проверенных страниц. Но если оставить только страницы, опубликованные после запуска ChatGPT в конце 2022 года, картина меняется резко: у больше чем трети из них есть признаки того, что текст написан или существенно доработан ИИ. С момента запуска ChatGPT доля вероятно ИИ-сгенерированного контента в сети росла устойчиво.
По доменным зонам расклад такой: признаки ИИ-авторства есть примерно у каждой десятой страницы на домене .com, у 4,6% страниц на .org и лишь примерно у 1% страниц на .edu и на .gov, то есть на коммерческих сайтах ИИ-текст встречается примерно в десять раз чаще, чем на образовательных и государственных.
Pew также зафиксировал, как с 2023 года изменился сам стиль текстов в сети. Длинные тире стали встречаться примерно вдвое чаще, чем в 2023 году, а использование оксфордской запятой выросло на 63%. Частота ряда слов, которые считаются любимыми у языковых моделей, «delve» («углубляться»), «interplay» («взаимодействие»), «testament» («свидетельство»), «pivotal» («ключевой»), «landscape» («ландшафт», «сфера»), «tapestry» («полотно», «палитра»), «bolstered» («подкреплённый»), «crucial» («критически важный»), «meticulous» («скрупулёзный»), «vibrant» («яркий»), выросла более чем вдвое. Оборот «это не просто X, это Y» встречается почти втрое чаще, хотя в абсолютных числах такие фразы всё ещё редки; отдельное исследование корпоративных PR-текстов показало, что именно эта фраза учетверилась с 2022 года, но это уже данные другой работы, не Pew.
К похожим выводам пришло и другое исследование, совместная работа Имперского колледжа Лондона, Internet Archive и Стэнфордского университета, опубликованная в апреле 2026 года: по её данным, около 35% всех новых сайтов полностью или частично сгенерированы ИИ. Авторы этой работы также обнаружили, что ИИ-тексты показывают на 33% более высокое смысловое сходство между собой и заметно более позитивный тон, но предупредили, что общественное восприятие вреда от такого контента часто идёт дальше, чем показывают сами данные.
У выводов есть оговорки. Современные инструменты детекции ИИ-текста пока плохо различают полностью автоматический текст и текст, который человек лишь частично доработал с помощью ИИ, а единого понимания того, что вообще считать «ИИ-текстом», в индустрии нет: спектр тянется от полностью машинного текста до человеческого черновика, слегка подправленного нейросетью, и до текста, где ИИ вмешался всего в пару предложений. Как отмечается в материале, при проверке сотен собственных текстов детекторы вроде Open Pangram дают лишь очень грубую оценку, не умеют надёжно определить, сколько именно ИИ было использовано и на каком этапе, и регулярно ошибаются. На этом фоне общественная дискуссия вокруг ИИ-текста становится всё более поляризованной, например, недавно обсуждали планы Anthropic снабдить водяным знаком текст, сгенерированный Claude (продукт пока не выпущен, речь только о планах). Использование ИИ-инструментов уже несёт стигму, которая бьёт в обе стороны, это же фиксируют отдельные исследования рабочей среды.
Ключевые факты
- Pew Research Center проверил почти полмиллиона англоязычных веб-страниц из архива Common Crawl инструментом Open Pangram: в выборке за июль 2026 года явные признаки ИИ-авторства нашлись примерно у 10% всех страниц.
- Если оставить только страницы, опубликованные после запуска ChatGPT в конце 2022 года, доля страниц с признаками ИИ-авторства превышает треть.
- По доменам: признаки ИИ-текста есть примерно у каждой десятой страницы на .com, у 4,6% на .org и примерно у 1% на .edu и на .gov, на коммерческих сайтах текст с ИИ встречается примерно в десять раз чаще, чем на образовательных и государственных.
- С 2023 года заметно чаще встречаются характерные стилистические приметы: длинные тире, почти вдвое чаще, оксфордская запятая, на 63% чаще, слова вроде «delve» и «testament», больше чем вдвое чаще; оборот «это не просто X, это Y» у Pew встречается почти втрое чаще (в абсолютных числах пока редок), а по данным отдельного исследования корпоративных PR-текстов эта же фраза с 2022 года учетверилась.
- Независимое исследование Имперского колледжа Лондона, Internet Archive и Стэнфордского университета (апрель 2026) даёт похожую оценку, около 35% новых сайтов полностью или частично сгенерированы ИИ, а сами ИИ-тексты показывают на 33% более высокое смысловое сходство между собой и более позитивный тон; при этом инструменты детекции, по признанию материала, пока плохо различают полностью машинный текст и слегка доработанный ИИ человеческий черновик.
Почему это важно
Это масштабная попытка измерить, сколько текста в интернете сегодня хотя бы отчасти написано или доработано ИИ, а не просто общее ощущение. Вывод Pew о том, что больше трети страниц, опубликованных после запуска ChatGPT, показывают признаки ИИ-авторства, подкреплён независимым исследованием Имперского колледжа Лондона, Internet Archive и Стэнфордского университета: другим методом оно получило похожую по порядку долю, около 35% новых сайтов. Одновременно исследование показывает, что типичные стилистические приметы «ИИ-текста», определённые слова, длинные тире, оксфордская запятая, стали настолько распространены в обычном письме, что сами по себе уже не надёжный сигнал происхождения текста.
Кому это важно
Тем, кто оценивает происхождение и достоверность текста в интернете: журналистам и редакторам, которые отбирают источники, преподавателям и учебным заведениям, проверяющим работы, разработчикам и пользователям детекторов ИИ-текста вроде Open Pangram. Владельцам и маркетологам коммерческих сайтов в зоне .com, именно там, по данным Pew, ИИ-текст встречается чаще всего. И тем, кто следит за регулированием и маркировкой ИИ-контента: материал прямо упоминает спор вокруг планов Anthropic снабдить водяным знаком текст, сгенерированный Claude.
Как это применить
Не стоит делать вывод, что конкретную страницу можно надёжно классифицировать по стилю или по вердикту одного детектора: сами инструменты детекции, по признанию материала, дают лишь грубую оценку и регулярно ошибаются. Практический вывод, воспринимать проценты Pew и похожих исследований как индикатор общего тренда роста ИИ-текста в сети, а не как точную метку для конкретной страницы, и не судить об «ИИ-происхождении» текста по одной примете вроде частых тире или слова «delve». Авторам и компаниям, использующим ИИ при подготовке контента, разумнее прямо раскрывать это, чем полагаться на то, что стигма вокруг ИИ-инструментов помешает это заметить.
Можно ли доверять
Pew Research Center, крупный и давно работающий исследовательский центр, а выборка (почти полмиллиона страниц) достаточно велика для количественных оценок такого рода. Ключевой вывод подтверждён независимо: другая команда, Имперский колледж Лондона, Internet Archive и Стэнфордский университет, другим методом в апреле 2026 года получила близкую по порядку величину долю (около 35% новых сайтов). Но обе оценки, не точная классификация конкретных страниц, а результат работы автоматических детекторов, которые, по признанию самого материала, пока плохо отличают полностью машинный текст от человеческого черновика, слегка доработанного ИИ; в статье не раскрывается, какой именно порог детектор использует, чтобы посчитать страницу «показывающей признаки» ИИ-авторства. Кроме того, анализ ограничен англоязычными страницами, выводы не стоит без оговорок переносить на рунет или другие языковые сегменты сети.
Риски и подводные камни
Главный риск, спутать «показывает признаки ИИ-авторства» с «точно написано ИИ»: сами детекторы регулярно ошибаются и не различают степень участия ИИ в тексте. Второй риск, смешать в одну цифру результаты разных исследований: рост языковых примет у Pew (тире, оксфордская запятая, слова вроде «delve») и учетверение фразы «это не просто X, это Y» в корпоративных PR-текстах, это данные двух разных работ с разными базовыми годами и выборками, их нельзя складывать в один тренд. Наконец, поляризованная публичная дискуссия вокруг ИИ-текста, где его то демонизируют, то полностью обесценивают, мешает воспринимать взвешенный вывод исследования: рост доли ИИ-текста в сети реален и значителен, но сам процент от детектора не равен точному диагнозу для конкретной страницы.