Около трети новых статей на arXiv теперь читаются как написанные ИИ
Авторы блога unslop.run, создатели детектора ИИ-текста, провели исследование доли научных статей на arXiv, которые читаются как написанные с помощью ИИ. Они прямо указывают на проблему заголовков вида «N% текста теперь ИИ»: такие цифры обычно не учитывают, что детектор ошибочно помечает и часть настоящего человеческого текста. Поэтому исследование построено вокруг «пола ложных срабатываний»: детектор откалиброван так, что на статьях 2021, 2022 годов (заведомо человеческих, до ChatGPT) он ошибочно помечает ровно 0,4% текстов, и эта планка служит опорой для всех дальнейших цифр. По заявлению авторов, при этом же пороге детектор распознаёт 85% реально сгенерированных ИИ академических текстов.
Всего проанализировали 12 750 статей: примерно по 25 статей в месяц на каждую из десяти предметных областей с января 2023 по июль 2026 года, плюс восемь контрольных месяцев из 2021, 2022 годов. Для каждой статьи брали первую версию PDF-файла, чтобы поздняя правка 2026 года не «просочилась» в оценку статьи, поданной в 2023-м. Оценивали полный текст, а не аннотацию: по наблюдению авторов, одна и та же статья может получить оценку меньше 20% по аннотации и больше 70% по основному тексту. Для каждой цифры указан 95%-й доверительный интервал (бутстрэп).
Доля помеченных статей держится на уровне 0,4% весь 2021 и 2022 год, начинает расти уже через несколько месяцев после выхода ChatGPT и двумя волнами доходит примерно до 32% за последний завершённый квартал измерений, а на пике в начале 2026 года, почти до 39%. Разброс по областям знания огромный: в компьютерных науках доля достигает около 65%, в математике остаётся самой низкой, около 0,7%. Авторы отмечают: области с наибольшим ростом не совпадают с областями с изначально более высоким контрольным уровнем, то есть завышенная стартовая точка рост не объясняет.
Авторы честно перечисляют ограничения метода. Контрольная выборка мала: на каждую из десяти областей приходится всего 200 статей 2021, 2022 годов, и при пороге 0,4% из всей выборки в 2000 контрольных статей срабатывает всего восемь, оценка контрольного уровня по отдельной области грубая, а набрать тысячи контрольных статей за область на архиве до 2023 года просто неоткуда. Низкий показатель в математике неоднозначен: математические статьи почти целиком состоят из формул и структуры «теорема-доказательство», и после удаления уравнений и ссылок оставшийся текст скуден и не похож на тот научный английский, на котором обучен детектор, поэтому низкая оценка может означать как низкое реальное использование ИИ, так и слепую зону детектора именно на таком тексте, различить эти два объяснения по имеющимся данным нельзя. Детектор также не одинаково чувствителен к разным генераторам текста и не тестировался на всём реальном многообразии моделей и промптов, поэтому фактическая доля ИИ-текста может быть только выше измеренной, а не ниже. Наконец, метка детектора, не доказательство авторства: инструмент оценивает вероятность того, что текст читается как машинный, не отличает слегка отредактированный текст от полностью сгенерированного и не может быть основанием для обвинения конкретного человека или статьи.
Детектор доступен бесплатно на сайте авторов: можно проверить произвольную статью с arXiv или собственный текст.
Ключевые факты
- Детектор откалиброван на «поле ложных срабатываний»: 0,4% ошибочных срабатываний на заведомо человеческих статьях 2021, 2022 годов (до ChatGPT); при этом пороге он распознаёт 85% реально сгенерированных ИИ текстов
- Проанализировано 12 750 статей arXiv: 10 предметных областей, ~25 статей в месяц с января 2023 по июль 2026, плюс 8 контрольных месяцев 2021, 2022; оценивали полный текст статьи (не аннотацию) и первую версию PDF
- Доля помеченных статей выросла с 0,4% в 2021, 2022 годах до ~32% за последний завершённый квартал и почти 39% на пике в начале 2026 года; в компьютерных науках доля достигает ~65%, в математике, самая низкая, ~0,7%
- Контрольная выборка мала (200 статей на область, всего 8 срабатываний на 2000 контрольных статей), оценка по отдельным областям грубая; низкий показатель в математике может означать и низкое использование ИИ, и слепую зону детектора на «сухом» математическом тексте
- Детектор не покрывает все генераторы и промпты, поэтому цифра, нижняя граница реального масштаба; метка не доказывает авторство и не отличает лёгкую ИИ-редактуру от полной генерации текста
Почему это важно
Заголовки вида «N% текста теперь написано ИИ» обычно мало что стоят, потому что не учитывают долю ложных срабатываний детектора на настоящем человеческом тексте. Это исследование, редкий пример аккуратной методологии: рост доли «машинно читаемых» статей на arXiv измерен относительно фиксированного порога ложных срабатываний (0,4%), откалиброванного на заведомо доконтактных статьях 2021, 2022 годов. Такой якорь позволяет отделить реальный рост от артефакта самого детектора и даёт куда более обоснованную цифру, чем большинство подобных заявлений о «доле ИИ» в текстах.
Кому это важно
Редакциям и рецензентам научных журналов и конференций, которые вырабатывают политику в отношении ИИ-помощи в текстах; исследователям, изучающим влияние ИИ на научную коммуникацию; разработчикам детекторов ИИ-текста, которым нужен пример корректной калибровки; научным журналистам, которые пишут о доле ИИ в академических публикациях и рискуют взять непроверенную цифру без указания метода измерения.
Как это применить
Детектор бесплатно доступен на сайте авторов, можно проверить конкретную статью с arXiv или собственный текст. При оценке подобных цифр стоит спрашивать: на каком пороге ложных срабатываний откалиброван инструмент и какова доля срабатываний на заведомо человеческом тексте? Здесь ответ известен (0,4%), это делает цифру в 32, 39% заметно надёжнее заголовков без такой привязки. Авторы прямо называют итоговую долю нижней границей реального масштаба, а не точным значением, так её и стоит читать.
Можно ли доверять
Методология выглядит аккуратной: якорь на пол ложных срабатываний, доверительный интервал 95% для каждой цифры, выборка 12 750 статей, использование только первой версии PDF во избежание утечки поздних правок и отдельный раздел с честными ограничениями. Слабое место, публикация без указания конкретных авторов: это блог создателей самого детектора, потенциальный конфликт интереса, хотя авторы утверждают, что не зарабатывают на инструменте. Исследование не рецензировалось независимо и не публиковалось в научном журнале.
Риски и подводные камни
Контрольная выборка мала, 200 статей на область, из них при пороге 0,4% срабатывает всего восемь на все 2000 контрольных статей, поэтому оценка «доконтактного» уровня по отдельным областям грубая. Низкий показатель в математике неоднозначен: он может отражать как реально низкое использование ИИ, так и слепую зону детектора на тексте, лишённом обычной научной прозы. Детектор не откалиброван на весь реальный набор генераторов и промптов, поэтому официальная цифра, нижняя граница, а не точный масштаб. И главное: метка детектора, не доказательство авторства и не основание для обвинения конкретного человека или статьи; она включает и случаи тяжёлой ИИ-редактуры человеческого текста, а не только полную генерацию.
«Если инструмент помечает 40% новых статей как написанные ИИ, но также помечает 20% статей, написанных до ChatGPT, настоящая история в этих 20%, о которых никто не говорит.»
— авторы исследования, unslop.run