Substack добавил ИИ-детектор текста, автор решил научить модель обходить его

Substack добавил в интерфейс платформы проверку текста на признаки ИИ-генерации. В ответ автор технического блога на Substack решил показать, как устроены такие детекторы изнутри, и заодно обучить небольшую языковую модель (SLM) писать текст, который эту проверку обходит. Автор называет это небольшим учебным проектом: цель, изучить ограничения ИИ-детекторов и опробовать применение LLM на основе модели-верификатора за пределами привычных задач для «рассуждающих» моделей, которые обычно тренируют на математике и коде.
У такого детектора, по словам автора, есть практическое применение: отсеивать спам-контент, а также помогать проверять собственные тексты. Пример риска, который приводит автор: если для правки грамматики использовать обычную LLM вроде ChatGPT, результат может стать «переполированным», звучать как ИИ-текст и попасть под спам-фильтр, хотя формально текст остаётся авторским. В качестве иллюстрации, не реального случая, а гипотетического примера, автор приводит запрос, который можно адресовать такому детектору: «Исправь мне грамматику, но так, чтобы текст по-прежнему получал 0% по шкале ИИ-генерации».
Сам автор прямо предупреждает: ИИ-детекторы, это, по сути, игра в кошки-мышки. Едва детектор научится распознавать характерный признак, свойственный ИИ-тексту, следующее поколение LLM может случайно или намеренно перестать его проявлять и пройти проверку, тогда детектор снова приходится дообучать, и цикл повторяется. Плюс, по словам автора, ложные срабатывания вероятны и на человеческом тексте: детектор может ошибочно пометить как «сгенерировано ИИ» текст, написанный человеком.
Заявленный метод похож на модели Pangram, которые, как предполагает сам автор (с оговоркой «насколько мне известно»), стоят за детектором самого Substack. В основе, классификатор, полученный дообучением модели DistilBERT, тем же способом, что автор описывал в своём более раннем материале про дообучение больших языковых моделей. На выходе детектор выдаёт оценку от 0 до 100, это собственная оценка классификатора для класса «сгенерировано ИИ», основанная на его обучающих данных, а не универсальная вероятность того, что текст реально написан ИИ; автор отдельно подчёркивает разницу между этими двумя вещами. Ранее, в 2023 году, автор уже публиковал отдельный обзорный материал о разных подходах к детектированию ИИ-текста, от классификаторов с учителем и вероятностных тестов на основе возмущений текста до метрик перплексии и цифровых водяных знаков.
Итоговый результат проекта заявлен как API детектора, доступный людям и ИИ-агентам, плюс удобный веб-интерфейс: в превью-скриншоте интерфейс уже показывает общую оценку текста и подсветку по отдельным фрагментам. Но заголовок материала обещает полный цикл, сборку датасета, обучение модели, локальное развёртывание и технику RLVR (обучение с подкреплением по проверяемым наградам) для тренировки модели, обходящей детектор, а бесплатно открытый фрагмент обрывается сразу после того, как автор анонсировал дообучение DistilBERT: дальше текст закрыт платной подпиской, и подробностей самого обучения, датасета, метрик или процесса обхода в открытой части нет.
Ключевые факты
- Substack добавил в интерфейс проверку текста на признаки ИИ-генерации, это и стало поводом для материала.
- Автор технического блога решил построить собственный ИИ-детектор с нуля и параллельно обучить небольшую языковую модель (SLM), которая учится обманывать этот детектор, заявленная цель: изучить ограничения ИИ-детекторов на практике.
- Метод основан на дообученном классификаторе DistilBERT, который выдаёт оценку от 0 до 100, это собственная оценка классификатора для класса «сгенерировано ИИ», а не универсальная вероятность авторства.
- Практический риск, который иллюстрирует автор: если полировать собственный текст обычной LLM вроде ChatGPT, результат рискует зазвучать как ИИ-текст и попасть под спам-фильтр, хотя текст остаётся авторским.
- Заявленный метод похож на модели Pangram, которые, по неподтверждённому предположению автора, стоят за детектором Substack; сам автор описывает ИИ-детекторы как «игру в кошки-мышки», где ложные срабатывания на человеческий текст тоже вероятны.
Почему это важно
Substack, один из крупнейших сервисов для блогов и рассылок, встроил проверку на ИИ-происхождение текста прямо в свой интерфейс: подобные проверки перестают быть нишевым сторонним сервисом и становятся частью повседневного инструментария площадок, где публикуются авторы. В ответ автор технического блога решил открыть эту технологию: построить аналогичный детектор с нуля и показать, как он устроен изнутри, а заодно обучить модель, которая учится его обманывать, чтобы на практике продемонстрировать пределы такого подхода. Это ещё и пример прикладного применения «модели-верификатора» для обучения LLM за пределами привычных задач вроде математики и программирования.
Кому это важно
Авторам и блогерам, которые публикуются на площадках со встроенной проверкой на ИИ (включая сам Substack) и хотят понимать, как эти системы решают, что «звучит как ИИ», особенно тем, кто пользуется LLM-инструментами для правки текста и рискует получить пометку «спам» за собственный, но отредактированный текст. Также, ML-инженерам и всем, кто интересуется практическим построением классификаторов и «моделей-верификаторов» для LLM-приложений, включая пошаговый разбор на основе дообучения DistilBERT.
Как это применить
В открытой части материала это план и метод, а не готовый рецепт. Автор описывает будущий детектор как классификатор, дообученный на основе модели DistilBERT, тем же способом, что и в его более раннем материале о дообучении больших языковых моделей: на выходе он выдаёт оценку от 0 до 100, вероятность, которую классификатор присваивает классу «сгенерировано ИИ» на основе своих обучающих данных, а не универсальную вероятность авторства. Итоговый продукт заявлен как API детектора для людей и ИИ-агентов плюс удобный веб-интерфейс, в превью-скриншоте он уже показывает общую оценку текста и подсветку отдельных фрагментов. А вот сборка датасета, сам процесс обучения, локальное развёртывание и техника RLVR (обучение с подкреплением по проверяемым наградам) для тренировки модели, обходящей детектор, по подзаголовку материала это часть заявленного объёма, но открывается она только по платной подписке, поэтому пересказать эти шаги по фактам мы не можем.
Можно ли доверять
Материал, не рецензируемое исследование, а личный проект автора блога на Substack, который сам называет его «небольшим учебным». Автор прямо оговаривается, что не уверен на 100%: связь между детектором Substack и моделями Pangram, это его предположение («насколько мне известно»), а не подтверждённый факт. Цифр по точности, полноте или доле ложных срабатываний детектора в открытой части текста нет, сказано лишь, что ложные срабатывания «вероятны», без конкретной статистики. Результатов обучения модели, обходящей детектор, тоже нет: она пока существует только как план, описанный в подзаголовке материала.
Риски и подводные камни
Сам автор описывает ИИ-детекторы как «игру в кошки-мышки»: как только детектор научится ловить характерный признак ИИ-текста, следующее поколение LLM может случайно или намеренно перестать его проявлять, и обход происходит без всякого специального умысла. Здесь же показан и прямой путь намеренного обхода: обучение модели-«верификатора» писать текст, который проходит проверку, а значит, подобные методы потенциально можно использовать, чтобы выдавать массово сгенерированный контент за человеческий. И ещё один риск для читателя: оценка детектора, это не факт авторства, а вероятностная догадка конкретной модели, которая, по признанию самого автора, ошибается в обе стороны, пропускает ИИ-текст и ошибочно помечает человеческий.
«ИИ-детекторы, это, по сути, игра в кошки-мышки: едва детектор научится распознавать характерный признак ИИ-текста, следующая модель может перестать его проявлять и пройти проверку.»
— автор материала