Себастьян Рашка показал, как построить детектор ИИ-текста с нуля

Себастьян Рашка выпустил образовательный проект: пошаговое руководство, как самому построить детектор ИИ-сгенерированного текста. Поводом стал запуск такой функции в интерфейсе Substack, а параллельно, по словам автора, его давно просили показать интересные локальные DIY-проекты на малых языковых моделях (SLM). Цель туториала двойная: объяснить, как вообще устроены детекторы ИИ-текста, и на этом примере разобрать более общую тему, как строить скорер или верификатор для LLM.
Методически детектор, это классификатор: дообученная модель DistilBERT, которая выдаёт оценку от 0 до 100, насколько вероятно, что текст сгенерирован ИИ, исходя из распределения обучающих данных. Рашка отдельно подчёркивает: это не «универсальная вероятность», а именно оценка классификатора. По его предположению (он сам оговаривается «насколько мне известно», подтверждения нет), подход близок к моделям Pangram, которые, как он считает, стоят за детектором Substack.
Тот же детектор Рашка использует и как верификатор: с его помощью через RLVR обучается малая языковая модель, которая учится генерировать текст, обходящий обнаружение, то есть проект одновременно демонстрирует и защиту, и обход защиты. Автор поясняет практическую пользу детекторов: они фильтруют спам-контент, а также помогают проверить, не «переполировал» ли грамматический чекер (вроде ChatGPT) собственный авторский текст до состояния, которое воспринимается как ИИ-сгенерированное и помечается как спам. В качестве иллюстрации в статье приведён пример запроса, «поправь мне грамматику, но так, чтобы текст по-прежнему получал 0% ИИ-генерации»; это пример формулировки из текста, а не измеренный результат работы детектора.
Рашка прямо предупреждает: детекторы ИИ-текста, это, по сути, игра в кошки-мышки между детекторами и генераторами, и они регулярно дают ложные срабатывания, помечают текст человека как ИИ-сгенерированный. Ранее, в 2023 году, он уже писал отдельную статью о разных подходах к детекции ИИ-текста, от классификаторов с учителем и тестов на основе пертурбаций до мер перплексии и водяных знаков.
Ключевые факты
- Толчком к проекту стал запуск детектора ИИ-текста в интерфейсе Substack
- Детектор, дообученный классификатор DistilBERT, выдаёт оценку от 0 до 100 (вероятность, что текст сгенерирован ИИ)
- Тот же детектор используется как верификатор: через RLVR на нём обучается малая языковая модель, которая учится обходить обнаружение
- По предположению автора (не подтверждено), подход похож на модели Pangram, которые, как он считает, стоят за детектором Substack
- Автор предупреждает о ложных срабатываниях на человеческом тексте и называет детекцию ИИ-текста игрой в кошки-мышки
Почему это важно
Туториал не просто описывает готовый продукт, а вскрывает механику: как устроены детекторы ИИ-текста, на которые сейчас массово полагаются платформы вроде Substack. Одновременно проект показывает менее очевидное применение малых языковых моделей, не только генерация, но и роль верификатора/скорера, обучающего другую модель через RLVR. Это выходит за рамки привычных примеров с математикой и кодом.
Кому это важно
Инженерам и исследователям, которые строят или оценивают ML-классификаторы и верификаторы для LLM; авторам и редакторам, которые используют грамматические чекеры и хотят понимать, почему «переполированный» текст может быть помечен как ИИ-сгенерированный; всем, кто хочет разобраться в механике детекторов ИИ-контента, а не просто доверять их вердикту.
Как это применить
Туториал даёт воспроизводимый пайплайн: сборка датасета, дообучение классификатора DistilBERT, локальное развёртывание в виде API и пользовательского интерфейса. Из практических применений автор называет фильтрацию спам-контента и самопроверку собственных текстов после использования грамматических чекеров, чтобы не получить непреднамеренно «ИИ-звучащий» текст.
Можно ли доверять
Автор, известный технический блогер, ранее публиковавший материалы по дообучению LLM; туториал заявлен как полный сквозной проект (данные → обучение → развёртывание). При этом связь метода с моделями Pangram и с детектором Substack, это прямо обозначенное предположение самого автора («насколько мне известно»), а не подтверждённый факт; численных показателей точности итогового детектора (accuracy, precision, доля ложных срабатываний) в тексте не приведено.
Риски и подводные камни
Сам автор называет ключевой риск: детекторы регулярно дают ложные срабатывания на текстах, написанных людьми. Долгосрочно детекция ИИ-текста, игра в кошки-мышки: любой детектор устаревает по мере появления моделей, которые обучены его обходить, и этот же туториал, по сути, обучает такую обходящую модель напрямую. Есть и обратная сторона грамматических чекеров: попытка «отполировать» свой собственный, человеческий текст рискует сделать его похожим на ИИ-сгенерированный и привести к ложной блокировке.
«Проверки на ИИ, это, по сути, игра в кошки-мышки.»
— Себастьян Рашка