Технический директор Pangram: тексты ИИ узнаваемы из-за защитных ограничений

Брэдли Эми, технический директор сервиса Pangram, который определяет тексты, написанные нейросетями, написал в своём блоге: языковые модели теоретически способны писать так же разнообразно, как люди, но на практике этого не делают. Дело, по его словам, не в самой природе ИИ, а в этапе донастройки модели после базового обучения (в оригинале, post-training), в который входят и защитные ограничения поведения.
Системы вроде ChatGPT, Claude или Gemini в ходе такой донастройки усваивают правила поведения, например, не выдавать опасные инструкции и уклоняться от некоторых политических высказываний. По словам Эми, именно эти правила резко сужают диапазон возможных формулировок модели; такое сужение стиля в материале называют «коллапсом мод» (mode collapse). Получается, что узнаваемо однообразный стиль донастроенных моделей, а не сам факт того, что текст сгенерирован нейросетью, и позволяет детекторам вроде Pangram его вычислять.
Так называемые базовые модели, версии до этапа донастройки, пишут заметно разнообразнее, и детектор Pangram их не распознаёт, утверждает Эми. Похожая ситуация, отмечается в материале, и с двумя другими типами вывода: узкоспециализированными дообученными моделями (например, натренированными только на текстах Хемингуэя или на текстах определённых сабреддитов) и «сломанными» моделями, которые выдают бессвязный текст, их стиль настолько отличается от типичного для донастроенных ассистентов, что детектор тоже их пропускает.
Оговорка касается только текста без цифровых водяных знаков: как отмечается в материале, водяные знаки должны продолжать работать даже для базовой модели с более разнообразным стилем. Материал не приводит ни цифр точности детектора Pangram, ни подробностей о том, какие именно политические высказывания или правила поведения имеются в виду, перед читателем изложение одного аргумента технического директора компании-детектора, а не независимо подтверждённое исследование.
Ключевые факты
- Технический директор сервиса Pangram (детектор ИИ-текста) Брэдли Эми пишет в блоге: языковые модели способны писать так же разнообразно, как люди, но на практике этого не делают.
- Причина, по его словам, этап донастройки после базового обучения: защитные правила поведения (не выдавать опасные советы, уклоняться от некоторых политических высказываний) резко сужают стиль модели, эффект, названный в материале «коллапсом мод» (mode collapse).
- Базовые модели (до донастройки), узкоспециализированные дообученные версии (например, натренированные только на текстах Хемингуэя или определённых сабреддитов) и модели с бессвязным, «сломанным» выводом детектор Pangram, по словам Эми, не распознаёт.
- Это касается только текста без цифровых водяных знаков: в материале отмечается, что водяные знаки должны продолжать работать даже для базовой модели с разнообразным стилем.
- В материале нет цифр точности детектора, аргумент стоит воспринимать как позицию технического директора компании-детектора, а не как независимо подтверждённое исследование.
Почему это важно
Расхожее представление, что нейросети «просто вычисляются» детекторами, потому что они, ИИ, здесь оспаривается: по аргументу технического директора Pangram Брэдли Эми, узнаваемость идёт не от архитектуры модели самой по себе, а от защитных правил поведения, которые в неё встраивают на этапе донастройки после базового обучения. Получается, что чем «безопаснее» и предсказуемее ведёт себя модель, тем у́же её стиль и тем легче её вычислить статистическому детектору, а не наоборот, как можно было бы предположить. Это меняет привычную рамку спора об обнаружении ИИ-текста: вопрос не в том, «выдаёт ли себя ИИ», а в том, какой ценой достигается его безопасное поведение.
Кому это важно
Это касается компаний, которые строят и продают детекторы ИИ-текста вроде Pangram, аргумент Эми сразу очерчивает границы возможностей их метода. Это важно и разработчикам больших языковых моделей: получается, что их решения о защитных ограничениях и допустимых темах напрямую влияют на то, насколько легко распознать вывод модели, раньше это редко рассматривали как отдельный компромисс. Касается это и тех, кто на практике полагается на такие детекторы, школ, вузов, редакций: аргумент Эми предупреждает, что базовые и узкоспециализированные дообученные модели могут пройти проверку, даже если текст на самом деле сгенерирован нейросетью.
Как это применить
Из аргумента Эми следует практический вывод: полагаться на статистические детекторы вроде Pangram как на единственное доказательство происхождения текста рискованно, потому что они ловят прежде всего узнаваемый стиль донастроенных «безопасных» моделей, а не сам факт генерации текста нейросетью. Более надёжный путь, отмечается в материале, встраивать в модель цифровые водяные знаки: тогда происхождение текста можно установить независимо от того, насколько разнообразным получился стиль. Командам, которые дообучают модели под конкретную задачу или тон (например, «под Хемингуэя» или под стиль отдельного сабреддита), тоже стоит учитывать: по словам Эми, такая узкая донастройка заодно снижает шанс, что вывод модели поймает детектор.
Можно ли доверять
Аргумент высказал технический директор Pangram, то есть человек, чей бизнес прямо зависит от того, насколько хорошо работают детекторы ИИ-текста. Это само по себе не делает довод неверным, но означает, что перед читателем позиция заинтересованной стороны, а не независимое исследование. В материале нет ни цифр точности детектора Pangram, ни данных о том, на каком объёме текстов проверялась гипотеза о «коллапсе мод», зато есть ссылка на исходный пост Эми в блоге, сверить аргумент с первоисточником можно самостоятельно, но оценивать его обоснованность всё равно приходится на слово технического директора компании-детектора.
Риски и подводные камни
Главный риск, практический: если аргумент Эми верен, получается, что нынешние статистические детекторы ловят не «текст, написанный ИИ» как таковой, а конкретно узнаваемый, суженный стиль донастроенных «безопасных» моделей вроде ChatGPT, Claude или Gemini. Тот, кто целенаправленно хочет обойти проверку, может использовать базовую модель или узкоспециализированную дообученную версию, по словам Эми, детектор Pangram такие тексты не распознаёт. Из-за этого результат детектора нельзя считать окончательным доказательством того, что текст написан человеком, а именно так его нередко используют в учебных работах, публикациях и других ситуациях, где нужно подтвердить происхождение текста.