Anthropic объявила: тексты Claude будут маркироваться незаметными водяными знаками

11 августа Anthropic объявила, что все будущие модели Claude будут генерировать текст со встроенным водяным знаком, который выдаёт его ИИ-происхождение. Компания не первая: у Google уже есть собственная текстовая маркировка, Anthropic взяла её за основу для своей, которую применяют к выводу моделей Gemini; OpenAI текстового водяного знака пока не ввела, но планирует. Быстрое распространение такой маркировки, отчасти ответ на закон ЕС об ИИ (AI Act), который требует маркировать модели, выпущенные после 2 августа 2026 года, наряду с другими готовящимися правилами против обманного или манипулятивного ИИ-контента. Но новые требования могут дорого обойтись пользователям, которым просто нужен лучший результат.
Для изображений, аудио и видео закон ЕС тоже требует маркировки, и такие водяные знаки применяются уже много лет: их эффективность как целостного решения ещё обсуждается, но детектируются они с точностью выше 99%, и их уже используют OpenAI, Google и Meta (у Anthropic нет модели для генерации изображений). Текстовые водяные знаки распространены куда меньше, и не все уверены, что маркировку текста можно внедрить без потерь в качестве ответа модели.
Джон Грубер, плодовитый автор, пишущий о технологиях, и один из создателей языка Markdown, называет текстовый водяной знак «извращением письма» и оспаривает утверждение Anthropic, что метка не меняет смысл и качество текста: по его словам, изображение состоит из миллионов пикселей, а ответ модели, часто всего из десятков или сотен слов. Похоже, у текста заметно меньше пространства, чтобы изменить вывод модели незаметно для человека, но всё же обнаруживаемо. Джон Кирхенбауэр, исследователь на постдокторской позиции в Vector Institute и соавтор статьи 2023 года, одной из первых, описавших метод текстовой маркировки, возражает: знак попросту не получится обнаружить, если в тексте нет изменения, а вопрос не в том, отличается ли распределение слов от исходного, а в том, меняет ли это практическую пользу текста для того, кто им пользуется.
Технически языковая модель на каждом шаге генерации присваивает вероятность каждому возможному следующему слову (точнее, токену): например, самому вероятному слову может достаться около 40% вероятности, правдоподобной альтернативе, около 10%, а маловероятному варианту, доли процента, и модель выбирает слово случайно, с весом по этим вероятностям, так что самое вероятное слово обычно побеждает, но не всегда. Метод Кирхенбауэра и соавторов из статьи 2023 года делит слова на «красный» и «зелёный» списки: слова из красного списка не трогают, а вероятность слов из зелёного, слегка завышают, так что за много токенов текст статистически смещается к зелёному списку, оставаясь неотличимым на глаз. Авторы сообщили о точности обнаружения 98,4% и нулевых ложных срабатываниях на ответах примерно в 200 токенов; убрать такой знак из длинного текста простым пересказом своими словами не получится, по их подсчётам, для этого нужно изменить примерно четверть слов или больше.
Самое веское свидетельство, что маркировка не портит качество, даёт статья 2024 года команды Google, представившая схему SynthID-Text, водяной знак Anthropic основан именно на ней, хотя компания не раскрыла, чем её версия отличается (от дополнительных комментариев для этой статьи Anthropic отказалась). Авторы Google случайным образом направляли запросы пользователей Gemini на маркированные и немаркированные варианты моделей и сравнили отклик пользователей на 20 миллионах ответов, значимой разницы не нашли.
Часть исследователей всё равно сомневается. Вину Санкар Садасиван, исследователь ИИ в Meta и соавтор широко цитируемой статьи об обнаружимости текстовых водяных знаков, говорит, что маркировка особенно плохо работает там, где вариантов подбора слова немного: для твита в 20 слов из «зелёного» списка должно быть 50 или 60% слов, чтобы знак надёжно обнаруживался, похожее напряжение возникает и при генерации простой функции на Python. По его словам, здесь есть расхождение с публичными заявлениями Anthropic о том, что качество не меняется: силу знака можно динамически повышать или понижать, чтобы сохранить качество ответа в сложных случаях, но это же снижает и надёжность самого знака. График из статьи Google о SynthID-Text показывает точность обнаружения до 95% в лучшем случае, но ниже 50% для коротких ответов.
Спор идёт не только о том, насколько хорошо работает маркировка, но и о том, какие компромиссы допустимы ради чёткой пометки ИИ-текста. Позиция Грубера: менять текст недопустимо, потому что это делает результат работы модели другим, чем он был бы без вмешательства; закон ЕС об ИИ, напротив, исходит из того, что некоторое изменение допустимо, если оно сообщает людям, что перед ними ИИ-текст. Исследователи всё сильнее смотрят на текстовые водяные знаки не только как на пометку отдельного ответа, а как на инструмент отслеживания данных в масштабе: статья 2026 года с участием Кирхенбауэра показывает, что модель, обученная на маркированном тексте, сама начинает выдавать текст с той же меткой, значит, владелец контента, пометивший свои документы до публикации, может использовать эти следы как статистическое доказательство того, что его текст попал в обучающую выборку модели. По той же логике ИИ-компания, обучая новую модель, может по водяным знакам исключать из обучающих данных тексты, сгенерированные предыдущими версиями той же модели, такая защита помогает избежать «коллапса модели» (model collapse), когда система раз за разом воспроизводит и усиливает собственные ошибки. По словам Кирхенбауэра, из-за этого весь спор смещается: дело не столько в обвинении «ты использовал ИИ», сколько в отслеживании происхождения данных и рециркуляции моделей, водяной знак становится просто ещё одним видом метаданных, который можно прикрепить к контенту и по которому можно проследить его путь.
Ключевые факты
- 11 августа Anthropic объявила, что все будущие модели Claude будут вставлять в текст незаметный водяной знак, который выдаёт его ИИ-происхождение; у Google такая маркировка (SynthID-Text) для Gemini уже есть и легла в основу решения Anthropic, а OpenAI текстовый знак пока не ввела, но планирует.
- Метод 2023 года Джона Кирхенбауэра делит слова на «красный» и «зелёный» списки и слегка завышает вероятность слов из зелёного списка; авторы сообщили о точности обнаружения 98,4% и нулевых ложных срабатываниях на ответах примерно в 200 токенов, а чтобы убрать знак пересказом, нужно изменить примерно четверть слов текста или больше.
- Статья Google 2024 года показала на 20 миллионах ответов Gemini, что заметной разницы в отклике пользователей на маркированный и немаркированный текст нет; но исследователь Meta Вину Санкар Садасиван возражает: у короткого текста вроде твита в 20 слов для надёжного обнаружения нужно 50 или 60% слов из зелёного списка, а точность SynthID-Text по графику самой Google падает ниже 50% на коротких ответах.
- Джон Грубер называет маркировку текста «извращением письма» и спорит с публичным заявлением Anthropic, что знак не меняет качество текста; сама Anthropic отказалась дать изданию дополнительные подробности о том, чем её версия отличается от SynthID-Text Google.
- Закон ЕС об ИИ требует маркировать ИИ-модели, выпущенные после 2 августа 2026 года; статья 2026 года с участием Кирхенбауэра показывает, что модель, обученная на маркированном тексте, сама начинает выдавать текст с той же меткой, это может защитить от «коллапса модели» и стать доказательством, что чей-то текст попал в обучающую выборку без разрешения.
Почему это важно
История фиксирует момент, когда маркировка ИИ-текста водяными знаками перестаёт быть нишевой техникой и становится отраслевым стандартом сразу у нескольких крупных игроков: у Google она уже работает в Gemini, Anthropic 11 августа объявила о такой же функции для будущих моделей Claude, а OpenAI пока не ввела, но тоже готовит собственную. Форсирует это отчасти закон ЕС об ИИ (AI Act), который требует маркировать контент моделей, выпущенных после 2 августа 2026 года, и хотя правило касается любого ИИ-контента (изображений, аудио, видео, текста), именно с текстом сложнее всего: у изображения миллионы пикселей, где спрятать метку незаметно, а у типичного ответа модели, от силы сотня-другая слов, так что пространство для скрытого, но надёжного вмешательства заметно у́же. Это и превращает вопрос в развилку: возможна ли прозрачная маркировка ИИ-текста без ущерба для качества ответов.
Кому это важно
Пользователям любого ИИ-чат-бота или генератора текста, метка встраивается в каждый ответ незаметно для глаза и без отдельного согласия; создателям контента, которые хотят доказать, что их тексты попали в обучающую выборку модели без разрешения, водяной знак даёт для этого статистический след; самим ИИ-компаниям, которым предстоит обучать новые модели и которым водяные знаки позволяют отличать текст, сгенерированный прошлыми версиями той же модели, от нового человеческого текста; и регуляторам ЕС, для которых водяной знак, конкретный технический механизм под уже принятым законом об ИИ.
Как это применить
Практических следствий три. Читателю: доверять собственному глазу или простому детектору при попытке распознать ИИ-текст нельзя, метод рассчитан на необнаружимость без специального ключа, и даже пересказ своими словами снимает знак только при изменении примерно четверти слов или больше. Владельцу контента: если заранее пометить собственные документы водяным знаком, а затем найти тот же знак в выводе чужой модели, это можно использовать как статистическое свидетельство, что текст попал в обучающую выборку без спроса. Разработчику модели: водяные знаки прошлых версий можно использовать как фильтр, исключать из обучающих данных новой версии тексты, которые сгенерировала предыдущая, и так снижать риск «коллапса модели» (model collapse), когда система раз за разом обучается на собственных, всё более искажённых ответах.
Можно ли доверять
Материал IEEE Spectrum сводит вместе конфликтующие позиции, а не пересказывает заявление одной стороны. Главное эмпирическое свидетельство в пользу «знак не портит качество», статья 2024 года команды Google со сравнением отклика пользователей на 20 миллионах ответов, а не маркетинговая декларация; при этом сама Anthropic отказалась объяснить изданию, чем её версия SynthID-Text отличается от версии Google, так что независимо проверить это для Claude нельзя. Критика тоже исходит не от анонимов: Джон Грубер и Вину Санкар Садасиван, названные по имени специалисты с собственными публикациями по теме. Слабое место в самой конструкции доказательства: приведённые данные об отсутствии потерь в качестве получены для SynthID-Text Google, а про метод Anthropic остаётся верить компании на слово.
Риски и подводные камни
Главный риск виден на графике из статьи Google: точность обнаружения SynthID-Text падает ниже 50% на коротких ответах, то есть именно там, где короткая реплика чат-бота, твит или однострочная функция кода нуждаются в метке сильнее всего, знак менее всего надёжен. Второй риск, прямой компромисс между силой знака и качеством ответа: по словам Садасивана, усиление знака ради надёжного обнаружения сильнее меняет текст, а ослабление ради качества снижает обнаружимость, и заявления Anthropic об отсутствии изменения качества он прямо называет предметом своего несогласия с публичными заявлениями компании. Третий риск, сама незаметность: тот же механизм, что даёт 98,4% обнаружения при нуле ложных срабатываний в статье 2023 года, делает знак невидимым и для собственного автора текста, который ничего не знает о метке в своих словах, пока не встанет вопрос об авторстве или обучающих данных.
«Если бы не было изменения, водяной знак нельзя было бы обнаружить. Это очень фундаментальный момент.»
— Джон Кирхенбауэр, Vector Institute
Компания Meta Platforms признана экстремистской организацией, её деятельность на территории РФ запрещена.