Как Claude ставит водяные знаки на сгенерированный текст: разбор эксперта

Как Claude ставит водяные знаки на сгенерированный текст: разбор эксперта

Anthropic объявила, что будет ставить водяные знаки на тексты, которые генерируют модели Claude, скрытую метку внутри самого текста, позволяющую компании впоследствии определить, что фрагмент написан именно её моделью. Знак невидим для пользователей: расшифровать его и подтвердить происхождение текста может только сама Anthropic.

Собственный материал Anthropic об этой технологии, по словам исследователя и автора учебных пособий по LLM Себастьяна Рашки (в их числе книги «Build a Large Language Model From Scratch» и «Build a Reasoning Model From Scratch»), несколько раз редактировался: изначально он был короче, не содержал ни одной иллюстрации и ограничивался общими рассуждениями о том, зачем нужен watermarking, без объяснения механики, с одной ссылкой на весьма техническую статью. Короткий пост самого Рашки на эту тему в соцсетях вызвал настолько живой отклик, что он решил разобрать тему подробно: записал лекцию с расшифровкой и опубликовал её вместе со слайдами и версией для YouTube. Изначально он планировал сделать 10 слайдов и уложиться в 10 минут, но материал разросся до более чем 50 слайдов и 48-минутной записи.

Прежде чем перейти к самому водяному знаку, лекция объясняет, как вообще устроена генерация следующего токена в языковой модели: промпт переводится в идентификаторы токенов, модель выдаёт распределение оценок (логитов) по всему словарю, в иллюстративном примере с промптом «столица Германии, это» наивысший балл получает токен с индексом 19 846, соответствующий слову «Berlin», при том что типичный словарь современной модели насчитывает около 250 000 токенов, а в примере логиты варьируются примерно от -8/-9 до 20. Дальше поясняется разница между «жадным» декодированием (выбор токена с максимальным баллом) и сэмплированием через softmax, которое добавляет модели вариативность в ответах.

Это объяснение, фундамент для дальнейшего разбора: по заявленному плану лекция также должна показать, в каком именно месте этого процесса применяется водяной знак и как watermarking может давать сбой или быть снят. Однако в доступной части материала расшифровка обрывается на середине объяснения сэмплирования, не доходя до самого механизма встраивания знака, так что детали конкретно watermarking-техники в этом фрагменте не раскрыты.

Ключевые факты

  • Anthropic объявила, что будет ставить невидимые водяные знаки на текст, который генерируют модели Claude; расшифровать метку и подтвердить авторство сможет только сама компания.
  • Себастьян Рашка, автор книг о LLM «с нуля», записал лекцию-разбор темы после того, как его короткий пост об этом вызвал бурное обсуждение; материал вырос с задуманных 10 слайдов и 10 минут до более чем 50 слайдов и 48 минут записи.
  • Собственная статья Anthropic о водяных знаках, по словам автора, несколько раз редактировалась и изначально не содержала ни иллюстраций, ни объяснения механизма, только идею и ссылку на одну весьма техническую статью.
  • Лекция начинается с азов генерации текста в LLM: токенизация промпта, распределение логитов по словарю из примерно 250 000 токенов, выбор следующего токена жадным способом или сэмплированием через softmax.
  • В доступном фрагменте расшифровка обрывается до объяснения того, как именно встраивается сам водяной знак и как его можно обойти, эта часть анонсирована в лекции, но в материале не раскрыта.

Почему это важно

Тексты от языковых моделей всё труднее отличить от написанных человеком, и водяные знаки, один из немногих технических способов проверить происхождение конкретного фрагмента текста. Anthropic встраивает такую метку прямо в процесс генерации токенов, а не добавляет её постфактум, поэтому понимание базового механизма сэмплирования, не просто теория, а прямой ключ к тому, как работает watermarking.

Кому это важно

Разработчикам и исследователям, которые хотят понимать внутреннее устройство LLM, а не только пользоваться ими. Пользователям Claude и всем, кто беспокоится о происхождении текста в интернете, водяной знак напрямую касается того, можно ли будет доказать, что конкретный фрагмент сгенерирован ИИ. Тем, кто следит за образовательными материалами Рашки по LLM «с нуля», лекция построена на тех же принципах и иллюстрациях, что и его книги.

Как это применить

Материал доступен как видео-лекция (есть версия для YouTube), набор слайдов и текстовая расшифровка, можно выбрать удобный формат. Расшифровка полезна как самостоятельный курс по основам генерации текста в LLM: токенизация, распределение логитов, жадное декодирование против сэмплирования через softmax, это база, без которой сложно понять механику самого watermarking, когда до неё доходит дело в остальной части лекции.

Можно ли доверять

Автор, Себастьян Рашка, исследователь и автор известных учебных пособий по LLM «с нуля», у него сложившаяся репутация в объяснении механики языковых моделей на понятном уровне. При этом доступный фрагмент текста охватывает только вводную часть, мотивацию Anthropic и базовые принципы генерации токена; собственно объяснение того, как встраивается и декодируется водяной знак Claude, в этом фрагменте не приведено, и оценить точность именно этой части не по чему.

Риски и подводные камни

Автор упоминает, что среди зрителей есть опасение, будто watermarking может ухудшать качество генерируемого текста, но в доступном материале эта проблема только называется, без разбора. Отдельный вопрос доверия: раз водяной знак невидим и расшифровать его может только сама Anthropic, независимая проверка стороннему наблюдателю недоступна, приходится полагаться на слово компании. Тема того, как watermarking может давать сбой или быть снят, заявлена как часть лекции, но в предоставленном тексте не раскрыта.

«Этот водяной знак невидим для пользователей, расшифровать его и понять, что текст помечен, может только сама Anthropic.»

— Себастьян Рашка