Anthropic объяснила, как в Claude будут работать водяные знаки текста

Anthropic объяснила, как будет применять невидимые водяные знаки к тексту, который генерирует Claude, мера нужна, чтобы соответствовать требованиям прозрачности Акта ЕС об искусственном интеллекте (EU AI Act). В пятницу компания сообщила, что система маркировки текста Claude, это «версия подхода SynthID-Text»: открытой технологии, которую разработала Google DeepMind и которая создаёт обнаружимые паттерны на основе вероятностей выбора слов.
Механизм Anthropic описала на примере фразы «Погода сегодня была холодной и…». Следующим словом почти наверняка не окажется что-то вроде «сахарной», зато вполне может оказаться «пасмурной» или «серой»: для смысла предложения не принципиально, какое из этих двух слов выберет модель. Обычно такой выбор решает случайное число. Водяной знак использует именно такие малозначимые развилки, а они встречаются в сгенерированном тексте много раз, чтобы оставить в ответах Claude паттерн: он незаметен для читателя, но обнаружим для того, у кого есть ключ, который его кодирует. При включённой маркировке выбор слова по-прежнему происходит случайно, но источник случайности другой: вместо произвольного генератора случайных чисел система берёт ключ и несколько предыдущих слов, чтобы определить, какое слово выберет модель.
Требование прозрачности из Акта ЕС об ИИ обязывает синтетические аудио, изображения, видео и текст нести машиночитаемые метки, по которым контент можно распознать как искусственно созданный или изменённый. Помимо текстовых водяных знаков, ради тех же обязательств Anthropic добавляет для обрабатываемых Claude изображений поддержку стандарта C2PA.
По словам Anthropic, водяные знаки не сделают Claude дороже для пользователей и не окажут никакого практического влияния на качество или содержание ответов Claude.
Требования ЕС по прозрачности касаются не только Anthropic, так что Claude не останется единственной моделью с текстовыми водяными знаками: чат-бот Google Gemini поддерживает SynthID-Text уже с 2024 года. OpenAI, в свою очередь, пока не раскрыла в своей дорожной карте соответствия Акту ЕС об ИИ планов по водяным знакам текста для ChatGPT, хотя тоже подпадает под требования этого закона.
Ключевые факты
- Anthropic объявила в пятницу: система водяных знаков текста Claude, «версия подхода SynthID-Text», открытой технологии Google DeepMind.
- Механизм: на развилках, где смысл фразы не меняется от выбора слова, модель вместо произвольного генератора случайных чисел использует ключ и предыдущие слова, это оставляет незаметный, но обнаружимый по ключу паттерн.
- Мера вводится ради соответствия Акту ЕС об ИИ, который требует машиночитаемых меток на синтетических аудио, изображениях, видео и тексте; заодно Anthropic добавляет поддержку C2PA для изображений, обработанных Claude.
- Anthropic утверждает: нововведение не повысит стоимость Claude для пользователей и не повлияет на качество или содержание его ответов.
- Google Gemini поддерживает SynthID-Text с 2024 года; OpenAI пока не раскрыла план водяных знаков текста для ChatGPT в своей дорожной карте соответствия Акту ЕС об ИИ, хотя тоже подпадает под его требования.
Почему это важно
Акт ЕС об ИИ требует, чтобы синтетические аудио, изображения, видео и текст несли машиночитаемые метки, по которым контент можно распознать как искусственно созданный или изменённый. Это обязывающее регулирование, а не добровольная инициатива: Anthropic вводит водяные знаки текста и поддержку C2PA для изображений именно затем, чтобы выполнить эти требования. История показывает, как крупная ИИ-компания на практике встраивает требование прозрачности в продукт, не переделывая саму модель.
Кому это важно
Пользователям Claude в юрисдикции ЕС и всем, кто подпадает под действие Акта об ИИ, сама Anthropic отмечает, что требования касаются и других крупных разработчиков. Это важно также тем, кто занимается проверкой происхождения контента (журналистам, образовательным и медиаорганизациям), и конкурентам, Google уже применяет ту же технологию в Gemini, а OpenAI ещё не раскрыла аналогичные планы для ChatGPT.
Как это применить
Для пользователей Claude действие автоматическое: ничего включать не нужно, водяной знак встраивается в текст на этапе генерации и не требует действий от человека. Источник не говорит, распространяется ли маркировка на все модели и тарифы Claude или только на часть из них, и не называет дату, когда функция заработает, известна только дата самого объявления, пятница.
Можно ли доверять
SynthID-Text, реальная и проверяемая технология: это открытая разработка Google DeepMind, которую с 2024 года уже применяет Gemini, так что базовый подход не выдуман компанией специально под этот случай. А вот заявления самой Anthropic о том, что водяные знаки не удорожают Claude и не влияют на качество ответов, это позиция компании о собственном продукте, внешне не проверенная: источник не приводит независимых тестов, данных о точности или частоте ложных срабатываний системы.
Риски и подводные камни
Источник не раскрывает, как генерируется, хранится и распределяется ключ, который делает водяной знак обнаружимым, а значит, неясно, кто именно способен читать эти метки за пределами самой Anthropic. Нет и данных о точности детектора или частоте ложных срабатываний. Отдельный риск, сама формулировка «версия» подхода SynthID-Text: неясно, чем реализация Anthropic отличается от оригинала Google и насколько она с ним совместима.
«Водяные знаки не сделают Claude дороже для пользователей и не окажут никакого практического влияния на качество или содержание ответов Claude»
— Anthropic