Anthropic запускает API для проверки водяных знаков Claude

Anthropic запускает API для проверки водяных знаков Claude

Anthropic объявила, что скоро выпустит API для обнаружения водяных знаков, сторонние разработчики смогут встроить в свои приложения проверку, писал ли текст Claude. Компания использует вариант метода SynthID Text, который Google DeepMind опубликовала в журнале Nature в 2024 году. Метод подменяет источник случайности при выборе слов моделью, из-за чего в тексте остаётся отслеживаемый паттерн. По словам Anthropic, это «не влияет на содержание, уровень креативности или читаемость текста Claude» (анимацию принципа работы DeepMind показала ещё в 2024 году).

Водяной знак работает менее надёжно на коротких текстах и в местах, насыщенных фактами, где мало вариантов перефразировки, то же касается кода. Текст, где человек лично выбрал каждое слово (чистая правка), знак не несёт вовсе. С переводами ситуация другая: там все слова подбирает сама модель, поэтому знак сохраняется. А вот сильная переработка текста человеком, по данным опубликованного Anthropic FAQ, может стереть водяной знак. При этом сама проверка умеет лишь показать, что Claude, вероятно, участвовала в создании текста: определить, написала ли модель весь текст или только отредактировала его, а также отличить текст человека от текста другой ИИ-модели, водяной знак не может.

Причина запуска, регуляторная. Anthropic внедряет водяные знаки, чтобы соответствовать Акту ЕС об ИИ (EU AI Act): в июле 2026 года компания вместе с примерно 190 другими подписантами присоединилась к Кодексу практик ЕС о прозрачности ИИ-контента. Технической возможности ограничить функцию отдельным регионом сейчас нет, поэтому водяные знаки запускаются сразу по всему миру; Anthropic сообщает, что продолжает изучать дополнительные варианты и планирует обновления. Все модели, выпущенные после 2 августа 2025 года, поддерживают водяные знаки «из коробки»; более старые модели Claude получат эту функцию в ближайшие месяцы. Для файлов Anthropic использует открытый стандарт C2PA, который добавляет метаданные, не изменяя сам файл.

Подход Anthropic принципиально отличается от внешних инструментов детекции ИИ-текста вроде Pangram: у таких сервисов нет доступа к ключам Anthropic, поэтому они ищут в тексте типичные паттерны, характерные обороты речи или избыточно часто используемые слова. Проверка водяного знака, принципиально иной подход, и, как отмечает источник, на практике он должен быть надёжнее.

Ключевые факты

  • Anthropic скоро выпустит API для обнаружения водяных знаков в текстах Claude, сторонние разработчики смогут встроить проверку в свои приложения
  • Используется вариант метода SynthID Text, который Google DeepMind опубликовала в Nature в 2024 году; знак подменяет источник случайности при выборе слов
  • Знак работает ненадёжно на коротких и фактологически плотных текстах, а также в коде; на переводах сохраняется, при чистой правке человеком, отсутствует, при сильной переработке может исчезнуть
  • Причина запуска, Акт ЕС об ИИ: в июле 2026 года Anthropic вместе с ~190 другими компаниями подписала Кодекс практик ЕС о прозрачности ИИ-контента, из-за чего функция включается сразу по всему миру
  • Модели после 2 августа 2025 года поддерживают знак сразу; старые получат его позже; для файлов используется открытый стандарт C2PA

Почему это важно

Это не прорыв в возможностях модели, а инфраструктурный шаг: Anthropic впервые открывает сторонним разработчикам техническую возможность проверять происхождение текста Claude напрямую, а не косвенными эвристиками. До сих пор внешние детекторы ИИ-текста вроде Pangram работали вслепую, искали типичные обороты речи, не имея доступа к внутренней информации модели. API на основе водяного знака меняет саму механику проверки: вместо догадок, техническая метка, встроенная в сам процесс генерации текста.

Кому это важно

В первую очередь, разработчикам, которым по регуляторным или продуктовым причинам нужно определять ИИ-происхождение контента: образовательным платформам, издательствам, модераторам контента, комплаенс-командам. Также это важно бизнесам и продуктам, работающим на рынке ЕС, им придётся учитывать требования Акта ЕС об ИИ вне зависимости от того, работают ли они непосредственно с Anthropic.

Как это применить

Пока речь о будущем API, точная дата запуска, цена и условия доступа не раскрыты, известно только, что это «скоро». Разработчикам, которым важна проверка происхождения текста, стоит следить за анонсом самого API и опубликованным Anthropic FAQ, где расписаны ограничения метода (короткие тексты, код, переводы, ручная правка). Дожидаться готового инструмента разумнее, чем встраивать сторонние эвристические детекторы, которые работают менее надёжно.

Можно ли доверять

Сама Anthropic прямо описывает ограничения метода: знак не всегда сохраняется (короткие тексты, код, сильная переработка человеком), а положительное срабатывание означает лишь вероятное участие Claude, не доказывает, что весь текст написан моделью, и не отличает Claude от других ИИ-систем. Это честное признание пределов технологии, а не маркетинговое обещание стопроцентной детекции.

Риски и подводные камни

Главный риск, переоценка надёжности метода: водяной знак легко обходится сильной переработкой текста человеком, а на коротких или фактологически насыщенных фрагментах и вовсе работает слабо. Кроме того, отсутствие технической возможности ограничить функцию одним регионом означает, что водяные знаки включаются во всём мире по регуляторным причинам ЕС, а не по собственному выбору Anthropic для каждого рынка, источник не раскрывает ни точность детекции, ни долю ложных срабатываний.

«Это не влияет на содержание, уровень креативности или читаемость текста Claude»

— Anthropic