Разработчики обошли водяные знаки Claude за 4 часа

Разработчики обошли водяные знаки Claude за 4 часа

Anthropic подтвердила, что модели Claude по всему миру начнут вшивать в сгенерированный текст невидимые, машиночитаемые водяные знаки, так компания выполняет требования вступившего в силу ранее в этом месяце закона Евросоюза об искусственном интеллекте (AI Act): поставщики вроде Anthropic и OpenAI обязаны маркировать синтетические аудио, изображения, видео и текст так, чтобы их можно было распознать машиной как сгенерированные ИИ, иначе, штраф до 3% годового оборота компании. Разработчик Гийом Мейер и другие начали разбираться в устройстве этой маркировки ещё на прошлой неделе, когда Anthropic впервые объявила о переходе на неё, а когда встраивание подтвердили официально, Мейер уже через 4 часа опубликовал рабочий код, который снимает водяные знаки с текстов Claude.

Инструмент Мейера стал вирусным: его добавили в закладки более 20 000 раз в соцсети X (бывший Twitter), а на GitHub к проекту присоединились более 100 контрибьюторов, ещё больше разработчиков встраивают этот код в свои собственные продукты. Свои способы обхода придумали и другие: инженер-программист Эрик Хьюз с помощью самого Claude за 15 минут собрал инструмент, который убирает невидимые и похожие на обычные символы, меняет порядок предложений внутри абзацев и заменяет часть слов синонимами. Леон Хлон, приглашённый научный сотрудник Оксфордского университета, говорит, что знак пропадает, если сжать ответ Claude, перевести его, например, на один из арабских диалектов, со значительно иной семантикой, чем у английского, а затем перевести обратно. Уэйн Пэн, технический директор и сооснователь стартапа Haimaker (Кремниевая долина, разработка суверенного ИИ), включил инструмент Мейера в свою платформу: ему тоже не нравится идея маркировать даже слегка отредактированный текст Claude, да ещё незаметно для пользователя.

Мейер говорит, что одни пытаются обойти маркировку из принципа, не согласны, что весь ИИ-текст обязательно нужно помечать, а другие, включая его самого, просто увлечены технической задачей; за помощью к нему обращались и фрилансеры-копирайтеры, и создатели контента для соцсетей. Свою позицию он объясняет так: «Я не против прозрачности и полностью за то, чтобы указывать источник контента. Но водяные знаки сами по себе, очень плохое решение: у него серьёзные недостатки и риски». Мейер опасается ложных срабатываний и того, что метка не различает лёгкую и глубокую правку ИИ, он, носитель французского языка, часто использует Claude и другие инструменты вроде Grammarly просто для того, чтобы отредактировать свой текст. По его словам, если водяной знак начнут использовать как доказательство, а даже сама Anthropic признаёт, что метка даёт лишь вероятность, а не уверенность в том, что текст правил Claude, это может привести к тому, что работодатели будут несправедливо отклонять кандидатов, а исследователей, огульно обвинять в использовании ИИ просто потому, что сработал детектор.

Технология называется SynthID: невидимый знак оставляет характерный отпечаток в том, какие слова и обороты выбирает Claude, человек его не замечает, а машина, которая знает, что искать, обнаруживает. Разработала SynthID компания Google и с 2023 года маркирует ею собственный ИИ-контент. Информатик Скотт Ааронсон предлагал похожий метод ещё во время работы в OpenAI, но там его так и не внедрили, в компании опасались, что водяные знаки оттолкнут клиентов. Часть пользователей боится, что встроенная метка ухудшит качество ответов Claude, хотя Anthropic это отрицает. Сам метод Мейера работает так: он прогоняет текст через другую большую языковую модель, без встроенных водяных знаков, и та переписывает его несколько раз, подставляя синонимы и слегка меняя структуру. Это ставка на то, что альтернативные модели останутся немаркированными, а гарантии здесь нет: кодекс добросовестной практики Евросоюза по прозрачности уже подписали 190 организаций, включая OpenAI, Microsoft и Meta, и их водяные знаки должны появиться во всех новых моделях начиная с августа, а в уже существующих, быть внедрены до декабря.

В официальном заявлении для Wired представитель Anthropic подтвердил: маркировка добавлена, чтобы соответствовать AI Act ЕС, и другие лаборатории делают то же самое; текст с поддерживаемых моделей Claude, включая вывод Claude Code, будет нести невидимый водяной знак, который не меняет смысл, качество и читаемость ответов, и компания планирует выпустить API для распознавания такого текста. Anthropic всё ещё дорабатывает систему маркировки и пока не выпустила инструмент для обнаружения собственного знака, а значит, по словам Пэна, никто не может быть уверен, что методы обхода действительно работают, пока Anthropic не опубликует это программное обеспечение. «Думаю, они хотели показать, что действуют добросовестно, говорит Пэн., Но не думаю, что водяной знак когда-нибудь выдержит вообще всё».

Ключевые факты

  • Anthropic подтвердила, что модели Claude по всему миру начнут вшивать в текст невидимые водяные знаки, того требует вступивший в силу AI Act Евросоюза, а нарушителям грозит штраф до 3% годового оборота.
  • Через 4 часа после подтверждения разработчик Гийом Мейер опубликовал код, снимающий эти водяные знаки; его добавили в закладки более 20 000 раз в соцсети X, а на GitHub к проекту присоединились более 100 контрибьюторов.
  • Свои способы обхода придумали и другие: инженер-программист Эрик Хьюз с помощью Claude за 15 минут собрал инструмент, который убирает незаметные символы и переставляет предложения, а Леон Хлон из Оксфорда предлагает переводить ответ Claude на арабский диалект и обратно.
  • Технология водяных знаков называется SynthID, её разработала Google и использует с 2023 года; в OpenAI похожий метод предлагал информатик Скотт Ааронсон, но там его не внедрили, испугались оттолкнуть клиентов.
  • Сама Anthropic признаёт: метка даёт лишь вероятность, а не гарантию, что текст правил Claude, а после сильной правки, пересказа или перевода может пропасть вовсе; собственный инструмент для обнаружения знака компания пока не выпустила.

Почему это важно

Это первая крупная проверка боем механизма маркировки ИИ-контента, которого требует AI Act Евросоюза: обязательные водяные знаки должны были стать техническим способом отличить синтетический текст от человеческого. На практике защита продержалась считаные часы, рабочий код, снимающий метку, опубликован, разошёлся по сети и уже встроен в сторонние продукты и платформы. Это ставит под вопрос саму работоспособность требования: если знак снимается за часы силами независимых разработчиков без специальных ресурсов, регуляторный механизм не гарантирует заявленную функцию по умолчанию, он работает только для тех, кто не пытается его обойти.

Кому это важно

Регуляторам Евросоюза и самой Anthropic, потому что под вопросом эффективность одного из первых крупных инструментов исполнения AI Act. Другим лабораториям, подписавшим кодекс добросовестной практики ЕС (190 организаций, включая OpenAI, Microsoft и Meta), у них те же сроки внедрения (новые модели с августа, уже существующие, до декабря) и тот же риск, что их маркировку обойдут так же быстро. Работодателям, преподавателям и редакциям, которые могут опираться на детектор ИИ-текста при решениях, касающихся людей, им стоит знать про риск ложных срабатываний. И самим пользователям Claude, фрилансерам, копирайтерам, всем, кто просто правит свой текст с помощью ИИ, потому что именно их водяной знак может пометить ошибочно.

Как это применить

Тем, кто встраивает детектор ИИ-текста в свои процессы, модерацию, приём вступительных работ, отбор кандидатов, не стоит использовать срабатывание водяного знака как единственное или окончательное доказательство: сама Anthropic говорит, что метка даёт лишь вероятность, а не уверенность, и что сильная правка, пересказ или перевод могут её стереть. Компаниям, подписавшим кодекс добросовестной практики ЕС, полезно свериться со сроками из материала: новые модели, с августа, уже существующие, до декабря. А тем, кто оценивает надёжность самой темы, стоит дождаться, когда Anthropic выпустит собственный инструмент для обнаружения знака, до этого момента ни одно заявление об «успешном обходе» нельзя считать окончательно подтверждённым.

Можно ли доверять

Материал вышел в Wired и включает прямую цитату представителя Anthropic, взятую специально для этого текста; численные детали, более 20 000 закладок, более 100 контрибьюторов, 15 минут на альтернативный инструмент, указаны конкретно, а не оценочно, и это похоже на проверяемые факты. При этом сама суть заявления, что водяные знаки реально обходятся, исходит от заинтересованных в этом разработчиков и независимо не подтверждена: даже один из процитированных источников, Уэйн Пэн, прямо говорит, что уверенности не будет, пока Anthropic не выпустит собственный детектор. Это не повод сомневаться в факте публикации кода и его популярности, это факт, а не мнение, но повод не считать вопрос «работает ли обход» закрытым.

Риски и подводные камни

Главный риск, ложные срабатывания и ложное чувство защищённости: если водяной знак начнут использовать как доказательство при найме или в академической среде, это, по словам Мейера, может привести к несправедливым отказам кандидатам и необоснованным обвинениям исследователей. Второй риск, для самого регуляторного механизма: обход уже не приватное исключение, а открытый проект с сотней контрибьюторов, и вся конструкция AI Act по маркировке контента рискует не сработать так, как задумано. Третий, метод Мейера держится на том, что для перезаписи текста найдутся немаркированные модели, а это ставка с истекающим сроком: 190 организаций уже обязались внедрить собственные водяные знаки к декабрю, и число немаркированных моделей будет сокращаться. Наконец, сама Anthropic предупреждает, что после сильной правки, пересказа или перевода метка может пропасть и без всякого умысла, то есть границу между «обошёл специально» и «просто отредактировал текст» на практике провести сложно.

«Я не против прозрачности и полностью за то, чтобы указывать источник контента. Но водяные знаки сами по себе, очень плохое решение: у него серьёзные недостатки и риски.»

— Гийом Мейер, разработчик инструмента для удаления водяных знаков Claude, в комментарии Wired

Компания Meta Platforms признана экстремистской организацией, её деятельность на территории РФ запрещена.