Google SynthID и другие «водяные знаки» ИИ: автор предложил термин «спаймарк» для скрытой слежки

Разработчик Брэндон Томас опубликовал эссе, в котором предлагает ввести новый термин, «спаймарк» (от английского spy, «шпион», и mark, «метка»), для скрытых сигналов слежки, которые технологические компании встраивают в фотографии, аудио, видео и тексты под видом «водяных знаков», помогающих отличать контент, созданный ИИ. По мысли автора, привычное слово «водяной знак» ассоциируется с чем-то безобидным, рамкой авторства или защитой от подделки, и это маскирует настоящую опасность: некоторые такие метки способны кодировать данные, которые привязывают файл к конкретному человеку.

Главный пример в тексте, система Google SynthID. По данным собственной статьи Google о SynthID-Image, вариант SynthID-O способен закодировать в изображении размером 512×512 пикселей полезную нагрузку в 136 бит, этого достаточно для 64-битного идентификатора базы данных и ещё 72 бит на исправление ошибок. Такой идентификатор теоретически может быть связан с записью пользователя: именем, IP-адресом, датой рождения, адресом, партийной принадлежностью и другими данными. Автор подчёркивает, что сама Google описывает эти сигналы как «незаметные для человека» (imperceptible to humans). SynthID, по словам автора, умеет встраивать похожий статистический паттерн и в текст, за счёт выбора конкретных слов при генерации. OpenAI и, по утверждению автора, ряд других технологических компаний разрабатывают подобные системы в промышленных масштабах; конкретных названий их продуктов в тексте не приводится.

Отдельный пример, аудио-спаймарки. Автор ссылается на обзорную статью Wen и соавторов (2025) о надёжности водяных знаков в генеративном аудио и отмечает, что такие метки обычно неслышимы человеку, встраиваются в звуковую волну во временной или частотной области и сконструированы так, чтобы переживать сжатие или перекодирование файла. В качестве примера, открытый инструмент audiowmark, появившийся в 2018 году: он умеет прятать в звуке полезную нагрузку в 128 бит и защищать её секретным AES-ключом, так что без ключа извлечь данные нельзя.

Автор отдельно разводит спаймарки и обычные метаданные вроде тегов EXIF в фотографиях или ID3 в MP3, это стандартизированные, документированные поля, которые пользователь может посмотреть, отредактировать или удалить (хотя тот же EXIF способен непреднамеренно раскрыть GPS-координаты). Спаймарк, в отличие от этого, встроен в сами пиксели, звуковую волну или выбор слов, поэтому он не виден пользователю и способен пережить удаление метаданных и часть последующих правок файла. Как ранний исторический пример подобных скрытых меток автор называет точки слежения принтеров (printer tracking dots), известные с 1980-х годов.

Автор описывает тревожный сценарий: если каждое устройство будет проходить аттестацию, а каждая публикация в соцсети, нести привязанный к аккаунту спаймарк, сочетание таких меток с данными аккаунта позволит восстанавливать, как расходится контент, и вычислять авторов конкретных фотографий или постов, что особенно опасно для информаторов и людей, которые не хотят быть преследуемыми за свои слова. Текст завершается отсылкой к цитате Урсулы Ле Гуин о том, что назвать вещь, значит подчинить её себе: по мысли автора, введение отдельного слова для «спаймарка» позволяет сразу обозначить угрозу приватности, не объясняя каждый раз заново технические детали слежки.

Ключевые факты

  • Автор ввёл термин «спаймарк» для скрытых сигналов слежки в ИИ-контенте, отличая их от обычных «водяных знаков».
  • Google SynthID-O кодирует в изображении 512×512 пикселей 136-битную нагрузку: 64 бита под идентификатор базы данных и 72 бита на исправление ошибок.
  • Открытый инструмент audiowmark (с 2018 года) прячет в аудио 128-битную нагрузку, защищённую AES-ключом.
  • В отличие от EXIF и ID3, спаймарки нельзя увидеть или снять обычными средствами, они переживают удаление метаданных.
  • Автор предупреждает, что сочетание таких меток с данными аккаунта особенно опасно для информаторов и авторов, не желающих раскрывать личность.

Почему это важно

Термин «спаймарк» переносит фокус с технической детали (водяной знак как метод выявления ИИ-генерации) на политику приватности: одни и те же алгоритмы, которые компании продают как средство маркировки синтетического контента, технически способны нести привязанный к личности идентификатор. Google в собственной статье о SynthID-Image описывает 136-битную ёмкость метки, этого достаточно для 64-битного ID пользователя. Пока это не задокументированный случай слежки за конкретным человеком, а техническая возможность, но именно ёмкость сигнала, то, что обычно не обсуждают, когда презентуют водяные знаки как средство борьбы с дипфейками.

Кому это важно

Людям, которые публикуют фото, аудио или текст, сгенерированные ИИ-инструментами или прошедшие через эти инструменты, то есть почти любому пользователю соцсетей и мессенджеров. Отдельно, информаторам и авторам, которым важна анонимность: если публикация несёт привязанный к аккаунту спаймарк, её происхождение можно восстановить даже после того, как обычные метаданные вроде EXIF удалены. Также, разработчикам и юристам, которые формируют политику компаний вокруг водяных знаков ИИ-контента, и журналистам, которые пишут о приватности и слежке.

Как это применить

Практического инструмента для обнаружения или удаления спаймарков в эссе не приводится, это текст-предложение новой терминологии, а не гайд по защите. Единственный практический вывод, который следует из текста, не путать спаймарк с обычными метаданными: если инструмент вроде EXIF-очистки убирает GPS-координаты из фото, это не значит, что скрытый статистический сигнал в пикселях или звуковой волне тоже удалён, по описанию автора, такие сигналы способны пережить и удаление метаданных, и часть редактирования файла.

Можно ли доверять

Это мнение одного автора (Брэндона Томаса), опубликованное на его собственном сайте, а не рецензируемое исследование, само по себе предложение нового термина не является установленным фактом. При этом числовые характеристики, которые он приводит про Google SynthID (136-битная нагрузка, 64 бита под идентификатор, 72 бита на коррекцию ошибок), опираются на собственную статью Google о SynthID-Image, то есть эта часть проверяема. А вот сценарий с привязкой к личным данным (имя, IP, дата рождения) и картина повсеместного внедрения спаймарков в соцсети и смартфоны, это авторская экстраполяция технической возможности, а не задокументированный случай: сам текст нигде не утверждает, что кого-то реально идентифицировали через такую метку.

Риски и подводные камни

Главный риск, о котором пишет автор, необратимость: в отличие от EXIF или ID3, спаймарк нельзя увидеть или снять стандартными средствами, и он способен пережить часть правок файла. Это создаёт риск для тех, кому важна анонимность публикации, в первую очередь для информаторов. Другой риск, терминологическая путаница: пока слово «водяной знак» остаётся общим и для безобидных меток авторства, и для скрытых трекеров, компании могут представлять слежение как обычную защиту от подделок. При этом сам автор не приводит подтверждённых случаев, когда спаймарк реально использовали для деанонимизации конкретного человека, риск описан как потенциальный, а не свершившийся.

«Назвать вещь, значит подчинить её себе.»

— Урсула Ле Гуин, «Правило имён» (цитата в эссе)