ShieldFont, шрифт, который обманывает ИИ-скрейперов

ShieldFont, шрифт, который обманывает ИИ-скрейперов

Дизайнеры Isaque Seneda и Gabriel Abrucio описали в недавнем техническом документе шрифт ShieldFont, который должен дать издателям сайтов, по их словам, «практический способ отказаться от несанкционированного обучения ИИ и сорвать сбор данных, если этот отказ проигнорировали».

Шрифт построен на лигатурах, давней функции шрифтов, которая обычно заменяет пары букв более читаемым начертанием, когда буквы стоят вплотную друг к другу. В ShieldFont тот же механизм лигатур используют иначе: он подменяет не буквы, а целые слова, чтобы обесценить текст для скрейперов. Подмена происходит только на этапе отрисовки страницы шрифтовым движком на экране: человек видит нормальный читаемый текст, а скрейпер, который просто скачивает исходный код страницы, получает изменённую, бессмысленную версию, которую обычный посетитель сайта никогда не увидит.

Авторы отмечают, что подбор слов для замены, балансирование между двумя крайностями. Простая замена слов синонимами или антонимами была бы слишком легко обратима для продвинутого скрейпера. С другой стороны, замена слов на полностью не связанную по смыслу бессмыслицу облегчила бы обнаружение, и, возможно, обход, со стороны умного фильтра скрейпинга. Как именно ShieldFont выбирает конкретные слова-замены, в материале не раскрыто. Нет в нём и данных об эффективности шрифта против реальных скрейперов, не названы конкретные ИИ-компании как цель, не сказано, когда и как издатели смогут установить шрифт на свои сайты.

Ключевые факты

  • ShieldFont, шрифт от дизайнеров Isaque Seneda и Gabriel Abrucio, представленный в их техническом документе.
  • Механизм строится на лигатурах: вместо соединения пар букв они подменяют целые слова текста.
  • Подмена происходит только при отрисовке страницы шрифтовым движком, читатель видит обычный текст, а скрейпер, скачивающий исходный код, получает изменённую версию.
  • Цель, дать издателям инструмент отказа от несанкционированного использования их текстов для обучения ИИ.
  • В материале нет данных об эффективности против реальных скрейперов, способа выбора слов-замен и сроков появления шрифта у издателей.

Почему это важно

Скрейпинг веб-страниц для сбора обучающих данных ИИ уже привёл к искам против компаний и к техническим средствам защиты со стороны издателей. ShieldFont, новый подход к этой защите: вместо блокировки на уровне сервера или юридических требований он прячет подмену текста внутри самого шрифта, так что скрейпер получает искажённые данные, даже не подозревая об этом, пока человек продолжает видеть страницу без изменений.

Кому это важно

Издателям и владельцам сайтов, которые хотят не дать своим текстам попасть в обучающие выборки ИИ-моделей без разрешения, но не готовы усложнять доступ обычным читателям или закрывать сайт технической блокировкой.

Как это применить

В материале не описано, как именно установить или подключить ShieldFont на сайт, известно только, что шрифт представлен в техническом документе дизайнеров. Практического руководства по внедрению, цены или условий использования в источнике нет.

Можно ли доверять

Материал опирается на технический документ самих создателей шрифта, Isaque Seneda и Gabriel Abrucio; независимых тестов или данных об эффективности ShieldFont против реальных ИИ-скрейперов в источнике не приведено, так что оценивать заявленный эффект стоит с осторожностью.

Риски и подводные камни

Авторы сами признают компромисс: слишком простая замена слов на синонимы или антонимы легко обратима умным скрейпером, а замена на полную бессмыслицу облегчает обнаружение и обход фильтром. Как именно ShieldFont выдерживает этот баланс на практике и насколько устойчив к более совершенным скрейперам, из материала не ясно, данных об эффективности нет.

«Практический способ отказаться от несанкционированного обучения ИИ и сорвать сбор данных, если этот отказ проигнорировали.»

— Isaque Seneda и Gabriel Abrucio, авторы ShieldFont