Скрапер, укравший 12 млн работ с Cara, помог создать инструмент защиты Lantern

С начала 2023 года фотограф Джинна Чжан и небольшая команда волонтёров развивают Cara, социальную сеть и портфолио-приложение для художников, которое привлекло около 1,5 миллиона авторов. Людей туда привело общее неприятие того, что их работы без разрешения используют для обучения ИИ-моделей, и желание показывать свои работы, не становясь бесплатным сырьём для крупных технокомпаний. Cara отфильтровывает сгенерированные ИИ изображения и предлагает минимальную защиту, но полностью исключить скрапинг она не может.
С 13 августа платформу подряд ударили три крупные скрап-атаки. Первым о своём улове объявил в сабреддите r/DefendingAIArt пользователь MandarinDawnPoppy994: он собрал архив на 12 терабайт из 12 миллионов работ, фактически всю публичную библиотеку Cara, и потратил на это меньше $10. «Это был забавный проект», написал он в посте, который позже удалил. Чжан узнала о случившемся от пользователей, отметивших её в сети: скрапер хвастался находкой и искал единомышленников, чтобы вместе поработать с датасетом на Reddit, из-за чего в ИИ-сообществах разгорелся спор об этичности его поступка. «Мне кажется, это было целенаправленно и очень болезненно», говорит Чжан, добавляя, что законы не поспевают за такими сборами данных, и скраперы часто могут формально оправдать свои действия как законные. (Отдельно от этой истории Чжан участвует в двух коллективных исках художников, против Stability AI, Midjourney и других компаний, а также против Google, по поводу того, что генераторы изображений этих компаний обучались на работах авторов без разрешения.)
Второй скрапер под ником CaptiveDreamer выгрузил на платформу Hugging Face около 8,5 миллиона ссылок на работы с Cara вместе с метаданными, именами пользователей, названиями и тегами. После потока жалоб на нарушение авторских прав Hugging Face заявила, что уведомит CaptiveDreamer о необходимости удалить персональные метаданные, но не может удалить сами ссылки, поскольку «здесь не хранится ни одной копии произведений», ссылки лишь «указывают на копии, которые художники сами опубликовали на Cara». Компания добавила, что «дальнейшие жалобы на нарушение авторских прав по тому же основанию не изменят этот вывод».
22 августа появился третий скрапер: он собрал 123 тысячи изображений вместе с текстовыми постами и биографиями пользователей, содержавшими личные данные, и выложил всё это на сайт Academic Torrents. После этого Чжан запустила сбор средств на GoFundMe на юридические расходы с целью $120 тысяч, на момент публикации статьи было собрано уже больше $100 тысяч, а Cara продолжает искать дополнительную юридическую помощь.
Чжан признаёт, что проблемой стали не только сами скрап-атаки, но и путаница вокруг того, что команда Cara реально может сделать для защиты художников: часть пользователей уже удалила портфолио и покинула площадку. «В рамках возможного мы сделали всё правильно, не превращая при этом сервис в кошмар для пользователей», говорит Чжан о нынешних защитных мерах Cara, включая временные меры вроде обязательного входа в аккаунт для просмотра контента, которые, по её словам, не решают проблему в масштабах всего интернета. Она опасается, что люди, винящие её в серии атак, не понимают: Cara наверняка уже подвергалась скрапингу и раньше, как и любой другой сайт, и не может гарантировать полную безопасность. «Если кому-то от этого легче, удалить работы и уйти с Cara, я это поддерживаю, говорит Чжан., Но я не хочу, чтобы у людей складывалось ложное впечатление, что в другом месте они в большей безопасности: это не так. Крупные платформы скрапят чаще, и от этого мне только хуже».
Неожиданно у Чжан появился союзник, тот самый человек, что спровоцировал августовскую волну скрапинга. После того как один из пользователей Cara вычислил его и убедил удалить датасет, он сам вышел на Чжан, чтобы объяснить свои мотивы и подтвердить удаление данных. Пользователь, представляющийся только под псевдонимом Heft, по его словам, из-за угроз доксинга и расправы, которые он получил после истории с Cara, студент из Северной Америки с опытом в разработке программного обеспечения и интересом к цифровому сохранению и архивным проектам. В переписке с Wired через Discord Heft рассказал, что изначально скрапинг Cara был чисто техническим проектом без намерения публиковать данные.
Он признаёт, что принял «глупое решение, попытаться устроить ragebait (провокационный пост, рассчитанный на гнев аудитории) с этим датасетом на Reddit» и увлёкся троллингом в комментариях. Он понимал, что это разозлит художников на Cara, но не ожидал такой силы отчаяния в сообществе: люди делились паническими атаками из-за скрапинга и рассказывали, как удаляли целые портфолио из интернета. Пообщавшись напрямую с художниками, он лучше понял, насколько лично для них важны их работы и право ими распоряжаться. «Оглядываясь назад, не только сам факт, что я целенаправленно выбрал Cara, но и то, как я подал это в посте, было жестоко и бездумно», говорит Heft.
По словам Heft, ему было любопытно, можно ли использовать эти данные для обучения ИИ, но он не верил, что это когда-нибудь случится: 12 миллионов изображений, «не так много, чтобы обучить модель для генерации изображений», а большинство коммерческих ИИ-лабораторий обучают модели на куда более масштабных веб-датасетах вроде тех, что собирают организации открытых данных наподобие LAION. Случайные пользователи вполне могут выкладывать такие дампы данных на Hugging Face, говорит Heft, но он считает «крайне маловероятным, что OpenAI или Anthropic сканируют каждый новый датасет на Hugging Face, чтобы обучаться на нём».
Отойдя от чисто теоретического взгляда на вещи и решив исправить ситуацию, Heft присоединился к Discord-серверу Cara в роли специалиста по устранению неполадок и объясняет команде, почему предложенные меры защиты вряд ли сработают. «Он просто нам помогает, тратит время, чтобы всё объяснить», говорит Чжан: когда речь заходит о каком-то конкретном инструменте или решении, Heft показывает, как можно «буквально за пару минут» его обойти. Убеждённый, что ни один сайт нельзя сделать по-настоящему «нескрапируемым», Heft вместе с Чжан разрабатывает инструмент противодействия постфактум, Lantern.
Lantern позволяет художникам создавать «одноразовый отпечаток» (one-way fingerprint) своих изображений, не сохраняя сами файлы на платформе. Инструмент «регулярно сканирует новые публично доступные датасеты изображений для ИИ», говорит Heft, и если работа художника обнаруживается в одном из них, «автор получает уведомление и ссылку на датасет, чтобы запросить удаление или, возможно, направить официальное требование об удалении (takedown notice)». Проект Lantern только запускается и остаётся несовершенным решением, порождённым отсутствием подходящего регулирования, но Чжан и Heft рассчитывают дать художникам больше контроля и понимания того, как их контент собирают по всему интернету, независимо от того, запрещают ли это условия использования площадки, как в случае с Cara. Поскольку инструмент открытый, доработать его код может кто угодно.
Главная надежда Чжан на то, что вся эта история со скрапингом привлечёт внимание регуляторов не только к вопросам авторского права, которые она считает лишь частью более сложной проблемы. «Атаки со стороны ИИ скоро станут просто обыденностью», говорит она. И в большинстве случаев атакующий не станет извиняться и тем более пытаться всё исправить.
Ключевые факты
- Cara подверглась трём крупным скрап-атакам за две недели в августе: 12 млн работ (12 ТБ) за меньше чем $10, 8,5 млн ссылок и метаданных на Hugging Face, 123 тысячи изображений и личные данные пользователей на Academic Torrents.
- Основательница Cara Джинна Чжан запустила сбор средств на юристов с целью $120 тысяч и уже собрала больше $100 тысяч.
- Hugging Face согласилась удалить персональные метаданные по жалобе, но отказалась удалять сами ссылки на работы, поскольку не хостит изображения, только указывает на копии, опубликованные на Cara.
- Первый скрапер, известный под ником Heft, после реакции сообщества пожалел о содеянном, удалил датасет и теперь вместе с Чжан разрабатывает открытый инструмент Lantern, «одноразовый отпечаток» изображений, который уведомляет художника, если его работа найдена в новом датасете для обучения ИИ.
- Heft считает, что 12 млн изображений слишком мало для обучения модели генерации изображений, и сомневается, что крупные ИИ-лаборатории вроде OpenAI и Anthropic используют случайные датасеты с Hugging Face.
Почему это важно
История Cara, наглядный пример того, как обучающие датасеты для ИИ сталкиваются с интересами живых людей, чьи работы становятся сырьём без спроса. Три скрапа за две недели показали, что технически предотвратить массовый сбор публичных данных почти невозможно, а юридически противопоставить этому почти нечего: сами скраперы признают, что законы «не поспевают» за такими практиками. При этом неожиданный поворот, сотрудничество бывшего скрапера с основательницей платформы, показывает, что конфликт вокруг обучающих данных не сводится к простому противостоянию «художники против ИИ»: у него есть человеческое измерение и пространство для диалога.
Кому это важно
Художникам и другим авторам, публикующим работы в сети и опасающимся, что их используют для обучения ИИ без разрешения. Платформам вроде Cara, которые размещают пользовательский контент и вынуждены балансировать между защитой авторов и удобством сервиса. Компаниям вроде Hugging Face, которые хостят датасеты и оказываются между требованиями об удалении и собственными правилами. А также разработчикам ИИ-моделей и регуляторам, для которых эта история, очередной пример того, что законодательство о данных для обучения ИИ пока не поспевает за практикой.
Как это применить
Художникам, обеспокоенным скрапингом своих работ, стоит следить за запуском Lantern: инструмент задуман как открытый и бесплатный способ узнавать, попали ли работы в новый датасет для обучения ИИ, и после этого запрашивать удаление. Платформам, которые хранят пользовательский контент, история Cara показывает ограничения простых мер вроде обязательного входа в аккаунт для просмотра, и то, что полноценная защита требует сотрудничества с сообществом, включая, как ни странно, с бывшими нарушителями. Тем, кто работает с датасетами на Hugging Face и подобных площадках, кейс с CaptiveDreamer напоминает, что удаление личных метаданных и удаление самих ссылок на контент, это разные типы жалоб с разными шансами на успех.
Можно ли доверять
Материал Wired во многом опирается на прямые интервью: с Джинной Чжан от первого лица и с Heft, в переписке через Discord. Ключевые цифры (объём датасетов, суммы сборов) приведены со ссылкой на публичные посты скраперов и данные GoFundMe, а заявление Hugging Face процитировано напрямую. Слабое место, личность Heft: издание не может независимо подтвердить ни его настоящее имя, ни детали биографии, поскольку он общается только под псевдонимом, ссылаясь на угрозы в свой адрес. Это делает часть истории (мотивы, раскаяние) рассказанной исключительно с его слов, хотя факт удаления датасета и сотрудничество с Чжан подтверждает и она сама.
Риски и подводные камни
Пока в большинстве юрисдикций нет чётких законов против скрапинга публичных данных для ИИ, подобные истории будут повторяться: сами участники признают, что действия часто формально законны. Lantern решает проблему только постфактум, он не мешает скрапингу, а лишь уведомляет автора, если работа уже попала в датасет, и не гарантирует, что оператор датасета согласится её удалить. Третий скрап уже показал, что вместе с изображениями утекают и личные данные, имена пользователей и биографии, что расширяет ущерб за пределы авторских прав. Наконец, история с Heft поднимает менее очевидный риск: угрозы доксинга и расправы в адрес человека, пусть и совершившего проступок, форма самосуда, которая едва ли делает пространство вокруг ИИ и данных более безопасным для кого бы то ни было.
«Атаки со стороны ИИ скоро станут просто обыденностью»
— Джинна Чжан, основательница Cara