OpenAI и Microsoft знали, что запускают «петлю гибели» для веба

Рассекреченные в суде документы по иску The New York Times против OpenAI и Microsoft показывают, что обе компании заранее знали: их стратегия работы с контентом запускает «петлю гибели» (doom loop), которая вредит всему вебу. Внутренние материалы и сотрудники называли сбор данных для обучения моделей «крупнейшей кражей труда в истории человечества» и «полным издевательством над идеей добросовестного использования» (fair use). The Verge приводит выдержки из 92-страничного документа, поданного в суд; среди упомянутых в нём фигур, Сатья Наделла, Сэм Альтман и другие сотрудники OpenAI и Microsoft.
Большинство самых острых цитат принадлежит директору по прикладной науке Microsoft Бренту Хекту. Компания дистанцируется от его слов: представитель Microsoft Алекс Хаурек заявил The Verge, что «эти комментарии отражают личную позицию одного сотрудника, не являются юридическим анализом и не отражают точку зрения компании». В отдельном судебном документе Джордан Усдан, гендиректор по стратегии данных и операциям в Microsoft AI, описал позицию Хекта как «расходящуюся, академическую и футуристическую», подчеркнув, что тот не говорит от имени Microsoft.
Среди других цитат, признание Сатьи Наделлы, что чат-боты фактически заменили поиск и убрали необходимость идти напрямую к источнику информации. Внутренний документ Microsoft гласит: «Наша стратегия работы с контентом для ИИ запустила „петлю гибели“, которая одновременно ухудшит качество наших моделей и всего веба: крайне необычно, когда конечный продукт угрожает экономическим основам своих ключевых поставщиков, но именно в такой ситуации оказался наш LLM-бизнес по отношению к своей „цепочке поставок контента“». Сооснователь OpenAI Грег Брокман, по данным документа, больше интересуется «гигантскими» суммами (gazillions), которые можно заработать на коммерческом ИИ.
Наделла также говорил, что «всё, что стоит за платным доступом, должно лицензироваться», но при этом представитель OpenAI признал, что «не знает» о каких-либо усилиях компании по обнаружению или удалению платного контента из обучающих данных. Внутри OpenAI признавали, что GPT-4 «запомнил огромный объём данных и поэтому будет исключительно хорош в дословном воспроизведении», несмотря на понимание того, что «предотвращение запоминания» важно для минимизации нарушений авторских прав. В документе приведены примеры, как ChatGPT выдавал длинные дословные фрагменты статей из The New York Times, Mercury News, The Denver Post, Lifehacker и Eurogamer в ответ на запросы.
Директор по политике OpenAI Джек Кларк, по данным иска, говорил о создании «систем, замещающих труд людей, которые определяют „культуру“ общества». Внутренние документы называли ChatGPT «современным газетным киоском». Глава направления ChatGPT в OpenAI Ник Тёрли (в источнике его имя на первое упоминание дано с оговоркой «предположительно») говорил, что после ответа чат-бота «нет смысла переходить» по ссылке на источник. Microsoft признавала: «LLM, это продукт, который уничтожает собственную цепочку поставок». Собственные эксперты OpenAI по медиа и экономике связали падение реферального трафика на сайты вроде NYT напрямую с ИИ-сводками вроде Google AI Overviews и предположили, что переходы из поиска могли упасть вплоть до 60%.
Хаурек также заявил, что «показания Сатьи и позиция Microsoft по этому делу полностью согласуются» и что его слова касались общих принципов и изменений в том, как люди находят и потребляют информацию, а не выводов по вопросам авторского права, которые Microsoft оспаривает в своих материалах по делу. Тем не менее, по выводам издания, из рассекреченного документа следует: обе компании знали, что необратимо вредят издательской индустрии, в которой заняты «миллионы людей», и, соответственно, собственному продукту, но продолжали двигаться вперёд ради «гигантских» денег.
Ключевые факты
- Рассекреченные материалы (92-страничный документ) по иску The New York Times к OpenAI и Microsoft показывают, что компании знали о вреде своей ИИ-стратегии для веба.
- Директор по прикладной науке Microsoft Брент Хект называл сбор данных для обучения «крупнейшей кражей труда в истории человечества»; Microsoft дистанцировалась от его слов через представителя Алекса Хаурека.
- Внутренний документ Microsoft описывал происходящее как «петлю гибели», которая одновременно вредит и моделям компании, и всему вебу.
- OpenAI признавала, что GPT-4 дословно воспроизводит контент изданий (NYT, Mercury News, The Denver Post, Lifehacker, Eurogamer), а собственные эксперты компании оценивали возможное падение переходов из поиска на сайты вроде NYT вплоть до 60%.
- Сооснователь OpenAI Грег Брокман, по документу, больше интересовался «гигантскими» суммами денег, чем декларируемым альтруизмом компании.
Почему это важно
Обычно позиция технологических компаний по спорным вопросам известна только по публичным заявлениям и PR. Здесь же в суде рассекретили внутренние документы и переписку, то, что сотрудники OpenAI и Microsoft писали и говорили друг другу до того, как это стало предметом судебного разбирательства. Формулировки вроде «крупнейшая кража труда в истории человечества» и «петля гибели» звучат не из уст критиков ИИ, а из внутренних материалов самих компаний-ответчиков. Для иска The New York Times против OpenAI и Microsoft это прямое свидетельство того, что компании осознавали вред своей стратегии обучения моделей на чужом контенте, и это меняет расстановку сил в деле о нарушении авторских прав.
Кому это важно
Издателям и СМИ, материал напрямую касается потери реферального трафика и угрозы их бизнес-модели. Индустрии генеративного ИИ, материал повышает юридические риски вокруг обучающих данных и трактовки добросовестного использования (fair use). Инвесторам и партнёрам OpenAI и Microsoft, а также юристам и регуляторам, которые следят за прецедентами по авторскому праву в эпоху ИИ. И читателям, которые всё реже переходят по ссылкам на первоисточники, пользуясь чат-ботами вместо поиска.
Как это применить
Для издателей рассекреченные материалы, повод жёстче требовать лицензионных условий за использование своего контента: сам Наделла говорил, что платный контент должен лицензироваться. Для компаний, работающих с генеративным ИИ, сигнал внимательнее относиться к тому, что фиксируется во внутренней переписке и презентациях: именно такие материалы становятся доказательствами в суде. Для читателей материал объясняет техническую причину падения трафика на сайты СМИ, переход аудитории на ИИ-сводки вместо перехода по ссылкам.
Можно ли доверять
Материал построен на прямых цитатах из документов, поданных в суд по делу The New York Times против OpenAI и Microsoft, включая внутреннюю переписку и показания (Наделла, Брокман и другие), а также официальный ответ Microsoft через представителя Алекса Хаурека и отдельное заявление Джордана Усдана, то есть приведены обе стороны: и рассекреченные цитаты, и опровержение/контекст от Microsoft. При этом дата рассекречивания документов в статье не уточняется (только «недавно»), а личность цитируемого «главы ChatGPT» на первое упоминание в источнике дана с оговоркой «предположительно» (позже названа прямо, Ник Тёрли). Итогового решения или вердикта по иску материал не сообщает.
Риски и подводные камни
Microsoft прямо настаивает, что слова Брента Хекта, личное мнение одного сотрудника, а не позиция компании, и что показания Наделлы касались общих принципов, а не юридических выводов по делу. Значит, при чтении стоит различать зафиксированные во внутренних документах факты и оценки, и их интерпретацию стороной NYT в рамках судебной стратегии. Материал не сообщает, как эти цитаты повлияют на исход дела: судебного решения пока нет.
«Крупнейшая кража труда в истории человечества.»
— Брент Хект, директор по прикладной науке Microsoft