Anthropic и OpenAI: независимое исследование нашло в их отчётах об использовании ИИ большие пробелы

Anthropic и OpenAI: независимое исследование нашло в их отчётах об использовании ИИ большие пробелы

Компании, которые делают ИИ-чат-ботов, Anthropic и OpenAI среди них, регулярно публикуют отчёты о том, как люди используют Claude, ChatGPT и подобные системы. Но эти отчёты показывают только те данные, которые компании сами решили раскрыть, а проверить их независимо было не на чем: своих переписок с пользователями компании никому не передают. Закрыть этот пробел решила группа исследователей из Стэнфорда, MIT, Data Provenance Initiative и других институтов, их проект называется AI Observatory. Соруководят проектом Анка Ройель, аспирантка лаборатории Stanford Trustworthy AI Research (STAIR) Lab, и Шейн Лонгпре, PhD из MIT Media Lab.

AI Observatory собрала 85 633 диалоговые пары (реплика пользователя плюс ответ модели) из 24 521 переписки, это данные о 5000 пользователей, которые общались с 52 разными моделями, включая ChatGPT, Gemini, Claude и Grok, в 2023, 2025 годах. Все переписки взяты из семи уже существующих датасетов, собранных с согласия пользователей в рамках более ранних исследований: AI Observatory не собирала новые разговоры, а объединила и переанализировала то, что уже существовало.

Один из самых известных и часто цитируемых источников статистики по ИИ, Anthropic Economic Index. Он сфокусирован на рабочем, продуктивном использовании Claude и отфильтровывает переписки, которые к работе не относятся. Когда исследователи AI Observatory применили ту же логику фильтрации к собственным данным, как нерабочие можно было отнести 48% переписок, почти половину. И именно среди этой нерабочей части оказалось заметно больше чувствительных тем, чем показывает анализ самой Anthropic: 44,2% (против 31,2% у Anthropic) касались здоровья и отношений, 7,9% (против 2,1%), контента для взрослых и незаконных тем, 27,5% (против 5,66%), харассмента и разжигания ненависти, 16,7% (против 2,4%), сексуального контента. У OpenAI похожая картина по её собственной статистике: в отчёте за 2025 год о ChatGPT она указала, что только 30% потребительского использования было связано с работой.

Anthropic и сама публиковала отдельные материалы о том, что Claude используют не только для работы: для эмоциональной поддержки, для общения-компаньонства, а в отдельных случаях, даже для создания материалов о сексуальном насилии над детьми (CSAM). Но, по словам Дэвида Уиддера, доцента Техасского университета в Остине, который изучает взаимодействие людей с ИИ-системами и в AI Observatory не участвовал, когда такие сведения «вынесены в отдельный отчёт», а не сведены в общую картину, исследователям сложнее понять контекст в целом. Общий, «панорамный» взгляд AI Observatory, по его словам, как раз и помогает увидеть это всё сразу, а не по частям.

Отдельно AI Observatory разобрала WildChat, один из самых крупных и подробных датасетов в своей выборке. Со временем переписки в нём становились длиннее и сложнее: росло число токенов в запросах и ответах, увеличивалось число реплик за разговор. Стало заметно больше «светской беседы», исследователи считают, что это косвенно говорит о росте компаньонского использования ИИ, а вот готовность самих моделей признаваться, что они боты, наоборот, снижалась. При этом доля переписок, которые исследователи разметили как чувствительные (потенциально вредный или ограниченный контент, включая сексуальный харассмент и разжигание ненависти), со временем сокращалась, это может говорить о том, что платформы стали эффективнее фильтровать такой контент.

Отличались и модели между собой. Grok и Gemini чаще использовали для поиска информации; Grok оказался особенно популярен для новостей и политики, и одновременно именно там, по данным исследователей, концентрировалась дезинформация (это совпадает и с другими исследованиями о том, как легко она распространяется в Grok; в xAI на запрос MIT Technology Review не ответили). Claude чаще использовали для кода, Gemini, для общения и ролевых игр, ChatGPT, для помощи с домашними заданиями. Разница была и между версиями одной модели: с GPT-3.5 разговоры в ChatGPT были короче, а с GPT-4o, длиннее и с большим числом итераций, что согласуется с репутацией этой версии, которую связывали с эмоциональной привязанностью пользователей. Такие различия, между моделями и даже между версиями одной и той же модели, отчёты компаний обычно не показывают. «Ни один отдельный отчёт компании не рассказывает всю историю целиком», резюмирует Лонгпре.

У AI Observatory всего 24 521 переписка, капля в море по сравнению с тем, что видят сами компании: последний Anthropic Economic Index построен на анализе миллиона переписок с Claude, а отчёт OpenAI о ChatGPT, на 1,5 миллиона переписок. Представитель Anthropic заявил, что публикации компании отражают конкретные вопросы и интересы её исследовательских команд и что компания считает важным поддерживать независимые исследования. OpenAI на запросы не ответила. Сами авторы AI Observatory признают ограничение своих данных: раз все переписки собраны только у пользователей, добровольно согласившихся ими поделиться, по-настоящему чувствительное использование в выборке, скорее всего, недопредставлено ещё сильнее, люди неохотно делятся именно такими разговорами. Поэтому исследователи прямо предупреждают: их результаты нельзя считать отражением всего использования ИИ в целом.

Проблема, впрочем, шире одного исследования. Компании, по словам независимых исследователей вроде Ройель и Уиддера, обычно не делятся своими данными о переписках для анализа, и потому их отчёты закономерно фокусируются на находках, которые выставляют компанию в выгодном свете. «Когда мы хотим спросить, например, используется ли универсальная ИИ-система Anthropic в основном во благо или в основном во вред, ответить на этот вопрос нам нечем, потому что эта информация закрыта», объясняет Уиддер. Данные AI Observatory станут доступны исследователям для анализа, а команда надеется со временем расширять выборку. В идеале, говорит Ройель, сами ИИ-компании делились бы данными с независимыми исследователями, конечно, с защитой приватности пользователей. Но пока, по её словам, любой, кто принимает решения на основе данных об использовании ИИ, «по сути действует вслепую и принимает по-настоящему важные решения, не зная, что происходит на самом деле, за рамками того, что рассказывают сами компании».

Ключевые факты

  • AI Observatory, проект Стэнфорда, MIT, Data Provenance Initiative и других институтов, впервые независимо проверил, как компании описывают использование своих чат-ботов: 85 633 диалоговые пары из 24 521 переписки 5000 пользователей с 52 моделями за 2023, 2025 годы, собранные из семи существующих датасетов.
  • Применив методологию Anthropic Economic Index к своим данным, исследователи выяснили, что 48% переписок были бы отфильтрованы как нерабочие; именно среди них резко больше чувствительных тем, чем в анализе самой Anthropic: 44,2% против 31,2% (здоровье и отношения), 7,9% против 2,1% (контент для взрослых), 27,5% против 5,66% (харассмент и разжигание ненависти), 16,7% против 2,4% (сексуальный контент).
  • У OpenAI похожая картина по её собственному отчёту за 2025 год: только 30% потребительского использования ChatGPT было связано с работой.
  • Использование разное по моделям: Grok и Gemini чаще берут для поиска информации (Grok особенно популярен для новостей и политики, и там же концентрируется дезинформация), Claude, для кода, Gemini, для общения и ролевых игр, ChatGPT, для домашних заданий; беседы с GPT-4o получались длиннее и с большим числом итераций, чем с GPT-3.5.
  • Anthropic ответила, что её публикации отражают интересы конкретных исследовательских команд и что компания поддерживает независимые исследования; OpenAI и xAI на запросы не ответили, а сами авторы AI Observatory предупреждают, что их выборка, скорее всего, недопредставляет чувствительное использование ещё сильнее, чем показывают цифры.

Почему это важно

Оценки того, как люди используют ИИ, не абстрактная статистика: на них опираются регуляторы и сами компании, когда решают, что в чат-ботах разрешать, а что ограничивать. До AI Observatory единственным источником такой статистики были сами Anthropic и OpenAI, а их отчёты по определению показывают ровно то, что компании решили показать, независимо проверить эти цифры было попросту не на чем. AI Observatory, первая попытка закрыть этот пробел данными, которые сами компании не контролируют.

Кому это важно

Прежде всего, регуляторам и политикам: они принимают решения об ограничениях для ИИ, опираясь на данные, которые компании публикуют сами о себе. Дальше, независимым исследователям ИИ и командам внутри самих компаний, которые отвечают за безопасность использования: результаты AI Observatory показывают, что чувствительного использования, от эмоциональной поддержки до харассмента, может быть значительно больше, чем показывают публичные отчёты. И наконец, всем, кто цитирует Anthropic Economic Index или отчёты OpenAI как объективную картину того, как люди используют ИИ: теперь у этой картины есть независимая проверка, и она расходится с тем, что публикуют сами компании.

Как это применить

Практический вывод для тех, кто читает отчёты об использовании ИИ: смотреть не только на итоговые цифры, но и на методологию, что именно отфильтровано и почему. Anthropic Economic Index описывает рабочее использование Claude и по конструкции не претендует на полную картину; выдавать его цифры за исчерпывающую статистику использования ИИ, ровно та ошибка, которую поймал AI Observatory. Для исследователей и журналистов данные AI Observatory обещают стать открытым ресурсом: команда планирует сделать их доступными для анализа и со временем расширять выборку. Ройель предлагает и системное решение, чтобы ИИ-компании делились данными с независимыми исследователями напрямую, защищая приватность пользователей, вместо того чтобы публиковать только то, что выгодно им самим.

Можно ли доверять

У AI Observatory прозрачная методология и солидная коалиция: Стэнфорд, MIT, Data Provenance Initiative и другие институты, данные собраны из семи уже существующих датасетов с согласия пользователей. Но есть и ограничения, которые проект не скрывает. Масштаб: 24 521 переписка AI Observatory, капля в море рядом с миллионом переписок, на которых построен Anthropic Economic Index, и полутора миллионами у OpenAI. Состав выборки: раз все данные, от пользователей, добровольно согласившихся ими поделиться, по-настоящему чувствительное использование в ней, скорее всего, недопредставлено ещё сильнее, чем показывают цифры, сами авторы прямо предупреждают, что результаты нельзя считать отражением всего использования ИИ. И ещё: источник не называет ни публикацию, ни рецензируемую площадку для этого исследования, только «новый исследовательский проект». При этом Anthropic на критику ответила: заявила, что её публикации отражают интересы конкретных исследовательских команд, и подчеркнула, что поддерживает независимые исследования; OpenAI и xAI на запросы не ответили.

Риски и подводные камни

Главный риск, принять цифры AI Observatory за окончательную и полную картину, хотя сам проект предупреждает об обратном: выборка меньше, чем у компаний, и смещена в сторону тех, кто согласился поделиться перепиской, то есть настоящая доля нерабочих переписок может быть выше, чем показали 48%. Дальше, риск для самих компаний: Anthropic уже публиковала материалы о том, что Claude используют не только для работы, но и для эмоциональной поддержки, компаньонства, а в отдельных случаях, даже для создания материалов о сексуальном насилии над детьми (CSAM); чем полнее независимая статистика, тем сложнее ограничивать разговор о рисках одними «рабочими сценариями». И методологический риск: цифры Anthropic и AI Observatory посчитаны на разных данных разными командами, поэтому прямое сравнение процентов, это оценка масштаба расхождения, а не результат строгого эксперимента на одной и той же выборке.

«Независимого источника, который мог бы это подтвердить, просто не существует»

— Анка Ройель, аспирантка Stanford Trustworthy AI Research (STAIR) Lab, соруководитель AI Observatory