ИИ-стартапы-единороги почти не публикуют научные работы

Новое библиометрическое исследование проанализировало научную публикационную активность примерно 317 ИИ-стартапов-единорогов (оценённых в $1 млрд и выше), а также ещё 17 их прежних названий, возникших из-за слияний и ребрендингов. Данные собирались из трёх баз: Web of Science Core Collection, INSPEC и Preprint Citation Index; в выборку не включали крупные устоявшиеся компании вроде Google и не учитывали публикации после 2025 года.

По количеству цитирований среди изученных компаний лидируют OpenAI, MEGVII, Hugging Face, Waymo, Momenta, Preferred Networks, Anthropic, Owkin, Databricks и Aibee. При этом основной вывод исследования в том, что подавляющее большинство остальных ИИ-единорогов почти не публикует рецензируемых научных работ вовсе, вместо этого компании ограничиваются блог-постами и препринтами без прохождения научного рецензирования. Авторы используют коэффициент Джини и кривые Лоренца, чтобы показать, что публикационная активность крайне неравномерна: заметный вклад дают буквально несколько компаний, а остальные почти не представлены в научной литературе.

Специалист по этике ИИ Мохамед Абдалла из Университета Альберты в связи с этим замечает, что задача компании, не продвигать науку, а зарабатывать деньги, объясняя нежелание стартапов делиться результатами исследований экономическими стимулами: публикация раскрывает конкурентам детали технологий, которые компании предпочитают держать в секрете.

Ключевые факты

  • Изучены около 317 ИИ-стартапов-единорогов (оценка от $1 млрд) плюс 17 их прежних названий; данные, из Web of Science Core Collection, INSPEC и Preprint Citation Index
  • Из выборки исключены крупные устоявшиеся компании вроде Google, а также публикации после 2025 года
  • По цитируемости лидируют OpenAI, MEGVII, Hugging Face, Waymo, Momenta, Preferred Networks, Anthropic, Owkin, Databricks и Aibee, остальные компании почти не представлены в научной литературе
  • Коэффициент Джини и кривые Лоренца показывают, что публикационная активность в отрасли крайне неравномерна и сосредоточена у горстки фирм
  • Специалист по этике ИИ Мохамед Абдалла (Университет Альберты): задача компании, не наука, а деньги, поэтому раскрывать детали исследований конкурентам стартапам невыгодно

Почему это важно

Ажиотаж вокруг ИИ строится на образе индустрии, которая двигает науку вперёд, но исследование показывает, что подавляющее большинство ИИ-стартапов-единорогов почти не публикует рецензируемых научных работ. Заметный вклад в открытую науку дают буквально несколько компаний, а остальные ограничиваются маркетинговыми блог-постами и препринтами без научной проверки. Это ставит под вопрос модель, на которой десятилетиями держался прогресс в вычислительной технике: открытая публикация результатов, доступных всей отрасли и академии.

Кому это важно

Учёным и университетам, которые полагаются на открытую литературу, чтобы отслеживать реальный прогресс отрасли, а не PR-заявления. Инвесторам и регуляторам, оценивающим, стоит ли за громкой оценкой стартапа реальная научная работа. Другим ИИ-компаниям и разработчикам, которые строят свои продукты на основе открытых исследований. Журналистам, которым присылают анонсы прорывов без научного подтверждения.

Как это применить

Читателю и журналисту стоит проверять заявления ИИ-стартапа о «прорыве» не по блог-посту компании, а по наличию рецензируемой публикации в базах вроде Web of Science или INSPEC. Инвестору, учитывать, что высокая оценка компании не обязательно означает вклад в науку: часть единорогов из выборки вообще не имеет заметных публикаций. Исследователям, использовать открытый методологический подход (доступный код и данные) как образец при оценке публикационной активности отрасли.

Можно ли доверять

Источник, библиометрическое исследование, опубликованное через Science.org и обсуждаемое на Hacker News (309 баллов, 168 комментариев); прямая страница статьи Science.org вернула ошибку доступа (HTTP 403), поэтому пересказ собран из обсуждения на Hacker News и публичного репозитория с кодом исследования на GitHub. Методология открыта и проверяема: три конкретные библиометрические базы данных, явно указанный размер выборки (около 317 компаний плюс 17 вариантов названий) и воспроизводимый программный конвейер сбора и очистки данных, это повышает доверие к результатам по сравнению с непроверяемыми оценками на глаз.

Риски и подводные камни

Число цитирований, не идеальный показатель научного вклада: он не учитывает внутренние технические отчёты и разработки, которые компании намеренно держат в секрете по конкурентным причинам, отсутствие публикаций не равно отсутствию исследований. Выборка ограничена официальным списком единорогов и не включает Google и другие крупные лаборатории, а также обрезана по дате (до 2025 года), что может искажать картину для самых новых компаний. Само распределение отрасли, где активность сосредоточена у нескольких лидеров вроде OpenAI, делает выводы о «типичном» стартапе чувствительными к тому, как именно считать среднее.

«Разве не работа компании, развивать науку? Нет, работа компании, зарабатывать деньги»

— Мохамед Абдалла, специалист по этике ИИ, Университет Альберты