Micro1 нарастила валовый run rate до $500 млн на фоне бума данных для обучения ИИ

Micro1 нарастила валовый run rate до $500 млн на фоне бума данных для обучения ИИ

Micro1, четырёхлетний стартап, который размечает данные для обучения ИИ-моделей силами нанятых по контракту экспертов: врачей, юристов, учёных. По данным источника, знакомого с положением дел в компании, за последние восемь месяцев валовый run rate Micro1 (валовая выручка в пересчёте на год) вырос с $100 млн до $500 млн. Из этой суммы сама компания удерживает, по оценке того же источника, примерно 30, 40%, то есть чистый run rate составляет от $150 млн до $200 млн в год.

По масштабу Micro1 всё ещё уступает конкурентам: Mercor этим летом вышел на $2 млрд валовой годовой выручки, а Handshake ранее в этом году достиг $1 млрд (источник не уточняет, валовая это цифра у Handshake или чистая). Тем не менее, по оценке TechCrunch, рост выручки Micro1 показывает, что спроса на данные для обучения ИИ достаточно, чтобы прокормить сразу несколько крупных игроков рынка. Некоторые исследователи допускают, что в будущем расходы индустрии ИИ на данные могут сравняться с расходами на вычислительные мощности.

У Micro1 растёт средний размер контракта, и компания рассчитывает и дальше наращивать маржинальность. Всё больше данных стартап генерирует синтетически, без участия людей, например, автоматические описания видеоконтента. Часть таких «готовых» датасетов Micro1 продаёт сразу нескольким заказчикам, и, по словам источника, знакомого с финансами стартапа, маржа по этому сегменту доходит до 80, 90%.

Именно продажа одних и тех же датасетов разным клиентам вызвала недавно споры: критики утверждают, что поставка «готовых» данных китайским разработчикам ИИ помогает их моделям приближаться по возможностям к лучшим американским. Основатель Micro1 Али Ансари в прошлом месяце написал в X, что, в отличие от некоторых конкурентов, его компания не продаёт данные китайским разработчикам моделей: «Некоторые компании, занимающиеся разметкой данных силами людей, работают с иностранными противниками. И результаты этого видны уже сегодня, в Kimi K3. Мы считаем позорным заявлять о стремлении к американскому доминированию в сфере ИИ и одновременно продавать данные на миллионы странам, с которыми мы находимся в отношениях враждебной конкуренции».

Micro1, как и конкурент Mercor, начинала как стартап для ИИ-подбора персонала. Ансари переключился на разметку данных, заметив, что клиенты, которым нужна разметка, использовали его платформу подбора персонала, чтобы находить и проверять разметчиков. Ранее Ансари рассказывал TechCrunch, что помимо оценки экспертами результатов работы моделей (эту практику называют reinforcement learning gyms), компания также собирает датасет для предобучения роботов: сотни привлечённых людей записывают у себя дома, как они взаимодействуют с обычными предметами.

Micro1 привлекла раунд Series A по оценке $500 млн в сентябре прошлого года, это тот же порядок цифр, что и нынешний run rate компании, но показатели разные: тогда $500 млн было оценкой всей компании, а не темпом выручки. По данным TechCrunch, стартап, возможно, недавно закрыл ещё один раунд по значительно более высокой оценке, но это не подтверждено, и точная цифра неизвестна. Сама Micro1 на запрос редакции о комментарии не ответила.

Ключевые факты

  • Валовый run rate Micro1 вырос со $100 млн до $500 млн за восемь месяцев; чистый показатель, по оценке источника, $150, 200 млн (30, 40% от валового).
  • Конкуренты крупнее: Mercor этим летом вышел на $2 млрд валовой годовой выручки, Handshake ранее в этом году, на $1 млрд.
  • Маржа по «готовым» синтетическим датасетам, которые Micro1 продаёт сразу нескольким клиентам, доходит до 80, 90%.
  • Основатель Али Ансари заявил в X, что Micro1, в отличие от некоторых конкурентов, не продаёт данные китайским разработчикам моделей, на фоне критики за такие продажи среди других компаний рынка.
  • Micro1 привлекла Series A по оценке $500 млн в сентябре прошлого года; по данным TechCrunch, возможно, недавно закрыла новый раунд по более высокой оценке (не подтверждено).

Почему это важно

Рост Micro1, ещё одно подтверждение того, что бум обучения больших ИИ-моделей породил самостоятельный и быстрорастущий рынок вокруг данных, а не только вокруг вычислительных мощностей и чипов. То, что сразу три компании, Micro1, Mercor и Handshake, независимо друг от друга довели выручку до сотен миллионов и миллиардов долларов, показывает: спрос лабораторий и корпораций на размеченные людьми данные для обучения ИИ ещё далёк от насыщения. Некоторые исследователи допускают, что в будущем расходы индустрии ИИ на данные могут сравняться с расходами на вычислительные мощности, то есть данные становятся таким же узким местом и таким же дорогим ресурсом, как GPU.

Кому это важно

Крупным ИИ-лабораториям и корпорациям, которые покупают размеченные данные для обучения моделей, у них появляется больше альтернативных поставщиков и, соответственно, больше рычагов в переговорах о цене. Самим Micro1, Mercor, Handshake и похожим стартапам, рынок явно выдерживает несколько крупных игроков одновременно, а не только одного лидера. Врачам, юристам, учёным и другим экспертам, которых такие компании нанимают по контракту размечать данные и оценивать ответы моделей, это ещё один канал подработки. И тем, кто следит за конкуренцией США и Китая в сфере ИИ, эпизод с продажей данных китайским разработчикам моделей показывает, что рынок разметки данных стал ещё одной точкой трения в этом противостоянии.

Как это применить

Если вы покупаете размеченные данные для обучения моделей, есть смысл сравнивать предложения не одного поставщика: рынок уже поддерживает несколько крупных игроков (Micro1, Mercor, Handshake) с разной специализацией и ценой. Для тех, кто строит бизнес в этой нише, показателен манёвр Micro1: помимо разметки на заказ, компания продаёт одни и те же «готовые» синтетические датасеты сразу нескольким клиентам, это поднимает маржу этого сегмента до 80, 90% против типичных 30, 40% удержания на индивидуальных контрактах и масштабируется без пропорционального роста числа нанятых экспертов.

Можно ли доверять

Ключевые цифры, рост выручки со $100 млн до $500 млн, разбивка на валовый и чистый run rate, маржа 80, 90% по «готовым» датасетам, исходят не от самой Micro1, а от анонимных источников: «человека, знакомого с положением дел в компании» и, отдельно, «человека, знакомого с финансами стартапа». На прямой запрос TechCrunch о комментарии Micro1 не ответила, то есть компания эти цифры публично не подтвердила. Даже сам TechCrunch называет возможный новый раунд Micro1 по более высокой оценке лишь предположением, а не подтверждённым фактом, и не приводит по нему никаких точных цифр.

Риски и подводные камни

Главный риск сюжета, контроль над тем, кому в итоге попадают такие данные. Раз одни и те же «готовые» датасеты продаются сразу нескольким заказчикам, критики утверждают, что часть таких данных попадает и китайским разработчикам ИИ, помогая их моделям приближаться по возможностям к лучшим американским; в цитате Ансари фигурирует «Kimi K3», источник не поясняет, что это и как именно это связано с Micro1. Сам Ансари отрицает, что его компания продаёт данные китайским разработчикам моделей, но это утверждение подтверждено только его собственным постом в X, независимой проверки в материале нет. Дополнительный источник неопределённости, сами финансовые цифры: они получены от анонимных источников, а не от самой компании, а точная текущая оценка Micro1 (после возможного нового раунда) в материале не названа вовсе.

«Некоторые компании, занимающиеся разметкой данных силами людей, работают с иностранными противниками. И результаты этого видны уже сегодня, в Kimi K3. Мы считаем позорным заявлять о стремлении к американскому доминированию в сфере ИИ и одновременно продавать данные на миллионы странам, с которыми мы находимся в отношениях враждебной конкуренции.»

— Али Ансари, основатель Micro1, пост в X