Экс-сотрудник OpenAI поставил $100 млрд на данные для ИИ вместо масштабирования

Экс-сотрудник OpenAI поставил $100 млрд на данные для ИИ вместо масштабирования

Эндрю Хо, до недавнего времени, исследователь OpenAI, покинул компанию всего через восемь месяцев работы. Причина, убеждённость, что большие языковые модели плохо обобщают: даже в такой щедро финансируемой области, как программирование, их результаты нестабильны от задачи к задаче. По мнению Хо, корень проблемы не в архитектуре или размере моделей, а в нехватке данных: большинство экономически значимых навыков почти никак не представлено в существующих обучающих наборах. Он поясняет: «Большая часть работы сильно зависит от контекста и плохо поддаётся формализации в среду с чёткой оценкой; даже если мы видим «эталонный путь», пройденный человеком, который считаем удачным, трудно понять, приведут ли альтернативные, контрфактические пути к хорошему или плохому результату».

По мнению Хо, простое масштабирование эту проблему не решит, он ожидает, что в ближайшие годы ИИ-лаборатории потратят на целевой сбор данных более $100 млрд. Он же скептически относится к заоблачным оценкам стоимости компаний вроде OpenAI и Anthropic: по его словам, они хронически убыточны, потому что вынуждены вкладывать всё больше денег в новые модели, просто чтобы не отстать от более дешёвых конкурентов вроде Qwen и Kimi.

Свой стартап Хо запускает с двумя направлениями. Первое, датасеты для сложного научного анализа в биоинформатике: даже нынешние модели вроде GPT-5.6 Sol справляются с такими задачами лишь примерно в 30% случаев; этой темой Хо занимался ещё в OpenAI. Второе, датасеты для рутинной лабораторной работы, например когда исследователи присылают ИИ-моделям фотографии экспериментов на оценку. В планах, химия, материаловедение, здравоохранение и более широкий класс интеллектуальных задач.

Скепсис Хо разделяет исследователь из Кембриджа Адам Хант: по его словам, собственный взгляд на языковые модели сместился с оптимистичного на всё более пессимистичный. Хант считает, что последние модели становятся не универсальнее, а специализированнее: способности к программированию и сложной математике продолжают расти, а качество языка и простая логика стагнируют или даже ухудшаются, это совпадает с наблюдением Хо о неравномерных результатах. Причина, по Ханту, в том, что обучение с подкреплением хорошо работает в такой области, как код, потому что там есть чёткие сигналы вознаграждения и полные обучающие данные; в других областях таких данных просто нет. Ранние успехи языковых моделей и их кажущаяся способность обобщать за счёт одного лишь масштаба и рассуждений были побочным эффектом обучения на широком текстовом корпусе, а не признаком настоящего общего понимания.

Вопрос об обобщении остаётся открытым: могут ли языковые модели развить способности, выходящие за рамки воспроизведения и комбинирования обучающих данных, особенно там, где результат нельзя автоматически проверить? Единого мнения у учёных нет. Сам Хант оценивает уверенность в собственном пессимистичном взгляде лишь примерно в 40% и признаёт, что технический прогресс может его опровергнуть, например, если удастся объединить специализированные ИИ-модели во что-то похожее на более общий интеллект.

В недавней позиционной статье под названием «Языковые модели не умеют прыгать» (в оригинале, "LLMs can't jump") Том Захави из Google DeepMind предлагает структурное объяснение неравномерности моделей. По его словам, языковые модели хорошо справляются с дедукцией и индукцией, но терпят неудачу в творческой абдукции, способности изобрести причину, для которой ещё не существует языкового прецедента. В качестве возможного решения Захави указывает на управляемые действием модели мира (world model), которые позволяют ставить контрфактические эксперименты. Языковые модели всё ещё могут играть в таких продвинутых системах ключевую роль, даже если поодиночке упираются в собственные ограничения.

Ключевые факты

  • Эндрю Хо покинул OpenAI через восемь месяцев и запустил стартап по сбору качественных данных для ИИ, не веря в то, что масштабирование само по себе научит модели обобщать.
  • Хо прогнозирует, что ИИ-лаборатории потратят на целевой сбор данных свыше $100 млрд, и называет оценки стоимости OpenAI и Anthropic завышенными из-за хронической убыточности этих компаний.
  • Первые датасеты стартапа, для биоинформатики (модели вроде GPT-5.6 Sol решают такие задачи лишь примерно в 30% случаев) и для рутинной лабораторной работы.
  • Кембриджский исследователь Адам Хант поддерживает скепсис Хо: по его наблюдениям, новые модели становятся специализированнее, а не универсальнее, а свою уверенность в этом выводе он оценивает лишь в 40%.
  • Исследователь Google DeepMind Том Захави в статье «Языковые модели не умеют прыгать» объясняет провалы моделей неспособностью к творческой абдукции и предлагает решение через управляемые модели мира.

Почему это важно

Материал бросает вызов главной ставке индустрии, идее, что дальнейшее масштабирование моделей само по себе даст более универсальный интеллект. Три независимых источника (бывший сотрудник OpenAI, исследователь Кембриджа, исследователь Google DeepMind) указывают на нехватку данных и структурные ограничения языковых моделей как на более вероятную причину неравномерного прогресса, чем недостаток вычислительных мощностей.

Кому это важно

ИИ-лабораториям и инвесторам, которые оценивают компании вроде OpenAI и Anthropic исходя из веры в дальнейший рост от масштабирования; исследователям и инженерам, работающим над обобщением моделей; учёным и лабораториям в биоинформатике, химии и материаловедении, именно для них Хо строит первые продукты своего стартапа.

Как это применить

Компаниям, зависящим от качества ИИ в специализированных областях, стоит рассматривать целевой сбор и разметку данных как отдельную статью инвестиций, а не полагаться на то, что более крупная модель сама справится с задачей. Для лабораторий и научных команд датасеты нового стартапа (биоинформатика, а затем химия и материаловедение) могут стать способом проверки моделей на реальных задачах, а не только на привычных бенчмарках.

Можно ли доверять

Скепсис по поводу масштабирования подкреплён независимыми выводами исследователей Кембриджа и Google DeepMind, что повышает доверие к общей картине. Но конкретный прогноз в $100 млрд, оценка одного человека, который только что основал стартап, продающий именно такие данные, то есть прямо заинтересован в этом нарративе; сам Хант оценивает уверенность в своей версии лишь в 40%. Цифру в 30% успеха для GPT-5.6 Sol стоит воспринимать как результат одного конкретного бенчмарка Хо, а не как универсальный показатель.

Риски и подводные камни

Прогноз в $100 млрд, спекулятивная оценка без раскрытой методологии расчёта, а не подтверждённая цифра. Позиция Хо небеспристрастна: он зарабатывает на продаже данных, которые сам же называет решением проблемы. Дебаты об обобщении моделей далеки от завершения, и даже сторонники пессимистичного взгляда (Хант) признают высокую вероятность ошибиться.

«Большая часть работы сильно зависит от контекста и плохо поддаётся формализации в среду с чёткой оценкой; даже если мы видим «эталонный путь», пройденный человеком, который считаем удачным, трудно понять, приведут ли альтернативные, контрфактические пути к хорошему или плохому результату.»

— Эндрю Хо, экс-исследователь OpenAI