Экс-вице-президент DeepMind Виньялс: ИИ будет улучшать себя, но без взрыва интеллекта

Экс-вице-президент DeepMind Виньялс: ИИ будет улучшать себя, но без взрыва интеллекта

Ориол Виньялс, до недавнего времени вице-президент по исследованиям Google DeepMind, где он работал над AlphaStar, AlphaCode и Gemini, через несколько дней после ухода из компании выступил на конференции Agentic AI Summit 2026 с разбором рекурсивного самосовершенствования (RSI) в системах ИИ. Его вывод: сам процесс неизбежен, но медленный и постепенный, внезапного, самоускоряющегося взрыва интеллекта он не ожидает. По оценке Виньялса, ИИ уже способен ускорить некоторые исследовательские и инженерные задачи в десять раз и больше, но это не превращается в резкий рывок к сверхразуму.

Виньялс начинает с вопроса, что вообще должно улучшаться. У системы ИИ много подвижных частей, и изменить можно любую: веса нейросети, обучающие данные, сами методы обучения, инструкции, которые модель получает при каждом запросе, внешние инструменты вроде доступа к базам данных и выполнения кода, и даже метрики, которыми система измеряет собственный прогресс. У каждого варианта, свои технические и регуляторные сложности.

Чтобы улучшить себя, система ИИ должна: придумать перспективную идею, написать код, который её реализует, поставить эксперимент, который её проверяет, и получить надёжный способ судить, помогла ли идея на самом деле. По словам Виньялса, ИИ уже неплохо справляется со средними двумя шагами, кодом и экспериментами, а вот генерация идей и оценка результатов остаются главными узкими местами.

Сегодня лаборатории измеряют самосовершенствование косвенно, через бенчмарки вроде SWE-Bench Pro и ML-Bench, поднимаясь в рейтинге и надеясь, что настоящее самосовершенствование возникнет как побочный эффект. Такие тесты дёшевы и чётко определены, но проверяют в основном реализацию и эксперименты, то, что и так уже получается. Опираясь на собственный опыт создания игровых агентов, Виньялс напоминает о переобучении и попытках обхитрить систему подсчёта очков: системы находят неожиданные способы обыграть саму метрику, а не по-настоящему решить задачу. Появляются и более прямые тесты самосовершенствования: системе дают метрику и бюджет вычислений и замеряют, насколько она улучшает сама себя. Такая оценка дорога, потому что требует часов работы агента над вспомогательными задачами, далёкими от конечной цели: в примере Виньялса агент оптимизирует игру в тетрис, а реальная цель, автоматизировать целую исследовательскую лабораторию и построить лучшую в мире модель.

Генерация идей развита не лучше. Хорошее исследование требует чутья, какие идеи вообще стоит разрабатывать, то, что Виньялс называет «исследовательским чутьём» (в оригинале, research taste); по его словам, никто всерьёз не изучал, как обучать этому в тренировке языковых моделей. Он ожидает, что будущие оценки станут измерять не только то, насколько система улучшилась, но и то, как именно она к этому пришла: для идей это те же критерии, что применяют рецензенты конференций, оригинальность, элегантность, эффективность и то, выдерживает ли приём проверку временем. Часть этого можно закрепить в правилах и моделях вознаграждения и обучать через обучение с подкреплением, но это очень трудно и потребует времени; человеческое рецензирование тоже дорого и не особо хорошо находит по-настоящему сильные идеи. Виньялс указывает и на чисто физические ограничения: чипы не могут считать быстрее, чем позволяют их конструкция и скорость света, так что даже более удачный алгоритм ИИ всё равно упирается в железо, на котором работает. В некоторых областях человеческая производительность, возможно, уже близка к некоему пределу, насколько хорош AlphaGo на самом деле по сравнению с идеальной партией в го, по словам Виньялса, не знает никто.

Свой анализ Виньялс переводит в практику: он запускает стартап Discovery Loop вместе с Джеффом Дином в роли генерального директора, старшим научным сотрудником Google Санджаем Гемаватом и сооснователем Google Brain Куоком Ле. Трое из четырёх основателей входят в число самых цитируемых исследователей ИИ, а Гемават, среди самых цитируемых в области распределённых систем. Компания намерена автоматизировать весь научный цикл, от формулировки гипотез до постановки экспериментов и оценки результатов, включая как раз те два шага, где ИИ пока отстаёт. По словам Дина, команда сначала автоматизирует ИИ-исследования, а первым клиентом Discovery Loop станет сама компания; другие научные области подключат позже. На сайте компании основатели описывают будущее, где «горстка людей сможет вести научные исследования и инженерные разработки гораздо быстрее и качественнее, чем сегодня это делают огромные команды учёных и инженеров». Сам Виньялс признаёт, что генерация идей, самая сложная часть, поэтому на раннем этапе гипотезы будут формировать вместе люди и машины.

Ключевые факты

  • Ориол Виньялс, до недавнего времени вице-президент по исследованиям Google DeepMind (работал над AlphaStar, AlphaCode и Gemini), выступил на Agentic AI Summit 2026 через несколько дней после ухода из компании.
  • Он считает рекурсивное самосовершенствование ИИ неизбежным, но постепенным: ускорение исследовательских и инженерных задач в 10 раз и больше, да, внезапный самоускоряющийся взрыв интеллекта, нет.
  • Главные узкие места, генерация идей и оценка результатов: с кодом и экспериментами ИИ уже справляется, а «исследовательского чутья», понимания, какие идеи стоит развивать, ему не хватает.
  • Виньялс запускает стартап Discovery Loop с Джеффом Дином (гендиректор), Санджаем Гемаватом и Куоком Ле, автоматизировать весь научный цикл, от гипотез до оценки результатов, начиная с самих ИИ-исследований.
  • У самосовершенствования есть и физический потолок: чипы не могут считать быстрее, чем позволяют их конструкция и скорость света, так что даже лучший алгоритм упирается в железо.

Почему это важно

Это чёткий, разложенный по шагам ответ на один из самых обсуждаемых сейчас вопросов в исследованиях ИИ, рекурсивное самосовершенствование и то, ждать ли от него внезапного, самоускоряющегося взрыва возможностей. Виньялс не ограничивается общими словами: он раскладывает самосовершенствование на четыре конкретных шага, идея, код, эксперимент, оценка результата, и показывает, какие из них ИИ уже освоил, а какие остаются узким местом. Это смещает разговор от общих прогнозов к конкретным инженерным барьерам: генерации идей и оценке результатов. И это не только тезис для конференции, Виньялс подкрепляет его собственным стартапом Discovery Loop, нацеленным ровно на эти два узких места, а среди сооснователей, одни из самых цитируемых исследователей Google.

Кому это важно

Прежде всего, исследователям и лабораториям, которые строят агентные системы для автоматизации собственных экспериментов и кода: разбор Виньялса на идею, код, эксперимент и оценку и его предупреждение о переобучении под метрику дают готовую рамку для проверки собственных систем. Полезно и тем, кто следит за сроками появления по-настоящему самосовершенствующихся систем ИИ, аргумент против внезапного взрыва интеллекта звучит от человека, лично строившего AlphaStar и Gemini, а не со стороны. Интересно это и рынку труда в ИИ: уход Виньялса и запуск стартапа с Джеффом Дином, Санджаем Гемаватом и Куоком Ле показывает, куда движется часть самых опытных исследователей Google. Меньше пользы тем, кто ищет готовый продукт или конкретные сроки: у Discovery Loop пока нет ни релиза, ни объявленного финансирования.

Как это применить

Командам, которые строят агентные системы для собственных исследований и кода, полезно сначала проверить, что именно измеряет их бенчмарк: SWE-Bench Pro и ML-Bench, по словам Виньялса, в основном покрывают реализацию и эксперимент, шаги, которые ИИ и так уже освоил, а не генерацию идей или оценку результатов. Если система оценивается напрямую, метрика плюс бюджет вычислений, стоит закладывать защиту от переобучения и попыток обхитрить саму метрику: агенты умеют находить способ выиграть по очкам, не решив задачу по существу. Такая прямая оценка вдобавок дорога, она требует долгих прогонов агента на вспомогательных задачах, которые сами по себе далеки от конечной цели. Собственный план Discovery Loop можно взять как шаблон: начинать автоматизацию со своей же области (у Discovery Loop это ИИ-исследования, а первый клиент, сама компания) и на раннем этапе не убирать человека из генерации гипотез полностью, а строить связку «человек плюс машина».

Можно ли доверять

У Виньялса есть прямая техническая база под этим аргументом: он лично работал над AlphaStar, AlphaCode и Gemini и годами строил игровых агентов, на практике видел, как системы обыгрывают систему подсчёта очков вместо самой задачи, это опыт, а не умозрительное рассуждение. Но стоит учитывать и конфликт интересов: его новый стартап Discovery Loop создан ровно для того, чтобы решить те же два узких места, генерацию идей и оценку, которые он только что публично назвал главными барьерами, то есть постановка проблемы удобно совпадает с питчем его же компании. В тексте нет ни конкретных цифр цитируемости сооснователей, ни результатов на SWE-Bench Pro или ML-Bench, ни данных о финансировании Discovery Loop, заявления о самых цитируемых исследователях и амбициях компании пока держатся на репутации основателей, а не на проверяемых цифрах.

Риски и подводные камни

Сам тезис может быстро устареть: Виньялс признаёт, что оценивать стоит не только объём улучшения, но и то, как именно оценивались сами идеи, а обучать этому «исследовательскому чутью» в тренировке моделей, по его словам, всерьёз ещё никто не изучал. Иначе говоря, оба барьера, которые он называет главными, это ещё и области с наименее устоявшейся методологией: прогресс здесь, возможно усилиями самого Discovery Loop, может изменить всю картину быстро и непредсказуемо. Переобучение и обыгрывание метрики, не гипотетический риск, а проблема, которую Виньялс называет знакомой по собственному опыту с игровыми агентами: система может выглядеть «улучшившейся» по метрике, не решив задачу на самом деле, и отличить одно от другого сложно. Наконец, Discovery Loop, компания на стадии идеи: без объявленного финансирования, сроков и готового продукта её способность реально автоматизировать весь научный цикл пока ничем не подтверждена, кроме репутации основателей.

«Горстка людей сможет вести научные исследования и инженерные разработки гораздо быстрее и качественнее, чем сегодня это делают огромные команды учёных и инженеров.»

— основатели Discovery Loop, на сайте компании