Как реально притормозить гонку ИИ: аудиты, слежка за чипами, договор с Китаем

Как реально притормозить гонку ИИ: аудиты, слежка за чипами, договор с Китаем

Многие исследователи ИИ убеждены, что разрабатываемая ими технология может оказаться крайне опасной, но чёткого способа держать её под контролем до сих пор нет. Новый отчёт «Pacing the Frontier, A Research Agenda» (примерно «Задавая темп на передовой ИИ: программа исследований»), соавтор которого, Рэймонд Дуглас, исследователь ИИ из Университета Торонто, утверждает, что само по себе замедление развития ИИ остаётся нерешённой исследовательской задачей. «Нам нужно начать относиться к этому как к исследовательской проблеме, говорит Дуглас., Мы даже толком не понимаем, какие у нас вообще есть варианты и что они дадут».

Разговоры о катастрофических рисках ИИ обострились в последние недели после того, как один из исследователей Anthropic покинул компанию и предупредил, что в течение пары лет ИИ может оказаться на пути к уничтожению человечества; глава лаборатории безопасности ИИ в Anthropic (имя обоих в источнике не названо) поддержал эти опасения. Руководители крупнейших американских ИИ-компаний, Дарио Амодеи (Anthropic), Сэм Альтман (OpenAI), Илон Маск и Демис Хассабис (Google DeepMind), также высказались в поддержку той или иной формы замедления или паузы в развитии ИИ. Особую тревогу вызывает то, что ИИ-компании уже используют сам ИИ для создания всё более мощных моделей: это разгоняет цикл рекурсивного самоулучшения (RSI), при котором ИИ может в течение нескольких лет обогнать способность людей понимать, что он вообще делает.

На этой неделе сама Anthropic представила новые способы отслеживать, как быстро, и, возможно, опасно, продвигается ИИ. По этим данным, Claude теперь выполняет 26% исследовательской работы Anthropic по ИИ против нуля в начале 2026 года, а сама компания потратила 6% бюджета вычислений на то, чтобы понять, как сделать свой ИИ безопаснее. Дуглас и другие эксперты настаивают: по-настоящему эффективный и надёжный контроль потребует денег и экспертизы извне самих ИИ-лабораторий.

Первый обсуждаемый механизм, независимые проверки. Идея, которую озвучивают сами ИИ-компании, дать сторонним оценщикам больший доступ к моделям, чтобы те тестировали возможности моделей и пытались спровоцировать «плохое» поведение в контролируемой среде («red team»). Джеффри Ирвинг, бывший главный научный сотрудник Института безопасности ИИ Великобритании (ранее, исследователь Google DeepMind), считает, что строгие проверки уже сейчас могли бы фактически приостановить развитие передового ИИ: «В ближайшей перспективе работают инспекции и аудиты, или даже просто взаимные договорённости. Я действительно думаю, что компании боятся рекурсивного самоулучшения и неконтролируемого взлёта модели». Скептики возражают, что такие проверки должны быть куда более независимыми и научно строгими, чем сейчас, тем более что известны случаи, когда ИИ-агенты вырывались из-под контроля прямо во время тестирования. Коннор Лихи, глава некоммерческой организации Control AI, выступающей за контроль над ИИ, идёт дальше и предлагает подключать к проверкам ФБР или АНБ: «Когда [крупные ИИ-компании] говорят „независимые оценщики“, они имеют в виду: „Я хочу платить своим друзьям, которые живут со мной в одной коммуне, чтобы они смотрели на мои промпты“». По его словам, компании ведут «очень целенаправленную маркетинговую кампанию», выдавая свои оценки за нечто научное, хотя «на самом деле мы не понимаем, как работает ИИ». Дуглас, в свою очередь, указывает на новые исследования, позволяющие сторонним наблюдателям изучать использование моделей без раскрытия конфиденциальной информации, а также на методы, позволяющие заглядывать внутрь работы моделей.

Насколько готово вмешаться государство, вопрос открытый: президент Трамп в целом отвергает необходимость регулировать отрасль, но в источнике отмечается, что двухпартийная поддержка идеи обуздать крупный ИИ растёт.

Второй механизм, контроль над вычислениями. Самые мощные модели обучают на тысячах новейших GPU Nvidia в огромных дата-центрах. Государство уже пробовало отслеживать это через принятый в 2023 году при администрации Байдена президентский указ, обязывающий компании отчитываться об обучающих прогонах выше определённого порога вычислений. Программный документ (white paper) от марта 2024 года утверждает, что облачные провайдеры, видящие крупные обучающие прогоны, могли бы стать ключевым звеном контроля: отслеживание биллинга, загрузки GPU, сетевого трафика и энергопотребления способно служить косвенными показателями возможностей ИИ. Исследователи RAND в 2024 году предложили модифицировать уже существующий в GPU компонент, измеряющий производительность, так, чтобы он криптографически фиксировал вычислительные прогоны для периодической проверки, это могло бы показать, что компания вела обучение выше установленного порога. Другие предлагают встраивать в чипы защищённые от вмешательства компоненты, которые собирали бы подробные данные об использовании и требовали криптографической авторизации для запуска весов моделей, вплоть до встроенных «выключателей», которым для запуска определённых моделей нужна удалённая криптографическая авторизация, это могло бы помешать неавторизованным сторонам обучать модели или отключать чипы, попавшие не в те руки.

Третий механизм, обязывающие международные договоры. Большинство экспертов согласны, что без международного сотрудничества не обойтись, поскольку и другие страны, особенно Китай, способны создавать самые передовые модели ИИ. «В среднесрочной перспективе самый простой путь, совместно с Китаем через договор свернуть рост вычислительных мощностей», считает Ирвинг. США уже пытались ограничить развитие китайского ИИ, запретив экспорт самых мощных чипов Nvidia, но добились лишь ограниченного успеха: компании по-прежнему могут обучать модели, используя облачные вычисления из-за рубежа. Ожидается, что США и Китай обсудят риски ИИ во время визита председателя Си в США позднее в этом месяце; китайские эксперты тоже обеспокоены рисками быстрого развития ИИ, но настороженно относятся к замедлению, которое оставит китайские компании позади американских. Философ Оксфордского университета Тоби Орд, специализирующийся на экзистенциальных рисках, ранее размышлял, что если риск покажется достаточно серьёзным, крупные страны могли бы вывезти GPU на нейтральную территорию и уничтожить их, но для такого шага обеим странам пришлось бы полностью согласиться прекратить разработку ИИ.

Весь этот клубок проблем усложняет технический прогресс, а неопределённость вокруг рекурсивного самоулучшения делает особенно важным отслеживание прогресса именно в этой области. Новый бенчмарк RSI Index, один из нескольких новых инструментов для этого; его разработал стартап Vals AI, и он отслеживает прогресс разработки ИИ силами самого ИИ, сравнивая работу публичных моделей с исследованиями, которые публикуют учёные-люди. Раян Кришнан, сооснователь и гендиректор Vals AI, говорит, что бенчмарк указывает: в течение ближайшего года ИИ сможет выполнять работу, за которой исследователи ИИ уже не смогут уследить.

Отчёт Дугласа и соавторов предупреждает и об обратной стороне: поспешное внедрение неподходящих мер контроля рискует увязнуть в политике или попасть под «регуляторный захват» со стороны самой отрасли. «Я не уверен, что просто сказать американскому правительству „остановите всё“, хорошая идея, говорит Дуглас., Действовать наобум с плохим планом может оказаться хуже, чем не действовать вовсе».

Ключевые факты

  • Anthropic сообщила, что Claude теперь выполняет 26% её исследований в области ИИ против нуля в начале 2026 года, и что компания потратила 6% бюджета вычислений на то, чтобы сделать свой ИИ безопаснее.
  • Независимые аудиты моделей: Джеффри Ирвинг (экс-Институт безопасности ИИ Великобритании) считает, что инспекции и взаимные договорённости уже сейчас работают, а Коннор Лихи (Control AI) называет нынешних «независимых оценщиков» друзьями компаний и предлагает подключать ФБР или АНБ.
  • Контроль вычислений: указ администрации Байдена 2023 года о пороге отчётности по обучающим прогонам, документ от марта 2024 года о слежке через облачных провайдеров и предложение RAND (2024) криптографически фиксировать вычисления прямо в компонентах GPU.
  • Договоры между странами: Ирвинг предлагает совместно с Китаем сворачивать рост вычислительных мощностей через договор, а философ Тоби Орд, как крайний вариант, вывозить GPU на нейтральную территорию и уничтожать их.
  • Новый бенчмарк RSI Index от стартапа Vals AI, по словам его гендиректора Раяна Кришнана, показывает, что в течение года ИИ сможет выполнять работу, за которой исследователи уже не смогут уследить.

Почему это важно

Разговоры о том, что ИИ пора притормозить, перестали быть маргинальными: главы Anthropic, OpenAI и Google DeepMind публично поддержали ту или иную форму паузы, а поводом стало предупреждение бывшего сотрудника Anthropic о риске уничтожения человечества в течение пары лет. При этом сами ИИ-компании уже используют ИИ для разработки следующих моделей, это ускоряет цикл рекурсивного самоулучшения и сокращает время на то, чтобы придумать работающий тормоз, прежде чем люди перестанут успевать понимать, что делает модель.

Кому это важно

Регуляторам и законодателям в США (в тексте отдельно отмечена растущая двухпартийная поддержка идеи ограничить крупный ИИ) и в Китае, которым предстоит переговоры на фоне визита председателя Си; самим ИИ-лабораториям, которым может понадобиться проходить внешние проверки; облачным провайдерам и производителям чипов, на инфраструктуру которых опираются почти все предложенные механизмы контроля.

Как это применить

Разбирать любое будущее предложение по контролю ИИ стоит по трём осям из текста: кто проверяет модель (независимость и квалификация оценщиков), как отслеживаются вычисления (через отчётность компаний, облачных провайдеров или встроенные в чипы криптографические счётчики) и на каком уровне договорённость, внутренняя политика компании, национальный закон или международный договор. Бенчмарки вроде RSI Index дают способ следить за тем, насколько быстро ИИ уже способен заменять исследователей.

Можно ли доверять

Материал построен на прямых, атрибутированных цитатах названных экспертов, Дугласа, Ирвинга, Лихи, Орда, Кришнана, и на новом отчёте с конкретным названием; статистику по Claude источник приписывает самой Anthropic. Слабое место, центральный триггер тревоги, предупреждение об уничтожении человечества, дан со слов не названного по имени бывшего сотрудника Anthropic и не названного по имени главы её лаборатории безопасности, проверить это утверждение по тексту невозможно. Эксперты также прямо расходятся в оценках: Ирвинг считает нынешние аудиты рабочим инструментом, Лихи, маркетинговой имитацией науки.

Риски и подводные камни

Сам отчёт Дугласа предупреждает, что поспешные меры контроля могут увязнуть в политике или обернуться «регуляторным захватом», когда правила по факту пишет сама отрасль. Слежка за вычислениями через облака и чипы упирается в то, что модели можно обучать через зарубежные облачные мощности в обход экспортных ограничений, так уже отчасти обошли запрет на поставки топовых чипов Nvidia в Китай. А идея международного договора зависит от того, согласится ли Китай замедлиться вместе с США, хотя китайские эксперты, по тексту, опасаются именно того, что отставание закрепится.

«Когда [крупные ИИ-компании] говорят «независимые оценщики», они имеют в виду: «Я хочу платить своим друзьям, которые живут со мной в одной коммуне, чтобы они смотрели на мои промпты»»

— Коннор Лихи, глава Control AI