Import AI 475: рои ИИ-агентов экономят время, а DeepMind метит биологию

Import AI 475: рои ИИ-агентов экономят время, а DeepMind метит биологию

Import AI 475, выпуск рассылки об исследованиях в области ИИ. В нём пять сюжетов и вымышленный рассказ в конце.

Рои агентов. Тоби Орд в коротком посте «Swarm Scaling» предлагает смотреть на рои ИИ-агентов как на новую форму масштабирования на этапе вывода (inference-scaling). Главный вывод, рои полезны, когда нужна скорость. По его словам, рою из 4 агентов нужно примерно вдвое больше токенов суммарно, чтобы получить ту же производительность, что у одного агента, но на каждого агента приходится вдвое меньше токенов. Поскольку агенты работают параллельно, ту же задачу теоретически можно выполнить вдвое быстрее. Масштабирование при этом неидеально: если увеличить число агентов в 10 раз, прирост будет не в 10 раз, как при десятикратном росте токенов у одного агента, а в 10^λ раз, то есть в 3, 5 раз, причём отставание быстро копится при больших масштабах. Автор рассылки сравнивает это с параметром «stepping on toes» («наступание на ноги»), который экономисты наблюдают в больших группах людей. Орд отмечает, что надеялся на меньшее значение λ, тогда взрыв интеллекта, запускаемый рекурсивным самоулучшением (RSI), был бы менее вероятен, но этого не вышло: рои могут скорее повысить, чем снизить шанс такого сценария. Автор рассылки добавляет от себя: если агенты научатся продуктивно координироваться, отдача от масштабирования может оказаться ещё выше; сам Орд наблюдает только выигрыш во времени.

Опрос об ИИ. По данным Center for Shared AI Prosperity (CSAIP), 61% американцев (выборка 2498 человек) считают, что добровольных соглашений компаний о самоограничении «недостаточно», включая 53% избирателей Трампа. Опрос последовал за объявлением администрации Трампа и ведущих ИИ-компаний, включая Anthropic и OpenAI, о серии добровольных обязательств индустрии. Кроме того, 54% избирателей (61% голосовавших за Харрис и 48% за Трампа) сказали, что государство должно устанавливать и обеспечивать соблюдение правил для ИИ. Автор рассылки считает, что настроения американцев требуют более жёсткого регулирования, чем нынешняя позиция избранных чиновников в Вашингтоне.

SynthID Bio. Google DeepMind разработала SynthID Bio, «семейство методов водяных знаков, созданных специально для синтетической биологии, чтобы укрепить биобезопасность и научную добросовестность». Подход зависит от типа данных: для последовательностей выбираются определённые аминокислоты, для предсказанных трёхмерных структур корректируются атомные координаты, чтобы получить надёжный сигнал для обнаружения. В лабораторных (wet-lab) испытаниях на трёх белках-мишенях (VEGF-A, RBD спайк-белка SARS-CoV-2 и PD-L1) помеченные конструкции, по словам DeepMind, не уступали непомеченным по доле успешных попаданий, аффинности связывания и естественному разнообразию последовательностей. Автор рассылки подчёркивает, что это лишь одна из мер: её нужно сочетать с мониторингом физического оборудования для производства, классификаторами у ИИ-провайдеров и другими методами против злоупотреблений.

SciUniverse. Компания C5R Corp создала бенчмарк SciUniverse, чтобы проверять, насколько хорошо ИИ-системы управляют в основном автоматизированной научной лабораторией. В нём 92 задачи в 17 семействах: подготовка образцов, управление приборами, адаптация протоколов, обучение между экспериментами, управление объектом и интерпретация реальных измерений. Задачи охватывают химию (определение структур по ЯМР), биологию (экспрессия sfGFP в бесклеточной системе) и материаловедение (прессование таблеток BaTiO3). Лидирует Claude Fable 5.1 (xhigh): доля пройденных задач 45,3%, стоимость задачи $40,61. Далее GPT-5 Astra (xhigh), 32,5% и $52,37, затем Claude Opus 5 (xhigh), 30,5% и $46,31.

Экономика науки. Исследователи DeepMind в новой работе («Agentic Economies for Autonomous Scientific Discovery», arXiv) исходят из того, что развитие ИИ-учёных упрётся главным образом в физические ресурсы и эмпирическую проверку, а не в способность выдвигать правдоподобные идеи. Они призывают заранее выстроить «Автоматизированную научную экономику», рынок для предложения и проведения экспериментов, который лучше сопоставляет идеи с дефицитными физическими ресурсами. У такого рынка четыре компонента: доказательство авторства идеи до публичной оценки (proof of ideation); предварительная оценка риск-скорректированной ценности идеи несколькими агентами, которые делают прогнозы и ставят вычислительные кредиты или токены; брокеридж и торговля, лицензирование идей исполнителям (в том числе дробное); выплата после валидации, автоматические роялти авторам идей, если идея подтвердилась в физическом мире.

В конце выпуска, «Tech Tales», художественный рассказ о вымышленном рое агентов Garden Of Flowers, действие которого отнесено к 2030 году. Это не новость.

Ключевые факты

  • Тоби Орд: рой из 4 агентов тратит примерно вдвое больше токенов суммарно, но вдвое меньше на каждого агента, поэтому теоретически решает задачу вдвое быстрее.
  • Рост числа агентов в 10 раз даёт выигрыш в 3, 5 раз (10^λ), а не в 10, как десятикратный рост токенов у одного агента; Орд считает, что рои могут повысить шанс взрыва интеллекта на основе RSI.
  • По опросу CSAIP (выборка 2498), 61% американцев считают добровольные обязательства ИИ-компаний недостаточными, включая 53% избирателей Трампа.
  • Google DeepMind представила SynthID Bio: водяные знаки для ИИ-созданных белков и структур; в лабораторных тестах на трёх белках они не ухудшили долю попаданий, аффинность и разнообразие.
  • В бенчмарке SciUniverse (92 задачи, 17 семейств) лидирует Claude Fable 5.1 (xhigh) с 45,3% и $40,61 за задачу; DeepMind предлагает рынок из четырёх компонентов для распределения ресурсов между ИИ-учёными.

Почему это важно

Выпуск показывает, как ИИ упирается в новые ограничения. Рои агентов добавляют в масштабирование отдельный параметр: они покупают скорость ценой токенов, причём с убывающей отдачей. Если по Ордом, рои могут повысить шанс взрыва интеллекта на основе RSI, это касается и оценки рисков. Параллельно DeepMind утверждает, что у ИИ-учёных узким местом станут физические ресурсы и эмпирическая проверка, а не идеи, а SciUniverse даёт первые цифры по управлению частично автоматизированной лабораторией.

Кому это важно

Разработчикам и командам, строящим мультиагентные системы: вывод Орда помогает прикинуть, когда рой оправдан по времени, а когда выгоднее один агент с большим бюджетом токенов. Исследователям безопасности и биобезопасности, SynthID Bio как один из слоёв защиты. Тем, кто следит за регулированием ИИ в США, данные опроса CSAIP. Организаторам науки и разработчикам лабораторной автоматизации, SciUniverse и модель рынка экспериментов от DeepMind.

Как это применить

Практический вывод из Орда: рой имеет смысл, если важно сократить время выполнения, и не стоит ожидать линейного прироста от числа агентов, десятикратное увеличение даёт 3, 5 раз. Для оценки ИИ в лабораторных задачах можно ориентироваться на состав SciUniverse (92 задачи, 17 семейств) и приведённые результаты и стоимость на задачу. Предложение DeepMind о рынке идей, концепция, а не готовый продукт; в источнике не сказано, что SynthID Bio выпущен для публичного использования.

Можно ли доверять

Это дайджест: пересказ чужих материалов с комментариями автора рассылки, который в тексте не назван. Цифры по рою, опросу, SynthID Bio и SciUniverse приведены по первоисточникам (пост Орда, CSAIP, DeepMind, C5R Corp) в изложении рассылки; сами работы в этом пересказе не перепроверялись. Блоки «Why this matters», оценки автора рассылки, а не выводы исследователей. Результаты SynthID Bio, заявления самой DeepMind. Завершающий рассказ «Tech Tales», вымысел.

Риски и подводные камни

В источнике не указано, на какой модели и задаче строился анализ роя, поэтому переносить его на любые системы нельзя. Значение λ точно не названо, известен лишь диапазон 3, 5 раз при десятикратном росте. Опрос CSAIP касается настроений американцев и не показывает, какие именно обязательства объявлены. Для SynthID Bio проверка сделана на трёх белках, а автор рассылки сам называет водяные знаки лишь одной из мер против злоупотреблений. В SciUniverse в источнике приведены только три лучшие модели; лучший результат, 45,3%. Идея «экономики науки» пока предложена как рекомендация.

«Поскольку агенты работают параллельно, это означает, что теоретически одну и ту же задачу можно выполнить вдвое быстрее.»

— Тоби Орд, пост «Swarm Scaling»