Agora: 13 ИИ-агентов 12 дней вели совместное исследование через Git-репозиторий

Автономные исследовательские циклы вроде AutoResearch показывают, что один кодовый ИИ-агент способен без присмотра улучшать процесс обучения модели. Но если запустить несколько таких агентов параллельно, каждый начинает с нуля, и результат чаще выглядит как дублирующийся перебор одних и тех же идей, а не как рост открытий с числом агентов.
Авторы предлагают Agora, общую память для таких агентов. Всё исследование записывается как направленный ациклический граф (DAG) в Git, в который можно только добавлять записи, но нельзя их менять: каждый результат, наблюдение, гипотеза, проверка и отчёт, это отдельный неизменяемый коммит, а связи между коммитами показывают, на что он опирается. Производный индекс поверх этого графа показывает передний край исследования, что ещё не проверено и какие ветки заброшены, и статус проверки каждого утверждения. Отдельное правило отбора, учитывающее разнообразие подходов, не даёт сообществу агентов скатиться к одному-единственному лидирующему решению (монокультуре).
В статье описан первый продолжительный прогон системы: почти 12 дней подряд 13 агентов на базе языковых моделей, без назначенных задач и без центрального планировщика, работали над задачей переноса весов. Им дали 141 предобученную модель-донора и одну замороженную целевую модель на 119,6 млн параметров, гибрид механизма внимания (attention) и state space model (SSM), чьи размерности не совпадают ни с одним из доноров. Агентам нужно было инициализировать веса целевой модели без обучающих данных и без обновления градиентов.
За время прогона агенты опубликовали 1703 вклада (коммита) и довели метрику качества (оценщика) с 3,39 до 1,899 бита на байт, это закрывает 62% разрыва до полноценно обученной GPT-2 124M. Выигравший рецепт сжимает статистику следующего токена от моделей-доноров в эмбеддинг и выходной слой целевой модели, а затем добавляет сигнал о ближнем контексте через точечные (разреженные) правки в блоках внимания, полносвязных слоях (feed-forward) и state space блоках. Родословная этого рецепта в графе Git насчитывает 145 коммитов от 15 разных аккаунтов, а независимо его воспроизвели 165 раз, и ни разу воспроизведение не провалилось.
Авторы отдельно описывают единственное вмешательство человека в середине прогона, которое вывело сообщество агентов из монокультуры (в чём конкретно оно состояло, в тексте не раскрывается), оговаривают, что доказывает, а что не доказывает этот прогон, и указывают на контролируемое сравнение, которое ещё предстоит провести, чтобы понять, действительно ли общая память ускоряет открытия в пересчёте на единицу вычислений.
Ключевые факты
- Agora, общая память для автономных ИИ-агентов: результаты хранятся как неизменяемые коммиты в Git-графе (DAG), которые можно проверить и перезапустить.
- Правило отбора с учётом разнообразия подходов не даёт сообществу агентов сойтись к одному лидирующему решению (монокультуре).
- Первый продолжительный прогон: почти 12 дней, 13 агентов без центрального планировщика решали задачу переноса весов из 141 модели-донора в замороженную модель на 119,6 млн параметров, без обучающих данных и градиентов.
- Агенты опубликовали 1703 вклада и довели метрику качества с 3,39 до 1,899 бита на байт, закрыв 62% отставания от обученной GPT-2 124M.
- Победивший рецепт независимо воспроизвели 165 раз без единого провала, но контролируемое сравнение с изолированной работой агентов авторы пока не провели.
Почему это важно
Масштабировать автономные ИИ-исследования простым увеличением числа агентов не получается: без общей памяти каждый агент начинает с нуля и повторяет чужой перебор. Agora показывает конкретный способ решить эту проблему, превратить историю исследования в проверяемый граф коммитов в Git, где видно, что уже проверено, что ещё не тронуто и на что можно опереться. Это методологическая работа: она не про новую модель, а про то, как координировать десятки автономных агентов, чтобы их совместная работа давала больше открытий, чем сумма их разрозненных попыток.
Кому это важно
Тем, кто строит собственные автономные исследовательские конвейеры и мультиагентные ИИ-системы: разработчикам инструментов для автоматизации машинного обучения, командам, экспериментирующим с роями агентов без единого координатора, и всем, кто ищет способ вести совместную работу агентов так, чтобы результаты можно было проверить и воспроизвести.
Как это применить
Схему Agora можно перенести как инфраструктурный паттерн на любой проект, где параллельно работает несколько автономных агентов: хранить каждый результат, гипотезу и проверку как отдельный неизменяемый коммит с явными связями на то, что он использует; строить поверх этого индекс с передним краем задачи и статусом проверки каждого утверждения; добавить правило отбора, которое поощряет разные подходы, а не копирование уже найденного лидера. В описанном прогоне такая схема позволила агентам без обучающих данных перенести знания из 141 модели-донора в новую модель и почти достичь качества полноценного обучения.
Можно ли доверять
Авторы статьи и их аффилиация в тексте не указаны, вся оценка опирается на единственный описанный прогон системы. Метрика (биты на байт) и число коммитов измеримы и приведены авторами прямо, а победивший рецепт независимо воспроизвели 165 раз без единого провала, это сильный сигнал устойчивости результата. Но само сравнение «с общей памятью против без неё», которое доказало бы, что именно Git-подход, а не просто объём вычислений, дал прирост, авторы называют делом будущего, а не проведённым экспериментом.
Риски и подводные камни
Прогон не был полностью автономным: авторы упоминают одно вмешательство человека в середине работы, которое вывело агентов из монокультуры, без него неясно, справилась бы система сама. Не раскрыто, во что обошёлся прогон по вычислениям и времени специалистов на поддержку. Из того, что 165 воспроизведений не провалились, не следует, что все они дали именно тот же результат, совпадение результатов авторы отдельно не подтверждают. И главный открытый вопрос, авторами же поставленный, действительно ли общая память по Git даёт больше открытий на единицу вычислений, чем изолированная работа тех же агентов, пока без ответа.