Agensh: мультиагентная система ИИ без центрального оркестратора

Исследователи представили Agensh, мультиагентный харнесс (программную инфраструктуру для координации ИИ-агентов), который работает без центрального оркестратора. Авторы отмечают, что масштабируемость существующих мультиагентных систем часто упирается в возможности центрального координатора распределять задачи и синхронизировать работу агентов.
В Agensh параллельно работающие агенты сами непрерывно собирают контекст, забирают и назначают себе подзадачи, выполняют действия, делятся находками, проверяют результаты друг друга и асинхронно объединяют прогресс, без единого управляющего узла. Эту схему поддерживает инфраструктура из трёх компонентов: общее рабочее пространство, где хранятся предложенные, выполняемые и завершённые задачи; интерфейс сообщений для коммуникации между агентами; и общий контекст, где сохраняются переиспользуемые находки и намерения по работе.
Систему проверили на пяти самых сложных задачах из бенчмарка ProgramBench с моделью GPT-5.6-sol (high). При увеличении числа агентов с 1 до 128 средняя итоговая доля пройденных тестов выросла с 19,31% до 28,78%, примерно на 49% в относительном выражении. По наблюдению авторов, более крупные группы агентов достигают сопоставимого уровня точности быстрее. На отдельной задаче конвертации документов через pandoc масштабирование с 1 до 1024 агентов подняло итоговую долю пройденных тестов с 33,89% до 55,06%.
Анализ траекторий работы агентов показал, что по мере роста организации постепенно возникают и закрепляются разные формы самоорганизованной кооперации. Авторы делают вывод, что число агентов, это новое измерение масштабирования для мультиагентных систем, которое может расширить границы возможностей ИИ и дать практическое решение для сложных задач в условиях жёстких ограничений по времени и задержкам.
Ключевые факты
- Agensh, мультиагентная система ИИ без центрального оркестратора: агенты сами берут и распределяют подзадачи через общее рабочее пространство, интерфейс сообщений и общий контекст
- На пяти самых сложных задачах ProgramBench (модель GPT-5.6-sol, high) рост числа агентов с 1 до 128 поднял среднюю точность прохождения тестов с 19,31% до 28,78%, примерно на 49% относительно
- На задаче pandoc масштабирование с 1 до 1024 агентов увеличило итоговую долю пройденных тестов с 33,89% до 55,06%
- Более крупные группы агентов достигают сопоставимого уровня точности быстрее, чем небольшие
- Авторы называют число агентов новым измерением масштабирования мультиагентных систем, альтернативой наращиванию мощности одной модели
Почему это важно
Большинство мультиагентных систем ИИ упираются в производительность центрального оркестратора, который распределяет задачи между агентами, это ограничивает масштабирование. Agensh убирает этот узел и показывает, что просто увеличивая число самоорганизующихся агентов, можно заметно повышать точность решения сложных задач без изменения самой модели.
Кому это важно
Разработчикам мультиагентных систем и инженерам, которые строят конвейеры из ИИ-агентов для сложных задач, например, автоматизации разработки или обработки документов, и упираются в узкое место центрального координатора.
Как это применить
В основе Agensh, три компонента, которые можно рассматривать как архитектурный паттерн: общее рабочее пространство для задач (предложенных, выполняемых, завершённых), интерфейс сообщений между агентами и общий контекст для переиспользуемых находок. Этот подход применим там, где задачу можно разбить на параллельно решаемые подзадачи и где важно уложиться в жёсткие ограничения по времени.
Можно ли доверять
Работа опубликована как препринт на портале Hugging Face Papers; в доступном тексте не указаны ни авторы, ни организация, стоящая за исследованием, ни дата публикации. Приведённые цифры, результаты собственных экспериментов авторов на бенчмарке ProgramBench и задаче pandoc с одной моделью (GPT-5.6-sol), без сравнения с другими мультиагентными фреймворками.
Риски и подводные камни
Результаты пока не подтверждены независимо и не сопоставлены с конкурирующими мультиагентными харнессами. Неясны детали задач ProgramBench и pandoc, а также вычислительная стоимость и задержки при запуске сотен и тысяч агентов одновременно, рост точности мог достигаться ценой существенно возросших затрат на инференс.
«Более крупные организации агентов достигают сопоставимой точности прохождения тестов быстрее.»
— авторы работы