Prime Intellect переписала Prime Agent на Rust с помощью роя из 2000+ агентов

Prime Intellect сообщила в своём блоге, что её кодинг-агент Prime Agent переписан с TypeScript на Rust, причём в основном силами самого Prime Agent. По словам компании, с августа агент скачали более 300 000 раз, и он обработал более 8 трлн токенов.
Переписывание заняло две недели: Prime Agent выступил оркестратором роя из более чем 2000 агентов, который работал на 10 000+ песочниц Prime Sandboxes и потратил более 200 млрд токенов с эндпоинта GLM-5.3 сервиса Prime Inference. Все оркестраторы и их агенты работали на двух 8-ядерных CPU-узлах по требованию, каждый из которых держал более 100 одновременных субагентов; тяжёлую работу (компиляцию, проверку типов, сравнение) выносили в песочницы.
Цель была в том, чтобы агенты выполнили переписывание автономно при минимуме участия людей. Людям оставили настройку проверки: четыре вида проверок на соответствие поведению TypeScript-версии. Первая сравнивает кадры терминального интерфейса (TUI) двух бинарников на одном и том же сценарии с заскриптованной моделью. Вторая сверяет транскрипты сессий и запросы к провайдеру модели. Третья проверяет все типы сообщений протокола демона. Четвёртая, аудит функций по компонентам: каждый помечали как совпадающий, частичный или отсутствующий.
Задачи раздавал один корневой агент: он выстроил их в топологическом порядке, сам не писал продуктовый код и следил за общим ходом работ. Каждая задача проходила через четыре агента: планировщик (спецификация и проверка соответствия), исполнитель (код в отдельном рабочем дереве), рецензент (враждебная проверка запроса на слияние другой моделью и в отдельном контексте) и верификатор (сборка и запуск проверок в чистой песочнице). Провал рецензии или проверки возвращал задачу исполнителю.
Структуру кода тоже пересмотрели: теперь он разбит на девять крейтов (пакетов Rust) с односторонним графом зависимостей, который контролирует Cargo. Самый большой файл, около 2500 строк против примерно 15 000 в TypeScript; файлов длиннее 5000 строк нет, тогда как в TypeScript было четыре. Каждая сессия работает в отдельном рабочем процессе под небольшим супервизором, поэтому сбой одной сессии не трогает остальные. Благодаря перестройке появились поддержка Windows, изоляция падений сессий и более согласованный протокол демона, а список моделей и MCP вынесен в каталог, подгружаемый во время работы.
После достижения паритета второй оркестратор три дня вёл цикл пошаговой оптимизации (hillclimbing) по замерам: ему намеренно не ставили числовых целей. Цикл записал более 144 записей об экспериментах и аудитах и слил более 69 изменений, повысивших производительность. Каждое изменение проверяли два агента-рецензента на разных передовых моделях. По словам компании, основной выигрыш дали три вида правок: вынос работы из путей запуска и отрисовки, замена циклов опроса на событийное ожидание и освобождение памяти сразу после загрузки больших сессий.
Итог по заявлению компании: время до готовности к вводу примерно в 14 раз меньше, чем у TypeScript-версии, а память после запуска используется более чем на 80% экономнее; Prime Agent назван «одной из самых быстрых» агентных обвязок. Замеры сделаны на собственном наборе тестов компании, и она сама оговаривается, что без общего стандарта бенчмарков сравнения надо трактовать осторожно. В планах, развитие возможностей и оценок, а также открытие пользователям многоагентных рабочих процессов, на которых построено это переписывание.
Ключевые факты
- Prime Agent переписан с TypeScript на Rust за две недели роем из более чем 2000 агентов на 10 000+ песочниц; потрачено более 200 млрд токенов с эндпоинта GLM-5.3 сервиса Prime Inference.
- Основа подхода, объективные проверки соответствия старой версии (терминальный интерфейс, транскрипты сессий, протокол демона, аудит функций) и разделение ролей: планировщик, исполнитель, рецензент, верификатор.
- Три дня оптимизации под руководством второго оркестратора без числовых целей дали более 69 слитых изменений; по замерам компании, время до готовности к вводу примерно в 14 раз меньше, а памяти после запуска нужно более чем на 80% меньше.
- Кодовая база разбита на девять крейтов; самый большой файл сократился с примерно 15 000 до около 2500 строк, появились поддержка Windows и изоляция падений сессий.
- Сравнения с другими агентами сделаны на собственном наборе тестов компании; общего стандарта бенчмарков нет.
Почему это важно
Это редкий публичный пример того, как кодинг-агент в большой мере переписал сам себя на другой язык, причём по описанной процедуре: рой из более чем 2000 агентов, оркестратор, автоматические проверки соответствия и рецензия другой моделью. Компания подаёт это ещё и как нагрузочный тест своей инфраструктуры песочниц и инференса. Заявленные результаты, примерно 14-кратное ускорение времени до готовности к вводу и более 80% экономии памяти после запуска, относятся к её собственным замерам.
Кому это важно
Команды, которые строят многоагентные системы и автоматизированные миграции кода, найдут в описании готовую схему: порядок задач, роли агентов, проверки соответствия. Пользователям Prime Agent важны поддержка Windows, изоляция падений сессий и более быстрый запуск. Тем, кто выбирает кодинг-агента, полезны сами заявленные показатели, но с оговорками о методике замеров.
Как это применить
Из текста следует несколько приёмов. Сначала создать объективную проверку для каждого вида соответствия (интерфейс, запросы к модели, протокол, перечень функций), чтобы агенты сами мерили прогресс и ловили регрессии. Разделять написание кода и его проверку между разными агентами, а рецензента ставить на другую модель в отдельном контексте. Для оптимизации дать агентам бенчмарк-набор и цикл «профилирование, гипотеза, замер в чередующемся порядке, рецензия, слияние», не задавая числовых порогов, чтобы они не становились точкой остановки. Тяжёлые сборки и проверки выносить в отдельные песочницы.
Можно ли доверять
Источник, блог самой компании, то есть первоисточник, но и заинтересованная сторона. Цифры 14x и 80% получены на её собственном наборе тестов (свежая песочница на 4 ядра и 8 ГБ, терминал с заскриптованной моделью, инференс в замеры не входит). Сама компания пишет, что без общего стандарта сравнения следует трактовать осторожно. Какие именно другие агенты сравнивались, какие модели рецензировали правки и каковы абсолютные значения замеров, в тексте не названо. Независимой проверки результатов в материале нет.
Риски и подводные камни
Компания отмечает, что проверки соответствия подтверждали только то поведение, которое они затрагивали: оставшиеся ошибки и расхождения в основном нашли при внутреннем использовании. Довод о полной автономности следует смягчать: люди настраивали проверки, обсуждали с корневым агентом приоритеты и просматривали результаты, а доведение до релизного качества заняло ещё несколько недель с участием людей. Затраты на такой подход велики: более 200 млрд токенов и тысячи песочниц, а подробностей о человеко-часах и стоимости в материале нет.
«Без общего стандарта бенчмарков сравнения следует интерпретировать с осторожностью.»
— Блог Prime Intellect