Agent Lightning v1.0 поднял результат ИИ-агента в кодинге на 14,6 п.п.

Agent Lightning v1.0 поднял результат ИИ-агента в кодинге на 14,6 п.п.

Современные ИИ-агенты работают не сами по себе, а внутри «харнесса», программной обвязки, которая ведёт агента через рабочий цикл: вызывает инструменты, управляет контекстом и потоком выполнения. Авторы называют харнесс критической частью всей агентной системы. Первая версия Agent Lightning предложила архитектуру, в которой харнесс агента и движок RL-обучения работают как разные процессы, а связывает их только прокси на эндпоинте LLM: обучающий движок не видит агента напрямую, а получает лишь поток запросов и ответов языковой модели, проходящий через харнесс. Эту архитектуру позже переняли другие RL-фреймворки, verl Uni-Agent, AReaL 2.0, slime и Polar. Авторы называют получившуюся парадигму «харнессовым агентным RL» (harnessed agentic RL): харнесс, которым агент пользуется в реальной эксплуатации, а не отдельный тренировочный движок, напрямую участвует в дообучении модели.

Харнессовый агентный RL принципиально отличается от обычного: харнесс, а не тренировочный движок, владеет циклом взаимодействия со средой, а тренер видит только последовательности запросов и ответов языковой модели. Из-за этого возникают инженерные сложности, ретокенизация, слияние сэмплов, расчёт advantage, нормализация функции потерь, планирование бэкенда, и, по словам авторов, эти сложности МОГУТ существенно повлиять на стабильность и эффективность обучения (не «обязательно влияют», а именно «могут»). Чтобы изучать именно эти сложности на практике, авторы выпустили Agent Lightning v1.0, лёгкий фреймворк примерно на 3500 строк кода, который поддерживает произвольные харнессы агентов и служит практическим испытательным стендом для их изучения, а не готовым решением.

Фреймворк проверили на трёх типах агентов: следующих инструкциям, поисковых и кодовых, и для кодовых агентов выложили полный воспроизводимый конвейер RL-обучения. Единственный числовой результат в тексте, по кодовому агенту: используя всего 6 тысяч обучающих примеров и «умеренные» вычислительные ресурсы (сколько именно GPU, времени или денег на это ушло, в тексте не указано), RL-дообучение подняло результат модели Qwen3.5-9B на бенчмарке SWE-bench Verified с 41,8% до 56,4%, прирост в 14,6 процентного пункта. Для агентов, следующих инструкциям, и для поисковых агентов сопоставимых числовых результатов текст не приводит, хотя авторы говорят, что оценивали фреймворк и на них тоже. Авторы сообщают, что выкладывают весь конвейер и обучающие скрипты в открытый доступ, чтобы сделать исследование харнессового агентного RL воспроизводимым.

Ключевые факты

  • Agent Lightning v1.0, фреймворк примерно на 3500 строк кода для харнессового агентного RL: обучающий движок подключается к любому харнессу агента через прокси на эндпоинте LLM и видит только поток запросов и ответов языковой модели.
  • Изначальную архитектуру Agent Lightning с разделением харнесса и движка обучения позже переняли другие RL-фреймворки, verl Uni-Agent, AReaL 2.0, slime и Polar.
  • Такая RL-тренировка через харнесс усложняет ретокенизацию, слияние сэмплов, расчёт advantage, нормализацию функции потерь и планирование бэкенда, по словам авторов, эти сложности МОГУТ существенно влиять на стабильность и эффективность обучения.
  • На кодовом агенте: всего 6 тысяч обучающих примеров и «умеренные» вычислительные ресурсы подняли результат модели Qwen3.5-9B на бенчмарке SWE-bench Verified с 41,8% до 56,4%, на 14,6 процентного пункта.
  • Фреймворк также проверили на агентах, следующих инструкциям, и на поисковых агентах (без приведённых в тексте числовых результатов), а весь конвейер и обучающие скрипты авторы выложили в открытый доступ.

Почему это важно

Современные ИИ-агенты работают внутри «харнесса», программной обвязки, которая ведёт агента через рабочий цикл: вызывает инструменты, управляет контекстом и потоком выполнения. Авторы прямо называют харнесс критической частью всей агентной системы. Первая версия Agent Lightning предложила архитектуру, где харнесс агента и движок RL-обучения работают как разные процессы, связанные только прокси на эндпоинте LLM: обучающий движок не видит агента напрямую, а получает лишь поток запросов и ответов языковой модели. Эту архитектуру позже переняли другие RL-фреймворки, verl Uni-Agent, AReaL 2.0, slime и Polar, то есть речь не об изолированной идее одной команды, а о паттерне, который уже используют несколько независимых проектов. Авторы называют получившуюся парадигму «харнессовым агентным RL» (harnessed agentic RL): харнесс, которым агент пользуется в реальной эксплуатации, напрямую участвует в дообучении модели. Agent Lightning v1.0, не смена подхода, а оформление той же идеи в лёгкий и воспроизводимый инструмент.

Кому это важно

В первую очередь, командам, которые дообучают модели для ИИ-агентов методом RL и не хотят переписывать логику харнесса, которым агент уже пользуется в реальной работе: фреймворк подключается через прокси на эндпоинте LLM к произвольному харнессу, а не к одной конкретной реализации. Это касается и тех, кто уже работает с фреймворками verl Uni-Agent, AReaL 2.0, slime или Polar, по словам авторов, все они переняли ту же архитектуру с разделением харнесса и движка обучения, так что Agent Lightning v1.0 описывает принцип, знакомый пользователям этих инструментов. Отдельно это важно исследователям, которые изучают именно инженерные сложности харнессового RL, ретокенизацию, слияние сэмплов, расчёт advantage, нормализацию функции потерь, планирование бэкенда: авторы прямо называют v1.0 испытательным стендом для изучения этих сложностей, а не готовым решением. И командам, которые меряют качество кодовых ИИ-агентов бенчмарком SWE-bench Verified: результат на нём, ещё один пример измеримого прироста от RL-дообучения поверх харнесса.

Как это применить

Agent Lightning v1.0, лёгкий фреймворк примерно на 3500 строк кода, который поддерживает произвольные харнессы агентов и служит практическим стендом для изучения сложностей харнессового RL. Авторы проверили его на трёх типах агентов, следующих инструкциям, поисковых и кодовых, и для кодовых агентов выложили полный воспроизводимый конвейер RL-обучения. Единственный числовой результат в тексте, по кодовому агенту: используя всего 6 тысяч обучающих примеров и «умеренные» вычислительные ресурсы (сколько именно GPU, времени или денег на это ушло, в тексте не указано), RL-дообучение подняло результат модели Qwen3.5-9B на бенчмарке SWE-bench Verified с 41,8% до 56,4%, прирост в 14,6 процентного пункта. Для агентов, следующих инструкциям, и для поисковых агентов сопоставимых числовых результатов текст не приводит, хотя авторы говорят, что оценивали фреймворк и на них тоже. Авторы сообщают, что выкладывают весь конвейер и обучающие скрипты в открытый доступ, это заявлено прямо, как способ сделать исследование воспроизводимым.

Можно ли доверять

Источник, аннотация научной работы на Hugging Face Papers; в самом тексте не названы ни имена авторов, ни организация, которая стоит за проектом, судить о репутации команды по этому тексту нельзя. Первым автором в метаданных страницы указан Чжиюань Хэ, но раз внутри текста нет перечня соавторов, корректнее говорить о работе «Чжиюань Хэ с соавторами», а не одного человека. Все результаты, самоотчёт авторов: единственная количественная цифра прироста (41,8% → 56,4%, 14,6 процентного пункта) приведена только для одной пары модель/бенчмарк, Qwen3.5-9B на SWE-bench Verified, сравнения с результатами других RL-фреймворков для харнессов текст не приводит. При этом у заявления есть конкретная опора: авторы называют точный объём кода (около 3500 строк), точное число обучающих примеров (6 тысяч) и говорят, что публикуют весь конвейер и обучающие скрипты, это более проверяемая позиция, чем голое заявление о приросте без деталей.

Риски и подводные камни

Авторы сами формулируют инженерные сложности харнессового RL, ретокенизацию, слияние сэмплов, расчёт advantage, нормализацию функции потерь, планирование бэкенда, как то, что МОЖЕТ существенно повлиять на стабильность и эффективность обучения, а не как то, что определённо влияет всегда; Agent Lightning v1.0 в тексте описан как стенд для изучения этих сложностей, а не как их решение. Единственный числовой результат (+14,6 процентного пункта) получен на одной модели и одном бенчмарке, SWE-bench Verified с Qwen3.5-9B, и неизвестно, переносится ли он на агентов, следующих инструкциям, или на поисковых агентов, хотя фреймворк заявлен универсальным для произвольных харнессов. Формулировка «умеренные вычислительные ресурсы» ничем не подкреплена: нет ни числа GPU, ни времени обучения, ни оценки стоимости, так что оценить, насколько воспроизведение доступно за пределами лаборатории авторов, по этому тексту нельзя. Дата выхода, обучения или оценки фреймворка в тексте тоже не указана.