VHD-Play: новый метод генерации сред для тренировки ИИ-агентов поднял их результаты почти вчетверо

Языковые модели-агенты всё чаще сталкиваются с длинными задачами, где состояние меняется во времени, решения взаимозависимы, а результат виден не сразу. Чтобы обучать такие агенты с помощью reinforcement learning (обучения с подкреплением), нужны разнообразные тренировочные среды с надёжным сигналом результата и низкой стоимостью создания. Обычно такие среды сначала строят, а правило оценки результата и разметку траекторий добавляют уже потом, из-за этого динамика среды и способ её оценки могут расходиться.
Пайплайн VHD-Play переворачивает этот порядок: сначала выбирается и решается математическая модель, а затем на основе размеченного корпуса «сеттер» (генератор) превращает процесс принятия решений в этой модели в набор статeful-инструментов (сохраняющих состояние между шагами). И исполняемая динамика среды, и эталон для оценки траекторий берутся из одной и той же уже решённой модели, это должно устранять рассинхрон между поведением среды и правилами её оценки.
С помощью VHD-Play авторы сгенерировали 3300 разнообразных агентных сред стоимостью в несколько центов каждая. На трёх семействах таких сред обучили модель Qwen3.6-35B-A3B: её средний агентный показатель (по пятисемейственной диагностике) вырос с 0,204 до 0,815. Прирост проявился не только на отложенных примерах из тех же трёх семейств, но и на восьми ранее не встречавшихся семействах механизмов, а также на внешних бенчмарках, общем вызове функций (function calling), планировании путешествий и 365-дневном бенчмарке электронной коммерции (E-Commerce Bench). На последнем обученная модель завершила все прогоны без банкротства и превзошла Qwen3.7-Max.
Авторы отдельно сравнили «письменные» версии задач с их stateful-аналогами, в которых параметры либо раскрываются, либо скрываются от модели. Сравнение показало, что основная часть обучаемого разрыва в качестве связана именно со stateful-взаимодействием, а не с решением задачи как таковой. Для получения более крупных сред использовался замороженный 35-миллиардный сеттер, а при согласованном масштабировании прирост сохранялся по мере роста размера механизма и горизонта планирования, авторы видят в этом потенциал для постоянно обновляемого обучающего субстрата.
Имена авторов, их организация и дата публикации в тексте источника не указаны, как и то, что именно означает аббревиатура VHD за пределами названия статьи.
Ключевые факты
- Пайплайн VHD-Play генерирует агентные RL-среды в обратном порядке: сначала решается математическая модель, затем на её основе строится stateful-среда с согласованной оценкой
- Сгенерировано 3300 разнообразных сред стоимостью в несколько центов каждая
- Обучение Qwen3.6-35B-A3B на трёх семействах сред подняло средний агентный показатель с 0,204 до 0,815
- Прирост подтвердился на восьми новых, ранее не встречавшихся семействах механизмов и на внешних бенчмарках (function calling, планирование путешествий, 365-дневный E-Commerce Bench)
- На E-Commerce Bench обученная модель завершила все прогоны без банкротства и превзошла Qwen3.7-Max
Почему это важно
Обучение ИИ-агентов с подкреплением упирается в нехватку разнообразных и надёжно оцениваемых тренировочных сред: их дорого делать вручную, а автоматическая генерация обычно рассинхронизирует динамику среды и правило её оценки. VHD-Play предлагает способ обойти это, выводя и динамику, и эталон оценки из одной решённой математической модели, что снижает риск несогласованности и удешевляет создание сред до нескольких центов за штуку.
Кому это важно
Прежде всего исследователям и командам, которые занимаются обучением ИИ-агентов с подкреплением на длинных задачах, вызов внешних функций, планирование, электронная коммерция и другие сценарии с меняющимся состоянием. Также интересно тем, кто ищет способы масштабировать генерацию тренировочных данных без ручной разметки каждой среды.
Как это применить
В тексте источника нет ни имён авторов, ни организации, ни даты публикации, ни описания, как именно выбираются исходные математические модели и какие домены покрывают 3300 сгенерированных сред, это ограничивает возможность сразу оценить применимость метода к конкретной задаче. Судя по описанию, подход предполагает использование «сеттера», модели, которая превращает решённую математическую модель в набор инструментов с сохранением состояния; в экспериментах для более крупных сред использовался замороженный сеттер на 35 миллиардов параметров.
Можно ли доверять
Фактура взята из текста аннотации/описания статьи; источник не называет авторов, институт и дату публикации, поэтому независимо сверить заявленные цифры (например, рост показателя с 0,204 до 0,815) с полным текстом статьи или сторонними обзорами по имеющимся данным нельзя. Пресс-заметка отмечает низкую вовлечённость и неясное авторство материала.
Риски и подводные камни
Заявленные улучшения получены на собственных синтетических бенчмарках авторов и на выбранных внешних тестах (function calling, планирование путешествий, E-Commerce Bench), неясно, насколько результат переносится на другие типы задач и реальные продакшен-сценарии. Отсутствие данных о том, как именно отбираются исходные математические модели и какие домены они покрывают, затрудняет оценку возможных смещений (bias) в сгенерированном наборе сред.
«Сравнение показывает, что основная часть обучаемого разрыва в качестве связана со stateful-взаимодействием, а не с решением задачи как таковой»
— авторы исследования