VHD-Play: новый метод генерации сред для тренировки ИИ-агентов поднял их результаты почти вчетверо

VHD-Play: новый метод генерации сред для тренировки ИИ-агентов поднял их результаты почти вчетверо

Языковые модели-агенты всё чаще сталкиваются с длинными задачами, где состояние меняется во времени, решения взаимозависимы, а результат виден не сразу. Чтобы обучать такие агенты с помощью reinforcement learning (обучения с подкреплением), нужны разнообразные тренировочные среды с надёжным сигналом результата и низкой стоимостью создания. Обычно такие среды сначала строят, а правило оценки результата и разметку траекторий добавляют уже потом, из-за этого динамика среды и способ её оценки могут расходиться.

Пайплайн VHD-Play переворачивает этот порядок: сначала выбирается и решается математическая модель, а затем на основе размеченного корпуса «сеттер» (генератор) превращает процесс принятия решений в этой модели в набор статeful-инструментов (сохраняющих состояние между шагами). И исполняемая динамика среды, и эталон для оценки траекторий берутся из одной и той же уже решённой модели, это должно устранять рассинхрон между поведением среды и правилами её оценки.

С помощью VHD-Play авторы сгенерировали 3300 разнообразных агентных сред стоимостью в несколько центов каждая. На трёх семействах таких сред обучили модель Qwen3.6-35B-A3B: её средний агентный показатель (по пятисемейственной диагностике) вырос с 0,204 до 0,815. Прирост проявился не только на отложенных примерах из тех же трёх семейств, но и на восьми ранее не встречавшихся семействах механизмов, а также на внешних бенчмарках, общем вызове функций (function calling), планировании путешествий и 365-дневном бенчмарке электронной коммерции (E-Commerce Bench). На последнем обученная модель завершила все прогоны без банкротства и превзошла Qwen3.7-Max.

Авторы отдельно сравнили «письменные» версии задач с их stateful-аналогами, в которых параметры либо раскрываются, либо скрываются от модели. Сравнение показало, что основная часть обучаемого разрыва в качестве связана именно со stateful-взаимодействием, а не с решением задачи как таковой. Для получения более крупных сред использовался замороженный 35-миллиардный сеттер, а при согласованном масштабировании прирост сохранялся по мере роста размера механизма и горизонта планирования, авторы видят в этом потенциал для постоянно обновляемого обучающего субстрата.

Имена авторов, их организация и дата публикации в тексте источника не указаны, как и то, что именно означает аббревиатура VHD за пределами названия статьи.

Ключевые факты

  • Пайплайн VHD-Play генерирует агентные RL-среды в обратном порядке: сначала решается математическая модель, затем на её основе строится stateful-среда с согласованной оценкой
  • Сгенерировано 3300 разнообразных сред стоимостью в несколько центов каждая
  • Обучение Qwen3.6-35B-A3B на трёх семействах сред подняло средний агентный показатель с 0,204 до 0,815
  • Прирост подтвердился на восьми новых, ранее не встречавшихся семействах механизмов и на внешних бенчмарках (function calling, планирование путешествий, 365-дневный E-Commerce Bench)
  • На E-Commerce Bench обученная модель завершила все прогоны без банкротства и превзошла Qwen3.7-Max

Почему это важно

Обучение ИИ-агентов с подкреплением упирается в нехватку разнообразных и надёжно оцениваемых тренировочных сред: их дорого делать вручную, а автоматическая генерация обычно рассинхронизирует динамику среды и правило её оценки. VHD-Play предлагает способ обойти это, выводя и динамику, и эталон оценки из одной решённой математической модели, что снижает риск несогласованности и удешевляет создание сред до нескольких центов за штуку.

Кому это важно

Прежде всего исследователям и командам, которые занимаются обучением ИИ-агентов с подкреплением на длинных задачах, вызов внешних функций, планирование, электронная коммерция и другие сценарии с меняющимся состоянием. Также интересно тем, кто ищет способы масштабировать генерацию тренировочных данных без ручной разметки каждой среды.

Как это применить

В тексте источника нет ни имён авторов, ни организации, ни даты публикации, ни описания, как именно выбираются исходные математические модели и какие домены покрывают 3300 сгенерированных сред, это ограничивает возможность сразу оценить применимость метода к конкретной задаче. Судя по описанию, подход предполагает использование «сеттера», модели, которая превращает решённую математическую модель в набор инструментов с сохранением состояния; в экспериментах для более крупных сред использовался замороженный сеттер на 35 миллиардов параметров.

Можно ли доверять

Фактура взята из текста аннотации/описания статьи; источник не называет авторов, институт и дату публикации, поэтому независимо сверить заявленные цифры (например, рост показателя с 0,204 до 0,815) с полным текстом статьи или сторонними обзорами по имеющимся данным нельзя. Пресс-заметка отмечает низкую вовлечённость и неясное авторство материала.

Риски и подводные камни

Заявленные улучшения получены на собственных синтетических бенчмарках авторов и на выбранных внешних тестах (function calling, планирование путешествий, E-Commerce Bench), неясно, насколько результат переносится на другие типы задач и реальные продакшен-сценарии. Отсутствие данных о том, как именно отбираются исходные математические модели и какие домены они покрывают, затрудняет оценку возможных смещений (bias) в сгенерированном наборе сред.

«Сравнение показывает, что основная часть обучаемого разрыва в качестве связана со stateful-взаимодействием, а не с решением задачи как таковой»

— авторы исследования