Qwen3-Coder и Gemma 4 деградируют как агенты, копируя эксперта

Qwen3-Coder и Gemma 4 деградируют как агенты, копируя эксперта

«Обвязка» ИИ-агента, это системный промпт, набор инструментов, хуки выполнения и механизм управления контекстом вокруг модели. По утверждению исследователей, именно обвязка в решающей степени определяет, справится ли агент с задачей. Автоматическая эволюция такой обвязки уже умеет подтягивать более слабые и заметно более дешёвые модели до уровня, который на конкретных предметных (узкоспециализированных) задачах не уступает топовым моделям. Раз и обвязка, и веса модели вместе формируют поведение агента, возникает вопрос: как эволюцию обвязки лучше сочетать с лёгким дообучением самой модели?

Авторы проверили это на семи корпоративных агентных задачах. Сначала они эволюционировали обвязку под слабую модель, а затем обнаружили, что более сильная модель-«эксперт» использует эту же обвязку даже эффективнее слабой модели. Отсюда напрашивался очевидный ход: раз эксперт так хорошо ладит с этой обвязкой, дообучить на его примере саму слабую модель, на полных траекториях (полных примерах решения задачи), которые эксперт прошёл именно под этой обвязкой.

Результат оказался обратным ожиданиям. Дообучение слабой модели на полных траекториях эксперта под эволюционировавшей обвязкой не улучшает, а ухудшает результат, сразу на всех семи задачах, на 4, 30 пунктов (проверено на моделях Qwen3-Coder и Gemma 4). Показательно, что та же самая процедура дообучения помогает, если применить её к обычной, не эволюционировавшей обвязке: дело не в дообучении на действиях эксперта самом по себе, а именно в его сочетании с обвязкой, «заточенной» под другую модель.

Анализ авторов объясняет причину. Имитация действий эксперта действительно передаёт слабой модели знания и заставляет её активнее использовать инструменты обвязки, но при этом ломает соответствие между моделью и обвязкой: слабая модель перенимает стиль планирования эксперта, не имея компетенции его исполнить, и перестаёт соответствовать обвязке, которая была эволюционно подстроена именно под её собственный, а не под чужой стиль планирования.

Решение, которое предлагают авторы, конвейер точечной коррекции эксперта (в тексте он назван on-policy expert-correction). Процесс автоматизирует отдельный агент, играющий роль ML-инженера на мета-уровне (meta-level MLE agent): он находит именно тот шаг, на котором слабая модель ошиблась в своей собственной попытке (прогоне) решения задачи, и просит эксперта переписать только этот один шаг, а не всю траекторию целиком. Так сохраняется собственный стиль планирования слабой модели, а выигрыш от эволюции обвязки и от дообучения модели складывается, а не гасит друг друга.

Авторы формулируют это как обнаружение и устранение конфликта между обновлением обвязки агента и обновлением весов модели, «рецепт совместного развития, сохраняющий совместимость» для экономичного повышения качества ИИ-агентов на узкоспециализированных корпоративных задачах.

Ключевые факты

  • На семи корпоративных агентных задачах авторы сначала эволюционировали обвязку под более слабую модель, а затем обнаружили, что более сильная модель-эксперт использует эту же обвязку даже эффективнее слабой модели.
  • Дообучение слабой модели на полных траекториях эксперта под этой эволюционировавшей обвязкой ухудшает результат на всех семи задачах, на 4, 30 пунктов (проверено на Qwen3-Coder и Gemma 4), хотя та же процедура дообучения помогает, если применить её к обычной, не эволюционировавшей обвязке.
  • Причина, по анализу авторов: имитация эксперта передаёт знания и увеличивает использование инструментов обвязки, но ломает соответствие модели и обвязки, слабая модель перенимает стиль планирования эксперта, не имея компетенции его исполнить.
  • Предложенное решение, конвейер точечной коррекции эксперта: автоматизированный агент (meta-level MLE agent) находит сбойный шаг в собственной попытке слабой модели и просит эксперта переписать только этот шаг, не трогая остальную траекторию.
  • Такая точечная коррекция сохраняет собственный стиль планирования модели и одновременно даёт выигрыш и от эволюции обвязки, и от дообучения, авторы называют это рецептом совместного развития, сохраняющим совместимость обвязки и модели.

Почему это важно

Автоматическая эволюция агентной обвязки, многообещающий способ получить от небольшой и дешёвой модели результат, который на конкретной задаче не уступает дорогой топовой модели. Казалось бы, естественный следующий шаг, дообучить слабую модель на действиях более сильного эксперта поверх такой обвязки. Это исследование показывает, что интуитивный ход работает наоборот: результат проседает на 4, 30 пунктов на всех семи проверенных задачах. Ценность работы в том, что она называет точную причину провала, разрыв между стилем планирования модели и обвязкой, заточенной под другой стиль, и предлагает рабочий обход: точечную правку одного шага вместо копирования всей траектории эксперта. Это делает получение экспертного уровня качества агентов дешевле.

Кому это важно

Инженерам, которые строят и дообучают ИИ-агентов для конкретных прикладных, в первую очередь корпоративных задач и одновременно настраивают системный промпт, набор инструментов и логику агента. Командам, которые пытаются заменить дорогую топовую модель более дешёвой ради экономии, не потеряв в качестве. Исследователям методов дообучения и имитационного обучения агентов, которые ищут причины, почему перенос знаний от сильной модели к слабой не всегда работает, даже если формально это тот же самый способ обучения.

Как это применить

Практический вывод: не стоит дообучать слабую модель на полных траекториях эксперта, если обвязка агента уже эволюционировала под саму эту слабую модель, так можно ухудшить, а не улучшить результат. Вместо этого нужен конвейер, который сначала прогоняет слабую модель по задаче в её собственном стиле, находит момент, где она ошиблась, и передаёт эксперту на переписывание только этот один шаг, а не всю траекторию. В тексте этот процесс описан как автоматизированный отдельным агентом уровня ML-инженера на мета-уровне (meta-level MLE agent). Авторы не приводят ни кода, ни данных, ни описания семи конкретных задач, так что для переноса метода в свой проект конвейер локализации и переписывания шагов придётся реализовывать самостоятельно.

Можно ли доверять

Это препринт, размещённый на HuggingFace Papers; сам текст аннотации не называет ни авторов, ни организацию, ни дату публикации. Результаты получены на семи «корпоративных агентных задачах», но сами задачи не названы и не описаны; регресс на 4, 30 пунктов и выигрыш от новой методики измерены и представлены самими авторами, без упоминания независимой проверки или рецензирования. Источник не раскрывает ни абсолютные показатели качества до и после, ни код, ни модели целиком, ни датасет, только относительный сдвиг результата. К выводам стоит относиться как к заявлению авторов, пока не подтверждённому со стороны.

Риски и подводные камни

Метод по-прежнему требует доступа к более сильной модели-эксперту и к отдельному автоматизированному агенту, который ищет сбойный шаг, то есть не убирает зависимость от дорогой модели полностью, а меняет способ её использования. Семь задач, на которых проверен эффект, не названы и не описаны, поэтому неясно, насколько регресс на 4, 30 пунктов и его исправление переносятся на задачи за пределами эксперимента. Авторы не публикуют ни код, ни данные, ни точный механизм работы «агента уровня ML-инженера», воспроизвести результат по одному только тексту аннотации нельзя.