WHALE: совместная настройка весов и обвязки ИИ-агента подняла точность

Качество работы ИИ-агента зависит не только от весов лежащей в его основе модели, но и от исполняемого кода обвязки (harness), программы, которая управляет контекстом (что модель видит) и логикой работы (когда и как она вызывается). Если настраивать только одну из этих двух частей, система упирается в потолок, заданный второй, замороженной частью: обновление весов может изменить, какая обвязка вообще подходит модели, а изменение обвязки, раскрыть или, наоборот, скрыть какие-то возможности модели. Существующие методы совместной адаптации дообучают веса вместе с текстовыми промптами, но саму более широкую обвязку, то есть весь управляющий код агента, а не только текст подсказки, оставляют неизменной.
Хэчан Ким (Haechan Kim) с соавторами предлагает WHALE (Weight-Harness Alternating LEarning, «попеременное обучение весов и обвязки»), рецепт, который чередует две фазы. В первой фазе веса модели дообучаются под текущую обвязку методом онлайн-дообучения с отбраковкой неудачных попыток (rejection-sampling fine-tuning): агент решает задачи, а модель дотягивается на успешных попытках. Во второй фазе, под уже обновлённые веса, ищется более удачная обвязка, методом, который авторы называют Meta-Harness. Момент переключения между фазами, отдельное решение: чтобы отличить реальное улучшение от шума и не подстраивать одну фазу под ещё меняющуюся другую, WHALE переключается либо через фиксированные по длительности интервалы, либо по адаптивному правилу «терпения» (patience), которое следит за сигналами обучения и меняет фазу, когда прогресс перестаёт расти.
В экспериментах с агентами на основе моделей Qwen3.5 размером 2 и 4 миллиарда параметров, в трёх разных областях, поиске ответов (SearchQA), математических рассуждениях и решении шахматных задач, WHALE обошёл три альтернативы: оптимизацию только весов, оптимизацию только обвязки и метод Fast-Slow Training. Прирост составил от 4,15 до 24,38 процентного пункта по лучшей достигнутой за обучение точности, усреднённой по восьми попыткам решения каждой задачи (best mean@8 accuracy). При этом узкое место в разных областях разное: в поиске ответов один только подбор обвязки без обновления весов достигает такого же пика точности, как оптимизация одних весов, но при заметно меньшем числе прогонов (rollouts); в математике же подбор обвязки помогает нарастить точность только после того, как веса модели уже обновились. Ещё один результат: частые небольшие чередования фаз обучения весов и подбора обвязки выигрывают у последовательной схемы «сначала все веса, потом вся обвязка», и по итоговой точности, и по числу требуемых прогонов. Код авторы выложили в открытый доступ в организации krafton-ai на GitHub.
Ключевые факты
- WHALE поочерёдно дообучает веса ИИ-агента (онлайн-дообучение с отбраковкой неудачных попыток, rejection-sampling fine-tuning) и подбирает более удачный код обвязки (harness) методом Meta-Harness, вместо того чтобы оптимизировать что-то одно.
- Момент переключения между двумя фазами задаётся либо фиксированной длительностью, либо адаптивным правилом «терпения» (patience) по сигналам обучения.
- На агентах Qwen3.5 (2 и 4 млрд параметров) в поиске ответов, математике и шахматных задачах WHALE обгоняет оптимизацию только весов, только обвязки и метод Fast-Slow Training на 4,15, 24,38 процентного пункта по точности (лучшее среднее по восьми попыткам, best mean@8).
- Узкое место разное для разных задач: в поиске ответов один подбор обвязки без изменения весов достигает пика точности весовой оптимизации при заметно меньшем числе прогонов (rollouts), а в математике обвязка помогает только после обновления весов.
- Частые небольшие переключения между фазами выигрывают у последовательной схемы «сначала веса, потом обвязка» и по точности, и по числу прогонов; код выложен в открытый доступ в организации krafton-ai на GitHub.
Почему это важно
Большинство способов улучшить ИИ-агента выбирают одно из двух: либо дообучают веса модели (например, обучением с подкреплением), либо вручную дорабатывают код обвязки, подсказки, память, порядок вызовов инструментов, оставляя другую часть системы нетронутой. Эта работа показывает, что обе части взаимозависимы: улучшение одной без другой упирается в потолок, который задаёт замороженная часть, потому что новые веса могут требовать другой обвязки, а новая обвязка, раскрывать другие способности модели. WHALE предлагает не выбирать одно из двух, а совместно чередовать обе настройки в одном цикле обучения.
Кому это важно
Тем, кто дообучает LLM-агентов обучением с подкреплением или методом отбраковки неудачных попыток и одновременно вручную настраивает их обвязку, память, промпты, порядок вызова инструментов: работа показывает, что эти два рычага нельзя дёргать по отдельности и рассчитывать на предсказуемый результат. Полезно и тем, кто занимается автоматическим поиском обвязки (harness search, автоматическая настройка промптов и логики агента), эксперименты показывают, в каких условиях такой поиск сам по себе не даёт прироста без обновления весов, а в каких, даёт его почти бесплатно, без единого шага дообучения весов.
Как это применить
Рецепт устроен как чередование двух шагов на одном и том же агенте: сначала веса модели дообучаются под текущую обвязку через онлайн-отбраковку неудачных попыток решения задач, затем под уже обновлённые веса методом Meta-Harness ищется более удачная обвязка, и цикл повторяется. Переключаться между шагами можно по простому расписанию (фиксированная длительность каждой фазы) либо по адаптивному правилу «терпения», которое ждёт, пока сигналы обучения перестанут расти, и только тогда меняет фазу. Код рецепта и экспериментов авторы выложили в открытый доступ в организации krafton-ai на GitHub, можно посмотреть реализацию обеих фаз и попробовать запустить их на своих задачах.
Можно ли доверять
В самом тексте аннотации не назван ни один автор и не указана организационная принадлежность, в метаданных страницы первым автором значится Хэчан Ким (Haechan Kim), но полный список соавторов и их институтов в тексте не приведён; единственная связанная с авторством деталь, адрес репозитория в организации krafton-ai на GitHub. Сам метод описан конкретно: две чётко названные фазы, две конкретные техники (rejection-sampling fine-tuning и Meta-Harness), два конкретных правила переключения, конкретное семейство моделей (Qwen3.5 2B/4B) и три конкретные предметные области. При этом в тексте нет ни одной абсолютной цифры точности ни для WHALE, ни для базовых методов, только разница в процентных пунктах между ними, и не сказано, какому концу диапазона 4,15, 24,38 п.п. соответствует какая область или какой базовый метод. Метод сравнения Fast-Slow Training назван, но не объяснён, что это за метод, из текста не следует.
Риски и подводные камни
Диапазон прироста в 4,15, 24,38 процентного пункта очень широкий и не привязан к конкретной области или базовому методу, поэтому по одному этому тексту нельзя понять, где выигрыш большой, а где почти незаметный. Абсолютных цифр точности нет вообще, так что нельзя оценить, насколько сильны или слабы были сами базовые методы, с которыми сравнивают WHALE. Эксперименты ограничены двумя относительно небольшими моделями (2 и 4 млрд параметров) и тремя предметными областями (поиск ответов, математика, шахматные задачи), перенос выводов на более крупные модели или на другие типы задач текстом не подтверждён. Наконец, в тексте обсуждается «стоимость прогонов» (rollout cost), но не приводится ни число прогонов, ни бюджет обучения, ни объём вычислений, количественно оценить обещанную экономию по одной аннотации нельзя.
Компания Meta Platforms признана экстремистской организацией, её деятельность на территории РФ запрещена.