Rufus-Air: открытый рецепт дообучения модели GLM-4.5-Air

Rufus-Air: открытый рецепт дообучения модели GLM-4.5-Air

Rufus-Air, это открытый и воспроизводимый рецепт пост-тренировки, применённый к базовой модели GLM-4.5-Air-Base (106B-A12B). Авторы описывают конвейер из восьми последовательных этапов: SFT (обучение с учителем), Reasoning RL, Coding RL, Instruction-Following RL, General Agent, Coding Agent, Search Agent и завершающий RLHF. По мере прохождения этапов обучение движется от базовых способностей к более сложным и от жёстких, легко проверяемых вознаграждений, к более мягким сигналам на основе оценщика (judge-based). Обучение опирается на открытые компоненты и публичные данные, значительная часть которых используется в исходном виде, без новой разметки людьми и без собственного «учителя» для дистилляции. Авторы формулируют четыре главных вывода: (1) разнообразный и качественный этап SFT задаёт прочную базовую планку возможностей модели; (2) фильтрация промптов по сложности удерживает обучение с подкреплением в продуктивном диапазоне; (3) надёжность вознаграждения, практический принцип для выбора порядка этапов; (4) инфраструктурные и инженерные решения, не техническая деталь реализации, а часть самого рецепта. По утверждению авторов, Rufus-Air превосходит официальный пост-тренированный релиз GLM-4.5-Air и конкурентоспособен с открытыми моделями схожего размера, однако конкретные числовые результаты бенчмарков в тексте не приводятся.

Ключевые факты

  • Rufus-Air, открытый и воспроизводимый рецепт пост-тренировки, применённый к GLM-4.5-Air-Base (106B-A12B)
  • Конвейер состоит из восьми последовательных этапов: SFT, Reasoning RL, Coding RL, Instruction-Following RL, General Agent, Coding Agent, Search Agent и RLHF
  • Обучение строится на открытых компонентах и публичных данных без новой ручной разметки и без собственного «учителя» для дистилляции
  • Ключевые выводы: качественный SFT даёт прочную базу, фильтрация по сложности удерживает RL в продуктивном диапазоне, надёжность вознаграждения определяет порядок этапов, инфраструктура, часть рецепта
  • По заявлению авторов, Rufus-Air превосходит официальный релиз GLM-4.5-Air и конкурентоспособен с открытыми моделями схожего размера, но конкретные цифры не опубликованы

Почему это важно

Работа документирует полный, воспроизводимый рецепт пост-тренировки крупной открытой модели, данные, дизайн вознаграждений, инфраструктуру, порядок этапов и промежуточные результаты. Для открытого сообщества это редкий уровень детализации: обычно такие подробности остаются внутри лабораторий крупных компаний.

Кому это важно

Прежде всего инженерам и исследователям, которые дообучают открытые модели семейства GLM или похожие модели-агенты, а также тем, кто выстраивает собственные пайплайны RL и SFT и ищет практические принципы упорядочивания этапов обучения.

Как это применить

Рецепт описан как воспроизводимый и опирается только на открытые компоненты и публичные данные, без новой ручной разметки и без отдельной модели-«учителя» для дистилляции, то есть теоретически его можно повторить, используя только открытые ресурсы, следуя заявленному порядку из восьми этапов.

Можно ли доверять

Источник, карточка препринта на Hugging Face; в тексте не названы ни авторы, ни организация, ни дата публикации, а заявления об улучшении по сравнению с официальным GLM-4.5-Air и конкурентоспособности не подкреплены конкретными числами бенчмарков, все выводы приведены в самоописании работы.

Риски и подводные камни

Без опубликованных числовых результатов оценить реальный прирост качества невозможно; утверждения о превосходстве над официальным релизом GLM-4.5-Air и конкурентоспособности с другими открытыми моделями пока остаются декларативными и требуют независимой проверки.