LiquidAI LFM2.5-350M дообучили методом GRPO: точность структурированных ответов выросла с 22,6% до 29,7%

Материал показывает, как дообучение методом GRPO (Group Relative Policy Optimization, групповая относительная оптимизация политики) через библиотеку TRL заметно поднимает способность компактной модели LiquidAI LFM2.5-350M (350 миллионов параметров) выдавать корректные структурированные ответы, JSON и YAML по заданной схеме.
За основу взят бенчмарк IFStruct, открытый тест на валидность и соответствие схеме ответов языковых моделей (репозиторий Liquid4All/ifstruct, датасет LiquidAI/ifstruct-v1.0). Перед дообучением базовую LFM2.5-350M прогнали через IFStruct локально, на сервере llama.cpp (MacBook Pro с чипом Apple M5 Max и 36 ГБ единой памяти): модель прошла 452 из 2000 тестов, то есть 22,6%, близко к 21,1%, которые для той же модели указаны в официальном релизном блоге IFStruct. Именно 22,6%, измеренные на своём стенде, автор берёт как базовую точку для сравнения, а не цифру из чужого блога.
Для дообучения к модели подключили LoRA-адаптер (ранг 16, альфа 32) на специфичных для гибридной attention/convolution-архитектуры LFM2.5 слоях, это около 6 миллионов обучаемых параметров, или 1,66% от полной модели. Обучающие данные, около 500 примеров из датасета nvidia/Nemotron-RL-instruction_following-structured_outputs, где к каждому запросу приложены целевая JSON-схема и ожидаемое число полей. Чтобы приблизить обучающие данные к формату оценки IFStruct, часть промптов доработали: 40% получили инструкцию оборачивать ответ в блок кода, а ещё отдельные 20% переделали в задачи с ответом-массивом верхнего уровня и заданным числом элементов.
Модель обучали 100 шагов GRPO с 8 генерациями на группу промптов, при learning rate 5e-5, температуре сэмплирования 1,1 и коэффициенте KL-штрафа (beta) 0,01, конфигурация рассчитана на бесплатный GPU с 16 ГБ памяти. Награду считали как взвешенную сумму трёх функций: за корректный и запрошенный формат вывода (JSON/блок кода), за совпадение числа полей объекта с ожидаемым (с линейным снижением балла при отклонении) и за прохождение валидации по JSON-схеме запроса, с весами 1,0, 0,5 и 2,0 соответственно.
После дообучения модель прогнали через тот же бенчмарк на том же локальном стенде: результат, 594 из 2000, то есть 29,7% (было 22,6%). По форматам: точность на JSON выросла с 18,0% до 31,9%, на YAML, с 27,2% до 27,5%. По типу структуры: доля прошедших тестов с ответом-массивом верхнего уровня («голый список») выросла с 16,6% до 29,7%, а с обёрткой-ключом, с 28,5% до 29,7%. Автор подчёркивает: цель работы, не воспроизвести оценку из релизного блога IFStruct и не повторить методику обучения RL-модели из того блога, а показать, что точечное дообучение небольшой модели под конкретную задачу способно приблизить её результаты к результатам куда более крупных моделей.
Ключевые факты
- LiquidAI LFM2.5-350M (350 млн параметров) дообучили методом GRPO через библиотеку TRL, 100 шагов, LoRA-адаптер на ~6 млн параметров (1,66% модели)
- На бенчмарке IFStruct точность выросла с 22,6% до 29,7% (452 → 594 из 2000 тестов); для JSON, с 18,0% до 31,9%, для ответов-массивов верхнего уровня, с 16,6% до 29,7%
- Для обучения использовали около 500 примеров из датасета nvidia/Nemotron-RL-instruction_following-structured_outputs и три взвешенные функции награды, за формат вывода, за число полей и за соответствие JSON-схеме
- Оценка проводилась локально через llama.cpp на MacBook Pro (Apple M5 Max, 36 ГБ памяти); обучение рассчитано на бесплатный GPU с 16 ГБ памяти
- Автор уточняет: цель, не повторить методику из релизного блога IFStruct, а показать, что точечное дообучение маленькой модели приближает её к результатам куда более крупных моделей
Почему это важно
Способность модели надёжно возвращать валидный, разбираемый ответ по заданной схеме, то, что называют «соответствием схеме» (schema compliance), часто и решает, можно ли вообще встроить модель во внешнюю систему, но большинство бенчмарков не выделяют эту способность отдельно, а размазывают её по общим оценкам рассуждений или извлечения данных. Материал показывает, что даже компактную модель на 350 миллионов параметров можно заметно подтянуть по этому параметру дёшево: 100 шагов дообучения GRPO и LoRA-адаптер на 1,66% параметров модели подняли долю прошедших тестов IFStruct с 22,6% до 29,7%.
Кому это важно
Инженерам, которые встраивают языковые модели в пайплайны с жёстким требованием к формату вывода (JSON или YAML под конкретную схему) и не могут положиться на крупную модель из-за стоимости или задержки; разработчикам, работающим с компактными и edge-моделями вроде LFM2.5-350M, которые можно дообучать и запускать локально; всем, кто использует TRL и GRPO для дообучения через обучение с подкреплением.
Как это применить
Автор выкладывает полный воспроизводимый пайплайн: ноутбук для дообучения рассчитан на бесплатный GPU уровня Colab или Kaggle, оценка, на обычном ноутбуке (MacBook Pro, Apple M5 Max, 36 ГБ памяти) через локальный сервер llama.cpp с OpenAI-совместимым API. Обучающие данные, около 500 примеров из открытого датасета nvidia/Nemotron-RL-instruction_following-structured_outputs, LoRA настроена под гибридную attention/convolution-архитектуру LFM2.5 (ранг 16, альфа 32), а награда, взвешенная сумма трёх функций (за формат вывода, за число полей и за прохождение валидации по JSON-схеме, веса 1,0/0,5/2,0). Все гиперпараметры GRPO (100 шагов, 8 генераций на промпт, learning rate 5e-5, температура 1,1, KL-коэффициент 0,01) приведены в тексте и рассчитаны на GPU с 16 ГБ памяти.
Можно ли доверять
Материал, технический разбор с открытым кодом, открытым датасетом и открытым бенчмарком (IFStruct, репозиторий Liquid4All), а не маркетинговое заявление: числа получены самим автором на собственном локальном стенде, а не переписаны из чужого отчёта. Локально измеренная точность базовой модели (22,6%) близка к цифре из официального релизного блога IFStruct (21,1%), что говорит в пользу воспроизводимости методики. Автор прямо оговаривает, что не пытался повторить ни итоговую оценку, ни методику обучения RL-модели из блога IFStruct, сравнение изолировано в рамках одного и того же стенда оценки. При этом кто именно написал материал (Hugging Face или LiquidAI), в тексте не указано, а из заключительной части, где должен был стоять итог сравнения двух прогонов, в сохранённом тексте статьи уцелел лишь обрывок фразы.
Риски и подводные камни
Обучающая выборка небольшая, около 500 примеров, и прирост точности неравномерный по категориям бенчмарка: по типу camera_review (обзор фотокамеры) доля прошедших тестов даже немного просела, с 7,2% до 6,0%, а по gpu_review (обзор видеокарты) и recipe (рецепт) осталась на уровне 6, 10% и после дообучения, обе категории были в числе самых слабых ещё до тюнинга. Самая частая ошибка на обоих прогонах, отсутствие обязательного поля в ответе, не исчезла: она остаётся главной причиной провала и после дообучения. Все цифры получены на одном конкретном стенде (свой LoRA-адаптер, свой набор наград с фиксированными весами, конкретная версия llama.cpp), сопоставимость такого прироста с другой моделью, другим бенчмарком или другим набором обучающих данных источником не проверялась.