В блоге Hugging Face описали, как собрать шесть малых моделей через ML Intern

В блоге Hugging Face вышел пост от первого лица (имя автора в тексте не указано) о том, как собрать небольшую специализированную модель, если подходящей готовой нет. Отправная точка: автору понадобилась компактная версия переписчика промптов (prompt rewriter) из Qwen-Image 2.1. Официальный, модель на 9 млрд параметров, ей нужно около 20 ГБ памяти, и перед одним абзацем она «думает» тысячи токенов. На Hub автор нашёл лишь сжатые копии той же 9B-модели. Он описал задачу агенту ML Intern, а на следующий день получил версию на 0,8 млрд параметров, которая работает на процессоре, выдаёт корректный результат в 99,7% случаев и тратит примерно четверть токенов «учителя». Вся работа, включая разметку 8 797 примеров девятимиллиардной моделью, обошлась в USD 16.
За следующие дни автор сделал ещё пять моделей тем же способом. Каждая начиналась с сообщения в HuggingChat с включённым режимом ML-intern, а заканчивалась публичной моделью на Hub с оценкой качества в карточке. По описанию автора, агент планирует работу, перед тратами запрашивает бюджет, запускает небольшой пробный прогон перед основным заданием, затем обучает, оценивает и публикует модель на оборудовании Hugging Face.
О промптах. Основные усилия автор вкладывает в первое сообщение: первый промпт (для модели по цитрусам) занимал около 450 слов, к шестому проекту вырос почти до 2 000 слов. Все семь промптов лежат на GitHub (yvrjsharma/ml-intern-prompts) в исходном виде. Структура такая: идея в одной строке и мотивация; точные названия набора данных, базовой модели и обучающего скрипта; раздел «Verified facts, do not re-derive» («проверенные факты, не выводить заново») с тем, что автор уже выяснил, чтобы агент не тратил бюджет на повторные открытия; в конце, ожидаемые результаты, содержимое карточки модели и лимит расходов. Две строки автор считает критичными: просьба замерить базовую модель до обучения и пробный запуск с проверкой (для изображений, 50 шагов обучения и проверка, что сохранённые веса действительно изменились, прежде чем платить за полный запуск). По словам автора, ML-intern начинает каждую задачу с нулевым бюджетом и требует разрешения на платные задания, поэтому лимит соблюдается жёстко; если бюджет не указан, агент предлагает несколько вариантов в зависимости от размера проекта. Всё это нужно не сразу: в первом (цитрусовом) промпте раздела с проверенными фактами не было, и модель всё равно более чем втрое улучшила точность Qwen3.5-2B.
Шесть моделей. 1) Цитрусы: Qwen3.5-2B дообучена на наборе citrus-disease-vlm-instruct (3 017 размеченных изображений, 21 категория вредителей, болезней, нехватки питания и способов лечения; собран автором с помощью Claude из трёх источников организации Project-AgML). На 335 тестовых фото базовая модель называла верную проблему в 14,9% случаев, после двух эпох на одной A10G, в 52,8%; расходы около USD 1,90. 2) Персонаж Huggy: LoRA на FLUX.2 klein base 4B, обученная на 84 подписанных рисунках; контрольные точки сохранялись каждые 100 шагов, на шаге 200 Huggy впервые выглядел полностью «в образе», а начиная с шага 500 его стиль просачивался в несвязанные запросы; около USD 7,60. 3а) LoRA для смены ракурса камеры у Qwen-Image 2.1: когда автор проверил через несколько дней после выхода модели, такой никто не сделал. ML-intern отрендерил 1 030 отсканированных бытовых предметов из Google Scanned Objects под 24 углами (24 722 изображения с прозрачным фоном), в итоге в обучении 461 предмет, ещё 40 отложены для теста, 1 844 пары «до/после» на 23 инструкции по камере. Обучение: 2 000 шагов, около 90 минут на одной A100 (~USD 3,75); проект занял около полудня и 48 заданий (часть упала из-за отсутствующих пакетов и неверных путей, и агент запускал их заново); всего около USD 16. 3б) Doodle-in LoRA: на фото рисуется пурпурная закорючка, в подсказке называется предмет, и LoRA заменяет закорючку этим предметом, сохраняя освещение и композицию. Набора данных не существовало, поэтому промпт описывал его сборку: взять фото из Open Images, убрать предмет моделью LaMa, нарисовать закорючку на его месте; нетронутое фото служит целью. Получилось 6 042 обучающие пары и тест из 160 пар (40 из них, из 23 классов предметов, исключённых из обучения). Обучение: 2 000 шагов за 1 час 38 минут на A100 (~USD 4); по сравнению сохранённых точек на 48 тестовых парах выбран шаг 500. В паре с ускоряющей LoRA Viggle turbo на 6 шагах предмет оказывался там, где нарисован, в 67,5% случаев, 4,7 секунды на правку; для 23 не виденных классов, 65,0% против 64,2% у остальных. Проект: чуть больше суток, 59 заданий, около USD 24. 4а) Pocket Rewriter, тот самый переписчик промптов: ML-intern сгенерировал 8 797 коротких запросов на картинки (фото, плакаты, логотипы, инфографика; примерно треть, с точным текстом в кавычках, много не на английском), 9B-«учитель» переписал их на одной A100 за 2 часа 37 минут (~USD 6,50), после фильтрации осталось 1 840 примеров. «Ученики» на 0,8B и 2B обучались 12 и 18 минут на A10G (USD 0,75 на двоих); 0,8B также выпущена как файл GGUF на 812 МБ для процессора. Проект: около 11 часов, 24 задания, около USD 16. 4б) Agate-Preview-002-4step: Agate Preview 002 от Logolabs, модель text-to-image на 260 млн параметров, которой нужно 50 шагов с управлением подсказкой (100 проходов сети на картинку). Автор попросил сжать её до 4 проходов. Первый запуск: 155 000 изображений в виде латентов, «запекание» управления в модель, затем сокращение числа шагов ступенями 16, 8, 4; четырёхшаговый «ученик» обошёл «учителя» на тех же 4 шагах по GenEval и FID, после чего ML-intern экспортировал его в ONNX для браузера (около 13 часов, USD 22). Второй запуск: 24 000 дополнительных пар от «учителя» на 16 шагах и около часа дообучения; GenEval вырос с 0,509 до 0,536 при 0,563 у «учителя» на 50 шагах; около 8 часов. Общие расходы по двум запускам, около USD 37.
В конце автор советует включить режим ML-intern в HuggingChat, вставить промпт, задать небольшой бюджет, попросить базовый замер и пробный запуск и проверять результат, прежде чем поднимать лимит. Свои примеры промптов он предлагает копировать свободно.
Ключевые факты
- Автор поста в блоге Hugging Face описывает шесть моделей, собранных за несколько дней: в каждом случае он пишет сообщение в HuggingChat с режимом ML-intern, а агент планирует, обучает, оценивает и публикует модель на Hub.
- Pocket Rewriter на 0,8 млрд параметров заменяет 9B-переписчик промптов Qwen-Image 2.1: работает на процессоре, корректный результат в 99,7% случаев, около четверти токенов «учителя»; весь проект обошёлся в USD 16.
- Цитрусовая модель на базе Qwen3.5-2B повысила долю верно названных проблем на 335 тестовых фото с 14,9% до 52,8% при расходах около USD 1,90.
- Расходы по проектам варьируются от около USD 1,90 до около USD 37 (сжатие модели Agate до 4 шагов в два запуска, GenEval 0,509 → 0,536 против 0,563 у «учителя» на 50 шагах).
- Рецепт промпта: идея и мотивация, точные ресурсы, раздел «проверенные факты», базовый замер до обучения, пробный запуск с проверкой и жёсткий лимит бюджета; семь промптов опубликованы на GitHub.
Почему это важно
Пост показывает практический сценарий: когда нужной малой модели нет на Hub, её можно заказать агенту на естественном языке и получить опубликованную модель с оценкой в карточке. Самый яркий пример: вместо сжатых копий 9B-переписчика, которым нужно около 20 ГБ памяти, получена версия на 0,8 млрд параметров, запускаемая на процессоре (файл GGUF на 812 МБ), за USD 16 и около 11 часов. Для сравнения, остальные проекты в посте стоят от около USD 1,90 до около USD 37 а там, где сроки названы, занимают от полудня до чуть более суток.
Кому это важно
Разработчикам и исследователям, которым нужна небольшая специализированная модель под узкую задачу (классификация по фото в своей области, LoRA для персонажа или нового приёма, дистилляция для браузера или процессора) и которые не хотят сами писать весь конвейер обучения. Полезен и как справочник по построению промптов для агентов: структура, раздел с проверенными фактами, лимит бюджета.
Как это применить
Автор советует: включить режим ML-intern в HuggingChat и вставить промпт; начать с модели, которой вам не хватает, и набора данных, который у вас есть или который можно описать; задать небольшой бюджет; обязательно попросить замер базовой модели до обучения и пробный запуск с проверкой (например, 50 шагов обучения и проверка, что веса изменились); читать результат, прежде чем поднимать лимит. Семь промптов автора опубликованы на GitHub (yvrjsharma/ml-intern-prompts) и свободны для копирования. Если бюджет не указать, агент предложит несколько вариантов по размеру проекта. Условия использования самого режима ML-intern в HuggingChat в тексте не описаны; в посте приводятся только расходы на графические и процессорные задания.
Можно ли доверять
Это рассказ одного автора о собственных проектах, без независимой проверки или сторонней оценки моделей. Как именно измерены 99,7% корректного вывода и «четверть токенов» и на каком тестовом наборе, в тексте не сказано. Для LoRA с Huggy и сменой ракурса числовых результатов в тексте нет. Частично выводы можно проверить самому: автор указывает, что оценки приведены в карточках публичных моделей на Hub, а промпты лежат на GitHub. В тексте также расходятся счётчики («пять моделей», «семь промптов», шесть пунктов, во втором из которых два запуска), и объяснения нет.
Риски и подводные камни
Расходы в посте, итог удачных проектов; автор сам отмечает, что в проекте со сменой ракурса часть из 48 заданий упала из-за отсутствующих пакетов и неверных путей и их пришлось перезапускать. Агент не гарантирует высокое качество: цитрусовая модель угадывает проблему лишь в 52,8% случаев, а у Huggy при долгом обучении стиль начал просачиваться в несвязанные запросы (поэтому нужен выбор контрольной точки). Лимит бюджета держится на том, что ML-intern начинает с нулевого бюджета и просит разрешения на платные задания, но подробные таблицы расходов в тексте не приведены. Автор настаивает на проверке результата перед повышением лимита.
«Ограничь общие расходы суммой в USD 12 и спроси меня, прежде чем её превысить.»
— автор поста, пример инструкции из своих промптов для ML Intern