Qwen Coder 3B возглавил бенчмарк малых языковых моделей для локального ИИ
Авторы статьи исходят из того, что демократизация ИИ, это не вопрос повторения возможностей передовых крупных моделей, а вопрос того, можно ли выбрать, проверить и специализировать модель в рамках железа и требований к управлению (governance), которые реально доступны рядовым организациям. Чтобы проверить это, они провели контролируемое сравнение девяти открытых языковых моделей с числом параметров от 135 миллионов до 3 миллиардов.
Для сравнения был построен бенчмарк из 1085 примеров по 16 темам в формате вопросов с выбором ответа, заточенный под структурированное локальное развёртывание: он проверяет точность работы с символами, соблюдение жёсткого формата вывода, извлечение информации и быстрые семантические решения, ответ модель обязана давать строго одной буквой.
Без дополнительного дообучения лучший результат показала Qwen Coder 3B, 75,67% точности. Далее идут Qwen2.5 1.5B (67,10%), Qwen3.5 2B (64,98%) и Granite 3.3 2B (64,61%).
Затем часть моделей дообучили по единому экономному конвейеру: 4-битное NF4-квантование с адаптерами в духе DoRA/LoRA, уместившимися в бюджет одного GPU уровня NVIDIA L4. На отложенной выборке из 108 примеров дообучение дало прирост точности: Qwen Coder 3B, плюс 26,85 процентного пункта, SmolLM2 1.7B, плюс 25,92, Qwen2.5 1.5B, плюс 19,44, SmolLM2 360M, плюс 10,18, SmolLM2 135M, плюс 5,55 процентного пункта.
Авторы разобрали результаты и по другим срезам, рейтингу моделей, различиям между темами, уровням сложности вопросов, структуре ошибок, соотношению затрат и качества и переносу знаний между темами, и во всех срезах вывод повторяется: дисциплинированный процесс из построения бенчмарка, сравнения моделей между собой и недорогой специализации уже делает часть моделей до 3 миллиардов параметров пригодными как локальные эксперты для узких структурированных задач.
Ключевые факты
- Протестировали 9 открытых моделей от 135 млн до 3 млрд параметров на бенчмарке из 1085 вопросов по 16 темам с ответом строго одной буквой
- Без дообучения лидирует Qwen Coder 3B, 75,67% точности; далее Qwen2.5 1.5B (67,10%), Qwen3.5 2B (64,98%), Granite 3.3 2B (64,61%)
- Дешёвое дообучение (4-битное NF4-квантование + DoRA/LoRA-адаптеры на одном GPU уровня NVIDIA L4) подняло точность Qwen Coder 3B на 26,85 п.п., SmolLM2 1.7B, на 25,92 п.п.
- У остальных моделей прирост от дообучения: Qwen2.5 1.5B +19,44 п.п., SmolLM2 360M +10,18 п.п., SmolLM2 135M +5,55 п.п.
- Вывод авторов: часть моделей до 3 млрд параметров уже пригодна как локальные эксперты для узких структурированных задач при недорогой специализации
Почему это важно
Авторы прямо формулируют тезис: доступность ИИ для рядовых организаций, это не гонка за размером и универсальностью топовых моделей, а вопрос того, можно ли выбрать подходящую модель, проверить её и дообучить под задачу в рамках реального железа и требований к управлению данными. Работа даёт для этого практическую опору, систематический бенчмарк и конвейер дообучения, а не единичный демонстрационный пример.
Кому это важно
Материал адресован тем, кто рассматривает локальное (on-premise) развёртывание ИИ вместо облачных крупных моделей: командам с ограниченным бюджетом на железо, организациям с требованиями по хранению данных внутри периметра и разработчикам узких локальных ассистентов под структурированные задачи, извлечение данных, классификацию, короткие семантические решения.
Как это применить
Практический путь, который описывает статья: сначала прогнать кандидатов через бенчмарк структурированных задач без дообучения и выбрать базовую модель (в тесте лучшей была Qwen Coder 3B), затем дообучить её дешёвым методом, 4-битное NF4-квантование с адаптерами DoRA/LoRA, на одном GPU уровня NVIDIA L4, без дорогого кластера.
Можно ли доверять
Это препринт на arXiv с контролируемой экспериментальной методологией: фиксированный бенчмарк, единый конвейер дообучения для всех моделей, числовые результаты по нескольким срезам (рейтинг, темы, сложность, ошибки, эффективность, перенос знаний). Имя автора(ов) в карточке источника не указано, рецензирование не подтверждено, как у любого препринта, независимая проверка результатов сообществом ещё впереди.
Риски и подводные камни
Бенчмарк, это вопросы с выбором ответа по 16 темам со строгим форматом вывода в одну букву: это узкий срез задач, и выводы не обязаны переноситься на свободную генерацию текста или более сложные рассуждения. Для дообучения всё равно нужен GPU уровня NVIDIA L4, то есть речь не о работе без всякого железа, а о существенно меньшем бюджете по сравнению с обучением крупных моделей. Прирост от дообучения также неравномерен между моделями (от 5,55 до 26,85 процентного пункта), то есть результат зависит от конкретной архитектуры.