Датские учёные выпустили Mimir v1, модель на 1 млрд параметров на легальных данных пост-обучения

Авторы работы указывают: разработка современных языковых моделей опирается на огромные датасеты, часто собранные без разрешения правообладателей, это создаёт высокий барьер для исследователей, которые хотят работать с открытыми и этично собранными данными.
В ответ на эту проблему группа Danish Foundation Models представила Mimir v1, языковую модель на 1 млрд параметров, основанную на архитектуре Hierarchical Reasoning Model (HRM). Модель обучена с нуля на смеси из 161 датасета, состоящей исключительно из легальных, разрешённых к использованию данных пост-обучения. Работу представил Питер Шнайдер-Камп (Peter Schneider-Kamp) с соавторами; модель выложена в открытый доступ на Hugging Face Hub по адресу danish-foundation-models/DFM-Mimir.
По заявлению авторов, Mimir v1 превосходит исходную модель HRM-Text 1B и конкурирует по качеству с заметно более крупными моделями, Qwen 3.5 4B и Gemma 4 E2B, хотя параметров в ней в разы меньше. Для английского языка модель показывает высококонкурентные результаты, а для датского, устанавливает новый рекорд (state of the art). Проверка проводилась на 20 бенчмарках, охватывающих английский язык, математику и код, а также датский язык.
В самом тексте анонса нет конкретных числовых результатов бенчмарков, условий лицензии модели, названий 161 датасета из обучающей смеси и объяснения, чем архитектура HRM технически отличается от классического трансформера.
Ключевые факты
- Mimir v1, языковая модель на 1 млрд параметров на архитектуре Hierarchical Reasoning Model (HRM), обучена с нуля
- Обучающая смесь, 161 датасет, целиком состоящий из легальных (разрешённых к использованию) данных пост-обучения
- Новый рекорд (state of the art) для датского языка, высококонкурентные результаты для английского
- Превосходит исходную HRM-Text 1B и конкурирует с более крупными Qwen 3.5 4B и Gemma 4 E2B
- Проверена на 20 бенчмарках (английский, математика и код, датский); выложена на Hugging Face Hub
Почему это важно
Большинство современных языковых моделей обучают на огромных датасетах, собранных без ясного разрешения правообладателей, это создаёт правовой и этический риск и высокий барьер для тех, кто хочет работать с открытыми, легально собранными данными. Mimir v1 показывает, что даже относительно небольшая модель на 1 млрд параметров, обученная исключительно на разрешённых данных пост-обучения, может конкурировать по качеству с моделями в разы крупнее, это меняет представление о том, что путь к сильной модели обязательно лежит через спорные по происхождению данные.
Кому это важно
Исследователям и командам, которые разрабатывают открытые языковые модели и хотят снизить юридические риски, связанные с происхождением обучающих данных. Особенно, сообществу, работающему над датским и другими скандинавскими языками, для которых Mimir v1 устанавливает новый ориентир качества. Также интересно тем, кто ищет компактные модели: результат на уровне моделей в 4 раза крупнее достигнут при 1 млрд параметров.
Как это применить
Модель выложена в открытый доступ на Hugging Face Hub (danish-foundation-models/DFM-Mimir), её можно скачать и использовать или дообучать самостоятельно. Условия лицензии, конкретные числовые результаты по бенчмаркам и состав из 161 обучающего датасета в тексте анонса не раскрыты, за деталями нужно идти на саму страницу модели или в полный текст статьи.
Можно ли доверять
Заявления о превосходстве над HRM-Text 1B и конкурентоспособности с Qwen 3.5 4B и Gemma 4 E2B принадлежат самим авторам работы и в тексте анонса не подкреплены конкретными числами, бенчмарки названы (20 штук, для английского, математики с кодом и датского), но их результаты не приведены. Сама методология, обучение на 161 датасете исключительно легальных данных пост-обучения, прозрачно заявлена как ключевое отличие от конкурентов, но проверить это заявление по тексту анонса напрямую нельзя.
Риски и подводные камни
В тексте анонса нет ни одного конкретного числа по бенчмаркам, поэтому оценить реальный разрыв между Mimir v1 и Qwen 3.5 4B / Gemma 4 E2B невозможно, заявление о конкурентоспособности стоит проверять по полной статье или странице модели. Также не раскрыты условия лицензии модели и не объяснено, чем архитектура HRM отличается от стандартного трансформера, это ограничивает независимую оценку и практическую применимость подхода.