Puro-2B: языковую модель обучили дешевле $6900 на игровой RTX 5090, почти на уровне Qwen2.5-1.5B

Предобучение языковых моделей с нуля обычно стоит непомерно дорого и недоступно большинству академических команд и открытых проектов. По словам авторов, даже при скромном размере моделей обучение Llama-3.2-3B обходится больше чем в $1,5 млн, а воспроизведение SmolLM3-3B, больше чем в $700 тысяч. Открытые веса и открытые рецепты обучения уже существуют, но дешёвого и воспроизводимого на доступном железе рецепта предобучения долго не было.
Чтобы закрыть этот пробел, авторы выпустили открытый рецепт предобучения и семейство моделей Puro-2B. Модели коллекции обучены с нуля на потребительских видеокартах RTX 5090, с вычислениями в формате FP8, на бюджете до 1,4 триллиона токенов; модели различаются объёмом обучающих данных и вариантами рецепта. Лучшая модель коллекции обучена менее чем за $6900 и по собственному протоколу оценки авторов приближается к качеству Qwen2.5-1.5B (но не достигает его и не превосходит). Экономия обеспечена не одним приёмом, а сочетанием подходов: выбор железа, обучение в низкой точности, оптимизация "hyperball", усреднение моделей по учебному плану (curriculum model averaging) и специально составленный датасет.
Кроме самого рецепта, авторы приводят два дополнительных результата. Во-первых, по данным всей коллекции Puro-2B они вывели закон масштабирования стоимости (Puro Cost Scaling Law), связывающий затраты на обучение со средним качеством модели; по этому закону для выхода на уровень другой модели, Qwen2-1.5B, должно хватить примерно $4400, меньше $5090. Это оценка по экстраполяции закона, а не стоимость реально обученной модели. Во-вторых, авторы провели сквозное исследование того, как учебный план предобучающих данных (data curriculum) влияет на итоговое качество модели после дообучения; такое контролируемое исследование стало возможным именно потому, что у авторов есть доступ ко всему пайплайну предобучения, а не только к готовым весам.
Весь рецепт обучения Puro-2B, данные, код и веса моделей, выложен в открытый доступ под лицензией Apache 2.0.
Ключевые факты
- Открытый рецепт предобучения Puro-2B: модели обучены с нуля на потребительских GPU RTX 5090, в формате FP8, на бюджете до 1,4 трлн токенов
- Лучшая модель коллекции обучена менее чем за $6900 и приближается по качеству к Qwen2.5-1.5B (не достигает и не превосходит)
- Экономия обеспечена сочетанием приёмов: выбор железа, низкая точность вычислений, оптимизация "hyperball", усреднение моделей по учебному плану и специальный датасет
- Выведенный закон масштабирования стоимости обучения (Puro Cost Scaling Law) оценивает: для выхода на уровень Qwen2-1.5B может хватить около $4400 (меньше $5090), это экстраполяция, а не реально потраченная сумма
- Полный рецепт, данные, код и веса моделей, открыт под лицензией Apache 2.0
Почему это важно
Предобучение LLM с нуля обычно требует сотен тысяч или миллионов долларов, по приведённым в источнике примерам, воспроизведение Llama-3.2-3B стоит больше $1,5 млн, а SmolLM3-3B, больше $700 тысяч. Puro-2B показывает, что модель, приближающуюся по качеству к Qwen2.5-1.5B, можно обучить менее чем за $6900 на игровых видеокартах, а не в дата-центре. Это снижает порог входа в исследования предобучения для небольших лабораторий и энтузиастов.
Кому это важно
В первую очередь, академическим группам, независимым исследователям и open-source-командам, у которых нет бюджета на промышленные кластеры GPU. Также важно тем, кто изучает сам процесс предобучения (data curriculum, законы масштабирования): открытый доступ к полному пайплайну, а не только к готовым весам, позволяет ставить контролируемые эксперименты, которые невозможны при работе с чужими закрытыми моделями.
Как это применить
Весь рецепт, данные, код обучения и веса моделей Puro-2B, выложен под лицензией Apache 2.0, то есть доступен для свободного использования, изменения и коммерческого применения. Отдельные компоненты рецепта (обучение в FP8 на потребительских GPU, оптимизация "hyperball", усреднение моделей по учебному плану) можно заимствовать и для других проектов предобучения, не обязательно повторяя всю коллекцию Puro-2B целиком.
Можно ли доверять
Источник, препринт с полным описанием методики и метриками по собственному протоколу оценки авторов; сторонней проверки результатов на момент публикации нет. Важно не путать два разных числа: $6900, реальная стоимость обучения лучшей модели, которая лишь приближается к Qwen2.5-1.5B, а $4400 (меньше $5090), это оценка по выведенному закону масштабирования для достижения уровня другой модели, Qwen2-1.5B, а не результат реального запуска. Авторы и организация в самом тексте не названы.
Риски и подводные камни
В источнике нет ни таблицы бенчмарков, ни точных цифр качества, только качественное сравнение с Qwen2.5-1.5B и Qwen2-1.5B, что затрудняет независимую проверку. Не указаны ни количество использованных RTX 5090, ни время обучения в часах. Оценка в $4400, экстраполяция закона масштабирования, а не подтверждённый результат: реально обученная модель обошлась дороже, в $6900, и лишь приблизилась (не сравнялась) к целевому уровню качества.