DeepSeek-V4 дообучили на Huawei Ascend в 2.93 раза эффективнее

Группа исследователей (первый автор, Dongfang Li) опубликовала работу о полнопараметрическом дообучении (full-parameter post-training) MoE-моделей масштаба триллион параметров на суперкластере Huawei Ascend NPU SuperPOD. Дообучение моделей такого размера создаёт системные трудности: нехватку памяти, накладные расходы на связь между узлами без перекрытия с вычислениями и неэффективное исполнение вычислительных ядер. Большинство систем такого масштаба строится вокруг GPU-кластеров, авторы же показывают сквозную (end-to-end) оптимизацию именно под архитектуру Ascend NPU.
В качестве целевой нагрузки взято семейство моделей DeepSeek-V4. Авторы разработали иерархический фреймворк оптимизации на трёх уровнях: параллелизм на уровне модели, оркестрация вычислений и связи между узлами, низкоуровневое исполнение вычислительных ядер. Итоговая система достигает 34.22% MFU (Model FLOPs Utilization, доля теоретической производительности чипа, реально используемая при обучении), это в 2.93 раза больше, чем у открытой базовой методики (open-source baseline), при сохранении стабильности обучения.
На основе этой оптимизированной инфраструктуры авторы построили конвейер продолженного предобучения (CPT) и дообучения с учителем (SFT) для сложных задач исследования операций (Operations Research, OR), например, задач математической оптимизации. Используя модель DeepSeek-V4-Flash, они собрали датасет из 10 тысяч высококачественных SFT-примеров, охватывающих четыре категории задач и три способа представления задач. Данные объединяют материалы по предметной области с синтетическими документами по оптимизации, верифицированными решателем (solver-verified).
Специализированная модель, полученная в результате этого конвейера, показала наивысший средний Pass@1 в zero-shot режиме среди всех сравниваемых моделей, 71.81%, опередив GPT-5.4-Mini на 3.98 процентного пункта и базовую DeepSeek-V4-Flash на 11.27 процентного пункта. Весь интегрированный фреймворк авторы называют SLAI T-Rex и представляют его как сквозной путь: от эффективного дообучения триллион-параметрических моделей на инфраструктуре Ascend до доменно-специализированных Flash-моделей для решения сложных задач математического моделирования.
Ключевые факты
- SLAI T-Rex, фреймворк полнопараметрического дообучения триллион-параметрических MoE-моделей на Huawei Ascend NPU SuperPOD, целевая модель, семейство DeepSeek-V4.
- Иерархическая оптимизация (параллелизм модели, оркестрация вычислений/связи, вычислительные ядра) даёт 34.22% MFU, в 2.93 раза больше открытой базовой методики, стабильность обучения сохраняется.
- Для DeepSeek-V4-Flash построен конвейер CPT+SFT под задачи исследования операций: датасет из 10 тыс. примеров, четыре категории задач, три формата представления.
- Специализированная OR-модель достигает 71.81% Pass@1 в zero-shot режиме, на 3.98 п.п. выше GPT-5.4-Mini и на 11.27 п.п. выше базовой DeepSeek-V4-Flash.
Почему это важно
Полнопараметрическое дообучение моделей триллионного масштаба, одна из самых ресурсоёмких задач в ИИ: нехватка памяти, задержки на межузловой связи и неэффективное исполнение вычислительных ядер обычно снижают реальную производительность кластера до малой доли теоретического максимума. Работа показывает, что сквозная оптимизация под конкретное железо (Ascend NPU, а не привычные GPU) способна почти утроить полезное использование вычислений (MFU вырос в 2.93 раза), а полученная инфраструктура затем используется для создания специализированной модели, которая обгоняет более крупные и универсальные аналоги на своей нише задач.
Кому это важно
Инженерам систем обучения больших MoE-моделей и командам, работающим с альтернативным (не-GPU) железом, прежде всего с NPU Ascend; исследователям, создающим доменно-специализированные модели для задач исследования операций и математической оптимизации; всем, кто оценивает конкурентоспособность экосистемы Huawei Ascend как альтернативы GPU-кластерам для обучения ИИ.
Как это применить
Практическая ценность работы, в наборе конкретных инженерных приёмов (параллелизм на уровне модели, оркестрация вычислений и связи, оптимизация ядер), которые можно переносить на другие крупномасштабные обучения MoE-моделей. Методика сбора OR-датасета, комбинация материалов по предметной области с синтетическими задачами, верифицированными решателем, тоже воспроизводима для других специализированных доменов, где важна проверяемая корректность ответа.
Можно ли доверять
Работа, технический отчёт с конкретными количественными результатами (34.22% MFU, 2.93x, Pass@1 71.81%), но опубликована как отчёт самих авторов без указания на независимое стороннее рецензирование; сравнение с GPT-5.4-Mini и базовой DeepSeek-V4-Flash проведено самими авторами на собственном бенчмарке, что типично для такого рода отчётов, но требует поправки на возможную оптимизацию под свои же метрики.
Риски и подводные камни
Результаты получены на специфической инфраструктуре (Ascend SuperPOD) и могут не переноситься напрямую на GPU-кластеры или другие конфигурации NPU. Специализация модели под задачи исследования операций (71.81% Pass@1) не означает превосходства в общих задачах, базовая DeepSeek-V4-Flash и GPT-5.4-Mini сравнивались именно на OR-бенчмарке, а не на широком спектре задач.