SeT-Diff: диффузионная модель научилась предсказывать показания датчиков суперкомпьютеров

Дата-центры и суперкомпьютеры нуждаются в точных и гибких цифровых двойниках, которые умеют моделировать сложное взаимодействие нагрузки, параметров среды и физических показателей оборудования. Существующие модели машинного обучения для телеметрии HPC (высокопроизводительных вычислений) обычно работают с жёстким, заранее заданным набором анонимных датчиков в фиксированных позициях и заточены под одну конкретную задачу. Из-за этого такие модели быстро устаревают: стоит поменять состав сенсоров или саму задачу, и модель приходится переобучать заново.

Авторы предлагают SeT-Diff, по их утверждению, первую фундаментальную (foundation) модель для телеметрии и временных рядов вычислительных узлов. В отличие от жёстких архитектур конкурентов, SeT-Diff строится на диффузионном подходе и обуславливает процесс генерации не на номере или позиции датчика, а на его семантическом описании, то есть на том, что именно этот датчик измеряет. Это разрывает жёсткую привязку модели к структуре конкретного датасета: систему можно применять к другому набору сенсоров без переобучения.

Модель проверили на данных реального суперкомпьютера. На задаче восстановления показаний (reconstruction) SeT-Diff показала среднюю абсолютную ошибку (MAE) 0,0470. Отдельно продемонстрирована устойчивость к перестановке датчиков в режиме zero-shot: если поменять порядок сенсоров местами, точность модели почти не падает, качество работы не завязано на порядок входных данных.

Одна и та же предобученная модель, без дообучения под конкретную задачу, справляется сразу с тремя сценариями: восполнением пропущенных данных (imputation), прогнозированием (forecasting) и виртуальным сенсорингом, предсказанием показаний датчика там, где физического сенсора вообще нет. В задаче виртуального сенсора температуры (thermal inference) ошибка составила 0,033 MAE. Авторы называют SeT-Diff практичным data-driven цифровым двойником для HPC-систем.

Ключевые факты

  • SeT-Diff, заявленная первая фундаментальная (foundation) модель для телеметрии и временных рядов вычислительных узлов дата-центров и суперкомпьютеров
  • В основе, диффузионный подход, который обуславливает генерацию на семантическом описании датчика, а не на его позиции или ID, поэтому модель не привязана к структуре конкретного набора сенсоров
  • На реальных данных суперкомпьютера получена MAE 0,0470 на задаче восстановления показаний
  • Показана устойчивость к перестановке датчиков в режиме zero-shot: точность почти не падает, даже если поменять порядок сенсоров
  • Одна предобученная модель без дообучения решает восполнение пропусков, прогнозирование и виртуальный сенсоринг; для виртуального датчика температуры ошибка, 0,033 MAE

Почему это важно

Дата-центрам и суперкомпьютерам нужны цифровые двойники, отражающие сложное взаимодействие нагрузки, условий среды и физических параметров оборудования. Проблема существующих ML-подходов к телеметрии HPC в том, что они заточены под фиксированный, заранее известный набор анонимных датчиков и под одну задачу, стоит изменить состав сенсоров или саму задачу, и модель устаревает и требует переобучения. SeT-Diff решает именно эту проблему: диффузионная модель опирается на семантическое описание датчика, а не на его позицию, и потому не привязана жёстко к структуре одного датасета.

Кому это важно

В первую очередь, инженерам и исследователям, которые эксплуатируют дата-центры и суперкомпьютеры и строят системы мониторинга, предиктивного обслуживания и управления температурным режимом оборудования. Подход полезен там, где парк датчиков со временем меняется, различается между площадками или где часть показателей физически недоступна и её нужно восстанавливать расчётным путём.

Как это применить

Одна и та же предобученная модель без дообучения под конкретную задачу закрывает сразу три сценария: восполнение пропущенных показаний датчиков (imputation), прогнозирование их будущих значений (forecasting) и виртуальный сенсоринг, предсказание показаний там, где физического датчика вовсе нет. Для виртуального датчика температуры точность составила 0,033 MAE, что авторы считают практически пригодным результатом для использования модели как data-driven цифрового двойника HPC-системы.

Можно ли доверять

Работа проверена на данных реального суперкомпьютера, а не только на синтетике, и результаты выражены в конкретных численных метриках (MAE 0,0470 на восстановление, 0,033 MAE на виртуальный датчик температуры), включая отдельный эксперимент на устойчивость к перестановке сенсоров. При этом это препринт на arXiv без указания на прохождение рецензирования, а проверка выполнена на одном наборе данных с одной вычислительной системы, воспроизводимость на других суперкомпьютерах и парках оборудования пока не показана.

Риски и подводные камни

Главное ограничение, единственный реальный датасет: неизвестно, насколько хорошо модель обобщается на суперкомпьютеры другой архитектуры, другого вендора оборудования или с иным набором сенсоров. Качество семантических описаний датчиков, на которые опирается генерация, само по себе становится узким местом: неточное или неполное описание сенсора может исказить прогноз. Диффузионные модели также обычно требовательны к вычислениям на этапе инференса, а в статье не приводится оценка задержки или стоимости запуска в реальном времени, что важно для практического мониторинга дата-центра.