Исследователи предложили прогнозировать задержки LLM на edge-устройствах
Статья посвящена выбору LLM для развёртывания на разнородных периферийных устройствах, где задержка инференса зависит не только от архитектуры модели и запроса, но и от среды выполнения, загрузки аппаратуры, динамического изменения напряжения и частоты (DVFS) и температуры. Авторы предлагают учитывать эти факторы при прогнозировании времени ответа, чтобы быстрее отсеивать неподходящие модели для конкретного сценария развёртывания.
Каждый запрос в предложенной схеме описывается конфигурацией из аппаратного обеспечения, среды выполнения, модели и промпта. Инференс разделяют на этапы prefill и decode, а модель прогноза с помощью управляемого механизма объединяет статические признаки с динамической телеметрией устройства.
Метод оценивали на мобильных устройствах Pixel и проверяли конвейер профилирования на Jetson Nano, Orange Pi 5 Pro и платформе с GPU класса RTX 3090. На Pixel 8 полный предиктор повысил R² для общей задержки с 0,953 до 0,960, а для задержки decode, с 0,957 до 0,973 по сравнению с вариантом только со статическими признаками. На Pixel 8 Pro R² для prefill вырос с -1,383 до 0,966. При переносе с Pixel 8 Pro на Pixel 8 калибровка подняла R² общей задержки с -0,974 до 0,940, а decode, с -1,085 до 0,927. Авторы также показывают, что скорость существенно зависит от устройства и среды: одна и та же семья SmolLM2 достигала 8,42 токена в секунду на Orange Pi 5 Pro и 64,38 токена в секунду на GPU класса RTX 3090. По выводам работы, прогноз с учётом среды выполнения и лёгкой калибровкой может снизить стоимость профилирования и помочь выбирать LLM с учётом задержки на разных периферийных платформах.
Ключевые факты
- Предиктор учитывает аппаратное обеспечение, среду выполнения, модель, промпт и динамическую телеметрию устройства.
- Инференс разделён на этапы prefill и decode, для которых задержку оценивают отдельно.
- На Pixel 8 R² общей задержки вырос с 0,953 до 0,960, а decode, с 0,957 до 0,973 относительно статического базового варианта.
- Калибровка при переносе с Pixel 8 Pro на Pixel 8 повысила R² общей задержки с -0,974 до 0,940.
- SmolLM2 показала 8,42 токена в секунду на Orange Pi 5 Pro и 64,38 токена в секунду на GPU класса RTX 3090.
Почему это важно
На периферийных устройствах время ответа LLM определяется не только самой моделью: на него влияют запрос, среда выполнения, загрузка аппаратуры, DVFS и температура. Поэтому измерения на одном устройстве нельзя безоговорочно переносить на другое. Работа предлагает прогнозировать задержку с учётом этих условий, а не выбирать модель только по статическим характеристикам.
Кому это важно
Подход рассчитан на тех, кто развёртывает или отбирает LLM на мобильных и других периферийных устройствах. В эксперименте использованы Pixel, Jetson Nano, Orange Pi 5 Pro и платформа с GPU класса RTX 3090, что иллюстрирует различия между мобильными, одноплатными и более мощными системами.
Как это применить
Для каждого предполагаемого запроса нужно собрать конфигурацию из устройства, среды выполнения, модели и промпта, а также телеметрию. Затем задержку prefill и decode можно оценивать раздельно; при переносе на другое устройство авторы предлагают лёгкую калибровку. Это может уменьшить объём прямых замеров при отборе модели.
Можно ли доверять
Это исследовательская работа с количественными результатами на нескольких платформах. В тексте приведены показатели R² для Pixel 8, Pixel 8 Pro и переноса между ними, а также проверка профилирования на других устройствах. Однако результаты относятся к описанному набору устройств, сред выполнения и условиям эксперимента.
Риски и подводные камни
Задержка остаётся зависимой от конкретного устройства и среды выполнения: разница для SmolLM2 между Orange Pi 5 Pro и GPU класса RTX 3090 составила 8,42 против 64,38 токена в секунду. Поэтому метод требует данных о целевой конфигурации и калибровки при переносе; показатели, полученные на одной платформе, сами по себе не гарантируют точность на другой.