Учёные представили FineServe, детальный датасет реальных нагрузок LLM-сервисов

Команда исследователей представила FineServe, набор данных о реальных нагрузках при обслуживании больших языковых моделей (LLM), собранный на глобальной коммерческой торговой площадке, которая предоставляет доступ сразу к нескольким моделям. Авторы отмечают, что LLM всё чаще работают как постоянно доступные онлайн-сервисы, поэтому эффективное обслуживание запросов, с низкой задержкой и высокой пропускной способностью при непредсказуемом спросе, стало критической инженерной задачей. Проблема в том, что прежние исследования нагрузок опирались на прокси-трейсы (косвенные данные, собранные не напрямую с боевых систем) или на слишком грубые обобщённые характеристики, которые не отражают разнородность современных платформ, обслуживающих сразу много разных моделей и типов задач.

FineServe устраняет этот пробел: это датасет «из реального мира» (in-the-wild), который позволяет детально, на уровне отдельных запросов и моделей, охарактеризовать динамику обслуживания в разнородной среде. Опираясь на эти данные, авторы провели анализ динамики поступления запросов и поведения токенов и показали, что режимы колебания нагрузки принципиально различаются в зависимости от архитектуры модели, её масштаба и типа решаемой задачи (task intent).

На основе этих наблюдений исследователи разработали генератор нагрузок FineServe, который собирает детализированные, учитывающие особенности конкретной модели нагрузки в настраиваемые смеси (mixtures). Это даёт разработчикам систем обслуживания LLM реалистичную основу для тестирования и сравнения стратегий маршрутизации запросов между моделями, планирования вычислений и управления мощностями на мультимодельных платформах. Датасет и генератор нагрузок выложены в открытый доступ на GitHub (репозиторий hihiztc1/FineServe).

Ключевые факты

  • FineServe, датасет с данными о реальных нагрузках обслуживания LLM, собранный на глобальной коммерческой площадке.
  • Датасет впервые даёт детальную (fine-grained) картину разнородных нагрузок на мультимодельных платформах вместо грубых обобщённых метрик, как в прежних работах.
  • Анализ показал, что динамика поступления запросов и поведение токенов принципиально различаются в зависимости от архитектуры, масштаба модели и типа задачи.
  • На основе данных исследователи создали генератор нагрузок FineServe, собирающий настраиваемые смеси нагрузок для бенчмаркинга.
  • Датасет и генератор нужны для тестирования маршрутизации, планирования и управления мощностями в системах обслуживания LLM; доступны на GitHub.

Почему это важно

LLM всё чаще работают как постоянно доступные онлайн-сервисы, поэтому эффективное обслуживание запросов, с низкой задержкой и высокой пропускной способностью при волатильном спросе, стало критической инженерной задачей. Прежние исследования нагрузок опирались на прокси-трейсы или грубые обобщённые характеристики, которые не отражают разнородность современных мультимодельных платформ обслуживания LLM. FineServe закрывает этот пробел: датасет «из реального мира», собранный на глобальной коммерческой площадке, впервые позволяет детально, на уровне отдельных запросов, охарактеризовать динамику обслуживания разных моделей и задач.

Кому это важно

Инженерам и исследователям, которые проектируют и тестируют системы обслуживания LLM: маршрутизацию запросов между моделями, планирование вычислений, управление мощностями. В первую очередь, командам, разрабатывающим инференс-платформы и облачные сервисы, одновременно обслуживающие несколько моделей.

Как это применить

На основе датасета авторы построили генератор нагрузок FineServe, который собирает детализированные, учитывающие особенности конкретной модели нагрузки в настраиваемые смеси. Это готовый инструмент для бенчмаркинга: разработчики платформ обслуживания LLM могут прогонять свои системы маршрутизации, планировщики и стратегии распределения мощностей на реалистичных, воспроизводимых нагрузках вместо синтетических прокси-трейсов. Датасет и генератор доступны на GitHub.

Можно ли доверять

Это препринт на arXiv; из аннотации не видно ни состава авторов, ни их организации, ни данных о рецензировании. При этом источник данных, реальная коммерческая площадка обслуживания LLM, а не синтетика, а код и датасет открыты и доступны на GitHub, что позволяет сообществу самостоятельно проверить их качество и воспроизвести анализ.

Риски и подводные камни

Данные собраны на одной конкретной коммерческой платформе, название которой в источнике не раскрывается, поэтому выводы о характере нагрузок могут не обобщаться на все сценарии промышленной эксплуатации LLM, включая закрытые корпоративные развёртывания. Отсутствие информации о платформе-источнике затрудняет независимую оценку репрезентативности датасета.