NVIDIA H100: конфиденциальный инференс на Intel TDX теряет до 28% скорости

Исследователи опубликовали на arXiv бенчмарк, который впервые системно измеряет цену конфиденциальных вычислений (confidential computing) для GPU-инференса больших языковых моделей. Confidential computing защищает обрабатываемые данные и веса проприетарных моделей во время выполнения, это становится практическим требованием для развёртывания ИИ-сервисов, работающих с чувствительными данными, но насколько это замедляет инференс на GPU, было плохо изучено.

Авторы сравнили обычный (не защищённый) режим выполнения с confidential-режимом на одной видеокарте NVIDIA H100 80GB, развёрнутой в конфиденциальном инстансе на базе Intel TDX (Trust Domain Extensions, технология доверенных доменов Intel). Тестировались две модели: Mistral-7B v0.1 и более крупная Qwen3-30B-A3B. Замерялись время до первого токена (TTFT), полная латентность запроса, скорость генерации токенов на один запрос, суммарная пропускная способность по токенам и пропускная способность запросов в закрытом цикле при растущей конкурентности.

В экспериментах с фиксированной частотой запросов confidential-режим увеличил среднее TTFT на 21,8% для Mistral-7B и на 27,8% для Qwen3-30B-A3B, а суммарная пропускная способность по токенам упала на 17,7% и 21,1% соответственно. В экспериментах с закрытым циклом и растущей конкурентностью разрыв в пропускной способности держался в диапазоне 11,5-20,2%, но у более крупной модели точка насыщения (излом кривой, после которого throughput перестаёт расти с ростом нагрузки) наступала раньше, чем в обычном режиме.

Вывод авторов: confidential GPU-инференс сохраняет пригодную для практического использования пропускную способность под нагрузкой, но при планировании мощностей нужно закладывать и постоянный штраф к throughput, и более раннее насыщение для крупных моделей.

Ключевые факты

  • Бенчмарк сравнил обычный и confidential-режим инференса на одной NVIDIA H100 80GB в конфиденциальном инстансе Intel TDX
  • Протестированы две модели: Mistral-7B v0.1 и более крупная Qwen3-30B-A3B
  • При фиксированной частоте запросов TTFT вырос на 21,8% (Mistral-7B) и 27,8% (Qwen3-30B-A3B), суммарный throughput упал на 17,7% и 21,1% соответственно
  • В сценарии закрытого цикла с растущей конкурентностью разрыв в throughput составил 11,5-20,2%, а у крупной модели точка насыщения наступает раньше
  • Вывод: confidential-инференс сохраняет рабочую пропускную способность, но требует отдельного планирования мощностей под этот штраф

Почему это важно

Confidential computing становится практическим требованием при развёртывании ИИ-инференса, который обрабатывает чувствительные данные пользователей или защищает проприетарные веса моделей от оператора инфраструктуры. Но до сих пор было мало предметных данных о том, какой ценой по производительности это достаётся на GPU. Работа впервые системно замеряет эту цену на реальном железе, NVIDIA H100 80GB в конфиденциальном инстансе на базе Intel TDX.

Кому это важно

Инженерам платформ инференса и MLOps-командам, которые проектируют облачные сервисы для отраслей с высокими требованиями к приватности данных, финтех, медицина, госсектор, а также любым компаниям, отдающим свои проприетарные модели на исполнение в чужую инфраструктуру и нуждающимся в гарантии, что веса и входные данные не утекут оператору.

Как это применить

Результаты дают конкретные ориентиры для планирования мощностей: закладывать в capacity planning падение суммарной пропускной способности на 17,7-21,1% и рост времени до первого токена на 21,8-27,8% при переходе на confidential-режим при фиксированной частоте запросов. При планировании под нарастающую конкурентную нагрузку важно учитывать, что более крупные модели упираются в потолок пропускной способности раньше, чем в обычном режиме, под них нужен больший запас по железу.

Можно ли доверять

Это академическая препринт-работа на arXiv с прямыми измерениями на реальном оборудовании (NVIDIA H100 в Intel TDX), а не маркетинговые заявления вендора GPU или производителя TEE. Методология, сравнение одинакового железа в двух режимах по нескольким независимым метрикам производительности, что повышает доверие к приведённым цифрам. В доступном тексте нет сведений об авторах, аффилиациях и статусе рецензирования.

Риски и подводные камни

Цифры получены на одной конкретной связке GPU и TEE-технологии (NVIDIA H100 + Intel TDX) и не обязательно переносятся на другие сочетания GPU и confidential-технологий, включая альтернативные подходы к доверенным средам выполнения. В тексте не раскрыты версии программного стека, размеры batch и точные параметры нагрузки, важные для воспроизводимости. Практически падение throughput на 17-21% и рост TTFT на 22-28% означает ощутимые дополнительные расходы на инфраструктуру при переводе продакшн-сервисов на confidential-режим.