DiffusionGemma: диффузионная языковая модель разгоняет генерацию текста до 1500 токенов в секунду

DiffusionGemma: диффузионная языковая модель разгоняет генерацию текста до 1500 токенов в секунду

Команда, называющая себя DiffusionGemma Team, опубликовала технический отчёт о DiffusionGemma, экспериментальной языковой модели с открытыми весами, которая генерирует текст с помощью дискретной диффузии. Вместо того чтобы декодировать по одному токену за раз, как это делают обычные авторегрессионные (AR) модели, DiffusionGemma итеративно уточняет сразу блок из 256 токенов параллельно, обходя узкое место последовательного декодирования.

Модель получена не обучением с нуля, а дообучением модели Gemma 4 с архитектурой смеси экспертов (MoE), у неё 3,8 млрд активных параметров и 25,2 млрд параметров всего. Двухэтапный конвейер обучения авторы называют экономичным по вычислениям: он использует менее 10% от общего бюджета обучающих токенов, потраченного на исходную AR-модель. На первом этапе применяется контролируемое дообучение, которое учит модель двунаправленному шумоподавлению (denoising). На втором этапе обучение с подкреплением сочетается с дистилляцией сэмплера, чтобы одновременно повысить качество генерации и эффективность вывода.

По утверждению авторов, DiffusionGemma задаёт новую границу Парето в компромиссе между скоростью генерации и качеством модели. В среднем по всему набору оценочных тестов модель генерирует около 20 токенов за один проход вперёд и выдаёт примерно 1500 выходных токенов в секунду на одном GPU NVIDIA H100, это, по словам авторов, существенно быстрее авторегрессионных моделей даже с современным спекулятивным декодированием. Конкретные модели и тесты, с которыми проводилось сравнение, в отчёте не названы.

DiffusionGemma сохраняет от исходной модели поддержку режима рассуждений (thinking mode), мультимодальных входов и длинного контекста. Несмотря на дообучение под диффузию, модель по-прежнему способна к обычной авторегрессионной генерации с лишь незначительной потерей качества, авторы называют это возможным путём к гибридному диффузионно-авторегрессионному декодированию, но не приводят количественную оценку этой потери.

В отчёте не указаны имена авторов или институциональная принадлежность (только коллективное «мы»), дата публикации, а также условия и сроки доступности весов модели, несмотря на то, что она описана как «открытая по весам» (open-weight).

Ключевые факты

  • DiffusionGemma генерирует текст дискретной диффузией, блоками по 256 токенов параллельно, а не по одному токену за раз
  • Модель получена дообучением MoE-модели Gemma 4 (3,8 млрд активных / 25,2 млрд параметров всего), а не обучением с нуля
  • Двухэтапный конвейер обучения (SFT для двунаправленного шумоподавления + RL с дистилляцией сэмплера) использует менее 10% бюджета обучающих токенов исходной AR-модели
  • На одном H100 модель выдаёт около 1500 токенов в секунду при ~20 токенах за проход, быстрее AR-моделей даже со спекулятивным декодированием
  • Модель сохраняет режим рассуждений, мультимодальность и длинный контекст, а также остаётся способна к обычной авторегрессионной генерации почти без потери качества

Почему это важно

DiffusionGemma решает фундаментальное ограничение современных языковых моделей, последовательное, по одному токену, декодирование, которое сдерживает скорость генерации даже с ускорениями вроде спекулятивного декодирования. Генерируя блоки токенов параллельно через диффузию, модель, по заявлению авторов, задаёт новую границу Парето между скоростью и качеством, то есть предлагает более выгодное соотношение этих двух параметров, чем существовавшие ранее подходы.

Кому это важно

Разработчикам инфраструктуры для вывода языковых моделей и командам, которым важна скорость и стоимость генерации текста в масштабе, например, для чат-ботов и агентных систем с высокой частотой запросов. Также интересно исследователям архитектур LLM, которые ищут альтернативы авторегрессионному декодированию, и всем, кто работает с семейством моделей Gemma, поскольку DiffusionGemma построена поверх Gemma 4.

Как это применить

Модель заявлена как «открытая по весам» (open-weight), но в тексте отчёта не указаны ни лицензия, ни где и когда веса будут доступны для скачивания, эти детали ещё предстоит уточнить. Способность модели работать и в диффузионном, и в обычном авторегрессионном режиме открывает путь к гибридному декодированию, которое может пригодиться там, где нужен баланс между скоростью и надёжностью генерации.

Можно ли доверять

Материал, технический отчёт самой команды разработчиков DiffusionGemma, опубликованный на HuggingFace Papers, а не независимая публикация или рецензируемая статья. Цифры о скорости и качестве приведены без названий конкретных моделей и тестов, с которыми проводилось сравнение, и без количественной оценки потери качества при обычной авторегрессионной генерации, это стоит учитывать при оценке заявлений.

Риски и подводные камни

В отчёте нет имён авторов и институциональной принадлежности за пределами коллективного «мы», не названы датасеты для обучения, не указана дата публикации и отсутствуют детали о лицензии и доступности весов, хотя модель называется «открытой по весам». Заявление о том, что модель «существенно быстрее» AR-моделей, не подкреплено названными эталонными тестами или моделями для сравнения.