DiffusionGemma на базе Gemma 4 достигает около 1500 токенов в секунду
Авторы технического отчёта представили DiffusionGemma, экспериментальную языковую модель с открытыми весами, которая генерирует текст с помощью дискретной диффузии. Вместо того чтобы декодировать по одному токену за раз, как это делают традиционные авторегрессионные (AR) большие языковые модели, DiffusionGemma итеративно уточняет блоки по 256 токенов параллельно, это устраняет последовательное узкое место AR-декодирования.
Модель не обучали с нуля: DiffusionGemma получена дообучением MoE-модели Gemma 4 (3,8 млрд активных параметров из 25,2 млрд общих). Двухэтапный, вычислительно-эффективный пайплайн обучения потратил менее 10% токенового бюджета, который ушёл на обучение исходной AR-модели. На первом этапе дообучение с учителем учит модель двунаправленному шумоподавлению; на втором этапе обучение с подкреплением сочетается с дистилляцией сэмплера, чтобы одновременно улучшить и качество генерации, и эффективность вывода.
По утверждению авторов, DiffusionGemma задаёт новую границу Парето для компромисса между скоростью генерации и возможностями модели. В среднем по всему набору оценочных тестов модель генерирует около 20 токенов за один прямой проход и выдаёт около 1500 токенов в секунду на одном GPU NVIDIA H100, это заметно быстрее AR-моделей, даже с учётом современных методов спекулятивного декодирования.
DiffusionGemma сохраняет унаследованные от исходной модели возможности: режим рассуждений, мультимодальный ввод и работу с длинным контекстом. Несмотря на диффузионное дообучение, модель остаётся способна и на обычную авторегрессионную генерацию, с лишь незначительным падением качества, что, по мнению авторов, указывает на возможный путь к гибридному диффузионно-авторегрессионному декодированию.
Технический отчёт опубликован на arXiv 31 июля 2026 года.
Ключевые факты
- DiffusionGemma, экспериментальная языковая модель с открытыми весами на основе дискретной диффузии: вместо генерации токена за токеном она параллельно уточняет блоки по 256 токенов.
- Модель получена не обучением с нуля, а дообучением MoE-модели Gemma 4 (3,8 млрд активных параметров из 25,2 млрд общих).
- Двухэтапный пайплайн, сначала дообучение с учителем для двунаправленного шумоподавления, затем обучение с подкреплением вместе с дистилляцией сэмплера, потратил менее 10% токенового бюджета исходной AR-модели.
- В среднем по всем оценочным тестам модель генерирует около 20 токенов за проход и выдаёт около 1500 токенов в секунду на одном GPU NVIDIA H100, заметно быстрее AR-моделей даже против спекулятивного декодирования.
- DiffusionGemma сохраняет режим рассуждений, мультимодальный ввод и длинный контекст исходной модели, а также остаётся способна на обычную AR-генерацию с небольшой потерей качества, авторы видят в этом путь к гибридному диффузионно-авторегрессионному декодированию.
Почему это важно
Обычные авторегрессионные (AR) языковые модели декодируют текст по одному токену за раз, это фундаментальное узкое место, ограничивающее скорость генерации. DiffusionGemma решает эту проблему дискретной диффузией: модель параллельно уточняет блоки по 256 токенов вместо последовательного декодирования, в среднем генерируя около 20 токенов за один проход и выдавая около 1500 токенов в секунду на одном GPU NVIDIA H100, по утверждению авторов, заметно быстрее AR-моделей даже с учётом спекулятивного декодирования. Не менее важен способ получения модели: DiffusionGemma не обучали с нуля, а дообучили из уже существующей MoE-модели Gemma 4, потратив менее 10% токенового бюджета исходного обучения, это демонстрирует путь превращения готовых AR-моделей в быстрые диффузионные версии без затрат на обучение с нуля.
Кому это важно
Командам, которые упираются в стоимость и задержку генерации токенов, от чат-ботов и агентов до массовой пакетной генерации, где пропускная способность напрямую определяет расходы на GPU. Исследователям, изучающим диффузионные языковые модели как альтернативу авторегрессии. Тем, кто уже работает с семейством Gemma, описанный рецепт дообучения (двухэтапный пайплайн с дообучением с учителем и обучением с подкреплением) в принципе применим и к другим MoE-моделям сопоставимого масштаба.
Как это применить
Работа описывает воспроизводимый рецепт: сначала дообучение с учителем учит модель двунаправленному шумоподавлению вместо однонаправленного предсказания следующего токена, затем обучение с подкреплением вместе с дистилляцией сэмплера доводит качество генерации и эффективность вывода, и всё это поверх уже готовой MoE-модели Gemma 4 (3,8 млрд активных параметров из 25,2 млрд), а не с нуля. Для команд с собственной сильной AR-моделью это ориентир, сколько ресурсов, менее 10% исходного токенового бюджета, может потребовать аналогичное дообучение в диффузионный режим. Прямое применение самой DiffusionGemma пока ограничено: источник не называет ни дату открытия весов, ни условия доступа, только то, что модель заявлена как открытая («open-weight»).
Можно ли доверять
Это технический отчёт на arXiv, опубликованный авторами 31 июля 2026 года, без указания на прохождение независимого рецензирования. Все цифры, около 20 токенов за проход, около 1500 токенов в секунду, менее 10% токенового бюджета, усреднённые показатели по собственному набору оценочных тестов авторов; конкретные бенчмарки и модели для сравнения по AR-скорости в тексте не названы, доверительные интервалы не приводятся. Формулировка «задаёт новую границу Парето», оценка самих авторов, а не независимо подтверждённый вывод.
Риски и подводные камни
Источник не называет конкретные AR-модели, с которыми сравнивалась скорость, оценить реальный масштаб превосходства независимо нельзя. «Незначительная деградация качества» при обычной AR-генерации после диффузионного дообучения не выражена в цифрах, судить о её размере можно только со слов авторов. Усреднённые по всему набору тестов показатели скорости и токенов за проход могут скрывать разброс между отдельными задачами, отчёт не приводит разбивку по задачам. Наконец, статус «open-weight» заявлен без даты и условий публикации весов, протестировать модель самостоятельно пока не на чем.