Google DeepMind рассказала, как превратила Gemma 4 в диффузионную модель DiffusionGemma

Google DeepMind рассказала, как превратила Gemma 4 в диффузионную модель DiffusionGemma

Google DeepMind опубликовала технический отчёт о DiffusionGemma, диффузионной модели для генерации текста, которую компания представила ещё в середине июня. Вместо обучения новой модели с нуля команда взяла существующую Gemma-4-26B-A4B и переделала её в диффузионную модель, потратив на конвертацию менее десяти процентов исходного бюджета обучающих токенов.

В отличие от обычных языковых моделей, которые генерируют текст токен за токеном, DiffusionGemma одновременно уточняет блоки по 256 токенов, примерно так же, как модели генерации изображений постепенно проявляют картинку из шума. На ускорителе Nvidia H100 модель выдаёт около 1500 токенов в секунду.

Обучение шло в два этапа. Сначала модель училась восстанавливать зашумлённые блоки текста по примерам. Затем следовал совмещённый этап, который Google называет SD·RL: он объединяет обучение с подкреплением (обычно повышает качество ответов) и дистилляцию сэмплера (позволяет модели обходиться меньшим числом шагов вычислений). По данным отчёта, такой совмещённый подход поднимает качество на бенчмарках для рассуждений в среднем на десять пунктов и почти вчетверо увеличивает число токенов, обрабатываемых за один шаг вычислений. Побочный эффект, ответы DiffusionGemma стали примерно на 50 процентов короче, что дополнительно ускоряет генерацию.

Обычные языковые модели вынуждены зафиксировать первую цифру ответа ещё до того, как рассуждение доведено до конца. В примере с математической задачей из отчёта Gemma 4 начинает ответ с «-1», по ходу вывода понимает, что верный ответ «-25», и дописывает исправление уже после. DiffusionGemma формирует ответ и рассуждение параллельно, поэтому может исправить ошибку до того, как вывод окончательно зафиксирован. По тому же принципу работает решение судоку, где каждая клетка зависит от клеток, которые заполняются позже: после минимального дообучения DiffusionGemma решает верно почти 85 процентов головоломок, тогда как базовая модель с задачей не справляется вовсе. Структурированный вывод вроде JSON или исправлений кода завершается всего за два-три шага уточнения, поскольку входные данные уже задают большую часть токенов. При этом DiffusionGemma сохранила обычный, последовательный режим генерации текста слово за словом, пользователь может переключаться между режимами в зависимости от задачи.

Абсолютное качество всё ещё уступает базовой авторегрессивной модели. Google называет несколько причин: DiffusionGemma не обучалась как диффузионная модель с самого начала, а была переделана постфактум; последующее обучение было относительно коротким; а второй этап, SD·RL, был настроен на скорость в ущерб пиковому качеству. Архитектура, обучающие данные и другие настройки унаследованы от исходной Gemma 4 и не обязательно оптимальны для диффузионного подхода. Модель иногда застревает в циклах повторения, выдавая одно и то же слово несколько раз подряд, это следствие агрессивно урезанного числа шагов вычислений. В мультимодальных задачах DiffusionGemma иногда забывает корректно закрыть раздел рассуждений, что искусственно занижает результаты на бенчмарках. Преимущество в скорости также держится в основном в однопользовательском сценарии: как только к модели поступает около 32 параллельных запросов, обычные языковые модели догоняют её по пропускной способности.

Google прямо называет DiffusionGemma экспериментальной моделью: цель релиза, ускорить исследования текстовой диффузии и дать сообществу основу для специализированных, ресурсоэффективных адаптаций. Модель уже использует стартап Interfaze для многоязычного распознавания речи, а также применяется в исследовательском проекте по генерации отчётов рентгенологии в интерактивном режиме. Ранее Google выложила модель под лицензией Apache 2.0 на Hugging Face. Предшественник DiffusionGemma, Gemini Diffusion, который Google показала в мае 2025 года.

Ключевые факты

  • Google DeepMind переделала существующую Gemma-4-26B-A4B в диффузионную модель DiffusionGemma, потратив на конвертацию менее 10% исходного бюджета обучающих токенов, вместо обучения с нуля
  • Модель уточняет блоки по 256 токенов параллельно (а не по одному токену) и выдаёт около 1500 токенов в секунду на ускорителе Nvidia H100
  • Совмещённое обучение SD·RL (RL плюс дистилляция сэмплера) подняло качество на бенчмарках рассуждений в среднем на 10 пунктов и почти вчетверо увеличило число токенов за один шаг вычислений
  • После минимального дообучения DiffusionGemma решает верно почти 85% судоку, тогда как базовая Gemma 4 с задачей не справляется вовсе
  • Преимущество в скорости держится в основном для одного пользователя: при примерно 32 параллельных запросах обычные языковые модели догоняют DiffusionGemma по пропускной способности

Почему это важно

Отчёт показывает путь к диффузионным текстовым моделям, который не требует обучения с нуля: Google DeepMind получила рабочую диффузионную версию Gemma 4, потратив менее десяти процентов исходного бюджета обучающих токенов. Это меняет экономику эксперимента, переход на параллельную генерацию текста становится доступен как надстройка над уже обученной моделью, а не как отдельный дорогостоящий проект.

Кому это важно

Прежде всего исследовательским командам, которые изучают диффузионные архитектуры для текста и ищут способ протестировать идею без обучения модели с нуля. Также полезно разработчикам, которым важна скорость генерации структурированного вывода (JSON, исправления кода) и параллельного рассуждения, DiffusionGemma уже применяют стартап Interfaze для многоязычного распознавания речи и исследовательский проект по генерации отчётов рентгенологии.

Как это применить

Модель доступна под лицензией Apache 2.0 на Hugging Face, её можно скачать и дообучать под свою задачу. Google подчёркивает, что DiffusionGemma сохранила и обычный, последовательный режим генерации, так что переключение между режимами возможно в зависимости от задачи. Сама компания называет релиз экспериментальным и рассчитанным на дальнейшие ресурсоэффективные адаптации сообществом, а не на прямую замену продакшн-моделей.

Можно ли доверять

Источник, технический отчёт самой Google DeepMind, то есть цифры даны разработчиком, а не независимой стороной. При этом отчёт не приукрашивает результат: компания открыто перечисляет причины, по которым качество DiffusionGemma уступает базовой авторегрессивной модели, и указывает конкретные слабые места (циклы повторения, потеря преимущества при параллельных запросах, недообученность второй ступени).

Риски и подводные камни

Абсолютное качество ответов ниже, чем у обычной Gemma 4, а второй этап обучения (SD·RL) был настроен на скорость в ущерб пиковому качеству. Модель иногда зацикливается, повторяя одно и то же слово несколько раз подряд, и в мультимодальных задачах может не закрыть раздел рассуждений, что занижает результаты бенчмарков. Преимущество в скорости исчезает при высокой параллельной нагрузке: примерно с 32 одновременных запросов обычные модели догоняют DiffusionGemma по пропускной способности.