Диффузионные языковые модели: как работает альтернатива GPT
Материал построен на семинарах и лекциях ICLR 2026 и MLSS 2026 и объясняет, как устроены диффузионные языковые модели, альтернатива господствующему сегодня авторегрессионному подходу (по такому принципу, слева направо, токен за токеном, генерируют текст модели вроде GPT). Для непрерывных данных, изображений и видео, стандартом давно стала диффузия; применить тот же принцип к дискретным данным вроде текста долго не удавалось. Вместо генерации токенов по одному диффузионная модель сразу выдаёт черновик всей последовательности и затем за несколько шагов итеративно его уточняет. Это даёт несколько преимуществ: можно менять число шагов, разменивая скорость на качество; ошибки можно исправлять по ходу генерации; и, в отличие от авторегрессионных моделей, каждый шаг видит контекст в обе стороны, а не только слева.
Авторы описывают 2024 год как переломный: диффузионные модели впервые стали конкурентоспособны по качеству с авторегрессионными. К 2026 году диффузионные языковые модели, уже коммерческая реальность: в числе примеров названа Mercury 2 от лаборатории Inception Labs.
Чтобы объяснить принцип, статья сначала описывает классическую гауссову диффузию для изображений. В её основе, денойзинг: вместо рисования картинки за один проход модель убирает шум пошагово. Прямой процесс берёт чистое изображение и постепенно превращает его в чистый шум, подмешивая гауссов шум на каждом шаге; обучения он не требует, зато даёт неограниченный поток обучающих примеров. Обратный процесс обучается инвертировать это превращение, то есть по зашумлённому изображению предсказывать, каким было исходное (или какой шум был добавлен), и генерация сводится к повторению этого шага, начиная с чистого шума.
Перенести гауссов шум на текст напрямую нельзя, добавлять непрерывный шум к дискретным категориальным величинам (токенам) математически не определено. Решение, которое статья называет популяризированным авторской исследовательской группой, определить шум через маскирование. Модель обучают как BERT, только с рандомизированной долей маскирования, и, в отличие от BERT, результат получается генеративным: модель по сути превращается в снимающую маски трансформер-модель. Генерация начинается с полностью замаскированной последовательности; модель раз за разом заполняет пропуски, часть заполненных токенов фиксируется, и с каждым раундом незамаскированных позиций становится больше, пока последовательность не станет полностью чистой.
Доля маскирования подчиняется расписанию, вероятности того, что токен остаётся немаскированным: она равна единице для чистой последовательности и падает до нуля для полностью замаскированной. Прямой процесс формализован как марковская цепь; оптимальный обратный процесс выводится по правилу Байеса, если конечная (чистая) последовательность известна. На практике конечная последовательность неизвестна, поэтому обучают отдельную модель предсказывать её по текущему зашумлённому состоянию и подставляют это предсказание в формулу обратного процесса. Так собирается математическое определение маскированной диффузионной языковой модели (MDLM). Нижняя граница правдоподобия (ELBO), которой аппроксимируют качество модели, в итоге сводится к тому же кросс-энтропийному лоссу, что и у BERT, но усреднённому по всем возможным долям маскирования, а не по одной фиксированной, и нормированному на долю замаскированных токенов.
По стандартной метрике оценки языковых моделей, логарифмическому правдоподобию (эквивалентно перплексии), между диффузионными и авторегрессионными моделями долго был существенный разрыв в качестве; упрощённые маскированные диффузионные модели одними из первых закрыли значительную часть этого разрыва.
Однако базовая MDLM, как она описана выше, не готова к промышленному применению: она генерирует только последовательности фиксированной длины, не поддерживает встроенное итеративное исправление ошибок и без дополнительного дообучения работает не особенно быстро. Дальше статья разбирает расширения, которые снимают эти ограничения.
Блочная диффузия (block diffusion) решает проблему фиксированной длины: диффузия проводится над блоками токенов с учётом уже сгенерированных ранее. Размер блока подбирают под задачу, например, в биологических приложениях под минимальную длину значимых взаимодействий, а в языковом моделировании, чтобы максимально загрузить GPU, подгоняя вычислительную интенсивность прямого прохода под конкретное железо. Блочная диффузия также естественно поддерживает KV-кеширование, технику ускорения генерации, которая используется в авторегрессионных моделях: ключи и значения уже сгенерированного блока кешируются и переиспользуются при генерации следующих блоков.
Другие подходы к генерации переменной длины опираются на связь маскированной диффузии с авторегрессионными моделями произвольного порядка. Например, Set Diffusion обобщает блочную диффузию на произвольные наборы позиций вместо строго последовательных блоков слева направо; ещё один упомянутый подход, Edit Flows (подробности в доступном тексте не приводятся).
Стандартные маскированные диффузионные модели по архитектуре, энкодер-модели (как BERT), в отличие от декодер-моделей (как GPT). Энкодерная архитектура требует прогонять полную сеть на каждом шаге удаления шума, что может обходиться заметно дороже по вычислениям. На этом месте доступный фрагмент текста обрывается на середине фразы, так что дальнейшее объяснение этой проблемы и последующая часть статьи в пересказ не вошли.
Ключевые факты
- Диффузионные языковые модели, альтернатива авторегрессионным (GPT-стиль): вместо генерации по одному токену слева направо модель сразу выдаёт черновик всей последовательности и затем итеративно уточняет его за несколько шагов, видя контекст в обе стороны.
- Маскированная диффузия (MDLM) обучается как BERT со случайной долей маскирования, но получается генеративной моделью; нижняя граница правдоподобия сводится к тому же кросс-энтропийному лоссу, что у BERT, усреднённому по всем долям маскирования.
- 2024 год авторы называют переломным: диффузионные модели впервые сравнялись по качеству (перплексии) с авторегрессионными; к 2026 году диффузионные LLM уже выпускают индустриальные лаборатории, в пример приведена Mercury 2 от Inception Labs.
- Базовая MDLM не готова к продакшену: только фиксированная длина последовательности, нет встроенного исправления ошибок, без дополнительного дообучения работает медленно.
- Блочная диффузия снимает ограничение по длине и поддерживает KV-кеширование (как у авторегрессионных моделей); Set Diffusion обобщает блочный подход на произвольные наборы позиций.
Почему это важно
Материал раскладывает по шагам математику реальной, уже коммерциализирующейся альтернативы доминирующему сегодня авторегрессионному подходу к языковым моделям: вместо генерации токен за токеном модель порождает всю последовательность целиком и итеративно её уточняет, что даёт гибкий обмен скорости на качество, исправление ошибок по ходу генерации и двусторонний контекст на каждом шаге. Авторы фиксируют 2024 год как момент, когда диффузионные модели впервые сравнялись по качеству с авторегрессионными, а к 2026 году называют диффузионные LLM коммерческой реальностью, с примером промышленного релиза (Mercury 2 от Inception Labs).
Кому это важно
Материал адресован инженерам и исследователям, которые строят или изучают языковые модели и хотят разобраться в альтернативной архитектуре генерации текста, а также тем, кто следит за семинарами и лекциями крупных ИИ-конференций (ICLR, MLSS), из которых материал адаптирован.
Как это применить
Это образовательный разбор, а не продукт или релиз с ценой, он последовательно вводит математический аппарат (гауссова диффузия → маскированная диффузия → расписание маскирования → ELBO) и практические расширения (блочная диффузия, KV-кеширование, Set Diffusion), которые инженер может использовать как отправную точку при реализации собственной диффузионной языковой модели.
Можно ли доверять
Источник, блог исследовательской группы Kuleshov, материал заявлен как адаптация реальных семинаров и лекций ICLR 2026 и MLSS 2026, то есть опирается на академический контекст. При этом в доступном фрагменте текста не назван конкретный автор статьи, не приведено ни одного числового бенчмарка (точность, скорость, значения перплексии), а сам текст обрывается на середине фразы («ключевая идея в том, что…»), часть материала за этой точкой в пересказ не попала.
Риски и подводные камни
Собственные оговорки авторов: базовая маскированная диффузионная модель, как она определена в статье, не готова к промышленному применению, генерирует только последовательности фиксированной длины, не умеет из коробки исправлять ошибки в процессе генерации и без дополнительного дообучения работает не особенно быстро. Отдельно отмечена архитектурная цена энкодерного подхода (как у BERT) по сравнению с декодерным (как у GPT), нужно прогонять полную сеть на каждом шаге удаления шума. Пересказ основан на неполном фрагменте текста источника: концовка статьи и её дальнейшие разделы не были доступны для проверки.