Непрерывные диффузионные языковые модели возвращаются после потухания 2023 года

Непрерывные диффузионные языковые модели возвращаются после потухания 2023 года

Исследователь Сандер Дилеман (автор блога sander.ai, ранее занимавшийся диффузионными языковыми моделями, а затем перешедший к разработке генеративных моделей изображений и видео, Imagen, Veo, Nano Banana и Omni) написал разбор о том, как непрерывная диффузия для языка, метод, который считался почти забытым, переживает всплеск новой исследовательской активности.

Современные языковые модели почти всегда авторегрессионные: они генерируют текст токен за токеном. Диффузионный подход устроен иначе, вместо последовательной генерации модель обучается обращать вспять процесс зашумления данных. Для текста это означает работу с дискретными (категориальными) единицами, токенами, а не с непрерывными сигналами, как в изображениях, что создаёт техническую сложность: гауссов шум, на котором строится классическая диффузия, естественно подходит для непрерывных данных, но не для дискретных.

Первые дискретные диффузионные модели языка появились в 2021 году, multinomial diffusion, D3PM и SUNDAE. В 2022 году возникла альтернатива: несколько групп предложили представлять дискретные токены непрерывными векторами-эмбеддингами и применять к ним обычную гауссову диффузию. Первой такой работой стала Diffusion-LM, за ней последовали DiffuSeq, SSD-LM, Difformer, SeqDiffuSeq, GENIE, LD4LG, а также две работы самого Дилемана, SED (self-conditioned embedding diffusion) и CDCD (continuous diffusion for categorical data).

Однако после 2023 года, по словам автора, почти все новые исследования в этой области стали дискретными, а непрерывный подход практически исчез, это видно по диаграмме из обзорной статьи о диффузионных языковых моделях 2025 года, на которую ссылается Дилеман в своём твите. Автор называет это "вымиранием непрерывного подхода" и признаётся, что относится к этому с ностальгией: "Не могу не испытывать лёгкую грусть по поводу очевидного вымирания непрерывного подхода после 2023 года", написал он в X (Twitter).

Точную причину этого сдвига автор назвать не берётся и прямо характеризует своё объяснение как предположение, не факт. Один из вероятных факторов, "момент ChatGPT", после которого фокус исследований диффузионных языковых моделей сместился с теоретической элегантности на чистую производительность: сообществу нужно было догонять или превосходить авторегрессионные модели, а дискретные методы концептуально ближе к авторегрессии. Другой фактор, сама наука о масштабировании диффузионных языковых моделей: в мае 2023 года исследователи Гулраджани и Хасимото количественно оценили разрыв в эффективности обучения для непрерывной диффузионной модели Plaid-1B, она оказалась в 64 раза менее эффективной по сравнению с сопоставимым авторегрессионным подходом. В тот период сообщество было сосредоточено на оптимальном соотношении вычислительного бюджета и качества (Chinchilla-оптимальность), и модель с почти двухпорядковым отставанием по эффективности обучения было сложно воспринимать всерьёз. Первая модель LLaMA, поставившая под вопрос исключительный фокус на эффективности обучения и напомнившая о важности бюджета на инференс, вышла лишь за несколько месяцев до этого, в феврале 2023 года, и, по мнению Дилемана, сообщество тогда ещё не успело осознать этот сдвиг.

Далее автор разбирает, как вообще непрерывную диффузию адаптируют для дискретных данных: сначала дискретные токены переводятся в непрерывное пространство эмбеддингов, а уже в нём применяется зашумляющий гауссов шум, по сути, меняется порядок операций по сравнению с дискретной диффузией. Ключевую роль играет выбор стратегии эмбеддинга: явное представление (one-hot-векторы или компактные бинарные коды, как в подходе Analog Bits), предобученные эмбеддинги (заимствованные, например, из авторегрессионной модели или BERT) и эмбеддинги, обучаемые совместно с самой диффузионной моделью (подход CDCD). Отдельно упоминается приём self-conditioning (самообусловливание), техника, которая почти всегда встречается в статьях на эту тему и заметно влияет на итоговое качество модели.

Ключевые факты

  • В 2021 году появились первые дискретные диффузионные модели языка, multinomial diffusion, D3PM и SUNDAE
  • В 2022 году несколько групп предложили непрерывную альтернативу, диффузию в пространстве эмбеддингов токенов (Diffusion-LM и другие, включая собственные работы автора SED и CDCD)
  • После 2023 года почти все новые исследования в этой области перешли на дискретную диффузию, а непрерывный подход, по словам автора, практически исчез
  • В мае 2023 года Гулраджани и Хасимото показали, что непрерывная диффузионная модель Plaid-1B в 64 раза менее эффективна при обучении, чем сопоставимый подход
  • Автор называет причины сдвига предположением, а не установленным фактом, и указывает на возможную роль "момента ChatGPT" и выхода модели LLaMA в феврале 2023 года

Почему это важно

Материал, не новость о конкретном релизе, а исследовательский разбор одного из архитектурных путей развития языковых моделей, альтернативного доминирующей авторегрессии. Он показывает, что выбор подхода к генерации текста (токен за токеном против диффузии) не решён окончательно, и что подходы, которые считались тупиковыми, могут возвращаться по мере смены исследовательских приоритетов.

Кому это важно

Материал адресован исследователям и инженерам, занимающимся архитектурами языковых моделей, в первую очередь тем, кто следит за альтернативами авторегрессионной генерации, диффузионными и другими непоследовательными методами.

Как это применить

Автор разбирает практические ингредиенты непрерывной диффузии для дискретных данных: выбор стратегии эмбеддинга (явные one-hot/бинарные представления, предобученные эмбеддинги из существующих моделей или совместно обучаемые эмбеддинги), функцию потерь, расписание шума и приём self-conditioning, который заметно улучшает качество почти во всех известных работах на эту тему.

Можно ли доверять

Автор, практик в этой области: он соавтор двух ранних работ по непрерывной диффузии для языка (SED и CDCD), а позже участвовал в разработке генеративных моделей изображений и видео Imagen, Veo, Nano Banana и Omni. При этом он сам подчёркивает, что его объяснение причин упадка непрерывного подхода после 2023 года, предположение ("это всё крайне спекулятивно"), а не установленный факт, и явно приглашает к альтернативным версиям в комментариях.

Риски и подводные камни

Ключевая проблема, из-за которой непрерывная диффузия уступила дискретной, вычислительная неэффективность: по данным на май 2023 года, модель Plaid-1B требовала в 64 раза больше ресурсов на обучение, чем сопоставимый авторегрессионный подход. Автор не приводит новых чисел, которые показывали бы, что этот разрыв закрыт, его текст описывает исторический контекст и техническую механику подхода, а не сравнение производительности с современными моделями.

«Не могу не испытывать лёгкую грусть по поводу очевидного вымирания непрерывного подхода после 2023 года»

— Сандер Дилеман