A comprehensive and structured list of research papers about Large-Language-Diffusion-Models (dLLMs).
Last major update: September 2026 — added 169 new papers from Jun–Aug 2026.
- Surveys & Useful Resources
- Core Methodologies
- Reasoning & Policy Optimization
- Token Ordering & Generation Strategies
- System Efficiency & Acceleration
- Multi-modal & Physical AI
- Agentic & Tool-Use dLLMs
- Theory, Guidance & Applications
- Seminal Diffusion Papers
- Gemini Diffusion
- Mercury (Inception Labs)
- Dream-7B
- DreamOn
- LLaDA2.X (InclusionAI / Ant Group)
- W1-4B-dLLM (Whaletech AI) (Demo)
- What are Diffusion Language Models? (Lilian Weng)
- Generative Modeling by Estimating Gradients (Yang Song)
- DiffusionGemma Explained (ML@Berkeley)
A new section: hybrids that interleave block-level AR with intra-block diffusion, or "forcing" approaches that retain causal masks for KV-cache reuse.
New section: production-grade frameworks and runtime engineering for dLLMs.
Scope note: this section covers VLA models that use a diffusion/masked-diffusion language model as the backbone (dVLM-based VLA) or apply discrete diffusion as the action-decoding mechanism (not continuous diffusion action heads grafted onto an AR VLM). Pure continuous-diffusion-policy VLAs such as DiVLA (Wen et al., 2024), HybridVLA, and ProgressVLA are intentionally excluded because their language model is autoregressive — only the action head is diffusion-based.
(a) dVLM-backbone VLA — language backbone itself is a diffusion language model.
| Paper Title | Year | Venue | Remark |
|---|---|---|---|
| LLaDA-VLA: Vision Language Diffusion Action Models | 2025.09 | Arxiv | First LLaDA(d-VLM)-based VLA |
| dVLA: Diffusion VLA with Multimodal Chain-of-Thought | 2025.09 | Arxiv | dLLM backbone + multimodal CoT |
| Dream-VLA: Open Vision-Language-Action Model with Diffusion Backbone | 2025.12 | Arxiv | dVLA from Dream-7B; first dLLM pretrained VLA |
| MMaDA-VLA: Large Diffusion VLA with Unified Multi-Modal Instruction and Generation | 2026.03 | Arxiv | Native discrete-diffusion VLA from MMaDA |
(b) Discrete-diffusion action decoding — language backbone may still be AR-VLM, but action chunks are decoded via discrete diffusion. Closely tied to dLLM literature for inference techniques.
| Paper Title | Year | Venue | Remark |
|---|---|---|---|
| Discrete Diffusion VLA: Action Decoding in VLA Policies | 2025.08 | ICML | Unified-transformer + discrete-diffusion actions |
| E0: Enhancing Generalization and Fine-Grained Control in VLA Models via Tweedie Discrete Diffusion | 2025.11 | Arxiv | AR-VLM backbone + Tweedie discrete diffusion on action tokens |
Scope note: works that apply discrete diffusion / masked-diffusion language modeling to driving trajectories, action codebooks, or tokenized world states. Continuous trajectory-diffusion planners (e.g., classical Diffusion Policy applied to driving) are out of scope.
| Paper Title | Year | Venue | Remark |
|---|---|---|---|
| Copilot4D: Learning Unsupervised World Models for Autonomous Driving via Discrete Diffusion | 2023.11 | ICLR | Discrete diffusion on tokenized point-cloud world model |
| ReflectDrive: Discrete Diffusion for Reflective Vision-Language-Action Models in Autonomous Driving | 2025.09 | Arxiv | dLLM finetuned on discretized 2D driving space |
| Efficient and Explainable End-to-End Autonomous Driving via Masked Vision-Language-Action Diffusion | 2026.02 | Arxiv | Discrete action codebook + masked diffusion |
| Fast-dDrive: Efficient Block-Diffusion VLM for Autonomous Driving | 2026.05 | Arxiv | Block-diffusion VLA, speculative scaffold decoding |
New section — emerging line: how dLLMs behave as agents (planning, multi-turn, tool calling). Critical for connecting dLLMs to robotics and physical-AI agent stacks.
| Paper Title | Year | Venue | Remark |
|---|---|---|---|
| The Bitter Lesson of Diffusion Language Models for Agentic Workflows: A Comprehensive Reality Check | 2026.01 | Arxiv | Embodied + tool-call eval |
| Agents of Diffusion: Enhancing Diffusion Language Models with Multi-Agent Reinforcement Learning for Structured Data Generation | 2026.01 | Arxiv | Multi-agent RL |
| DLLM Agent: See Farther, Run Faster | 2026.02 | Arxiv | dLLM-as-agent comparison |
| Paper Title | Year | Venue | Remark |
|---|---|---|---|
| Deep Unsupervised Learning using Nonequilibrium Thermodynamics | 2015.03 | ICML | Formulation |
| Denoising Diffusion Probabilistic Models (DDPM) | 2020.06 | NeurIPS | - |
| Denoising Diffusion Implicit Models (DDIM) | 2020.10 | ICLR | - |
| Score-Based Generative Modeling through SDEs | 2020.11 | ICLR | - |
| Diffusion Models Beat GANs on Image Synthesis | 2021.05 | NeurIPS | CG |
| Structured Denoising Diffusion in Discrete State-Spaces (D3PM) | 2021.07 | NeurIPS | Discrete |
| Vector Quantized Diffusion Model (VQ-Diffusion) | 2021.11 | CVPR | VQ |
| High-Resolution Image Synthesis with Latent Diffusion (LDM) | 2021.12 | CVPR | - |
| Progressive Distillation for Fast Sampling | 2022.02 | ICLR | Distillation |
| DPM-Solver: Fast ODE Solver for Sampling | 2022.06 | NeurIPS | - |
| Classifier-Free Diffusion Guidance | 2022.07 | NeurIPS | CFG |
| Analog Bits: Generating Discrete Data using Diffusion | 2022.08 | ICLR | Self-conditioning |
| Scalable Diffusion Models with Transformers (DiT) | 2022.12 | ICCV | Scalable focus |
| Consistency Models | 2023.03 | ICML | - |
- Maintainers: jake630@snu.ac.kr / wjk9904@snu.ac.kr
- Contributions via Pull Requests are welcome!