
Conference:ICML 2026
1. Abstract (摘要)
自回归大语言模型(LLMs)性能强大,但其固有的顺序解码机制导致推理延迟较高且 GPU 利用率不佳。投机解码(Speculative Decoding)通过“小模型打草稿、大模型并行验证”的方式缓解了这一瓶颈。然而,现有方法(如 EAGLE-3)的草稿模型依然依赖自回归起草(Autoregressive Drafting),这种串行起草过程限制了实际的加速上限。
虽然扩散语言模型(Diffusion LLMs)支持并行生成,但目前开源的扩散模型在生成质量上通常不及自回归模型。为此,本文提出了 DFlash 框架,首次采用轻量级的**块扩散模型(Block Diffusion Model)**进行并行起草。通过单次前向传播生成多个草稿 token,并利用从目标模型中提取的上下文特征作为条件注入,DFlash 实现了高质量、高接受率的草稿生成。实验表明,DFlash 在多款模型和任务上实现了超过 $6\times$ 的无损加速,比目前最先进的 EAGLE-3 投机解码方法速度高出 $2.5\times$。
2. Introduction (引言)
长思维链(CoT)推理模型的出现使得序列生成的延迟问题愈发严重。当前的投机解码方案面临一个核心矛盾:
- 自回归草稿模型的局限性: 串行起草效率低,容易产生错误累积,将理论加速上限限制在 $2\sim 3\times$。
- 扩散草稿模型的困境: 虽然支持并行和双向上下文建模,但为了保证质量往往需要多次去噪步骤,导致原始推理速度极慢。已有方法(如 DiffuSpec, SpecDiff-2)使用了高达 7B 参数的扩散模型打草稿,高昂的起草延迟抵消了投机的加速收益;而使用极小自回归模型(如 PARD)又会导致草稿质量差。
DFlash 的核心洞见: “目标模型最了解未来(The target knows best)”。目标大模型的隐藏特征中隐含了关于未来多个 token 的丰富信息。DFlash 将轻量级扩散模型作为“适配器(Adapter)”,利用大模型深层上下文特征作为条件(Conditioning),预测未来的 token 块。这种方法结合了自回归模型的高验证质量与扩散模型的高并行速度。

3. Related Work (相关工作)
- 投机解码: 从早期的标准投机解码,到无外部草稿模型的 Medusa,再到利用特征级上下文的 EAGLE 系列。尽管接受率不断提升,但起草过程的串行本质没有改变。
- 扩散语言模型(dLLMs): 如 LLaDA 将参数扩展到了百亿级别,但全并行扩散模型面临固定长度生成和缺乏 KV Cache 支持的问题。
- 基于扩散的投机解码: TiDAR 尝试联合训练扩散和自回归目标,但生成质量无法做到无损;Samragh 等人尝试训练 LoRA 适配器,但架构探索有限。大型扩散模型作为草稿器则面临计算开销过大的问题。
4. Preliminary (理论基础与动机)
本节从理论公式出发,详细分析了自回归起草与扩散起草的效率权衡。
4.1 投机解码加速比公式
在每个解码周期中,草稿模型预测 $\gamma$ 个 tokens,由目标模型并行验证。平均每个 token 的延迟 $L$ 为: $$ L = \frac{T_{\text{draft}} + T_{\text{verify}}}{\tau} $$ 其中 $T_{\text{draft}}$ 为起草延迟,$T_{\text{verify}}$ 为验证开销,$\tau \in [1, \gamma + 1]$ 为期望接受的 token 数量。加速比可表示为提升 $\tau$ 或降低 $T_{\text{draft}}$。
4.2 自回归 vs. 扩散起草
- 自回归起草: 延迟呈线性增长 $T_{\text{draft}} = \gamma \cdot t_{\text{step}}$。为了控制时间,模型只能设计得非常浅(如单层 Transformer),导致容量受限,进一步阻碍了接受长度 $\tau$ 的提升。
- 扩散起草: 所有 $\gamma$ 个 token 在单次前向传播中并行生成,延迟为 $T_{\text{draft}} = t_{\text{parallel}}$。现代 GPU 对并行矩阵计算的高效支持,使得 $t_{\text{parallel}} \ll \gamma \cdot t_{\text{step}}$。
(Figure 3 说明:相比于 1 层 EAGLE-3 的起草延迟随 token 数量线性攀升,DFlash(即使是 3层或5层模型)在生成 16 个 token 时延迟极低且基本保持平稳,这就为使用更深、更强的草稿模型提供了设计空间。)
5. Method (推理阶段核心设计)
此部分详细介绍了 DFlash 的系统架构设计,重点解释了如何利用目标模型特征实现高接受率。
(Figure 2: DFlash 推理设计架构。展示了特征提取、KV注入和并行块解码的全过程。)
1. 提取目标上下文特征 (Context features from the target model) 纯靠小扩散模型很难凭空预测高质量的 token 序列。在目标模型执行 Prefill 生成第一个 token 的过程中,DFlash 会从目标模型中均匀采样若干隐藏层(如从第 2 层到倒数第 3 层之间均匀抽取 5 层)的特征(Hidden representations)。随后,通过一个轻量级投影层将这些跨层特征融合为一个紧凑的目标上下文特征(Target Context Feature)。
2. 核心创新:通过 KV 注入实现接受长度缩放 (Conditioning via KV injection enables acceptance scaling)
- 对比 EAGLE-3: 现有方法通常将目标特征与草稿模型的 token embedding 融合后作为输入。这种设计的缺陷是:随着草稿模型深度的增加,输入层的特征信息会被逐层稀释,导致“更深的模型无法带来更高的接受率”。
- DFlash 的解决方案: 将融合后的目标上下文特征视为持久的上下文信息,直接注入到草稿模型每一层(Every draft model layer)的 Key 和 Value 投影中。这些特征被保存在草稿模型的 KV Cache 中跨迭代复用。这种设计确保了草稿模型在任何深度的注意力计算都能得到一致的条件指导,使得接受长度可以随草稿模型的层数有效提升。
3. 块级并行扩散起草 (Parallel diffusion drafting) 草稿模型采用块级(Block-level)扩散过程。在一次前向传播中,Block 内所有被 Mask 的位置会被同时解码为具体的 token。这种并行生成方式不仅降低了延迟,还显著提高了 GPU 的硬件利用率。
6. Training (训练阶段详细设计)
为了让扩散模型对齐投机解码的推理行为,DFlash 对标准块扩散的训练方法进行了几项关键调整。
(Figure 4: DFlash 训练注意力机制。展示了锚点随机采样与跨块掩码的注意力隔离策略。)
1. KV 特征注入 训练流程与推理保持一致,将完整序列通过冻结的目标模型提取隐藏特征,并注入到草稿模型的 KV 投影中。
2. 专为投机解码设计的:掩码块随机采样 (Random sampling of masked blocks)
- 标准的块扩散通常是对序列均匀分块并随机遮掩。
- DFlash 的改进: 在投机解码推理时,草稿模型总是基于目标模型生成的最后一个真实可见的 token(即 bonus token)进行条件生成。因此在训练时,DFlash 在响应序列中随机采样锚点(Anchor tokens)。每个锚点作为 Block 的第一个位置(保持真实可见),而随后的 $block_size - 1$ 个位置被设为 Mask。随机化锚点位置让模型能覆盖更多样化的目标上下文特征,提升了数据利用率。
3. 高效长上下文训练 (Efficient long-context training) 为控制长序列的训练成本,DFlash 在训练中固定每条序列的掩码块数量,并在每个 epoch 重新随机采样锚点位置。结合 Flex Attention 机制,不同 Block 之间的注意力被隔离,允许在单次前向与反向传播中高效并行处理多个草稿块。
4. 提升收敛速度的:位置衰减损失权重 (Loss weighting for faster convergence) 在投机解码中,草稿块早期的错误会导致后续所有预测失效,因此早期位置的预测准确率更为重要。DFlash 在训练交叉熵损失时引入了指数衰减权重公式: $$ w_k = \exp\left( - \frac{k - 1}{\gamma} \right) $$ 其中 $k$ 为块内的相对位置,$\gamma$ 为控制衰减率的超参数。该权重机制优先惩罚早期位置的预测错误,加快了模型收敛并提高了最终的平均接受长度。
5. 共享嵌入层和输出头 (Shared embedding and LM head) 草稿模型与目标模型共享 Token Embedding 层和 LM Head,并在训练中保持冻结。这大幅减少了可训练参数量,并促使草稿模型的表征空间与目标模型严格对齐。
7. Experiments (实验评估)
实验在 NVIDIA H200 GPU 上进行,对比基线为标准的自回归解码(Baseline)和 SOTA 方法 EAGLE-3。
7.1 指令模型评估 (Instruct Models)

- 配置: Qwen3 4B/8B,关闭思维模式。DFlash (Block Size 16) 对比 EAGLE-3 (Tree Size 16 和 60)。
- 结果: 在贪婪解码(Temp = 0)下,DFlash 在 4B 和 8B 模型上分别取得了 4.91$\times$ 和 4.86$\times$ 的平均加速比。相比同等起草预算的 EAGLE-3 (16)(约 $1.8\sim2.0\times$ 加速),DFlash 的加速效果高出 2.4 倍以上。即使 EAGLE-3 将树规模扩大到 60 以追求更高的接受率,DFlash 依然在更低的验证开销下实现了更高的整体加速比。
7.2 推理模型评估 (Reasoning Models)

- 场景: 针对开启思维模式(Thinking Mode)、输出极长的推理模型,加速需求更为迫切。
- 结果: DFlash 在保持高接受长度的前提下,贪婪解码取得了约 4.5$\times$ 的加速比,非贪婪采样(Temp=1)下取得了约 3.9$\times$ 的加速比。有效缓解了推理模型生成时间过长的问题。
7.3 SGLang 框架工业部署测试 (Performance on SGLang)

- 场景: 使用基于 FlashAttention-4 的 SGLang 框架进行吞吐量测试(Token/s),考察真实并发(Concurrency 1 到 32)下的降本能力。
- 结果: 在并发度为 1 时,Qwen3-8B 达到了最高 5.1$\times$ 的吞吐量提升。在并发度达到 32、系统处于计算密集状态时,依然能提供约 2.8$\times$ 的加速。证明了 DFlash 在高负载 Serving 场景下的实用性。
7.4 消融实验详析 (Ablation Study)
本小节通过控制变量验证了架构参数与设计选择的影响。
1. 训练数据控制 (Training Data)
基于 LLaMA-3.1-8B-Instruct,使用与 EAGLE-3 完全相同的开源训练集(UltraChat 和 ShareGPT)训练 DFlash。在严格对齐数据的情况下,DFlash 依然在所有并发度及基准测试中稳定优于 EAGLE-3 的各个版本。
2. 草稿模型层数 (Number of Draft Layers)
测试 3 层、5 层、8 层架构。更深的模型(8层)表现出更高的表达能力,达到了最长的接受长度 $\tau$。但由于 8 层的起草延迟略高,综合权衡下,5 层(5-L)模型实现了起草成本与草稿质量之间的最佳平衡,获得了最高的端到端加速比。
3. 目标特征提取层数 (Number of Target Hidden Features)
对比从目标模型提取 3 个或 5 个隐藏层特征。结果显示,提取 5 个特征(5-H)能提供更丰富的语义和时序信息,从而得到更高的接受长度和加速比。其代价仅为离线训练时占用相对较多的特征缓存空间。
4. 训练与推理时的块大小泛化 (Training-Inference Time Block Size)
- 测试模型在不同块大小(Block Size 8 和 16)之间的泛化能力。
- 结论: 存在单向的泛化不对称性。在 Block Size 16 下训练的模型,在推理时使用 Block Size 8 依然能保持高接受率;但在 Block Size 8 下训练的模型,无法有效泛化到推理时的 Block Size 16。这一特性为未来在实际服务中实现**动态块大小调度(Dynamic block-size scheduling)**提供了理论依据。
8. Conclusion (结论)
DFlash 提出了一种基于块扩散模型的投机解码框架,重新定义了扩散模型在加速自回归推理中的角色。通过将扩散模型限定在“起草阶段”,DFlash 充分发挥了其极高的并行优势,同时利用目标模型丰富的上下文特征保证了草稿的准确性。DFlash 提供了一种无损且高扩展性的加速范式,为提高大模型部署效率开辟了新的技术路径。
9. Appendix (附录细节补充)
为保证内容的完整性,附录中涉及的模型参数设置与额外消融实验同样不可忽视。
A.1 训练实现细节 (Training Implementation)
- 优化器与超参数: 采用 AdamW 优化器,训练 6 个 epochs,学习率设为 $6 \times 10^{-4}$,梯度裁剪阈值 1.0,使用占比 0.04 的 cosine warmup 调度。
- 数据构造: 训练序列最大长度为 3072(Qwen3-Coder 为 4096);每条序列随机采样 512 个锚点位置。
- 衰减因子 $\gamma$: 针对指数损失权重衰减,Block Size 16 时 $\gamma=7$;Block Size 10 时 $\gamma=5$;Block Size 8 时 $\gamma=4$。
- 支持在线计算特征与离线预缓存特征两种训练模式,离线模式可降低训练计算开销。