<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>Speculative Decoding on JJ&#39;s Blog</title>
    <link>https://jjl357.github.io/blog/tags/speculative-decoding/</link>
    <description>Recent content in Speculative Decoding on JJ&#39;s Blog</description>
    <generator>Hugo -- 0.152.2</generator>
    <language>zh-cn</language>
    <lastBuildDate>Fri, 08 May 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://jjl357.github.io/blog/tags/speculative-decoding/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>📝 DFlash: Block Diffusion for Flash Speculative Decoding - ICML&#39;26</title>
      <link>https://jjl357.github.io/blog/posts/dflash---block-diffusion-for-flash-speculative-decoding---icml26/</link>
      <pubDate>Fri, 08 May 2026 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/dflash---block-diffusion-for-flash-speculative-decoding---icml26/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/DFlash/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference：ICML 2026&lt;/strong&gt;&lt;/p&gt;
&lt;h2 id=&#34;1-abstract-摘要&#34;&gt;1. Abstract (摘要)&lt;/h2&gt;
&lt;p&gt;自回归大语言模型（LLMs）性能强大，但其固有的顺序解码机制导致推理延迟较高且 GPU 利用率不佳。投机解码（Speculative Decoding）通过“小模型打草稿、大模型并行验证”的方式缓解了这一瓶颈。然而，现有方法（如 EAGLE-3）的草稿模型依然依赖&lt;strong&gt;自回归起草（Autoregressive Drafting）&lt;/strong&gt;，这种串行起草过程限制了实际的加速上限。&lt;/p&gt;
&lt;p&gt;虽然扩散语言模型（Diffusion LLMs）支持并行生成，但目前开源的扩散模型在生成质量上通常不及自回归模型。为此，本文提出了 &lt;strong&gt;DFlash&lt;/strong&gt; 框架，首次采用轻量级的**块扩散模型（Block Diffusion Model）**进行并行起草。通过单次前向传播生成多个草稿 token，并利用从目标模型中提取的上下文特征作为条件注入，DFlash 实现了高质量、高接受率的草稿生成。实验表明，DFlash 在多款模型和任务上实现了超过 $6\times$ 的无损加速，比目前最先进的 EAGLE-3 投机解码方法速度高出 $2.5\times$。&lt;/p&gt;
&lt;h2 id=&#34;2-introduction-引言&#34;&gt;2. Introduction (引言)&lt;/h2&gt;
&lt;p&gt;长思维链（CoT）推理模型的出现使得序列生成的延迟问题愈发严重。当前的投机解码方案面临一个核心矛盾：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;自回归草稿模型的局限性：&lt;/strong&gt; 串行起草效率低，容易产生错误累积，将理论加速上限限制在 $2\sim 3\times$。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;扩散草稿模型的困境：&lt;/strong&gt; 虽然支持并行和双向上下文建模，但为了保证质量往往需要多次去噪步骤，导致原始推理速度极慢。已有方法（如 DiffuSpec, SpecDiff-2）使用了高达 7B 参数的扩散模型打草稿，高昂的起草延迟抵消了投机的加速收益；而使用极小自回归模型（如 PARD）又会导致草稿质量差。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;strong&gt;DFlash 的核心洞见：&lt;/strong&gt; “目标模型最了解未来（The target knows best）”。目标大模型的隐藏特征中隐含了关于未来多个 token 的丰富信息。DFlash 将轻量级扩散模型作为“适配器（Adapter）”，利用大模型深层上下文特征作为条件（Conditioning），预测未来的 token 块。这种方法结合了自回归模型的高验证质量与扩散模型的高并行速度。&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/DFlash/figure1.png&#34;&gt;&lt;/p&gt;
&lt;h2 id=&#34;3-related-work-相关工作&#34;&gt;3. Related Work (相关工作)&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;投机解码：&lt;/strong&gt; 从早期的标准投机解码，到无外部草稿模型的 Medusa，再到利用特征级上下文的 EAGLE 系列。尽管接受率不断提升，但起草过程的串行本质没有改变。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;扩散语言模型（dLLMs）：&lt;/strong&gt; 如 LLaDA 将参数扩展到了百亿级别，但全并行扩散模型面临固定长度生成和缺乏 KV Cache 支持的问题。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;基于扩散的投机解码：&lt;/strong&gt; TiDAR 尝试联合训练扩散和自回归目标，但生成质量无法做到无损；Samragh 等人尝试训练 LoRA 适配器，但架构探索有限。大型扩散模型作为草稿器则面临计算开销过大的问题。&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id=&#34;4-preliminary-理论基础与动机&#34;&gt;4. Preliminary (理论基础与动机)&lt;/h2&gt;
&lt;p&gt;本节从理论公式出发，详细分析了自回归起草与扩散起草的效率权衡。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 TALON: Confidence-Aware Speculative Decoding with Adaptive Token Trees</title>
      <link>https://jjl357.github.io/blog/posts/talon---confidence-aware-speculative-decoding-with-adaptive-token-trees/</link>
      <pubDate>Wed, 21 Jan 2026 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/talon---confidence-aware-speculative-decoding-with-adaptive-token-trees/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/TALON/title.png&#34;&gt;&lt;/p&gt;
&lt;h2 id=&#34;1-introduction&#34;&gt;1. Introduction&lt;/h2&gt;
&lt;p&gt;投机采样（Speculative decoding, SD）已成为在不牺牲输出质量的前提下加速大语言模型（LLM）推理的标准技术。最近的进展已从序列链式草稿（chain-based drafting）转向树状结构生成（tree-structured generation），即草稿模型（draft model）构建候选标记树，以并行探索多种可能的草稿。&lt;/p&gt;
&lt;p&gt;然而，现有的基于树的 SD 方法（如 EAGLE, Sequoia）通常构建&lt;strong&gt;固定宽度、固定深度&lt;/strong&gt;的草稿树，无法适应标记和上下文不断变化的难度。这导致草稿模型无法动态调整树结构，无法在遇到困难标记（difficult tokens）时及早停止，也无法在简单标记上扩展生成。&lt;/p&gt;
&lt;p&gt;为了解决这些挑战，作者提出了 &lt;strong&gt;TALON&lt;/strong&gt;：一种&lt;strong&gt;无需训练（training-free）&lt;/strong&gt;、&lt;strong&gt;预算驱动（budget-driven）&lt;/strong&gt; 的自适应树扩展框架，可以无缝集成到现有的基于树的方法中。与静态方法不同，TALON 迭代构建草稿树，直到达到预设的标记预算（Token Budget），并采用混合扩展策略，根据各层节点动态分配预算。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;核心理念&lt;/strong&gt;：将草稿树塑造成“&lt;strong&gt;深而窄&lt;/strong&gt;”（deep-and-narrow）的形式以应对确定性上下文，以及“&lt;strong&gt;浅而宽&lt;/strong&gt;”（shallow-and-wide）的形式以应对不确定的分支，从而在给定预算下优化探索宽度与生成深度之间的权衡。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;实验表现&lt;/strong&gt;：在 5 个模型和 6 个数据集上的广泛实验表明，TALON 一致优于最先进的 &lt;strong&gt;EAGLE-3&lt;/strong&gt;，相比于自回归解码（auto-regressive decoding）实现了高达 &lt;strong&gt;5.16×&lt;/strong&gt; 的端到端加速。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-motivated-experiments&#34;&gt;2. Motivated Experiments&lt;/h2&gt;
&lt;p&gt;为了从经验上调查静态树结构的局限性，作者使用 EAGLE 作为代表性基线进行了试点分析。作者在 MT-Bench 上使用 Qwen3-8B，设置固定树拓扑为宽度 、深度 。&lt;/p&gt;
&lt;hr&gt;
&lt;h3 id=&#34;41-the-acceptance-funnel-phenomenon-接受漏斗现象&#34;&gt;4.1 The &amp;ldquo;Acceptance Funnel&amp;rdquo; Phenomenon (接受漏斗现象)&lt;/h3&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/TALON/figure3.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;作者首先研究了草稿树中每个位置的接受频率。Figure 3 展示了静态树结构中各层各位置标记的接受频率分布。关于有效投机的分布，出现了两个关键观察结果：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;深层宽度的边际收益递减&lt;/strong&gt;：如图 3 所示，接受分布呈现出&lt;strong&gt;漏斗状模式&lt;/strong&gt;。在初始层（），接受概率在 Top-K 候选者中相对均匀，这表明由于草稿模型  与目标模型  之间的初始随机性和分布差异，需要较宽的搜索宽度。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;误差累积放大&lt;/strong&gt;：随着树的加深（），接受质量迅速集中在高置信度区域（如 top-1 和 top-2）。对于深层节点，草稿模型要么（1）与目标模型自信地对齐（预测正确），要么（2）由于自回归草拟过程中的误差累积，产生即便 top-K 候选也无法覆盖的幻觉路径。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;结论&lt;/strong&gt;：在深层维持  的固定宽度会产生巨大的冗余。当模型自信时，极小的  即可；当模型高度不确定时，应当停止生成以避免浪费计算资源。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h3 id=&#34;42-variance-in-real-world-accepted-length-实际接受长度的方差&#34;&gt;4.2 Variance in Real-World Accepted Length (实际接受长度的方差)&lt;/h3&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/TALON/figure4.png&#34;&gt;&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 SpecBranch: Speculative Decoding via Hybrid Drafting and Rollback-Aware Branch Parallelism - ICLR&#39;26</title>
      <link>https://jjl357.github.io/blog/posts/specbranch---speculativedecoding-via-hybrid-drafting-and-rollback-aware-branch-parallelism/</link>
      <pubDate>Sat, 20 Dec 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/specbranch---speculativedecoding-via-hybrid-drafting-and-rollback-aware-branch-parallelism/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/SpecBranch/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;ICLR&#39;26&lt;/strong&gt;&lt;/p&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;核心痛点：投机解码（Speculative Decoding, SD）中的串行瓶颈与回滚代价&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;受到现代处理器分支预测技术的启发 ，作者允许 Draft Model（草稿模型）在 Target Model（目标模型）进行验证的同时，主动生成推测性的分支。这种并行 SD 范式创建了一个两阶段流水线，使得 Draft Model 的 token 生成与 Target Model 的验证在时间上重叠，从而有效地填补了传统 SD 中固有的流水线气泡（Pipeline Bubbles）。&lt;/p&gt;
&lt;p&gt;先前的研究（如 PEARL ）尝试在 Drafting 阶段利用 Target Model 预验证第一个 token，并在验证阶段让 Draft Model 继续生成。然而，与传统 SD 仅面临局部惩罚（即丢弃部分 token）不同，&lt;strong&gt;并行 SD 面临全局失效的风险&lt;/strong&gt; 。如果并行生成的某个关键 token 被拒绝，会导致后续所有并行计算的 token 全部失效（Global Invalidation），从而严重阻碍并行效率。这种现象在生成长度较长时尤为严重，因为被接受的 token 数量通常服从截断几何分布（Truncated Geometric Distribution），这在并行性和回滚代价之间制造了一个艰难的权衡（Trade-off）。&lt;/p&gt;
&lt;p&gt;遗憾的是，PEARL 并未充分解决这些挑战：&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/SpecBranch/figure1.png&#34;&gt;&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;Pre-verify Rollback（预验证回滚）：&lt;/strong&gt; PEARL 忽视了并行加速的一个关键条件：验证期间生成的 token 必须被 &lt;strong&gt;“全部接受（All-Accepted）”&lt;/strong&gt; 。否则，PEARL 会退化为串行执行并失去并行能力。它仅验证第一个 token，而系统对序列中间发生的拒绝（例如 Fig. 1(b) 中  被拒绝）一无所知，直到并行验证结束才发现，导致大量浪费 。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 Taming the Long-Tail: Efficient Reasoning RL Training with Adaptive Drafter - ASPLOS&#39;26</title>
      <link>https://jjl357.github.io/blog/posts/taming-the-long-tail---efficient-reasoning-rl-training-with-adaptive-drafter---asplos26/</link>
      <pubDate>Sat, 20 Dec 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/taming-the-long-tail---efficient-reasoning-rl-training-with-adaptive-drafter---asplos26/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/TLT/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;ASPLOS&#39;26&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/mit-han-lab/fastrl&#34;&gt;https://github.com/mit-han-lab/fastrl&lt;/a&gt;&lt;/p&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;强化学习（RL）已成为赋予大语言模型（LLMs）强大推理能力（如OpenAI-o1, DeepSeek-R1）的标准方法。然而，这种RL方法面临独特的效率挑战。通过分析自收集的轨迹和来自字节跳动（ByteDance）的生产环境轨迹，作者确定了推理RL过程中的关键特征：&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/TLT/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;em&gt;(Figure 1展示了推理RL中的长尾生成问题和工作负载不平衡)&lt;/em&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;(1) 极不平衡的Rollout（采样）与训练时间 (Unbalanced Rollout and Training Time):&lt;/strong&gt;&lt;br&gt;
在RL过程中，最耗时的阶段是Rollout（模型生成大量候选回答）。这一阶段占据了总步长时间的绝大部分（约 &lt;strong&gt;85%&lt;/strong&gt;），成为主要的瓶颈。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;(2) 持续的长尾分布 (Persistent Long-Tail Distribution):&lt;/strong&gt;&lt;br&gt;
Rollout响应长度呈现长尾分布是导致效率低下的主要原因。虽然大多数生成的序列相对较短，但一小部分序列会达到极长的长度（例如达到最大上下文限制）。这种长尾模式并非偶发，而是贯穿整个长期训练过程的持续模式。在大多数RL步骤中，少数响应达到最大配置长度，而绝大多数则短得多，导致显着的资源未充分利用（即GPU在等待最长序列完成时处于闲置状态）。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;(3)巨大的时间和资源需求 (Substantial Time and Resource Demands):&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/TLT/figure2.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;ByteDance的生产轨迹显示，使用128个GPU训练一个32B模型，仅完成385步就需要11天。单步训练平均耗时约40分钟，极度消耗资源。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;为什么选择投机解码 (Why Speculative Decoding - SD)?&lt;/strong&gt;&lt;br&gt;
作者认为投机解码（SD）是非常适合解决此问题的方法。SD利用轻量级草稿模型（Draft Model）快速生成token序列，然后由目标模型并行验证。SD适合RL训练主要基于两个优点：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;数学上的无损性 (Mathematically Lossless):&lt;/strong&gt; 输出分布与目标模型的原始分布完全一致。这对RL至关重要，因为近似方法可能会改变策略优化轨迹。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;对长尾效率高 (Efficient for Long-Tail):&lt;/strong&gt; SD通过将过程从**内存受限（Memory-Bound）&lt;strong&gt;转变为&lt;/strong&gt;计算受限（Compute-Bound）**来提高吞吐量。这对于RL Rollout的长尾阶段特别有效，因为此时有效批大小（Batch Size）通常很小，标准解码无法充分利用GPU计算能力。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;strong&gt;在RL中应用SD的挑战 (Challenges in Reasoning RL):&lt;/strong&gt;&lt;br&gt;
现有的SD技术主要针对静态推理场景设计，应用于动态推理RL训练面临三大挑战：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;C1. 演进的目标模型 (Evolving Target Model):&lt;/strong&gt; RL训练期间目标模型权重不断更新。固定的草稿模型会迅速变得“过时”（Stale），导致投机接受率下降，严重削弱SD效果。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;C2. 草稿模型训练成本 (Draft Model Training Costs):&lt;/strong&gt; 高效的SD通常依赖专门的草稿模型（如EAGLE等），这需要额外的训练来与目标模型对齐，引入了额外的开销和复杂性。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;C3. 波动的批大小 (Fluctuating Batch Sizes):&lt;/strong&gt; 现有SD通常针对小批次优化。然而，RL Rollout的特征是有效批大小动态剧烈波动（开始时很大，随着短响应完成迅速减小）。如果不进行管理，在大批次下性能可能会下降甚至发生显存溢出（OOM）。&lt;/li&gt;
&lt;/ol&gt;
&lt;h2 id=&#34;2-contribution&#34;&gt;2. Contribution&lt;/h2&gt;
&lt;p&gt;为了解决上述挑战，论文提出了 &lt;strong&gt;TLT&lt;/strong&gt;，这是一个具有自适应投机解码的高效推理RL训练系统。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 Speculate Deep and Accurate - Lossless and Training-Free Acceleration for Offloaded LLMs via Substitute Speculative Decoding - NeurIPS&#39;25</title>
      <link>https://jjl357.github.io/blog/posts/speculate-deep-and-accurate---lossless-and-training-free-acceleration-for-offloaded-llms-via-substitute-speculative-decoding---neurips25/</link>
      <pubDate>Thu, 27 Nov 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/speculate-deep-and-accurate---lossless-and-training-free-acceleration-for-offloaded-llms-via-substitute-speculative-decoding---neurips25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/SubSpec/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;NeurIPS&#39;25&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/NYCU-EDgeAi/subspec&#34;&gt;https://github.com/NYCU-EDgeAi/subspec&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;大型语言模型（LLMs）模型体积巨大，超出常见消费级 GPU 的显存限制，导致两类常用处理方式：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;模型压缩（Quantization 等）&lt;/strong&gt;：例如 INT8/INT4 等低精度表示，能显著压缩内存占用，但属于&lt;strong&gt;有损&lt;/strong&gt;，可能影响输出质量。引用若干相关工作（GPTQ、AWQ、HQQ 等）。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;参数分流 / Offloading&lt;/strong&gt;：把不活跃层参数放到 CPU 主内存，需要时再传回 GPU，保证模型输出“无损”。但在 PCIe 带宽受限时，频繁的参数传输会大幅拉低吞吐与响应速度，导致单卡交互式生成速度可能只有每秒 1–2 token。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;为缓解 offloading 的数据传输瓶颈，&lt;strong&gt;Speculative Decoding (SD)&lt;/strong&gt; 提出使用“草稿模型”（draft model）先快速生成多个候选 token，然后由目标模型在单次前向中并行验证这些候选，从而减少昂贵的目标模型前向次数。但现有方法存在两大限制：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;依赖与目标模型“同族”的预训练小模型（若无同族小模型，需做额外训练/蒸馏）。&lt;/li&gt;
&lt;li&gt;训练过的草稿模型对定制 / fine-tuned 目标模型对齐不足，导致平均可接受 token 长度（average acceptance length，记作 $\tau$）较小，实际加速受限（常 &amp;lt; 7）。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;论文提出 &lt;strong&gt;Substitute Speculative Decoding (SubSpec)&lt;/strong&gt;：一种&lt;strong&gt;无训练（training-free）&lt;/strong&gt;、plug-and-play 的方法，通过在 GPU 上构造一个高度对齐的 draft 模型（使用低位宽 substitute 层 + 复用目标模型在 GPU 上的层与 KV-Cache）来大幅提升 $\tau$，从而在 offloading 场景下显著加速（例如在 8GB VRAM 下 Qwen2.5 7B 达到 ~25 token/s，超过 10× 加速）。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 SuffixDecoding: Extreme Speculative Decoding for Emerging AI Applications - NeurIPS&#39;25 Spotlight</title>
      <link>https://jjl357.github.io/blog/posts/suffixdecoding---extreme-speculative-decoding-for-emerging-ai-applications---neurips25-spotlight/</link>
      <pubDate>Tue, 18 Nov 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/suffixdecoding---extreme-speculative-decoding-for-emerging-ai-applications---neurips25-spotlight/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/SuffixDecoding/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;NeurIPS&#39;25 Spotlight&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/snowflakedb/ArcticInference&#34;&gt;https://github.com/snowflakedb/ArcticInference&lt;/a&gt;&lt;/p&gt;
&lt;h2 id=&#34;my-thoughts&#34;&gt;My Thoughts&lt;/h2&gt;
&lt;p&gt;这篇 paper 针对 AI 应用中大量推理请求呈现 &lt;strong&gt;高度重复、模式化且可预测&lt;/strong&gt; 的特性，提出了一个我觉得非常优秀的推测解码方法。起初我以为它的思路类似于 prefix cache，但实际阅读后发现：&lt;strong&gt;SuffixDecoding 基于 suffix tree 的方法对于 speculative decoding 的约束要小得多&lt;/strong&gt;。
Prefix cache 需要所有 token 完全一致才能命中，而 SuffixDecoding 只需满足 speculative decoding 的验证条件即可，大大提升了复用空间和适用范围。&lt;/p&gt;
&lt;p&gt;我原本担心 suffix tree 在实际部署中会因 &lt;strong&gt;规模过大&lt;/strong&gt; 或 &lt;strong&gt;查询速度过慢&lt;/strong&gt; 而成为瓶颈，但论文中的实验数据基本消除了这些顾虑。根据文中的测量，suffix tree 的&lt;strong&gt;内存效率非常高&lt;/strong&gt;：即使缓存 &lt;strong&gt;572M tokens（约 20K 请求）&lt;/strong&gt;，也只占用 &lt;strong&gt;6.15GB CPU 内存&lt;/strong&gt;，平均下来每个 token 仅需 &lt;strong&gt;10.75 bytes&lt;/strong&gt;。在一台常见的 &lt;strong&gt;144GB CPU 内存的 A100 系统&lt;/strong&gt;上，SuffixDecoding 甚至能够缓存 &lt;strong&gt;31 天连续生成的数据&lt;/strong&gt; 而无需 eviction。&lt;/p&gt;
&lt;p&gt;更重要的是，即便在如此大规模的 suffix tree 下，其性能依然稳定：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;更新耗时约 4μs/ token&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;查询耗时约 12μs/ token&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;构建速度同样令人放心，构建 &lt;strong&gt;10 万条示例输出&lt;/strong&gt; 的 suffix tree 仅需 &lt;strong&gt;~62 秒&lt;/strong&gt;，且这是整个系统启动时的一次性成本，后续更新增量极小。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 ViSpec: Accelerating Vision-Language Models with Vision-Aware Speculative Decoding - NeurIPS&#39;25 </title>
      <link>https://jjl357.github.io/blog/posts/vispec---accelerating-vision-language-models-with-vision-aware-speculative-decoding---neurips25/</link>
      <pubDate>Wed, 05 Nov 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/vispec---accelerating-vision-language-models-with-vision-aware-speculative-decoding---neurips25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/ViSpec/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;NeurIPS&#39;25&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;GitHub:&lt;/strong&gt; &lt;a href=&#34;https://github.com/KangJialiang/ViSpec&#34;&gt;https://github.com/KangJialiang/ViSpec&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;my-thoughts&#34;&gt;My Thoughts&lt;/h2&gt;
&lt;p&gt;个人感觉这篇工作是将Eagle应用于VLM， 并针对VLM带来的问题进行了解决。&lt;/p&gt;
&lt;p&gt;但这篇工作也是需要training，构造数据集和进行训练花销还是挺大的， 好奇能否有更efficient甚至是training-free的method来实现Vision-Aware Speculative Decoding。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;Speculative Decoding（推测解码）是一种在大型语言模型（LLM）中被广泛采用的推理加速技术。然而，其在视觉语言模型（Vision-Language Models, VLMs）中的应用仍然非常有限，已有方法的加速收益通常不足 &lt;strong&gt;1.5×&lt;/strong&gt;。&lt;br&gt;
随着多模态能力逐渐成为大规模模型的核心能力，这一加速差距变得愈发显著。&lt;/p&gt;
&lt;p&gt;ViSpec 的核心动机在于突破当前 VLM 加速的瓶颈：现有推测式解码方法主要针对纯文本推理设计，在视觉输入冗余较高的多模态场景下，小型草稿（draft）模型在生成过程中难以高效处理图像特征，从而限制了整体加速效率。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-challenge&#34;&gt;2. Challenge&lt;/h2&gt;
&lt;p&gt;目前针对 Vision-Language Models 的 Speculative Decoding 工作非常少。仅有的尝试[7] 在 LLaVA-7B 上应用了一个小型仅语言模型的 draft 模型，获得了大约 &lt;strong&gt;1.5×&lt;/strong&gt; 的加速。当他们将 image encoder 融入小型多模态草稿模型中时，加速效果并未显著提升，主要原因包括：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;图像信息冗余较高&lt;/strong&gt;：大量重复或低信息密度的视觉块（patch）对小模型造成干扰；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;多模态处理复杂性高&lt;/strong&gt;：视觉 token 的嵌入维度高、数量多，导致 draft 模型计算成本上升而收益有限。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;这些问题说明：在现有的 speculative decoding 框架中，草稿模型无法充分理解和整合图像特征信息。因此，作者需要一个 &lt;strong&gt;能高效处理视觉与语言双模态特征并保持高预测精度&lt;/strong&gt; 的专门框架。ViSpec 即是在此背景下提出。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;3-contribution&#34;&gt;3. Contribution&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/ViSpec/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;ViSpec 旨在解决小型 draft 模型在视觉冗余与上下文一致性方面的弱点。作者观察到，大型 VLM 能逐层过滤图像中冗余信息而保持语义理解，但小模型无法做到这一点。&lt;br&gt;
为解决这一问题，ViSpec 提出了 &lt;strong&gt;Vision-Aware Speculative Decoding&lt;/strong&gt; 框架，核心贡献如下：&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 SpecEdge: Scalable Edge-Assisted Serving Framework for Interactive LLMs - NeurIPS&#39;25 Spotlight</title>
      <link>https://jjl357.github.io/blog/posts/specedge---scalable-edge-assisted-serving-framework-for-interactive-llms-neurips25-spotlight/</link>
      <pubDate>Mon, 03 Nov 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/specedge---scalable-edge-assisted-serving-framework-for-interactive-llms-neurips25-spotlight/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/SpecEdge/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;NeurIPS&#39;25 Spotlight&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/kaist-ina/specedge&#34;&gt;https://github.com/kaist-ina/specedge&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;my-thought&#34;&gt;My Thought&lt;/h2&gt;
&lt;p&gt;个人感觉这篇工作是将&lt;strong&gt;ICLR25 PEARL: Parallel Speculative Decoding with Adaptive Draft Length&lt;/strong&gt;中 大小模型彼此互不等待的协同Speculative Decoding模式放在了云边协同场景下(一般来说Pearl中的大小模型协同需要放在不同的卡上，在单卡场景下没法实现，而云边协同的场景下刚好符合Pearl的研究场景)，用来掩盖和减小 draft 和 target model 的网络通信开销。&lt;/p&gt;
&lt;p&gt;同时也对 多edge draft models 的情况进行了优化，提出&lt;strong&gt;Server-Side Pipeline-Aware Scheduling&lt;/strong&gt;来进一步提高target model的利用率。&lt;/p&gt;
&lt;p&gt;这篇工作真正实现上还有许多细节，有时间可以看看开源代码中是否涉及到。&lt;/p&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;Large language models (LLMs) power many modern applications, but serving them at scale remains costly and resource-intensive. Current server-centric systems overlook consumer-grade GPUs at the edge.&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;大型语言模型（LLMs）支撑了众多现代智能应用，但其部署和推理成本极高。目前的主流推理系统普遍采用“服务器中心化”架构，忽视了边缘侧日益强大的消费级 GPU 资源。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;A compelling opportunity exists to dramatically reduce LLM serving costs by leveraging consumer-grade GPUs at the network edge.
The GeForce RTX 4090 delivers up to &lt;strong&gt;330.3 TFLOPS (FP16 tensor)&lt;/strong&gt;, even exceeding the &lt;strong&gt;312 TFLOPS&lt;/strong&gt; of data-center-class A100, while costing &lt;strong&gt;14.43× less&lt;/strong&gt;.&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 SPECVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruning - EMNLP&#39;25</title>
      <link>https://jjl357.github.io/blog/posts/specvlm---enhancingspeculative-decoding-of-video-llms-via-verifier-guided-token-pruning---emnlp25/</link>
      <pubDate>Wed, 29 Oct 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/specvlm---enhancingspeculative-decoding-of-video-llms-via-verifier-guided-token-pruning---emnlp25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/SpecVLM/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;EMNLP&#39;25&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/zju-jiyicheng/SpecVLM&#34;&gt;https://github.com/zju-jiyicheng/SpecVLM&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;Video large language models (Vid-LLMs) have shown strong capabilities in understanding video content. However, their reliance on dense video token representations introduces substantial memory and computational overhead in both prefilling and decoding.&lt;/p&gt;
&lt;p&gt;例如：
LLaVA-OneVision (Li et al., 2024a) 将每一帧处理为 196 个视觉 token。若视频为两分钟、60 FPS，则总 token 数量超过 100 万。
如此大量的 video tokens 导致：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;序列长度急剧增加；&lt;/li&gt;
&lt;li&gt;Prefill 阶段的 attention 开销呈平方级增长；&lt;/li&gt;
&lt;li&gt;Decoding 阶段 KV cache 急速膨胀，成为显著的 GPU 内存瓶颈。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;在 autoregressive 生成过程中，每步生成的 KV cache 都必须与模型参数一起加载与存储于 GPU 显存，导致显著的 memory-bound 现象。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 AdaSPEC: Selective Knowledge Distillation for Efficient Speculative Decoders - NeurIPS&#39;25 Spotlight</title>
      <link>https://jjl357.github.io/blog/posts/adaspec---selective-knowledge-distillation-for-efficient-speculative-decoders---neurips25-spotlight/</link>
      <pubDate>Mon, 27 Oct 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/adaspec---selective-knowledge-distillation-for-efficient-speculative-decoders---neurips25-spotlight/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/AdaSpec/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;NeurIPS&#39;25 Spotlight&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/yuezhouhu/adaspec&#34;&gt;https://github.com/yuezhouhu/adaspec&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;my-thoughts&#34;&gt;My Thoughts&lt;/h2&gt;
&lt;p&gt;有个问题在于：对于论文中提到的“hard tokens”，是否能 distill 出一个合适且有用的 draft model？&lt;br&gt;
论文结果显示当前方法对这些 token 效果较差（甚至比 reference model 还差），  因此好奇是否可能需要新的方式来改进这一部分的蒸馏与利用机制。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;Speculative Decoding (SD) accelerates large language model inference by employing a small &lt;strong&gt;draft model&lt;/strong&gt; to generate predictions, which are then verified by a larger &lt;strong&gt;target model&lt;/strong&gt;.&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/AdaSpec/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;SD 的加速性能依赖于 draft 与 target 模型的&lt;strong&gt;对齐度（alignment）&lt;/strong&gt;。传统 Knowledge Distillation (KD) 的目标是最小化 KL 散度，但这与 SD 的最终目标——&lt;strong&gt;最大化 token acceptance rate（被 target 接受的比例）&lt;/strong&gt;——并不一致。&lt;/p&gt;
&lt;p&gt;因此，即使 KD 能使分布接近，也不一定提升 SD 的实际加速效果。&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
