๐Ÿ“ DFlash: Block Diffusion for Flash Speculative Decoding - ICML'26

May 8, 2026

๐Ÿ“ TALON: Confidence-Aware Speculative Decoding with Adaptive Token Trees

January 21, 2026

๐Ÿ“ SpecBranch: Speculative Decoding via Hybrid Drafting and Rollback-Aware Branch Parallelism - ICLR'26

December 20, 2025

๐Ÿ“ Taming the Long-Tail: Efficient Reasoning RL Training with Adaptive Drafter - ASPLOS'26

December 20, 2025

๐Ÿ“ Speculate Deep and Accurate - Lossless and Training-Free Acceleration for Offloaded LLMs via Substitute Speculative Decoding - NeurIPS'25

November 27, 2025

๐Ÿ“ SuffixDecoding: Extreme Speculative Decoding for Emerging AI Applications - NeurIPS'25 Spotlight

November 18, 2025

๐Ÿ“ ViSpec: Accelerating Vision-Language Models with Vision-Aware Speculative Decoding - NeurIPS'25

November 5, 2025

๐Ÿ“ SpecEdge: Scalable Edge-Assisted Serving Framework for Interactive LLMs - NeurIPS'25 Spotlight

November 3, 2025

๐Ÿ“ SPECVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruning - EMNLP'25

October 29, 2025

๐Ÿ“ AdaSPEC: Selective Knowledge Distillation for Efficient Speculative Decoders - NeurIPS'25 Spotlight

October 27, 2025