<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>Paper Note on JJ&#39;s Blog</title>
    <link>https://jjl357.github.io/blog/tags/paper-note/</link>
    <description>Recent content in Paper Note on JJ&#39;s Blog</description>
    <generator>Hugo -- 0.152.2</generator>
    <language>zh-cn</language>
    <lastBuildDate>Sat, 20 Jun 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://jjl357.github.io/blog/tags/paper-note/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>📝 KVFlow: Efficient Prefix Caching for Accelerating LLM-Based Multi-Agent Workflows</title>
      <link>https://jjl357.github.io/blog/posts/kvflow---efficient-prefix-caching-for-accelerating-llm-based-multi-agent-workflows/</link>
      <pubDate>Sat, 20 Jun 2026 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/kvflow---efficient-prefix-caching-for-accelerating-llm-based-multi-agent-workflows/</guid>
      <description>&lt;h1 id=&#34;kvflow-efficient-prefix-caching-for-accelerating-llm-based-multi-agent-workflows&#34;&gt;KVFlow: Efficient Prefix Caching for Accelerating LLM-Based Multi-Agent Workflows&lt;/h1&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/KVFlow/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;NeurIPS&#39;25&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/PanZaifeng/KVFlow/tree/main&#34;&gt;https://github.com/PanZaifeng/KVFlow/tree/main&lt;/a&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;论文主题概括：&lt;/strong&gt;
这篇论文研究的是 &lt;strong&gt;LLM-based multi-agent workflows&lt;/strong&gt; 中的系统级推理加速问题，重点不是提升模型能力，也不是改 prompt 或 agent 协作策略，而是优化底层 LLM serving system 中的 &lt;strong&gt;KV cache 管理机制&lt;/strong&gt;。论文指出，现有系统通常使用 &lt;strong&gt;LRU&lt;/strong&gt; 策略管理 prefix KV cache，但 LRU 只根据过去访问时间做决策，无法理解多智能体工作流中 agent 的未来执行顺序，因此容易把“马上就要再次使用”的 agent prefix cache 提前驱逐掉。KVFlow 利用 workflow 结构预测 agent 的未来调用顺序，并据此进行 cache eviction 和 prefetching，从而减少 cache miss、降低 prefill 或 CPU-GPU loading 开销，提高多智能体工作流的执行效率。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;核心关键词：&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;LLM Serving&lt;/li&gt;
&lt;li&gt;Agentic Workflow&lt;/li&gt;
&lt;li&gt;Multi-Agent Workflow&lt;/li&gt;
&lt;li&gt;Prefix Caching&lt;/li&gt;
&lt;li&gt;KV Cache&lt;/li&gt;
&lt;li&gt;Cache Eviction&lt;/li&gt;
&lt;li&gt;LRU&lt;/li&gt;
&lt;li&gt;Radix Tree Cache&lt;/li&gt;
&lt;li&gt;Workflow-aware Cache Management&lt;/li&gt;
&lt;li&gt;Agent Step Graph&lt;/li&gt;
&lt;li&gt;Steps-to-execution&lt;/li&gt;
&lt;li&gt;KV Prefetching&lt;/li&gt;
&lt;li&gt;CPU-GPU Transfer&lt;/li&gt;
&lt;li&gt;SGLang&lt;/li&gt;
&lt;li&gt;HiCache&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id=&#34;abstract&#34;&gt;Abstract&lt;/h2&gt;
&lt;p&gt;这篇论文的出发点是：
现在很多复杂任务会通过 &lt;strong&gt;LLM-based agentic workflows&lt;/strong&gt; 来完成，即把一个复杂任务拆成多个 agent，每个 agent 有自己的角色、固定 prompt 和子任务。例如一个软件开发类 workflow 可能包含 Product Manager、Architect、Engineer、Reviewer 等 agent。每个 agent 在 workflow 中会被反复调用，每次调用 LLM 时都要处理自己的 prompt。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 ThunderAgent: A Simple, Fast and Program-Aware Agentic Inference System - ICML&#39;26 Spotlight</title>
      <link>https://jjl357.github.io/blog/posts/thunderagent---a-simple-fast-and-program-aware-agentic-inference-system---icml26-spotlight/</link>
      <pubDate>Thu, 18 Jun 2026 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/thunderagent---a-simple-fast-and-program-aware-agentic-inference-system---icml26-spotlight/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/ThunderAgent/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;ICML&#39;26 Spotlight&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/ThunderAgent-org/ThunderAgent&#34;&gt;https://github.com/ThunderAgent-org/ThunderAgent&lt;/a&gt;&lt;/p&gt;
&lt;h2 id=&#34;abstract&#34;&gt;Abstract&lt;/h2&gt;
&lt;p&gt;这篇论文研究的是 &lt;strong&gt;agentic inference system&lt;/strong&gt;，也就是面向 LLM Agent 多轮推理、多轮工具调用、多轮环境交互的推理系统。论文的核心问题是：现在的大模型不再只是一次性回答用户问题，而是越来越多地作为 Agent 使用，例如代码修复 Agent、科学发现 Agent、routing Agent、computer-use Agent 等。这类 Agent 往往需要在一个长时间运行的 workflow 中不断执行：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;LLM reasoning $\rightarrow$ tool call $\rightarrow$ tool observation $\rightarrow$ LLM reasoning $\rightarrow$ tool call $\rightarrow \cdots$&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这与传统 LLM serving 中“一个 prompt 对应一次 request”的模式不同。传统系统通常把 agentic inference 拆成两个彼此独立的组件：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;LLM inference engine&lt;/strong&gt;，例如 vLLM、SGLang；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;tool orchestrator&lt;/strong&gt;，例如 Kubernetes、Docker sandbox、API server 管理器等。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;这种组合虽然工程上容易实现，但系统只在 &lt;strong&gt;per-request&lt;/strong&gt; 层面调度资源，而没有看到整个 agent workflow 的 end-to-end 生命周期。论文指出，这种 request-aware 设计会导致两个关键资源管理不佳：&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 DroidSpeak: KV Cache Sharing Across Fine-tuned Model Variants - NSDI&#39;26</title>
      <link>https://jjl357.github.io/blog/posts/droidspeak---kv-cache-sharing--across-fine-tuned-model-variants---nsdi26/</link>
      <pubDate>Sun, 07 Jun 2026 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/droidspeak---kv-cache-sharing--across-fine-tuned-model-variants---nsdi26/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/DroidSpeak/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference：&lt;/strong&gt; &lt;strong&gt;NSDI&#39;26&lt;/strong&gt;&lt;/p&gt;
&lt;h2 id=&#34;abstract-摘要&#34;&gt;Abstract (摘要)&lt;/h2&gt;
&lt;p&gt;在大型企业环境中，复合型人工智能系统（Compound AI systems，例如多智能体 Agentic 系统）正成为一种新兴趋势。在这些系统中，专门为不同用户、任务或角色微调（Fine-tuned）的多个大语言模型（LLMs）协同工作。在这些场景下，不同的模型通常会处理共享相同上下文前缀（Context Prefix）的输入。尽管过去有许多工作致力于在&lt;strong&gt;单一模型&lt;/strong&gt;的不同输入之间实现前缀 KV Cache 的重用，但如何让&lt;strong&gt;一个模型重用另一个不同模型的&lt;/strong&gt;前缀 KV Cache，目前仍是一个未解的开放性问题。&lt;/p&gt;
&lt;p&gt;本文提出了 &lt;strong&gt;DroidSpeak&lt;/strong&gt;，这是第一个支持在运行不同 LLMs（只要这些模型具有相同的底层架构）的分布式节点之间实现 KV Cache 跨模型重用的分布式 LLM 推理系统。作者首先进行了一项首创性的实证研究，旨在理解跨不同 LLM 共享 KV Cache 的影响，以及这种共享是否/何时会影响生成质量。基于研究发现，作者设计了 DroidSpeak，该系统能够&lt;strong&gt;选择性地重新计算（recompute）由另一个 LLM 产生的 KV Cache 的少数几层，并直接重用（reuse）其余层的 KV Cache&lt;/strong&gt;，从而将质量损失降至可以忽略的程度。此外，作者精心设计了层级重计算与复用 KV Cache 加载之间的流水线（Pipelining）机制，进一步提升了推理性能。在多样化的数据集和模型对（Model Pairs）上的实验表明，相比于不允许跨模型共享的基线，DroidSpeak 能够实现高达 &lt;strong&gt;$4\times$ 的吞吐量提升&lt;/strong&gt;和约 &lt;strong&gt;$3.1\times$ 更快的 Prefill（首字延迟 TTFT 提升）&lt;/strong&gt;，而在 F1 分数、Rouge-L 或代码相似度得分上的质量损失可以忽略不计。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-introduction-引言&#34;&gt;1. Introduction (引言)&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/DroidSpeak/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;当前，LLM 推理已经成为工业界最消耗资源的负载之一。为了降低计算需求，一个常见的优化是：在运行&lt;strong&gt;同一个 LLM&lt;/strong&gt; 的 GPU 机器上，通过网络共享并重用输入前缀的 KV Cache。然而，这项优化如何应用于&lt;strong&gt;不同的 LLMs&lt;/strong&gt;，还有待研究。&lt;/p&gt;
&lt;p&gt;新兴的趋势是：在一个 GPU 集群中托管多个不同的 LLM。因为在复杂或个性化任务中，往往需要多个由同一个基础模型（Foundation Model）微调而来的模型，来服务不同的用户或扮演不同的角色。为了阐明这一挑战的动机，作者强调了多个微调模型在系统中协同工作的三个常见用例：&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 EPIC: Efficient Position-Independent Caching for Serving Large Language Models - ICML&#39;25</title>
      <link>https://jjl357.github.io/blog/posts/epic---efficient-position-independent-caching-for-serving-large-language-models---icml25/</link>
      <pubDate>Fri, 05 Jun 2026 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/epic---efficient-position-independent-caching-for-serving-large-language-models---icml25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/EPIC-ICML&#39;25/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;ICML&#39;25&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/DerekHJH/epic&#34;&gt;https://github.com/DerekHJH/epic&lt;/a&gt;&lt;/p&gt;
&lt;h2 id=&#34;1-abstract-摘要&#34;&gt;1. Abstract (摘要)&lt;/h2&gt;
&lt;p&gt;大型语言模型 (LLMs) 在广泛的应用中展现了强大的能力，但随着请求 (prompts) 变得越来越复杂，如何高效地进行模型服务 (serving) 成为一个日益严峻的挑战。
上下文缓存 (Context caching) 通过重用跨请求重复出现的 token 的中间表示——键值向量 (Key-Value vectors, KV cache)，显著提升了服务性能。然而，现有的上下文缓存技术&lt;strong&gt;要求跨请求的完全前缀匹配 (exact prefix matches)&lt;/strong&gt;，这极大地限制了其在少样本学习 (few-shot learning) 和检索增强生成 (RAG) 等场景下的重用率。在这些场景中，不可变的内容（例如检索到的文档）在不同请求之间保持不变，但它们往往被不同的前缀（如不同的用户指令或系统提示）所引导。&lt;/p&gt;
&lt;p&gt;为了解决这一问题，&lt;strong&gt;位置无关缓存 (Position-Independent Caching, PIC)&lt;/strong&gt; 应运而生，它使得 KV 向量的模块化重用成为可能，而不再受限于前缀是否一致。
本论文对 PIC 进行了形式化定义，并在前人工作的基础上提出了 &lt;strong&gt;EPIC&lt;/strong&gt; 服务系统。EPIC 结合了作者全新提出的 &lt;strong&gt;LegoLink 算法&lt;/strong&gt;。该算法巧妙地缓解了每个文档开头出现的不合理的“注意力下沉” (attention sink) 效应，从而以极小的计算代价维持了模型的准确率。&lt;/p&gt;
&lt;p&gt;实验结果表明，EPIC 在首字延迟 (Time-To-First-Token, TTFT) 上实现了高达 &lt;strong&gt;8倍&lt;/strong&gt; 的提升，在吞吐量上相较于现有系统获得了 &lt;strong&gt;7倍&lt;/strong&gt; 的增益，同时几乎没有带来任何准确率的损失。&lt;/p&gt;
&lt;h2 id=&#34;2-introduction-引言&#34;&gt;2. Introduction (引言)&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/EPIC-ICML&#39;25/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;首先，基于前缀的上下文缓存 (prefix-based CC) 通过将当前请求与之前的请求进行匹配，从而重用最长公共前缀的 KV 向量。尽管基于前缀的 CC 仍然是现有系统（如 kim; gem, b; Zheng 等人, 2024; Kwon 等人, 2023）中的主流方法，但它要求请求之间必须有&lt;strong&gt;精确的前缀匹配&lt;/strong&gt;。这限制了其在少样本学习和检索增强生成 (RAG) 等场景中的重用，在这些场景中，不可变的数据块（immutable chunks，例如文档）在请求之间保持不变，但前面的前缀却在不断变化。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 TwinQuant: Learnable Subspace Decomposition for 4-Bit LLM Quantization - ICML&#39;26</title>
      <link>https://jjl357.github.io/blog/posts/twinquant---learnable-subspace-decomposition-for-4-bit-llm-quantization---icml26/</link>
      <pubDate>Mon, 01 Jun 2026 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/twinquant---learnable-subspace-decomposition-for-4-bit-llm-quantization---icml26/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/TwinQuant/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;ICML&#39;26&lt;/strong&gt;&lt;/p&gt;
&lt;h2 id=&#34;abstract-摘要&#34;&gt;Abstract (摘要)&lt;/h2&gt;
&lt;p&gt;4-bit 量化能够显著减少大型语言模型（LLMs）推理时的显存占用并降低延迟，但激进的精度压缩往往会导致模型准确率严重下降。之前的方法通常通过&lt;strong&gt;将每个权重矩阵分解为两个组件&lt;/strong&gt;来解决这个问题（例如，通过奇异值分解 SVD），并分别对它们进行量化：将大部分数值分配给低精度（如 4-bit）的残差（residual）组件，同时使用高精度（如 FP16）的低秩（low-rank）组件来处理异常值（outliers）。然而，&lt;strong&gt;这类传统的分解方法旨在最小化残差的实数域能量（real-valued energy），而不是最小化残差和低秩组件在量化后的误差（post-quantization error）&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;为了解决这一问题，本文提出了 &lt;strong&gt;TwinQuant&lt;/strong&gt;，这是一种针对 LLMs 的 4-bit 量化框架。该框架能够学习到“量化友好（quantization-friendly）”的分解子空间，并联合重塑低秩组件和残差组件的分布。TwinQuant 通过在&lt;strong&gt;斯蒂费尔流形（Stiefel manifold，正交约束）&lt;strong&gt;和&lt;/strong&gt;一般线性流形（general linear manifolds）&lt;strong&gt;上进行联合优化，学习特定于组件的变换矩阵，从而展平它们的数据分布并减少动态范围的不平衡。为了实现端到端的高效执行，作者进一步设计了一个&lt;/strong&gt;融合的双组件计算核（fused dual-component kernel）&lt;/strong&gt;，该算子将两阶段的低秩计算在片内（on-chip）流水线化，并在单个 epilogue（收尾阶段）中将两个组件合并，从而完全避免了中间结果导致的全局内存读写（global-memory traffic）。&lt;/p&gt;
&lt;p&gt;在 LLaMA3 和 Qwen3 模型上的实验表明，TwinQuant 能够保持接近 FP16 的精度，并相比于 FP16 基线实现了高达 1.8 倍的端到端加速。&lt;/p&gt;
&lt;h2 id=&#34;1-introduction-引言&#34;&gt;1. Introduction (引言)&lt;/h2&gt;
&lt;p&gt;大型语言模型（LLMs）已成为对话助手、医疗决策支持和代码生成等领域的核心基础设施。随着模型参数从 7B 扩展到 70B 甚至超过 600B，推理过程越来越受到大型矩阵乘法的支配，这放大了计算和内存访问的成本，造成了关键的部署瓶颈。&lt;/p&gt;
&lt;p&gt;为了缓解这一压力，现代加速器原生支持了低精度计算（如 NVIDIA Blackwell 架构上的 FP8/FP4）。同时，**训练后量化（PTQ, Post-Training Quantization）**技术将权重和运行时激活值压缩为低比特格式，减少了显存占用并提高了吞吐量，使量化成为高效 LLM 服务的关键技术。&lt;/p&gt;
&lt;p&gt;然而，&lt;strong&gt;将权重和激活值激进地量化到低比特通常会导致精度的巨大下降&lt;/strong&gt;。这是因为它们具有**重尾（heavy-tailed）&lt;strong&gt;和&lt;/strong&gt;高度各向异性（highly anisotropic）**的统计特征，异构组件耦合在同一个张量中，导致量化误差被少数特定方向和大幅值（即异常值）所主导。早期的方法应用缩放和矩阵变换在量化前重新分布权重和激活值，但它们主要是在不同的坐标系中重新表达张量，并没有消除其固有的各向异性：少数主导方向仍然决定了动态范围，迫使所有组共享有限的 4-bit 缩放因子（scales），留下了仅仅靠重新分布无法消除的严重失真。&lt;/p&gt;
&lt;p&gt;更近期的方法（如 SVDQuant）超越了单一空间，将每个权重分解为两个组件：截断 SVD 可以将异常值吸收到一个很小的高精度低秩分支中，同时对残差进行量化。当奇异值快速衰减时（如扩散模型中），微小的秩（tiny rank）就能保留大多数异常值。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;然而，在主流 LLMs 中，作者通过实验观察到奇异值衰减非常缓慢（详见 Section 3），因此微小的秩无法吸收足够的异常值。这就产生了一个“困境”：&lt;/strong&gt;&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 LEARNPRUNER: RETHINKING ATTENTION-BASED TOKEN PRUNING IN VISION LANGUAGE MODELS  - ICLR&#39;26</title>
      <link>https://jjl357.github.io/blog/posts/learnpruner---rethinking-attention-based-token-pruning-in-vision-language-models---iclr26/</link>
      <pubDate>Sat, 09 May 2026 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/learnpruner---rethinking-attention-based-token-pruning-in-vision-language-models---iclr26/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/LearnPruner/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference: ICLR 2026&lt;/strong&gt;&lt;/p&gt;
&lt;h2 id=&#34;1-abstract-摘要&#34;&gt;1. Abstract (摘要)&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;【核心内容与总结】&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;研究背景：&lt;/strong&gt; 视觉语言模型（VLMs）在视觉理解和推理上表现出色，但由于长视觉序列输入（如高分辨率图像或视频），带来了显著的计算负担。现有的“Token剪枝”技术通过删除不重要的视觉 Token 来缓解该问题，但其核心在于“如何决定 Token 的重要性”，现有方法通常直接依赖于视觉编码器（Vision Encoder）或大语言模型（LLM）的注意力分数（Attention Scores）。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;核心发现：&lt;/strong&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;视觉编码器端：&lt;/strong&gt; 存在“注意力下沉（Attention Sink）”现象，导致其难以有效聚焦于包含丰富信息的前景区域。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;大语言模型端（LLM）：&lt;/strong&gt; 尽管先前的研究表明 LLM 存在对 Token 位置的注意力偏差（位置越后分数越高），但本文发现，&lt;strong&gt;文本到视觉（Text-to-Vision）的注意力机制能够抵抗这种偏差&lt;/strong&gt;，并在 LLM 的**中间层（Middle Layers）**提供了有效的剪枝指导。&lt;/li&gt;
&lt;/ol&gt;
&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;本文贡献：&lt;/strong&gt; 提出了一种&lt;strong&gt;双阶段（Two-stage）Token 剪枝框架 LearnPruner&lt;/strong&gt;。
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;第一阶段：&lt;/strong&gt; 在视觉编码器之后，通过一个&lt;strong&gt;可学习的剪枝模块 (Learnable Pruning Module, LPM)&lt;/strong&gt; 剔除视觉冗余 Token。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;第二阶段：&lt;/strong&gt; 在 LLM 的中间层，保留与任务（Query）相关的 Token。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;实验效果：&lt;/strong&gt; LearnPruner 在仅使用原始视觉 Token 数量 $ 5.5% $ 的情况下，保留了约 $ 95% $ 的原始性能，实现了 $ 3.2 \times $ 的推理加速，展示了良好的精度-效率权衡。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-introduction-引言&#34;&gt;2. Introduction (引言)&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/LearnPruner/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;【背景引入与动机分析】&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;重新审视注意力机制（结合 Figure 1）：&lt;/strong&gt;
&lt;ul&gt;
&lt;li&gt;如图 1 所示，Vision Encoder 使用的 &lt;code&gt;[CLS]&lt;/code&gt; token 注意力虽然能部分覆盖前景目标，但通常会将过多注意力分配给信息量较低的背景区域。这与视觉 Transformer 倾向于在均匀背景区域生成高范数离群 Token（Artifacts）的现象一致。&lt;/li&gt;
&lt;li&gt;在 LLM 端，尽管存在“注意力偏移（Attention Shift，偏向图像下半部分）”现象，但这种偏差主要存在于视觉到视觉（V2V）或全 Token 注意力中。相反，**文本到视觉（Text-to-Vision）**的注意力能够有效地聚焦于与查询（Query）相关的区域。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;现有剪枝方法的局限性：&lt;/strong&gt;
&lt;ul&gt;
&lt;li&gt;(1) 在视觉编码器中，&lt;code&gt;[CLS]&lt;/code&gt; token 无法充分关注显著前景，导致剪枝结果次优（尤其在 Token 预算有限时）。&lt;/li&gt;
&lt;li&gt;(2) 在 LLM 中，文本到视觉的注意力具有抵抗注意力偏移的鲁棒性，能提供可靠指导，但如果将剪枝推迟到中间层进行，前期浅层网络仍需处理完整的视觉序列，导致加速收益有限。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;LearnPruner 解决方案：&lt;/strong&gt;
&lt;ul&gt;
&lt;li&gt;提出双阶段框架顺序移除冗余 Token。首先，采用轻量级可学习模块（取代传统的 &lt;code&gt;[CLS]&lt;/code&gt; 分数）预测 Token 重要性，以消除固有的视觉冗余，并保留少量多样性 Token 提供补充信息。随后，剩余 Token 进入 LLM，在中间层基于文本查询进行第二次剪枝，进一步丢弃与指令无关的 Token。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id=&#34;3-method-方法设计&#34;&gt;3. Method (方法设计)&lt;/h2&gt;
&lt;p&gt;本节首先通过分析验证现有注意力机制在剪枝中的局限性，随后详细阐述 LearnPruner 的算法架构。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 DFlash: Block Diffusion for Flash Speculative Decoding - ICML&#39;26</title>
      <link>https://jjl357.github.io/blog/posts/dflash---block-diffusion-for-flash-speculative-decoding---icml26/</link>
      <pubDate>Fri, 08 May 2026 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/dflash---block-diffusion-for-flash-speculative-decoding---icml26/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/DFlash/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference：ICML 2026&lt;/strong&gt;&lt;/p&gt;
&lt;h2 id=&#34;1-abstract-摘要&#34;&gt;1. Abstract (摘要)&lt;/h2&gt;
&lt;p&gt;自回归大语言模型（LLMs）性能强大，但其固有的顺序解码机制导致推理延迟较高且 GPU 利用率不佳。投机解码（Speculative Decoding）通过“小模型打草稿、大模型并行验证”的方式缓解了这一瓶颈。然而，现有方法（如 EAGLE-3）的草稿模型依然依赖&lt;strong&gt;自回归起草（Autoregressive Drafting）&lt;/strong&gt;，这种串行起草过程限制了实际的加速上限。&lt;/p&gt;
&lt;p&gt;虽然扩散语言模型（Diffusion LLMs）支持并行生成，但目前开源的扩散模型在生成质量上通常不及自回归模型。为此，本文提出了 &lt;strong&gt;DFlash&lt;/strong&gt; 框架，首次采用轻量级的**块扩散模型（Block Diffusion Model）**进行并行起草。通过单次前向传播生成多个草稿 token，并利用从目标模型中提取的上下文特征作为条件注入，DFlash 实现了高质量、高接受率的草稿生成。实验表明，DFlash 在多款模型和任务上实现了超过 $6\times$ 的无损加速，比目前最先进的 EAGLE-3 投机解码方法速度高出 $2.5\times$。&lt;/p&gt;
&lt;h2 id=&#34;2-introduction-引言&#34;&gt;2. Introduction (引言)&lt;/h2&gt;
&lt;p&gt;长思维链（CoT）推理模型的出现使得序列生成的延迟问题愈发严重。当前的投机解码方案面临一个核心矛盾：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;自回归草稿模型的局限性：&lt;/strong&gt; 串行起草效率低，容易产生错误累积，将理论加速上限限制在 $2\sim 3\times$。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;扩散草稿模型的困境：&lt;/strong&gt; 虽然支持并行和双向上下文建模，但为了保证质量往往需要多次去噪步骤，导致原始推理速度极慢。已有方法（如 DiffuSpec, SpecDiff-2）使用了高达 7B 参数的扩散模型打草稿，高昂的起草延迟抵消了投机的加速收益；而使用极小自回归模型（如 PARD）又会导致草稿质量差。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;strong&gt;DFlash 的核心洞见：&lt;/strong&gt; “目标模型最了解未来（The target knows best）”。目标大模型的隐藏特征中隐含了关于未来多个 token 的丰富信息。DFlash 将轻量级扩散模型作为“适配器（Adapter）”，利用大模型深层上下文特征作为条件（Conditioning），预测未来的 token 块。这种方法结合了自回归模型的高验证质量与扩散模型的高并行速度。&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/DFlash/figure1.png&#34;&gt;&lt;/p&gt;
&lt;h2 id=&#34;3-related-work-相关工作&#34;&gt;3. Related Work (相关工作)&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;投机解码：&lt;/strong&gt; 从早期的标准投机解码，到无外部草稿模型的 Medusa，再到利用特征级上下文的 EAGLE 系列。尽管接受率不断提升，但起草过程的串行本质没有改变。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;扩散语言模型（dLLMs）：&lt;/strong&gt; 如 LLaDA 将参数扩展到了百亿级别，但全并行扩散模型面临固定长度生成和缺乏 KV Cache 支持的问题。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;基于扩散的投机解码：&lt;/strong&gt; TiDAR 尝试联合训练扩散和自回归目标，但生成质量无法做到无损；Samragh 等人尝试训练 LoRA 适配器，但架构探索有限。大型扩散模型作为草稿器则面临计算开销过大的问题。&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id=&#34;4-preliminary-理论基础与动机&#34;&gt;4. Preliminary (理论基础与动机)&lt;/h2&gt;
&lt;p&gt;本节从理论公式出发，详细分析了自回归起草与扩散起草的效率权衡。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 DOCPRUNE: Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning - CVPR&#39;26</title>
      <link>https://jjl357.github.io/blog/posts/docprune---efficient-document-question-answering-via-background-question-and-comprehension-aware-token-pruning---cvpr26/</link>
      <pubDate>Wed, 29 Apr 2026 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/docprune---efficient-document-question-answering-via-background-question-and-comprehension-aware-token-pruning---cvpr26/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/DocPrune/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;CVPR&#39;26&lt;/strong&gt;&lt;/p&gt;
&lt;h2 id=&#34;1-abstract&#34;&gt;1. Abstract&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/DocPrune/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;近年来，视觉-语言大模型（Vision-Language Models, VLMs）在多模态任务中展现了卓越的性能，其中包括文档问答（Document Question Answering, DocQA）。DocQA 任务不仅依赖文本，还需要利用排版、表格和图表中的结构化视觉线索（structured visual cues）。
然而，文档图像与自然图像存在显著差异：&lt;strong&gt;文档图像包含大量的背景区域（large backgrounds），并且支持回答问题的证据极其稀疏（only sparse supporting evidence）&lt;/strong&gt;。这种特性导致在处理尤其是长文档时，计算资源被极其低效地消耗。&lt;/p&gt;
&lt;p&gt;作者观察到，现有的针对自然图像和视频的 Token 减少方法（token-reduction methods，例如 FastV 等），在利用文档独有的“结构稀疏性（structural sparsity）”时显得力不从心。为了解决这一痛点，作者提出了 &lt;strong&gt;DOCPRUNE&lt;/strong&gt;——一个&lt;strong&gt;免训练（training-free）&lt;/strong&gt; 且 &lt;strong&gt;渐进式（progressive）&lt;/strong&gt; 的文档 Token 剪枝框架，专为高效的长文档理解而设计。&lt;/p&gt;
&lt;p&gt;DOCPRUNE 的核心优势在于：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;它只保留对当前任务至关重要的 Token，同时剔除不必要的 Token（如纯背景或与问题无关的 Token）。&lt;/li&gt;
&lt;li&gt;它能够根据模型内部的“理解力水平（level of comprehension）”，自动选择在哪一层网络触发 Token 剪枝。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;最终，在 M3DocRAG 基准上的实验表明，DOCPRUNE 在 Vision Encoder（视觉编码器）和 LLM Decoder（大语言模型解码器）中分别将吞吐量（throughput）提升了 &lt;strong&gt;3.0倍&lt;/strong&gt; 和 &lt;strong&gt;3.3倍&lt;/strong&gt;，同时 F1 分数还提升了 &lt;strong&gt;+1.0&lt;/strong&gt;。实现了在&lt;strong&gt;不进行任何额外训练（without any additional training）&lt;/strong&gt; 的前提下，精度与效率的提升。&lt;/p&gt;
&lt;h2 id=&#34;2-introduction&#34;&gt;2. Introduction&lt;/h2&gt;
&lt;p&gt;在文档理解中，长文档通常包含数百页，但有用的内容（文本、表格、图表等）却散布在巨大的背景中。Transformer 架构处理单页就会产生数千个视觉 Token，计算成本极其高昂。&lt;/p&gt;
&lt;p&gt;传统的降低成本的方法是 Token Reduction（如针对自然图像或视频的合并和剪枝），其核心假设是“相邻 patch 通常包含相似的视觉信息”。然而，这一假设在文档中是失效的：&lt;strong&gt;文档排版（如文本行、表格）具有极其严格的空间组织规律，即使是微小的 Token 删减也极易破坏文本连贯性或丢失重要的排版线索（destroy important layout cues）。&lt;/strong&gt; 因此，基于视觉冗余的传统方法在文档上性能下降严重。
另外，现有的剪枝方法往往通过固定的启发式规则（fixed heuristics）来决定剪枝层，忽略了模型理解力在各层之间的演变（neglecting how comprehension evolves across layers）。这种忽略导致剪枝可能发生得过早或不一致，造成性能不稳定及效率提升有限。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 Empirical Recipes for Efficient and Compact Vision-Language Models</title>
      <link>https://jjl357.github.io/blog/posts/empirical-recipes-for-efficient-and-compact-vision-language-models/</link>
      <pubDate>Tue, 24 Mar 2026 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/empirical-recipes-for-efficient-and-compact-vision-language-models/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/ARGUSVLM/title.png&#34;&gt;&lt;/p&gt;
&lt;h2 id=&#34;1-abstract&#34;&gt;1. Abstract&lt;/h2&gt;
&lt;p&gt;在资源受限的环境中部署视觉语言模型 (VLMs) 要求低延迟和高吞吐量。然而，现有的轻量级 (Compact) VLMs 往往无法达到其参数量缩减所应带来的推理加速。为了解释这一现象，作者进行了端到端的效率分析，并系统地剖析了推理过程以识别主要瓶颈。&lt;/p&gt;
&lt;p&gt;基于这些发现，作者为轻量级 VLMs 量身定制了一系列优化方案 (Recipes)，在保持准确性的同时大幅降低了延迟。这些技术将 InternVL3-2B 的首字生成时间 (Time To First Token, TTFT) 降低了 53%，在 SmolVLM-256M 上降低了 93%。作者的优化方案广泛适用于各种 VLM 架构和主流服务框架。&lt;/p&gt;
&lt;p&gt;此外，作者研究了如何扩展轻量级 VLM 以支持结构化感知输出，并推出了 &lt;strong&gt;ARGUSVLM&lt;/strong&gt; 模型系列。ARGUSVLM 在多个基准测试中表现强劲，同时保持了紧凑且高效的设计。&lt;/p&gt;
&lt;h2 id=&#34;2-introduction&#34;&gt;2. Introduction&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/ARGUSVLM/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;尽管紧凑型模型参数量更小，但它们在端到端效率上的表现往往不如预期。例如，SmolVLM-256M 的参数量远小于 InternVL3-8B，但其 TTFT (344.7 ms) 却比后者 (177.4 ms) 更长。&lt;/p&gt;
&lt;p&gt;通过系统性分析，作者发现：在轻量级模型中，以往被忽视的 &lt;strong&gt;CPU 端操作&lt;/strong&gt;（如图像预处理、文本分词）往往主导了整体延迟。相比之下，得益于 FlashAttention、CUDA Graphs 和算子融合 (Kernel Fusion) 等技术，GPU 端的计算占比反而较低。&lt;/p&gt;
&lt;p&gt;本研究通过针对性的 CPU 端优化，将 InternVL3-2B 的 TTFT 从 124.0 ms 降至 57.7 ms，将 SmolVLM-256M 的 TTFT 从 344.7 ms 降至 22.8 ms (如图 1 所示)。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 Variation-aware Vision Token Dropping for Faster Large Vision-Language Models - CVPR&#39;26</title>
      <link>https://jjl357.github.io/blog/posts/variation-aware-vision-token-dropping-for-faster-large-vision-language-models---cvpr26/</link>
      <pubDate>Mon, 23 Mar 2026 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/variation-aware-vision-token-dropping-for-faster-large-vision-language-models---cvpr26/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/V2drop/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;CVPR&#39;26&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/xuyang-liu16/V2Drop&#34;&gt;https://github.com/xuyang-liu16/V2Drop&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;abstract&#34;&gt;Abstract&lt;/h2&gt;
&lt;p&gt;Large vision-language models（LVLMs）在多模态理解任务上表现强大，但随着高分辨率图像与长视频理解需求不断增加，视觉 token 数量急剧上升，从而显著降低推理效率。Token compression 提供了一条直接路径：在不改变模型结构的前提下减少待处理 token 数，从而提升计算效率。作者通过系统分析指出，现有 inner-LLM token compression 方法主要存在两个关键问题：&lt;strong&gt;positional bias&lt;/strong&gt; 和 &lt;strong&gt;incompatibility with efficient operators&lt;/strong&gt;，这两点严重阻碍了它们在 LVLM 加速中的实际部署。本文提出了&lt;strong&gt;首个从动态 token variation 视角出发的方法&lt;/strong&gt;，发现 LLM 内部的视觉 token variation 具有 task-agnostic 特性。基于这一观察，作者提出 &lt;strong&gt;Variation-aware Vision Token Dropping（V2Drop）&lt;/strong&gt;，在 LVLM 推理过程中逐步移除 variation 最小的视觉 token，从而提升计算效率。大量实验表明，V2Drop 在图像理解任务和视频理解任务上分别保留了原始性能的 &lt;strong&gt;94.0%&lt;/strong&gt; 和 &lt;strong&gt;98.6%&lt;/strong&gt;，同时将 LLM generation latency 分别降低了 &lt;strong&gt;31.5%&lt;/strong&gt; 和 &lt;strong&gt;74.2%&lt;/strong&gt;。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-introduction&#34;&gt;1. Introduction&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/V2drop/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/V2drop/figure2.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/V2drop/figure3.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;Large vision-language models（LVLMs）在视觉理解与推理任务上表现突出，能够覆盖多种 vision-language 任务；但高分辨率图像理解和长视频理解会引入大量视觉 token，导致推理开销快速增长并限制实际部署。作者指出，随着输入分辨率和视频长度的提升，视觉 token 的数量增加会带来明显的计算复杂度压力，尤其是在 LLM 侧的 prefilling 和 generation 阶段。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 PRUNE REDUNDANCY, PRESERVE ESSENCE: VISION TOKEN COMPRESSION IN VLMS VIA SYNERGISTIC IMPORTANCE–DIVERSITY - ICLR&#39;26</title>
      <link>https://jjl357.github.io/blog/posts/prune-redundancy-preserve-essence---vision-token-compression-in-vlms-via-syner-gistic-importance-diversity---iclr26/</link>
      <pubDate>Sun, 01 Mar 2026 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/prune-redundancy-preserve-essence---vision-token-compression-in-vlms-via-syner-gistic-importance-diversity---iclr26/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/PruneSID/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference&lt;/strong&gt;: &lt;strong&gt;ICLR&#39;26&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github&lt;/strong&gt;: &lt;a href=&#34;https://github.com/ZhengyaoFang/PruneSID&#34;&gt;https://github.com/ZhengyaoFang/PruneSID&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-abstract&#34;&gt;1. Abstract&lt;/h2&gt;
&lt;p&gt;视觉-语言模型（VLMs）因产生大量视觉 token 导致计算效率低下。先前研究指出大比例 visual tokens 存在冗余，但现有压缩方法难以在“重要性（importance）保存”和“信息多样性（diversity）保留”之间取得良好平衡。为了解决该问题，论文提出 &lt;strong&gt;PRUNESID&lt;/strong&gt;：一种&lt;strong&gt;无训练（training-free）&lt;/strong&gt;、&lt;strong&gt;协同重要性—多样性（Synergistic Importance–Diversity）&lt;/strong&gt; 的 two-stage 框架，包含：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;PSCA（Principal Semantic Components Analysis）&lt;/strong&gt;：将 tokens 按语义主方向聚类成多个语义相干组（semantic groups），确保概念覆盖。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;组内 NMS（Intra-group Non-Maximum Suppression）&lt;/strong&gt;：在每组内按相似度动态阈值去重，保留最具代表性的 token。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;此外，PRUNESID 引入 &lt;strong&gt;信息感知动态压缩率（information-aware dynamic compression ratio）&lt;/strong&gt;，根据图像复杂度动态分配 token 预算，从而在多样化场景上实现更优的平均信息保留。大量实验表明：在 LLaVA-1.5 上仅保留 $11.1%$ token（64 tokens）时可达 $96.3%$ 精度；在极端压缩（$5.6%$）下在 LLaVA-NeXT 仍达 $92.8%$，相较此前方法有显著提升，并在 prefilling 时间上有 $7.8\times$ 的加速。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-introduction&#34;&gt;2. Introduction&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/PruneSID/figure1.png&#34;&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;现状：主流 VLM（如 LLaVA-1.5 与 LLaVA-NeXT）通常为每张图像产生数百到几千 visual tokens（例如 576 或 2880），远超捕捉图像语义所需。相关研究表明约 $70%$ tokens 可丢弃而对准确率影响甚微。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;两类现有方案：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Attention-guided selection&lt;/strong&gt;：依据 attention score 保留高 attention token（优点：保留局部显著性；缺点：忽视背景与多样性，可能重保重复区域）。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Duplication-aware（相似性/去重）方法&lt;/strong&gt;：依据相似性去重，提升多样性，但可能丢弃语义重要但相似的高 attention token。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;本文关键观点：设计一个 &lt;strong&gt;组引导（group-guided）&lt;/strong&gt; 的训练免费方法，使得“重要性”和“多样性”得到协同优化。通过 PSCA 先将 tokens 按语义方向分组，再在组内用 NMS 去冗余，同时用信息感知机制在图像间自动分配 token 预算，从而在极端压缩下仍保留丰富语义。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 MMTok: Multimodal Coverage Maximization for Efficient Inference of VLMs - ICLR&#39;26</title>
      <link>https://jjl357.github.io/blog/posts/mmtok---multimodal-coverage-maximization-for-efficient-inference-of-vlms/</link>
      <pubDate>Sat, 28 Feb 2026 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/mmtok---multimodal-coverage-maximization-for-efficient-inference-of-vlms/</guid>
      <description>&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;ICLR 2026&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Note:&lt;/strong&gt; &lt;a href=&#34;https://zhuanlan.zhihu.com/p/1944299907109348831&#34;&gt;https://zhuanlan.zhihu.com/p/1944299907109348831&lt;/a&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/Ironieser/MMTok&#34;&gt;https://github.com/Ironieser/MMTok&lt;/a&gt;&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 ONE PATCH DOESN’T FIT ALL: ADAPTIVE PATCHING FOR NATIVE-RESOLUTION MULTIMODAL LARGE LANGUAGE MODELS - ICLR&#39;26</title>
      <link>https://jjl357.github.io/blog/posts/one-patch-doesnt-fit-all----adaptive-patching-for-native-resolution-multimodal-large-language-models---iclr26/</link>
      <pubDate>Mon, 02 Feb 2026 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/one-patch-doesnt-fit-all----adaptive-patching-for-native-resolution-multimodal-large-language-models---iclr26/</guid>
      <description>&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; ICLR&#39;26&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-abstract&#34;&gt;1. Abstract&lt;/h2&gt;
&lt;p&gt;现实世界中的视觉信号在分辨率上天然具有高度的多样性，因此，让多模态大语言模型（Multimodal Large Language Models, MLLMs）具备&lt;strong&gt;原生分辨率（native-resolution）感知能力&lt;/strong&gt;是一个自然且必要的目标。原则上，对于一般且直观的多模态理解任务，低分辨率图像往往已经足够；但对于包含大量细节的信息密集型图像（如文档、表格、图表等），则必须保留高分辨率输入，否则简单的缩放操作会不可避免地导致关键信息丢失。&lt;/p&gt;
&lt;p&gt;近期的研究通过 &lt;strong&gt;sequence packing&lt;/strong&gt; 技术，使模型能够处理任意分辨率和任意宽高比的图像。然而，尽管这些方法在形式上支持 Any-Resolution（AnyRes）输入，模型在低分辨率和高分辨率下的性能仍然明显下降，同时高分辨率输入还会带来显著的计算开销。&lt;/p&gt;
&lt;p&gt;本文提出一个核心观点：&lt;strong&gt;“单一固定 patch size”是导致上述问题的根本原因&lt;/strong&gt;。当图像分辨率或信息密度发生变化时，固定 patch size 在建模上天然是次优的。&lt;/p&gt;
&lt;p&gt;为此，论文提出 &lt;strong&gt;Adaptive Patching（AdaPatch）&lt;/strong&gt;：一种&lt;strong&gt;无需额外训练&lt;/strong&gt;、可直接插入到现有固定 patch MLLMs 中的策略。AdaPatch 根据图像的&lt;strong&gt;原生分辨率&lt;/strong&gt;和&lt;strong&gt;信息密度&lt;/strong&gt;动态调整 patch size，从而在不同类型、不同分辨率的图像上取得更稳定、更优的性能。实验表明，该方法在不增加训练成本的前提下，显著提升了 AnyRes 场景下的准确率和稳定性；此外，论文还提出了一种&lt;strong&gt;训练版方法&lt;/strong&gt;，进一步增强模型对动态 patch size 的适应能力。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-introduction&#34;&gt;2. Introduction&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/AdaPatch/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;早期的多模态大模型（如 LLaVA、InternVL 系列）通常依赖&lt;strong&gt;固定分辨率的视觉编码器&lt;/strong&gt;：要么将输入图像统一 resize 到某个标准尺寸，要么先切分成多个 tile 再分别处理。这类预处理不可避免地会改变原始视觉内容，对于需要保留细粒度细节或整体结构的任务（例如图表、示意图）尤其不利。&lt;/p&gt;
&lt;p&gt;受 NaViT 启发，近期工作开始直接保留图像的&lt;strong&gt;原生分辨率&lt;/strong&gt;，并将图像划分为固定大小的 non-overlapping patches，使 token 数量随分辨率线性增长。随后通过 &lt;strong&gt;sequence packing&lt;/strong&gt; 将多张图像的 token 序列拼接为一个长序列，并通过 block-diagonal attention mask 保证不同图像之间不互相注意。Qwen2.5-VL、Ovis2.5、Kimi-VL 等 SOTA 模型均采用了这一范式，并宣称支持任意分辨率输入。&lt;/p&gt;
&lt;p&gt;然而，本文通过系统性实验指出：&lt;strong&gt;当前 AnyRes 设计并未真正实现“原生分辨率鲁棒性”&lt;/strong&gt;。在跨越大范围像素预算的测试中，模型性能在不同分辨率区间显著波动，且在极低或极高分辨率下普遍退化。&lt;/p&gt;
&lt;p&gt;论文进一步分析发现，问题的根源在于：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;在&lt;strong&gt;低分辨率或高信息密度图像&lt;/strong&gt;中，大 patch 会过于粗糙，无法捕获细节；&lt;/li&gt;
&lt;li&gt;在&lt;strong&gt;高分辨率或低信息密度图像&lt;/strong&gt;中，小 patch 过于局部，导致全局上下文建模能力不足。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;因此，&lt;strong&gt;patch size 与分辨率、信息密度之间的失配&lt;/strong&gt;，是 AnyRes 性能不稳定的主要架构性原因。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 Video Compression Commander: Plug-and-Play Inference Acceleration for Video Large Language Models - EMNLP&#39;25</title>
      <link>https://jjl357.github.io/blog/posts/video-compression-commander---plug-and-play-inference-acceleration-for-video-large-language-models---emnlp25/</link>
      <pubDate>Thu, 22 Jan 2026 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/video-compression-commander---plug-and-play-inference-acceleration-for-video-large-language-models---emnlp25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/VidCom2/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;EMNLP&#39;25&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/xuyang-liu16/VidCom2&#34;&gt;https://github.com/xuyang-liu16/VidCom2&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-introduction&#34;&gt;1. Introduction&lt;/h2&gt;
&lt;p&gt;视频大语言模型（VideoLLMs）在视频理解任务（如视频问答、视频推理、时序理解等）上表现出色，但其推理效率受到&lt;strong&gt;视觉 token 数量过多&lt;/strong&gt;的严重制约。具体而言，当前主流 VideoLLM 通常将视频拆解为多帧图像，每一帧再由 ViT 等视觉编码器转化为大量 patch-level tokens，这些视觉 tokens 会与文本 tokens 一同送入 LLM 进行跨模态建模。&lt;/p&gt;
&lt;p&gt;由于 Transformer 自注意力的复杂度为 $O(N^2)$，当视频帧数 $T$ 和每帧 token 数 $M$ 较大时，总 token 数 $N = T \times M$ 会迅速膨胀，导致推理延迟和显存消耗急剧上升。这一问题在&lt;strong&gt;长视频理解&lt;/strong&gt;和&lt;strong&gt;高分辨率视频&lt;/strong&gt;场景中尤为突出。&lt;/p&gt;
&lt;p&gt;作者系统性地分析了现有 VideoLLM token compression 方法，发现其普遍存在两个关键问题：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;忽视帧间差异性（Frame-level Distinctiveness）&lt;/strong&gt;
多数方法对所有帧采用统一的压缩比例，默认每一帧“信息密度相同”，从而容易在关键帧上丢失重要视觉线索。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;工程实现受限（Implementation Constraints）&lt;/strong&gt;
一些方法依赖特定模型结构（如 ViT 的 [CLS] token）或显式 attention 权重，导致难以兼容现代视觉编码器（如 SigLIP）或高效注意力算子（如 FlashAttention）。&lt;/p&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;为此，作者总结出 &lt;strong&gt;三条 VideoLLM token compression 的设计原则&lt;/strong&gt;，并提出一种**即插即用（plug-and-play）**的推理加速框架 &lt;strong&gt;Video Compression Commander（VidCom2）&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;VidCom2 的核心思想是：&lt;strong&gt;量化每一帧在整个视频中的“独特性（uniqueness）”&lt;/strong&gt;，并据此动态调整不同帧的压缩强度，从而在保证信息保真的前提下最大化冗余削减。&lt;/p&gt;
&lt;p&gt;大量实验表明，VidCom2 在多种 VideoLLM 架构和 benchmark 上均取得了更优的性能-效率权衡。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 TALON: Confidence-Aware Speculative Decoding with Adaptive Token Trees</title>
      <link>https://jjl357.github.io/blog/posts/talon---confidence-aware-speculative-decoding-with-adaptive-token-trees/</link>
      <pubDate>Wed, 21 Jan 2026 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/talon---confidence-aware-speculative-decoding-with-adaptive-token-trees/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/TALON/title.png&#34;&gt;&lt;/p&gt;
&lt;h2 id=&#34;1-introduction&#34;&gt;1. Introduction&lt;/h2&gt;
&lt;p&gt;投机采样（Speculative decoding, SD）已成为在不牺牲输出质量的前提下加速大语言模型（LLM）推理的标准技术。最近的进展已从序列链式草稿（chain-based drafting）转向树状结构生成（tree-structured generation），即草稿模型（draft model）构建候选标记树，以并行探索多种可能的草稿。&lt;/p&gt;
&lt;p&gt;然而，现有的基于树的 SD 方法（如 EAGLE, Sequoia）通常构建&lt;strong&gt;固定宽度、固定深度&lt;/strong&gt;的草稿树，无法适应标记和上下文不断变化的难度。这导致草稿模型无法动态调整树结构，无法在遇到困难标记（difficult tokens）时及早停止，也无法在简单标记上扩展生成。&lt;/p&gt;
&lt;p&gt;为了解决这些挑战，作者提出了 &lt;strong&gt;TALON&lt;/strong&gt;：一种&lt;strong&gt;无需训练（training-free）&lt;/strong&gt;、&lt;strong&gt;预算驱动（budget-driven）&lt;/strong&gt; 的自适应树扩展框架，可以无缝集成到现有的基于树的方法中。与静态方法不同，TALON 迭代构建草稿树，直到达到预设的标记预算（Token Budget），并采用混合扩展策略，根据各层节点动态分配预算。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;核心理念&lt;/strong&gt;：将草稿树塑造成“&lt;strong&gt;深而窄&lt;/strong&gt;”（deep-and-narrow）的形式以应对确定性上下文，以及“&lt;strong&gt;浅而宽&lt;/strong&gt;”（shallow-and-wide）的形式以应对不确定的分支，从而在给定预算下优化探索宽度与生成深度之间的权衡。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;实验表现&lt;/strong&gt;：在 5 个模型和 6 个数据集上的广泛实验表明，TALON 一致优于最先进的 &lt;strong&gt;EAGLE-3&lt;/strong&gt;，相比于自回归解码（auto-regressive decoding）实现了高达 &lt;strong&gt;5.16×&lt;/strong&gt; 的端到端加速。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-motivated-experiments&#34;&gt;2. Motivated Experiments&lt;/h2&gt;
&lt;p&gt;为了从经验上调查静态树结构的局限性，作者使用 EAGLE 作为代表性基线进行了试点分析。作者在 MT-Bench 上使用 Qwen3-8B，设置固定树拓扑为宽度 、深度 。&lt;/p&gt;
&lt;hr&gt;
&lt;h3 id=&#34;41-the-acceptance-funnel-phenomenon-接受漏斗现象&#34;&gt;4.1 The &amp;ldquo;Acceptance Funnel&amp;rdquo; Phenomenon (接受漏斗现象)&lt;/h3&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/TALON/figure3.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;作者首先研究了草稿树中每个位置的接受频率。Figure 3 展示了静态树结构中各层各位置标记的接受频率分布。关于有效投机的分布，出现了两个关键观察结果：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;深层宽度的边际收益递减&lt;/strong&gt;：如图 3 所示，接受分布呈现出&lt;strong&gt;漏斗状模式&lt;/strong&gt;。在初始层（），接受概率在 Top-K 候选者中相对均匀，这表明由于草稿模型  与目标模型  之间的初始随机性和分布差异，需要较宽的搜索宽度。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;误差累积放大&lt;/strong&gt;：随着树的加深（），接受质量迅速集中在高置信度区域（如 top-1 和 top-2）。对于深层节点，草稿模型要么（1）与目标模型自信地对齐（预测正确），要么（2）由于自回归草拟过程中的误差累积，产生即便 top-K 候选也无法覆盖的幻觉路径。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;结论&lt;/strong&gt;：在深层维持  的固定宽度会产生巨大的冗余。当模型自信时，极小的  即可；当模型高度不确定时，应当停止生成以避免浪费计算资源。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h3 id=&#34;42-variance-in-real-world-accepted-length-实际接受长度的方差&#34;&gt;4.2 Variance in Real-World Accepted Length (实际接受长度的方差)&lt;/h3&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/TALON/figure4.png&#34;&gt;&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 VLCACHE: Computing 2% Vision Tokens and Reusing 98% for Vision–Language Inference</title>
      <link>https://jjl357.github.io/blog/posts/vlcache---computing-2vision-tokens-and-reusing-98-for-visionlanguage-inference/</link>
      <pubDate>Tue, 06 Jan 2026 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/vlcache---computing-2vision-tokens-and-reusing-98-for-visionlanguage-inference/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/VLCACHE/title.png&#34;&gt;&lt;/p&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;前缀缓存（Prefix Cache）的局限性&lt;/strong&gt;：目前的 KV Cache 重用机制（如前缀缓存）要求新请求的初始片段（即前缀）与已有缓存序列&lt;strong&gt;精确匹配&lt;/strong&gt;。这种严格的匹配标准虽然保证了输出准确性，但在多模态场景下引入了严重的效率瓶颈：即便&lt;strong&gt;图像完全相同&lt;/strong&gt;，只要系统提示词或用户问题不同，也无法触发缓存命中。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;位置无关重用的必要性&lt;/strong&gt;：如果允许在&lt;strong&gt;不同位置&lt;/strong&gt;重用预缓存的 KV Cache，将显著提升多模态推理的灵活性。然而，位置变化会破坏因果注意力中的位置一致性，因此为了保持输出准确性，&lt;strong&gt;必须对部分 token 进行重新计算（recompute）&lt;/strong&gt;。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;现有启发式方法的缺陷&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;CacheBlend [14]&lt;/strong&gt;：通过比较&lt;strong&gt;前三层&lt;/strong&gt;的 KV Cache 距离来识别“最不可靠”的 token 并重计算。但该方法仅依赖&lt;strong&gt;浅层局部信息&lt;/strong&gt;，无法刻画 token 在整个 Transformer 堆栈中的&lt;strong&gt;全局重要性&lt;/strong&gt;。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;EPIC [6] 与 MPIC [16]&lt;/strong&gt;：以 chunk 为单位，重计算每个数据块的&lt;strong&gt;初始 token&lt;/strong&gt;。其中 MPIC 假设存在“注意力汇聚（attention sink）”效应，但该假设在视觉 token 上并不成立，因为视觉 token 不像系统提示词那样在注意力中占据主导地位。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;KVShare [13]&lt;/strong&gt;：基于注意力分布偏差选择性重计算关键 token，但仍然缺乏对&lt;strong&gt;重用误差如何在解码阶段传播&lt;/strong&gt;的系统性分析。&lt;/p&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;缺乏系统性研究&lt;/strong&gt;：上述方法普遍缺少以下两点：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;不同 Transformer 层对最终输出贡献差异的系统研究；&lt;/li&gt;
&lt;li&gt;重用误差在自回归解码过程中&lt;strong&gt;跨 token、跨层传播机制&lt;/strong&gt;的深入分析。&lt;/li&gt;
&lt;/ol&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-contribution&#34;&gt;2. Contribution&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;识别累积重用误差效应&lt;/strong&gt;：系统性分析了多模态大语言模型（VLM）中 KV Cache 重用所引入的误差，提出并验证了 &lt;strong&gt;累积重用误差效应（Cumulative Reuse Error Effect）&lt;/strong&gt;，即早期 token 的重用误差会在后续生成过程中不断传播和放大。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;层级重要性差异分析&lt;/strong&gt;：通过实验发现，不同 Transformer 层对最终模型输出的影响高度不均衡，并首次从实证角度揭示了 VLM 中的&lt;strong&gt;层级重要性多样性&lt;/strong&gt;。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;提出 VLCache 框架&lt;/strong&gt;：设计了一个端到端的视觉 token KV Cache 重用流水线，兼顾算法有效性与系统可落地性。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 Accelerating Streaming Video Large Language Models via Hierarchical Token Compression - CVPR&#39;26</title>
      <link>https://jjl357.github.io/blog/posts/accelerating-streaming-video-large-language-models-via--hierarchical-token-compression/</link>
      <pubDate>Sat, 27 Dec 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/accelerating-streaming-video-large-language-models-via--hierarchical-token-compression/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/STC/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/lern-to-write/STC&#34;&gt;https://github.com/lern-to-write/STC&lt;/a&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference: CVPR&#39;26&lt;/strong&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;最近，随着直播体育解说和增强现实眼镜等新兴应用的出现，对&lt;strong&gt;流式视频理解 (Streaming Video Understanding, SVU)&lt;/strong&gt; 的需求日益迫切。在这些场景中，模型必须持续处理输入的视频帧，并以极低的延迟生成响应 。然而，现有 VideoLLM 在处理来自连续视频流的高密度视觉标记（tokens）时，计算成本极高，导致其在延迟敏感的应用中难以实时部署 。&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/STC/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;通过图 1 的推理时间分解可以发现：视频理解与图像理解存在显著差异 。在 Qwen2-VL 和 LLaVA-OV 等模型中，ViT 编码的计算成本通常比图像理解高出 2-3 倍，成为主要的延迟瓶颈 。例如，当 LLaVA-OV 处理 32 帧视频时，会有  个视觉标记输入 LLM，是普通图像任务（约 1,900 个标记）的三倍以上 。&lt;/p&gt;
&lt;p&gt;针对流式场景，本研究通过实证分析揭示了两个关键特征：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;ViT 编码中的时间冗余 (Temporal Redundancy)&lt;/strong&gt;：流式视频需要更密集的帧采样，导致相邻帧之间存在大量重复内容 。实验显示，在 ViT 的深层（如 Layer 20），相邻帧特征的平均余弦相似度在流式设置下高达 0.85，而离线设置仅为 0.60 。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;不完整的视频与未知的指令 (Incomplete Video and Unknown Instructions)&lt;/strong&gt;：流式场景下，模型无法预先获取完整视频或用户指令，这使得依赖全局视频特征或指令感知的压缩策略（如 Instruction-aware pruning）失效，因为查询通常在视频帧处理完后才到达 。&lt;/p&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;因此，迫切需要一种能够**因果式（causally）**运行、利用编码过程中的时间冗余且不依赖全局上下文的压缩方法 。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-contribution&#34;&gt;2. Contribution&lt;/h2&gt;
&lt;p&gt;基于上述分析，我们提出了 &lt;strong&gt;Streaming Token Compression (STC)&lt;/strong&gt;，这是一个即插即用的分层加速框架，旨在共同优化 ViT 编码和 LLM 预填充（prefilling）阶段 。其核心贡献包括：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;流式场景的实证分析&lt;/strong&gt;：分析了现有压缩方法在 SVU 中的局限性，强调了因果压缩的必要性，即在不依赖未来指令的情况下降低 ViT 成本 。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 HyperVL: An Efficient and Dynamic Multimodal Large Language Model for Edge Devices</title>
      <link>https://jjl357.github.io/blog/posts/hypervl---an-efficient-and-dynamic-multimodal-large-language-model-for-edge-devices/</link>
      <pubDate>Tue, 23 Dec 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/hypervl---an-efficient-and-dynamic-multimodal-large-language-model-for-edge-devices/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/HyperVL/title.png&#34;&gt;&lt;/p&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/HyperVL/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;随着数据质量的提高和模型架构设计的成熟，LLM 的 &lt;strong&gt;Densing Law&lt;/strong&gt; [Yao et al., 2024] 不断提升，使得小参数模型也能获得强大的通用能力。这一趋势为大模型的端侧部署（On-device deployment）提供了实际的基础。最近，紧凑型 MLLM（如 Qwen3 VL 2B [Bai et al., 2025a] 和 InternVL 2B [Zhu et al., 2025, Wang et al., 2025]）展示了极具竞争力的性能。&lt;/p&gt;
&lt;p&gt;然而，一个关键的瓶颈依然存在：这些模型通常依赖标准的 &lt;strong&gt;Vision Transformer (ViT)&lt;/strong&gt; 编码器，而 ViT 具有二次复杂度（Quadratic Complexity）。当处理高分辨率输入（这在用户界面 UI 理解和 grounding 等典型端侧场景中至关重要）时，它们在端侧部署期间容易产生高内存消耗和明显的推理延迟。为了缓解这一问题，一些尝试（如 Apple 的 FastVLM [Vasu et al., 2025]）通常诉诸于通过激进的卷积下采样（Convolutional Downsampling）来减少视觉 token，但这往往以性能大幅下降为代价。&lt;/p&gt;
&lt;h2 id=&#34;2-conclusion&#34;&gt;2. Conclusion&lt;/h2&gt;
&lt;p&gt;为此，作者推出了 &lt;strong&gt;HyperVL&lt;/strong&gt;，这是一种专为端侧推理量身定制的高效多模态大语言模型。&lt;/p&gt;
&lt;p&gt;具体而言，作者采用了&lt;strong&gt;图像切片策略（Image-tiling strategy）&lt;/strong&gt;，将高分辨率输入划分为可以独立编码的小块，从而降低峰值内存消耗。在此基础上，作者通过两项关键技术进一步降低端侧推理成本：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;视觉分辨率压缩器 (Visual Resolution Compressor, VRC)&lt;/strong&gt;：自适应地根据图像信息密度预测最佳视觉编码分辨率，避免不必要的高分辨率计算，降低视觉编码延迟。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;双重一致性学习 (Dual Consistency Learning, DCL)&lt;/strong&gt;：在不同容量的 ViT 编码器上应用 DCL，使它们能够无缝连接到共享的 LLM，从而根据任务类型、延迟预算或设备计算能力，在轻量级和高精度视觉路径之间实现动态切换。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;strong&gt;总结作者的贡献如下：&lt;/strong&gt;&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning - NeurIPS&#39;25</title>
      <link>https://jjl357.github.io/blog/posts/visionthink---smart-and-efficient-vision-language-model-via-reinforcement-learning---neurips25/</link>
      <pubDate>Sun, 21 Dec 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/visionthink---smart-and-efficient-vision-language-model-via-reinforcement-learning---neurips25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/VisionThink/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;NeurIPS&#39;25&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/dvlab-research/VisionThink&#34;&gt;https://github.com/dvlab-research/VisionThink&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/VisionThink/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;最近，视觉语言模型（VLMs） 通过将视觉标记（visual tokens）投影并适配到大语言模型（LLM）空间中，在通用视觉问答（General VQA）和各种现实场景中取得了显著成就。然而，随着 VLM 性能的不断提升，视觉标记的消耗呈指数级增长。例如，一张使用智能手机拍摄的 $2048 \times 1024$ 照片在 LLaVA 1.5 中需要 576 个视觉标记，而现在在 Qwen2.5-VL 中则需要 2,678 个。因此，避免过度使用视觉标记已成为当务之急。&lt;/p&gt;
&lt;p&gt;目前已经有大量关于视觉标记压缩的研究被提出。大多数方法使用预定义的阈值来修剪或合并固定数量的视觉标记。然而，不同问题和图像的冗余程度各不相同，这引发了一个自然的问题：作者真的应该在所有场景中应用统一的标记压缩比吗？为了回答这个问题，作者简单地通过降低图像分辨率来减少视觉标记的数量，并评估了 Qwen2.5-VL 在多个基准测试上的性能。如 Fig. 1 左侧所示，作者发现对于大多数现实场景（如 MME 和 RealWorldQA），即使将图像分辨率降低四倍（显著减少 75% 的视觉标记），对模型性能的影响也微乎其微。然而，如 Fig. 1 右侧所示，对于 ChartQA 和 OCRBench 等需要细节理解和 OCR 相关能力的基准测试，减少视觉标记会导致性能大幅下降。&lt;/p&gt;
&lt;p&gt;基于这些观察，作者发现大多数现实世界的问题并不需要带有长视觉标记的高分辨率图像，而一小部分 OCR 相关任务对这类细节输入的要求非常高 。因此，如果作者能够动态区分哪些样本需要高分辨率处理，哪些不需要，那么效率优化将具有巨大的潜力 。&lt;/p&gt;
&lt;p&gt;在本文中，作者提出了 &lt;strong&gt;VisionThink&lt;/strong&gt;，这是一种利用模型推理能力的新型高效 VLM 范式 。与之前处理全图后丢弃冗余标记的方法不同，VisionThink 直接输入压缩后的视觉标记，并允许模型在需要时请求原始高分辨率图像 。这使得在大多数现实场景中能够进行更高效的推理，同时保留在 OCR 相关任务上的性能 。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-contribution&#34;&gt;2. Contribution&lt;/h2&gt;
&lt;p&gt;在本文中，作者提出了 VisionThink，这是一种新的高效 VLM 范式，它利用了模型的推理能力 。与之前处理完整图像然后丢弃冗余标记的方法不同，VisionThink 直接输入压缩后的视觉标记，并允许模型在需要时请求原始高分辨率图像 。这使得在大多数现实场景中能够实现更高效的推理，同时在 OCR 相关任务上保持性能 。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 SpecBranch: Speculative Decoding via Hybrid Drafting and Rollback-Aware Branch Parallelism - ICLR&#39;26</title>
      <link>https://jjl357.github.io/blog/posts/specbranch---speculativedecoding-via-hybrid-drafting-and-rollback-aware-branch-parallelism/</link>
      <pubDate>Sat, 20 Dec 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/specbranch---speculativedecoding-via-hybrid-drafting-and-rollback-aware-branch-parallelism/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/SpecBranch/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;ICLR&#39;26&lt;/strong&gt;&lt;/p&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;核心痛点：投机解码（Speculative Decoding, SD）中的串行瓶颈与回滚代价&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;受到现代处理器分支预测技术的启发 ，作者允许 Draft Model（草稿模型）在 Target Model（目标模型）进行验证的同时，主动生成推测性的分支。这种并行 SD 范式创建了一个两阶段流水线，使得 Draft Model 的 token 生成与 Target Model 的验证在时间上重叠，从而有效地填补了传统 SD 中固有的流水线气泡（Pipeline Bubbles）。&lt;/p&gt;
&lt;p&gt;先前的研究（如 PEARL ）尝试在 Drafting 阶段利用 Target Model 预验证第一个 token，并在验证阶段让 Draft Model 继续生成。然而，与传统 SD 仅面临局部惩罚（即丢弃部分 token）不同，&lt;strong&gt;并行 SD 面临全局失效的风险&lt;/strong&gt; 。如果并行生成的某个关键 token 被拒绝，会导致后续所有并行计算的 token 全部失效（Global Invalidation），从而严重阻碍并行效率。这种现象在生成长度较长时尤为严重，因为被接受的 token 数量通常服从截断几何分布（Truncated Geometric Distribution），这在并行性和回滚代价之间制造了一个艰难的权衡（Trade-off）。&lt;/p&gt;
&lt;p&gt;遗憾的是，PEARL 并未充分解决这些挑战：&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/SpecBranch/figure1.png&#34;&gt;&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;Pre-verify Rollback（预验证回滚）：&lt;/strong&gt; PEARL 忽视了并行加速的一个关键条件：验证期间生成的 token 必须被 &lt;strong&gt;“全部接受（All-Accepted）”&lt;/strong&gt; 。否则，PEARL 会退化为串行执行并失去并行能力。它仅验证第一个 token，而系统对序列中间发生的拒绝（例如 Fig. 1(b) 中  被拒绝）一无所知，直到并行验证结束才发现，导致大量浪费 。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 Taming the Long-Tail: Efficient Reasoning RL Training with Adaptive Drafter - ASPLOS&#39;26</title>
      <link>https://jjl357.github.io/blog/posts/taming-the-long-tail---efficient-reasoning-rl-training-with-adaptive-drafter---asplos26/</link>
      <pubDate>Sat, 20 Dec 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/taming-the-long-tail---efficient-reasoning-rl-training-with-adaptive-drafter---asplos26/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/TLT/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;ASPLOS&#39;26&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/mit-han-lab/fastrl&#34;&gt;https://github.com/mit-han-lab/fastrl&lt;/a&gt;&lt;/p&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;强化学习（RL）已成为赋予大语言模型（LLMs）强大推理能力（如OpenAI-o1, DeepSeek-R1）的标准方法。然而，这种RL方法面临独特的效率挑战。通过分析自收集的轨迹和来自字节跳动（ByteDance）的生产环境轨迹，作者确定了推理RL过程中的关键特征：&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/TLT/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;em&gt;(Figure 1展示了推理RL中的长尾生成问题和工作负载不平衡)&lt;/em&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;(1) 极不平衡的Rollout（采样）与训练时间 (Unbalanced Rollout and Training Time):&lt;/strong&gt;&lt;br&gt;
在RL过程中，最耗时的阶段是Rollout（模型生成大量候选回答）。这一阶段占据了总步长时间的绝大部分（约 &lt;strong&gt;85%&lt;/strong&gt;），成为主要的瓶颈。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;(2) 持续的长尾分布 (Persistent Long-Tail Distribution):&lt;/strong&gt;&lt;br&gt;
Rollout响应长度呈现长尾分布是导致效率低下的主要原因。虽然大多数生成的序列相对较短，但一小部分序列会达到极长的长度（例如达到最大上下文限制）。这种长尾模式并非偶发，而是贯穿整个长期训练过程的持续模式。在大多数RL步骤中，少数响应达到最大配置长度，而绝大多数则短得多，导致显着的资源未充分利用（即GPU在等待最长序列完成时处于闲置状态）。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;(3)巨大的时间和资源需求 (Substantial Time and Resource Demands):&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/TLT/figure2.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;ByteDance的生产轨迹显示，使用128个GPU训练一个32B模型，仅完成385步就需要11天。单步训练平均耗时约40分钟，极度消耗资源。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;为什么选择投机解码 (Why Speculative Decoding - SD)?&lt;/strong&gt;&lt;br&gt;
作者认为投机解码（SD）是非常适合解决此问题的方法。SD利用轻量级草稿模型（Draft Model）快速生成token序列，然后由目标模型并行验证。SD适合RL训练主要基于两个优点：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;数学上的无损性 (Mathematically Lossless):&lt;/strong&gt; 输出分布与目标模型的原始分布完全一致。这对RL至关重要，因为近似方法可能会改变策略优化轨迹。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;对长尾效率高 (Efficient for Long-Tail):&lt;/strong&gt; SD通过将过程从**内存受限（Memory-Bound）&lt;strong&gt;转变为&lt;/strong&gt;计算受限（Compute-Bound）**来提高吞吐量。这对于RL Rollout的长尾阶段特别有效，因为此时有效批大小（Batch Size）通常很小，标准解码无法充分利用GPU计算能力。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;strong&gt;在RL中应用SD的挑战 (Challenges in Reasoning RL):&lt;/strong&gt;&lt;br&gt;
现有的SD技术主要针对静态推理场景设计，应用于动态推理RL训练面临三大挑战：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;C1. 演进的目标模型 (Evolving Target Model):&lt;/strong&gt; RL训练期间目标模型权重不断更新。固定的草稿模型会迅速变得“过时”（Stale），导致投机接受率下降，严重削弱SD效果。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;C2. 草稿模型训练成本 (Draft Model Training Costs):&lt;/strong&gt; 高效的SD通常依赖专门的草稿模型（如EAGLE等），这需要额外的训练来与目标模型对齐，引入了额外的开销和复杂性。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;C3. 波动的批大小 (Fluctuating Batch Sizes):&lt;/strong&gt; 现有SD通常针对小批次优化。然而，RL Rollout的特征是有效批大小动态剧烈波动（开始时很大，随着短响应完成迅速减小）。如果不进行管理，在大批次下性能可能会下降甚至发生显存溢出（OOM）。&lt;/li&gt;
&lt;/ol&gt;
&lt;h2 id=&#34;2-contribution&#34;&gt;2. Contribution&lt;/h2&gt;
&lt;p&gt;为了解决上述挑战，论文提出了 &lt;strong&gt;TLT&lt;/strong&gt;，这是一个具有自适应投机解码的高效推理RL训练系统。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 Empower Vision Applications with LoRA LMM - Eurosys&#39;25</title>
      <link>https://jjl357.github.io/blog/posts/empower-vision-applications-with-lora-lmm---eurosys25/</link>
      <pubDate>Mon, 15 Dec 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/empower-vision-applications-with-lora-lmm---eurosys25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/VaLora/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;Eurosys&#39;25&lt;/strong&gt;&lt;/p&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;尽管 LMMs (Large Multimodal Models) 在通用视觉任务上表现出色，但在应用于需要&lt;strong&gt;领域特定知识 (Domain-specific knowledge)&lt;/strong&gt; 的实际场景时，其表现往往不如人意，类似于早期 LLM 的幻觉问题。&lt;/p&gt;
&lt;p&gt;虽然 RAG (Retrieval-Augmented Generation) 是 LLM 中常用的补充知识的方法，但对于&lt;strong&gt;时间敏感的视觉应用 (Time-sensitive vision applications)&lt;/strong&gt; 来说并不适用：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;RAG 的检索过程和附加的长上下文请求会导致超过 10 倍的响应延迟。&lt;/li&gt;
&lt;li&gt;相比之下，&lt;strong&gt;LoRA (Low-Rank Adaptation)&lt;/strong&gt; 提供了一种更有前景的方案。它通过在运行时将微调后的 Adapter 合并到 LMM 中，能够高效地生成高质量且一致的领域特定响应，且没有额外的推理开销。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;然而，现有的 LoRA 服务系统（如 Punica, S-LoRA, dLoRA）主要针对纯文本 LLM 优化，无法满足视觉应用的高效性和多样化需求：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;Unmerged Inference (不合并推理)&lt;/strong&gt;：为了支持多 Adapter 并行，现有系统通常采用不合并推理模式。虽然这解决了并发问题，但额外引入的计算开销导致了极高的延迟。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Vision Workloads (视觉负载)&lt;/strong&gt;：视觉任务通常包含大量的视觉 Token 处理，对计算资源的消耗与纯文本不同，现有系统的 Batching 策略效率低下。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;strong&gt;Research Question:&lt;/strong&gt; 我们能否利用 LoRA LMM 来丰富视觉应用，同时满足其严格的性能要求？
作者认为答案是肯定的，但必须解决 Capacity、Batching Efficiency 和 Orchestration Flexibility 三大挑战。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 Venus: An Efficient Edge Memory-and-Retrieval System for VLM-based Online Video Understanding - INFOCOM&#39;26</title>
      <link>https://jjl357.github.io/blog/posts/venus---an-efficient-edge-memory-and-retrieval-system-for-vlm-based-online-video-understanding---infocom26/</link>
      <pubDate>Fri, 12 Dec 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/venus---an-efficient-edge-memory-and-retrieval-system-for-vlm-based-online-video-understanding---infocom26/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/Venus/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;INFOCOM&#39;26&lt;/strong&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-motivation-动机&#34;&gt;1. Motivation (动机)&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/Venus/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;图 1 抽象了一个部署在智能家居场景中的&lt;strong&gt;基于VLM（视觉-语言模型）的在线视频理解应用&lt;/strong&gt;。在这个应用中，家庭成员可以随时发起针对当前或历史录制视频片段的查询。该应用包含三个关键模块：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;流媒体感知模块 (Streaming Perception Module):&lt;/strong&gt; 配备板载计算能力的边缘摄像头持续捕获家庭场景的视频，并即时处理多模态数据。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;历史记忆模块 (Historical Memory Module):&lt;/strong&gt; 构建历史视频流并存储在记忆数据库中，以支持高效准确地检索与查询相关的信息。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;推理模块 (Reasoning Module):&lt;/strong&gt; 在接收到用户查询后，利用云托管的 VLM 进行推理并生成答案，由历史记忆提供上下文基础 (contextual grounding)。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/Venus/figure2.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;AI 社区中新兴的研究工作（如 [13]–[15]）探索了 VLM 在视频理解中的有效性，但大多数工作都侧重于&lt;strong&gt;算法性能 (algorithmic performance)&lt;/strong&gt;，而&lt;strong&gt;忽略了部署相关的约束 (deployment-related constraints)&lt;/strong&gt;，这限制了它们在边缘智能场景中的直接适用性。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;纯云端部署 (Fully Cloud-based Deployment):&lt;/strong&gt;
&lt;ul&gt;
&lt;li&gt;利用强大的服务器端计算来减少设备端处理。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;缺点：&lt;/strong&gt; 需要上传&lt;strong&gt;整个相关视频 (entire relevant video)&lt;/strong&gt;，导致显著的&lt;strong&gt;通信延迟 (communication latency)&lt;/strong&gt;。图 2 显示，通信延迟可占总响应延迟的 &lt;strong&gt;80%&lt;/strong&gt;，且随着视频时长的增加而大幅增长。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;边缘-云端策略（边缘执行选择算法）(Edge-Cloud Strategy):&lt;/strong&gt;
&lt;ul&gt;
&lt;li&gt;一些方法 [3], [13] 通过在推理前执行**帧选择 (frame selection)**来提高准确性。&lt;/li&gt;
&lt;li&gt;在边缘设备上执行选择算法，只将选定的帧上传到云端，可以显著减少通信开销。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;缺点：&lt;/strong&gt; 边缘设备的计算能力有限，导致&lt;strong&gt;逐帧处理&lt;/strong&gt;产生&lt;strong&gt;巨大的设备端处理成本 (substantial on-device processing costs)&lt;/strong&gt;，例如高达 &lt;strong&gt;924秒&lt;/strong&gt; 的设备端延迟（图 2）。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;现有方法的共同限制：&lt;/strong&gt; 除了通信和计算开销，现有方法&lt;strong&gt;固有地受限于离线执行 (offline execution)&lt;/strong&gt;，不适用于涉及&lt;strong&gt;在线用户查询&lt;/strong&gt;并需要**长期上下文记忆 (long-term contextual memory)**的在线流媒体应用。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-contribution-贡献&#34;&gt;2. Contribution (贡献)&lt;/h2&gt;
&lt;p&gt;为解决上述限制，作者提出了 &lt;strong&gt;Venus&lt;/strong&gt;，一种新颖的&lt;strong&gt;设备端记忆和检索系统 (on-device memory-and-retrieval system)&lt;/strong&gt;，专为高效在线边缘视频理解而设计。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 Elastic On-Device LLM Service - MobiCom &#39;25</title>
      <link>https://jjl357.github.io/blog/posts/elastic-on-device-llm-service---mobicom25/</link>
      <pubDate>Mon, 08 Dec 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/elastic-on-device-llm-service---mobicom25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/ElasticLM/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference&lt;/strong&gt;: &lt;strong&gt;MobiCom &amp;lsquo;25&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/yinwangsong/ElastiLM&#34;&gt;https://github.com/yinwangsong/ElastiLM&lt;/a&gt;&lt;/p&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;端侧 LLM 需要弹性（Elasticity）&lt;/strong&gt;。LLM 虽然能够处理广泛的语言任务，但其巨大的参数量使得在设备上为每个任务部署独立的模型既不“必要”也不“实际”。因此，端侧 LLM 通常作为系统服务（LLM-as-a-Service）被多个任务和 APP 共享。然而，&lt;strong&gt;单一的静态 LLM 无法满足不同任务对服务水平目标（Service-Level Objectives, SLOs）的多样化需求&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;因此，端侧 LLM 必须具备弹性。由于 LLM 推理包含两个截然不同的阶段，这种弹性的需求变得更加复杂：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;Prefill（预填充阶段）&lt;/strong&gt;：处理 Prompt 的速度，由 &lt;strong&gt;Time-To-First-Token (TTFT)&lt;/strong&gt; 衡量。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Decode（解码阶段）&lt;/strong&gt;：生成 Token 的速度，由 &lt;strong&gt;Time-Per-Output-Token (TPOT)&lt;/strong&gt; 衡量。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/ElasticLM/table1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;不同的应用对这两个指标有截然不同的要求（如上表所示）：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Chatbot&lt;/strong&gt;：需要低 TTFT 和低 TPOT 以匹配人类阅读速度。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;UI 自动化 Agent&lt;/strong&gt;：需要低 TTFT 来快速响应首个动作，但对 TPOT 要求较低（因为生成过程可以与 UI 操作重叠）。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;后台屏幕录制器&lt;/strong&gt;：对 TTFT/TPOT 的容忍度都很高。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;如果无法满足 SLO，会导致用户体验严重下降或 Agent 交互失败。理想情况下，请求发送给弹性 LLM 时会附带 Prompt 和预期的 SLO，LLM 需要在不违反 SLO 的前提下提供最高的文本生成质量。&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/ElasticLM/figure2.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;作者的先导实验表明（如图2）：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;TTFT&lt;/strong&gt; 与 Prompt 长度和模型大小均成正比：$TTFT \propto PromptLength \times ModelSize$。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;TPOT&lt;/strong&gt; 在 KV Cache 的帮助下，主要与模型大小成正比：$TPOT \propto ModelSize$。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这意味着作者需要同时从 &lt;strong&gt;模型维度（Model Dimension）&lt;/strong&gt; 和 &lt;strong&gt;Prompt 维度（Prompt Dimension）&lt;/strong&gt; 进行弹性化。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 RServe: Overlapping Encoding and Prefill for Efficient LMM Inference</title>
      <link>https://jjl357.github.io/blog/posts/rserve---overlapping-encoding-and-prefill-for-efficient--lmminference/</link>
      <pubDate>Sat, 06 Dec 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/rserve---overlapping-encoding-and-prefill-for-efficient--lmminference/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/Rserve/title.png&#34;&gt;&lt;/p&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;大型多模态模型（LMMs）通常采用编码模块将多模态数据输入转换为 Embedding，然后将其馈送给语言模型进行进一步处理。然而，由于其推理流程的固有复杂性，高效地服务 LMM 仍然极具挑战性。传统的服务引擎将编码模块和语言模型部署在一起，导致显著的资源干扰和紧密的数据依赖。最近的研究通过将编码模块从模型中解（Disaggregating），采用预填充-解码（Prefill-Decode）分离的设计风格来缓解这一问题。尽管如此，这些方法未能充分利用单个请求内（Intra-request）和多个请求间（Inter-request）的并行性。&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/Rserve/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;与纯语言模型相比，多模态模型推理通常依赖于更丰富的提示输入，如图 1 所示。当前的 LMM 依赖额外的编码器来生成与传统 LLM 兼容的多模态输入 Embedding。尽管如此，LMM 面临另一个挑战：在单个请求内编码所有多模态数据会引入显著的延迟（其比例可高达 26%，如图 2 所示），这会干扰 LLM 的前向计算。&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/Rserve/figure2.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;随着模型规模的不断增长，LLM 或 LMM 的分布式部署已成为主流。最广泛使用的方法包括张量并行（Tensor Parallelism, TP）和流水线并行（Pipeline Parallelism, PP）。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;张量并行 (TP):&lt;/strong&gt; 通常用于具有高带宽互连的节点内，可有效降低推理延迟。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;流水线并行 (PP):&lt;/strong&gt; 通常用于带宽有限的节点间场景，可提高推理吞吐量。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;最近提出的 &lt;strong&gt;分块流水线并行 (Chunked Pipeline Parallelism, CPP)&lt;/strong&gt; 1改变了这一格局，使流水线并行能够实现与张量并行相当的延迟降低。具体而言，CPP 将整个输入 Embedding 分割成多个块（Chunks），并按原始输入顺序对预填充（Prefill）计算进行流水线处理，允许单个请求的不同块在流水线内同时处理。如图 2 所示，对于单个多模态请求，流水线并行和张量并行可以保持相当的推理延迟。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-contribution&#34;&gt;2. Contribution&lt;/h2&gt;
&lt;p&gt;为了实现交错和重叠执行，作者提出了 &lt;strong&gt;RServe&lt;/strong&gt;，这是一个 LMM 推理系统，能够以全并行方式高效编排请求内（Intra-request）和请求间（Inter-request）的流水线。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;请求内优化 (Intra-request Optimization):&lt;/strong&gt; 对于具有丰富多模态输入（即大量图像）的请求，RServe 将多模态编码过程与 Prefill 执行重叠，构建请求内流水线。为实现这一点，RServe 将输入 Embedding 分为两类：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;就绪 Embedding (Ready embeddings):&lt;/strong&gt; 包括文本 Embedding 和已经编码完成的多模态 Embedding。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;未就绪 Embedding (Not-ready embeddings):&lt;/strong&gt; 指尚未被编码模块处理的那些数据。
RServe 以细粒度从左到右顺序编码多模态数据，允许 LLM 在部分 Embedding 生成后立即启动 Prefill 执行。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;请求间优化 (Inter-request Optimization):&lt;/strong&gt; 为了保持高吞吐量和低延迟，RServe 进一步对不同请求进行批处理执行，并利用 &lt;strong&gt;可调度 Token (Schedulable Tokens)&lt;/strong&gt; 来平衡各个微批次（Micro-batches）之间的计算负载，构建请求间流水线。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 ModServe - Modality- and Stage-Aware Resource Disaggregation for Scalable Multimodal Model Serving - SoCC&#39;25</title>
      <link>https://jjl357.github.io/blog/posts/modserve---modality--and-stage-aware-resource-disaggregation-for-scalable-multimodal-model-serving---socc25/</link>
      <pubDate>Thu, 27 Nov 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/modserve---modality--and-stage-aware-resource-disaggregation-for-scalable-multimodal-model-serving---socc25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/ModServe/title.png&#34;&gt;
&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;SoCC&#39;25&lt;/strong&gt;&lt;/p&gt;
&lt;h3 id=&#34;1-动机motivation&#34;&gt;1. 动机（Motivation）&lt;/h3&gt;
&lt;p&gt;大型多模态模型（LMMs）需要处理本质上不同的输入类型，每种类型都需要独特的处理流程。这种固有的异构性为服务带来了特殊的复杂性，呼唤新的分析和服务策略。以图像-文本到文本模型[25]为例，推理流程包括多个专业阶段：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;图像预处理：&lt;/strong&gt; 将原始图像转换为张量表示。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;图像编码：&lt;/strong&gt; 将这些张量转换为图像标记（tokens）。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;语言模型后端：&lt;/strong&gt; 结合文本提示和图像标记生成文本输出。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;当前，这些阶段通常以&lt;strong&gt;单体系统&lt;/strong&gt;[5, 27, 62]形式提供服务，所有组件集成在单个实例中并作为一个统一实体进行扩展。虽然最新的LLM服务系统已采用预填充-解码（PD）分解[46, 65]来减轻LLM后端性能干扰，但这些优化仍以文本为中心，忽略了上游的多模态预处理和编码阶段。这些上游阶段在单体服务实例中依然紧密耦合。&lt;/p&gt;
&lt;p&gt;这种缺乏模态-aware解耦的设计，限制了现有系统在处理非文本工作负载时的效率和可扩展性。由于多模态输入预处理和编码位于关键路径上，这些系统难以满足&lt;strong&gt;首令牌时间（TTFT）的服务水平目标（SLOs）。&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/ModServe/figure1.png&#34;&gt;清晰地展示了，在每个请求的图像数量增加（这在多图像或视频工作负载中很常见）时，单体部署所面临的扩展挑战，这会导致TTFT急剧恶化。因此，图像密集型请求可能引发队头（HoL）阻塞&lt;/strong&gt;，进而降低系统响应能力并导致资源过度配置。&lt;/p&gt;
&lt;h3 id=&#34;2-贡献contribution&#34;&gt;2. 贡献（Contribution）&lt;/h3&gt;
&lt;p&gt;&lt;strong&gt;作者的工作：&lt;/strong&gt; 本文首次对两种主流LMM架构——&lt;strong&gt;交叉注意力（CroAttn）和仅解码器（DecOnly）&lt;/strong&gt;——进行了全面的系统分析。分析对象包括六个代表性的开源LMMs以及来自Azure数据中心的真实生产LMM推理轨迹。作者深入剖析了它们的多阶段推理流程、性能与资源之间的权衡，以及生产工作负载模式（包括可变的请求率、多样化的多模态输入和突发流量）。为促进研究，作者发布了来自生产集群的首个开源多模态轨迹，以供社区研究真实世界的部署模式。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;关键洞察（Insights）：&lt;/strong&gt; 作者的分析确定了三个优化LMM推理的关键洞察：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;Insight 1：&lt;/strong&gt; 不同的LMM推理阶段（如预处理、编码、预填充、解码）表现出不同的性能特征，并且对资源和模型配置（如批处理、模型分片）具有不同的敏感性，因此需要&lt;strong&gt;解耦执行&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Insight 2：&lt;/strong&gt; 图像编码是影响TTFT的主要瓶颈，因此需要&lt;strong&gt;高效的编码器并行化&lt;/strong&gt;来减少延迟和队头（HoL）阻塞。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Insight 3：&lt;/strong&gt; 生产多模态流量展现出独特的突发模式，主要由&lt;strong&gt;每个请求的图像数量增加&lt;/strong&gt;所驱动，这强调了需要&lt;strong&gt;模态感知路由策略&lt;/strong&gt;来管理突发流量并减轻尾部延迟峰值。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;strong&gt;ModServe架构：&lt;/strong&gt; 基于上述洞察，作者提出了&lt;strong&gt;ModServe&lt;/strong&gt;，一种新型的模块化架构，专为可扩展和资源高效的LMM服务而设计，旨在直接解决分析中发现的挑战。以图像-文本到文本任务为例，ModServe将图像和文本特定的推理阶段分离到不同的实例中进行解耦执行：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;图像实例：&lt;/strong&gt; 处理图像预处理和编码。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;文本实例：&lt;/strong&gt; 管理LLM的预填充和解码（见&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/ModServe/figure1.png&#34;&gt;）。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;请求流：&lt;/strong&gt; 纯文本请求绕过图像实例直接由文本实例服务；图像-文本请求则先通过图像实例将图像转换为标记，再转发给文本实例进行文本生成。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;ModServe的优化能力：&lt;/strong&gt; 这种模块化架构实现了阶段特定的优化：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;独立资源管理：&lt;/strong&gt; ModServe独立地使用阶段感知自动扩展、模型分片和批处理来管理图像和文本实例。通过单独扩展各个阶段，它最大程度地减少了资源过度配置。例如，在生产流量中观察到的图像驱动突发期间，图像实例可以独立扩展，从而比单体推理系统更具资源效率。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;并行化编码：&lt;/strong&gt; 为解决图像编码瓶颈，ModServe在多个图像实例上并行化单个请求的编码（&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/ModServe/figure1.png&#34;&gt;）。这是基于一个关键发现：请求中的图像在编码期间不进行相互注意力计算，因此请求可以在图像级别并行化。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;模态感知路由：&lt;/strong&gt; 为管理图像驱动的突发，ModServe为图像和文本实例实现了模态感知请求路由。例如，图像-文本请求中的图像被路由到具有最少待处理图像标记的图像实例，以减少HoL阻塞和尾部延迟峰值。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;性能表现：&lt;/strong&gt; 作者在高性能推理系统vLLM[27]之上实现了ModServe，并通过在运行Azure生产LMM推理轨迹的16服务器（128 GPU）集群上进行广泛评估，验证了ModServe的有效性。与最先进的基线相比，ModServe在静态资源分配下实现了&lt;strong&gt;3.3至5.5倍&lt;/strong&gt;更高的吞吐量，同时在满足P99 TTFT SLOs的前提下，将LMM服务成本降低了&lt;strong&gt;25%至41.3%&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;互补性：&lt;/strong&gt; 虽然现有的PD分解技术[46, 65]有助于优化LLM推理（通过分离预填充和解码），但它们对于处理多模态工作负载来说是不够的。生产环境中异构且突发的多模态流量性质，使得在以文本为中心背景下研究的PD分解难以扩展；模态特定的优化（如并行化编码、模态感知路由和阶段自动扩展）对于在保持资源效率的同时满足SLOs至关重要。作者在第5节中证明，ModServe可以与LLM后端的两种配置（共置LLM后端/混合PD批处理，以及文本节点的PD分解）结合，且提出的模态感知技术在两种配置下都能改善服务延迟。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;适用范围：&lt;/strong&gt; 作者重点研究了图像-文本到文本和视频-文本到文本（视频被视为图像帧序列处理[31]）任务，但其洞察可推广到其他多模态场景，例如音频-文本到文本任务[23]，因为它们与研究所用的模型具有相似的模型架构和推理阶段。&lt;/p&gt;
&lt;h3 id=&#34;3-基础知识preliminary&#34;&gt;3. 基础知识（Preliminary）&lt;/h3&gt;
&lt;p&gt;LMMs通过整合多模态理解能力，将以文本为中心的LLMs扩展到视觉问答[52]、计算机使用代理[42, 45]等任务。&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/ModServe/figure2.png&#34;&gt;描绘了视觉理解任务中LMM推理的典型流程[25]，它涉及三个关键阶段：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;图像预处理：&lt;/strong&gt; 将原始图像转换为统一大小的图块。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;图像编码：&lt;/strong&gt; 编码器提取视觉特征并生成一系列图像标记。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;文本生成：&lt;/strong&gt; LLM后端处理图像和文本标记以生成输出文本标记。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;strong&gt;LMM主流架构：&lt;/strong&gt; 主流LMM架构在LLM后端处理图像标记和文本标记的方式上存在差异：&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 Speculate Deep and Accurate - Lossless and Training-Free Acceleration for Offloaded LLMs via Substitute Speculative Decoding - NeurIPS&#39;25</title>
      <link>https://jjl357.github.io/blog/posts/speculate-deep-and-accurate---lossless-and-training-free-acceleration-for-offloaded-llms-via-substitute-speculative-decoding---neurips25/</link>
      <pubDate>Thu, 27 Nov 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/speculate-deep-and-accurate---lossless-and-training-free-acceleration-for-offloaded-llms-via-substitute-speculative-decoding---neurips25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/SubSpec/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;NeurIPS&#39;25&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/NYCU-EDgeAi/subspec&#34;&gt;https://github.com/NYCU-EDgeAi/subspec&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;大型语言模型（LLMs）模型体积巨大，超出常见消费级 GPU 的显存限制，导致两类常用处理方式：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;模型压缩（Quantization 等）&lt;/strong&gt;：例如 INT8/INT4 等低精度表示，能显著压缩内存占用，但属于&lt;strong&gt;有损&lt;/strong&gt;，可能影响输出质量。引用若干相关工作（GPTQ、AWQ、HQQ 等）。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;参数分流 / Offloading&lt;/strong&gt;：把不活跃层参数放到 CPU 主内存，需要时再传回 GPU，保证模型输出“无损”。但在 PCIe 带宽受限时，频繁的参数传输会大幅拉低吞吐与响应速度，导致单卡交互式生成速度可能只有每秒 1–2 token。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;为缓解 offloading 的数据传输瓶颈，&lt;strong&gt;Speculative Decoding (SD)&lt;/strong&gt; 提出使用“草稿模型”（draft model）先快速生成多个候选 token，然后由目标模型在单次前向中并行验证这些候选，从而减少昂贵的目标模型前向次数。但现有方法存在两大限制：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;依赖与目标模型“同族”的预训练小模型（若无同族小模型，需做额外训练/蒸馏）。&lt;/li&gt;
&lt;li&gt;训练过的草稿模型对定制 / fine-tuned 目标模型对齐不足，导致平均可接受 token 长度（average acceptance length，记作 $\tau$）较小，实际加速受限（常 &amp;lt; 7）。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;论文提出 &lt;strong&gt;Substitute Speculative Decoding (SubSpec)&lt;/strong&gt;：一种&lt;strong&gt;无训练（training-free）&lt;/strong&gt;、plug-and-play 的方法，通过在 GPU 上构造一个高度对齐的 draft 模型（使用低位宽 substitute 层 + 复用目标模型在 GPU 上的层与 KV-Cache）来大幅提升 $\tau$，从而在 offloading 场景下显著加速（例如在 8GB VRAM 下 Qwen2.5 7B 达到 ~25 token/s，超过 10× 加速）。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 Jupiter: Fast and Resource-Efficient Collaborative Inference of Generative LLMs on Edge Devices - INFOCOM&#39;25</title>
      <link>https://jjl357.github.io/blog/posts/jupiter---fast-and-resource-efficient-collaborative-inference-of-generative-llms-on-edge-devices---infocom25/</link>
      <pubDate>Wed, 26 Nov 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/jupiter---fast-and-resource-efficient-collaborative-inference-of-generative-llms-on-edge-devices---infocom25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/Jupiter/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;INFOCOM&#39;25&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/ysyisyourbrother/Jupiter&#34;&gt;https://github.com/ysyisyourbrother/Jupiter&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;随着生成式大型语言模型（LLMs）在边缘场景（如智能家居、个人设备）中应用需求上升，越来越多研究尝试将 LLM 服务下沉到受限的边缘设备上以保护隐私与降低云依赖。&lt;/li&gt;
&lt;li&gt;单个边缘设备通常计算/内存受限：长上下文导致 prefill 阶段时间增长，autoregressive decoding（逐token生成）也会因逐步依赖导致高延迟。&lt;/li&gt;
&lt;li&gt;现有协同边缘推理方法（TP/SequenceParallel 等）要么在每层进行大量 tensor 同步造成通信瓶颈（在低带宽下尤其明显），要么在单序列场景下无法并行利用多台设备（pipeline 在单序列下退化为串行）。&lt;/li&gt;
&lt;li&gt;此外，大多数现有工作只优化 prefill，相对忽略 decoding 阶段（但对于生成式任务，decoding 也可能主导延迟）。&lt;/li&gt;
&lt;li&gt;因此，论文动机是设计一个面向边缘、多设备、既能优化 prefill 又能加速 decoding，且通信高效、资源可扩展的协同推理系统 — 即 &lt;strong&gt;Jupiter&lt;/strong&gt;。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-contribution&#34;&gt;2. Contribution&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;提出以**pipelined architecture（流水线并行）**为原则的协同边缘推理系统设计，强调通过分层映射（layer→stage→device）来“拼装”多设备内存以容纳更大模型，同时只在相邻 stage 之间交换小量激活（activation），从而极大降低通信量。
&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/Jupiter/figure1.png&#34;&gt;&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;在 &lt;strong&gt;prefill&lt;/strong&gt; 阶段提出 &lt;strong&gt;intra-sequence pipeline parallelism&lt;/strong&gt; —— 将单条输入序列切分为多个连续子序列并并行注入流水线，同时依靠缓存的 hidden states 保障 self-attention 的正确性，从而在单序列场景下也能实现并发。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;设计了基于&lt;strong&gt;动态规划（dynamic programming）&lt;strong&gt;的&lt;/strong&gt;资源高效并行规划（parallelism planning）&lt;/strong&gt;，同时考虑设备异构、内存预算和可变输入长度，自动求解最优的模型层划分（LLM partition）与序列划分（sequence partition）。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;在 &lt;strong&gt;decoding&lt;/strong&gt; 阶段，引入并整合 &lt;strong&gt;speculative decoding&lt;/strong&gt;（自我/轻量 draft heads 或小 draft 模型产生候选 token ，随后并行验证）以并行化 token 生成，并进一步提出 &lt;strong&gt;outline-based pipeline parallel decoding&lt;/strong&gt; —— 先生成答案大纲（outline），再把大纲的每个点作为独立并行的“point-extending”请求注入流水线以并行生成每个点，从而充分利用多设备空闲计算资源。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 KVzip: Query-Agnostic KV Cache Compression with Context Reconstruction - NeuIPS&#39;25 Oral</title>
      <link>https://jjl357.github.io/blog/posts/kvzipquery-agnostic-kv-cache-compression-with-context-reconstruction/</link>
      <pubDate>Fri, 21 Nov 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/kvzipquery-agnostic-kv-cache-compression-with-context-reconstruction/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/KVzip/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;NeuIPS&#39;25 Oral&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;GIthub:&lt;/strong&gt; &lt;a href=&#34;https://github.com/snu-mllab/KVzip&#34;&gt;https://github.com/snu-mllab/KVzip&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h1 id=&#34;1-motivation&#34;&gt;&lt;strong&gt;1. Motivation&lt;/strong&gt;&lt;/h1&gt;
&lt;p&gt;大型语言模型（LLMs）在长上下文推理过程中，其 Key/Value（KV）缓存会随上下文长度线性增长，从而带来如下两个核心挑战：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;显存占用随 $n_c$ 线性扩张&lt;/strong&gt;
例如 Qwen2.5-14B 在 120k context 下需 &lt;strong&gt;33GB&lt;/strong&gt; KV Cache（论文 Figure 1）。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;解码阶段 Attention 的延迟随 KV 数量线性增加&lt;/strong&gt;
解码 token 的每一步都需对全部 KV 执行 attention，因此减少 KV 数量是最直接的加速策略。&lt;/p&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;已有 KV 压缩方法（如 &lt;strong&gt;SnapKV / PyramidKV&lt;/strong&gt;）依赖 &lt;strong&gt;query-aware importance&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;每个 query 都要重新 prefill 来获取 attention pattern。&lt;/li&gt;
&lt;li&gt;得到的重要 token 只对当前 query 有效，不可复用。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;论文的动机部分指出：&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/KVzip/figure2.png&#34;&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;在 multi-query 复用场景中，query-aware 方法的性能快速退化。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;因此本论文目标是：&lt;/p&gt;
&lt;h3 id=&#34;构建一种-query-agnostic一次预处理多-query-复用-的-kv-cache-压缩方法&#34;&gt;构建一种 &lt;strong&gt;query-agnostic、一次预处理、多 query 复用&lt;/strong&gt; 的 KV Cache 压缩方法。&lt;/h3&gt;
&lt;hr&gt;
&lt;h1 id=&#34;2-challenge&#34;&gt;&lt;strong&gt;2. Challenge&lt;/strong&gt;&lt;/h1&gt;
&lt;h2 id=&#34;21-为什么-query-aware-kv-importance-无法泛化&#34;&gt;&lt;strong&gt;2.1 为什么 query-aware KV importance 无法泛化？&lt;/strong&gt;&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/KVzip/figure6.png&#34;&gt;&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 SuffixDecoding: Extreme Speculative Decoding for Emerging AI Applications - NeurIPS&#39;25 Spotlight</title>
      <link>https://jjl357.github.io/blog/posts/suffixdecoding---extreme-speculative-decoding-for-emerging-ai-applications---neurips25-spotlight/</link>
      <pubDate>Tue, 18 Nov 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/suffixdecoding---extreme-speculative-decoding-for-emerging-ai-applications---neurips25-spotlight/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/SuffixDecoding/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;NeurIPS&#39;25 Spotlight&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/snowflakedb/ArcticInference&#34;&gt;https://github.com/snowflakedb/ArcticInference&lt;/a&gt;&lt;/p&gt;
&lt;h2 id=&#34;my-thoughts&#34;&gt;My Thoughts&lt;/h2&gt;
&lt;p&gt;这篇 paper 针对 AI 应用中大量推理请求呈现 &lt;strong&gt;高度重复、模式化且可预测&lt;/strong&gt; 的特性，提出了一个我觉得非常优秀的推测解码方法。起初我以为它的思路类似于 prefix cache，但实际阅读后发现：&lt;strong&gt;SuffixDecoding 基于 suffix tree 的方法对于 speculative decoding 的约束要小得多&lt;/strong&gt;。
Prefix cache 需要所有 token 完全一致才能命中，而 SuffixDecoding 只需满足 speculative decoding 的验证条件即可，大大提升了复用空间和适用范围。&lt;/p&gt;
&lt;p&gt;我原本担心 suffix tree 在实际部署中会因 &lt;strong&gt;规模过大&lt;/strong&gt; 或 &lt;strong&gt;查询速度过慢&lt;/strong&gt; 而成为瓶颈，但论文中的实验数据基本消除了这些顾虑。根据文中的测量，suffix tree 的&lt;strong&gt;内存效率非常高&lt;/strong&gt;：即使缓存 &lt;strong&gt;572M tokens（约 20K 请求）&lt;/strong&gt;，也只占用 &lt;strong&gt;6.15GB CPU 内存&lt;/strong&gt;，平均下来每个 token 仅需 &lt;strong&gt;10.75 bytes&lt;/strong&gt;。在一台常见的 &lt;strong&gt;144GB CPU 内存的 A100 系统&lt;/strong&gt;上，SuffixDecoding 甚至能够缓存 &lt;strong&gt;31 天连续生成的数据&lt;/strong&gt; 而无需 eviction。&lt;/p&gt;
&lt;p&gt;更重要的是，即便在如此大规模的 suffix tree 下，其性能依然稳定：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;更新耗时约 4μs/ token&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;查询耗时约 12μs/ token&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;构建速度同样令人放心，构建 &lt;strong&gt;10 万条示例输出&lt;/strong&gt; 的 suffix tree 仅需 &lt;strong&gt;~62 秒&lt;/strong&gt;，且这是整个系统启动时的一次性成本，后续更新增量极小。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 Breaking the Wall: Unifying Edge GPUs and NPUs into Pipeline Parallelism for Efficient LLM Fine-Tuning</title>
      <link>https://jjl357.github.io/blog/posts/breaking-the-wall---unifying-edge-gpus-and-npus-into-pipeline-parallelism-for-efficient-llm-fine-tuning/</link>
      <pubDate>Mon, 17 Nov 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/breaking-the-wall---unifying-edge-gpus-and-npus-into-pipeline-parallelism-for-efficient-llm-fine-tuning/</guid>
      <description>&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;目前边缘GPU（e-GPUs）和边缘NPU（e-NPUs）在硬件架构上存在显著差异，导致运行性能上有很大不同。例如，研究测量显示，某些e-NPUs仅进行前向传播的计算能力在进行反向传播时会降低10倍。具体来说，大多数边缘NPU（e-NPU）设备专为推理任务设计，只支持前向传播（FP），缺乏反向传播（BP）所需的BroadcastGradient和ReluGrad操作，这使得它们不兼容训练或微调任务。以Atlas 200I（e-NPU）的测量结果为例，如图1所示，其仅进行前向传播的计算能力为20 TOPS，而在进行反向传播时会降低约10倍至2.4 TOPS。这与Jetson Orin Nano等e-GPUs形成鲜明对比，后者的前向传播（FP）和反向传播（BP）计算能力保持相同的34 TOPS。因此，当使用现有并行方法将e-NPUs和e-GPUs统一用于LLMs微调时，e-NPUs上的慢速反向传播必然会增加整体延迟，如图5a所示。&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/HybridOP/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;因此，如何将e-GPUs和e-NPUs统一到单一的流水线并行中，以实现高效的LLMs微调，是一个尚未充分探索且具有挑战性的问题。&lt;/p&gt;
&lt;h2 id=&#34;2-preliminary&#34;&gt;2. Preliminary&lt;/h2&gt;
&lt;p&gt;与通过反向传播计算梯度的BP-enable设备（e-GPUs）不同，BP-free设备（e-NPUs）仅使用前向传播基于方向导数估计梯度。具体来说，当使用参数高效方法如LoRA微调LLM $\Theta$时，带有可训练参数$\theta$和损失函数$L$的$\Theta$，在小批量$B = {b_1, &amp;hellip;, b_M}$上的估计梯度可计算如下：&lt;/p&gt;
&lt;p&gt;$$\hat{\nabla}L(\theta|\Theta) = \frac{L(\theta + \epsilon\mathbf{z}|\Theta; B) - L(\theta|\Theta; B)}{\epsilon}\mathbf{z} = g(\mathbf{z})\mathbf{z},$$&lt;/p&gt;
&lt;p&gt;其中$L(\theta + \epsilon\mathbf{z}|\Theta)$表示可训练参数$\theta$在方向$\mathbf{z} \sim \mathcal{N}(0, I_d)$上扰动后的损失，这是对可训练参数的随机扰动。$d$表示可训练参数的大小，$\epsilon$表示标量步长。$g(\mathbf{z}) = \frac{L(\theta+\epsilon\mathbf{z}|\Theta;B) - L(\theta|\Theta;B)}{\epsilon}$表示随机方向$\mathbf{z}$的方向导数。因此，基于两次前向传播，作者可以获得$\theta$在方向$\mathbf{z}$上的下降尺度。&lt;/p&gt;
&lt;p&gt;图2a显示了估计梯度与通过带反向传播的一阶优化计算的梯度之间的相似性。作者观察到，添加扰动可以使估计梯度更接近BP梯度，同时仍比一阶优化实现更低的执行时间，如图2a所示。因此，为进一步减少估计方差并稳定微调，估计梯度可以通过对$Q$个独立采样方向$\mathbf{z}_q \sim \mathcal{N}(0, I_d)$取平均来计算：&lt;/p&gt;
&lt;p&gt;$$\hat{\nabla}L(\theta|\Theta) = \frac{1}{Q}\sum_{q=1}^{Q}\frac{L(\theta + \epsilon\mathbf{z}_q|\Theta; B) - L(\theta|\Theta; B)}{\epsilon}\mathbf{z}_q,$$&lt;/p&gt;
&lt;p&gt;此外，使用零阶优化估计梯度消除了对反向传播和中间激活保存的需求，从而减少了内存消耗，如图2b所示。&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/HybridOP/figure2.png&#34;&gt;&lt;/p&gt;
&lt;h2 id=&#34;3-contribution&#34;&gt;3. Contribution&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;作者首次提出了一种统一e-GPUs和e-NPUs的单一pipeline并行方案，用于高效的LLMs微调，该方案融合了无BP的零阶优化和一阶优化，以加速整体微调收敛。&lt;/li&gt;
&lt;li&gt;HybridOP的核心设计解决了两个关键挑战：跨异构e-GPUs和e-NPUs的LLM层划分和计算利用率提升。具体来说，作者开发了专用的成本模型来表征执行延迟和内存开销，这些模型专为HybridOP pipeline定制。分区规划器随后为e-NPUs和e-GPUs采用不同的搜索策略，以高效识别最优层分区方案，从而最小化执行延迟。&lt;/li&gt;
&lt;li&gt;大量实验表明了HybridOP的收敛性和有效性。与最先进的基线Asteroid相比，HybridOP将计算利用率提高了0.8倍，吞吐量提高了27.7%，并减少了41.2%的收敛时间，用于使用4个e-NPUs和6个e-GPUs微调LLaMA-3.1-8B模型。&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id=&#34;4-hybridop-system-design&#34;&gt;4. HYBRIDOP SYSTEM DESIGN&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/HybridOP/figure3.png&#34;&gt;&lt;/p&gt;
&lt;h3 id=&#34;41-overview&#34;&gt;4.1 Overview&lt;/h3&gt;
&lt;p&gt;在HybridOP并行方案中，e-GPUs使用反向传播计算BP梯度，而e-NPUs使用多次前向传播计算估计梯度。首先，这些e-GPUs和e-NPUs协作执行第一次前向传播，并获取相应的无扰动基础损失（蓝色箭头）。然后，e-NPU设备生成可训练参数的随机扰动，并基于这些扰动参数执行前向传播（绿色箭头）。同时，e-GPU设备执行反向传播以计算BP梯度（橙色箭头）。流水线的最后一个设备计算损失和对应于随机扰动的方向导数$g(\mathbf{z})$，并将$g(\mathbf{z})$传输到所有e-NPU设备。e-NPU设备基于公式(10)计算估计梯度。最后，所有异构设备在流水线中获取小批量$b_i$的梯度。&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/HybridOP/figure4.png&#34;&gt;&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 TINY BUT MIGHTY: A SOFTWARE-HARDWARE CO DESIGN APPROACH FOR EFFICIENT MULTIMODAL IN FERENCE ON BATTERY-POWERED SMALL DEVICES - ICLR&#39;26</title>
      <link>https://jjl357.github.io/blog/posts/tiny-but-mighty---a-software-hardware-co-design-approach-for-efficient-multimodal-in-ference-on-battery-powered-small-devices/</link>
      <pubDate>Mon, 17 Nov 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/tiny-but-mighty---a-software-hardware-co-design-approach-for-efficient-multimodal-in-ference-on-battery-powered-small-devices/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/NANOMIND/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;ICLR&#39;26&lt;/strong&gt;&lt;/p&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;在设备端运行大语言模型（On-device LLMs）通过将数据保留在本地，显著增强了安全性，降低了数据泄露风险，同时支持实时智能和用户隐私保护。然而，其实际部署仍受到紧凑系统严苛的功耗与计算预算限制。随着对高级模型需求的增长——尤其是在离线或弱连接场景下——亟需在资源效率与隐私之间取得平衡的解决方案。当前这些模型已被广泛部署于智能手机、桌面设备与机器人，以支持自然语言交互、实时任务执行以及更强的用户隐私保障。&lt;/p&gt;
&lt;p&gt;然而，现有方法几乎完全聚焦于&lt;strong&gt;软件或算法层面的优化&lt;/strong&gt;——主要是低比特量化（low-bit quantization）——却缺乏对碎片化多样的移动 GPU 与新兴 NPU 的支持，也无法很好地跨不同硬件平台适配。大多数先前工作仅尝试解决该问题的一两个方面，尚无端到端的完整解决方案。尤其重要的是，它们常常忽略了&lt;strong&gt;软硬件联合设计&lt;/strong&gt;（joint design of software and hardware）。其结果是，设备无法充分利用可用资源，且功耗问题很少被系统性地考虑。&lt;/p&gt;
&lt;p&gt;大型多模态模型（LMMs）具有天然的模块化结构，通常由视觉编码器、嵌入层、投影器（projector）和语言解码器等组件组成，每个组件具有独特的计算特性。同时，不同硬件加速器也具备各自的优势：例如，&lt;strong&gt;NPU 在低比特张量运算&lt;/strong&gt;（如 INT4/INT8），而 &lt;strong&gt;GPU 则擅长大规模并行浮点计算&lt;/strong&gt;。然而，目前 LMMs 通常被当作单体（monolithic）工作负载部署在单一加速器上，无视这些架构差异。这种错配导致硬件利用率低下、端到端延迟增加、推理效率低下。若无法将不同组件动态卸载到最适合的计算单元，大量宝贵的硬件资源将长期闲置。实验（见第 4 节）表明，&lt;strong&gt;NPU 在编码器推理任务上始终优于其他单元&lt;/strong&gt;，这凸显了动态、模块级卸载的重要性。&lt;/p&gt;
&lt;p&gt;此外，尽管许多框架现已支持在边缘设备上部署 LLM，但它们大多源自服务器或传统 PC 架构，其中 CPU 与 GPU 拥有独立的内存空间。相比之下，现代边缘设备（包括手机）普遍采用&lt;strong&gt;统一内存架构&lt;/strong&gt;（Unified Memory Architecture, UMA），CPU、GPU（或 NPU）共享同一物理 DRAM。这一根本差异使得许多传统设计在边缘设备上效率低下。在 UMA 下，NPU 与 GPU 缺乏 DMA 隔离，必须协调对共享内存的访问，这就要求全新的系统级优化和精心的重新设计以确保高效运行。&lt;/p&gt;
&lt;p&gt;现有方法主要聚焦于软件层面技术（如低比特量化和模型缩放）以减少内存占用，却常常忽视了硬件层面的关键优化，包括：对移动 GPU/NPU 低比特操作的驱动支持、高效电源管理、以及跨加速器利用率的提升。此外，将整个模型简单地部署在单一加速器上通常会导致高延迟，使得这些框架无法充分利用边缘和小型设备上有限的计算资源。&lt;/p&gt;
&lt;h2 id=&#34;2-related-work&#34;&gt;2. Related Work&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;推理系统&lt;/strong&gt;：在系统级优化方面，近期工作已开始利用现代 SoC 中的异构加速器。例如，&lt;code&gt;llm.npu&lt;/code&gt; (Xu et al., 2025) 在提示词、张量和块级别重构 NPU 上的执行流程，将异常值和浮点（FP）操作卸载到 CPU/GPU，并通过子图重排来提高利用率——解决了移动 NPU 仅支持静态输入形状的限制。&lt;code&gt;PowerInfer-2&lt;/code&gt; (Xue et al., 2024) 提出了一种 NPU-CPU 协同框架，根据神经元激活密度卸载 LLM 推理，使手机能运行超出其内存容量的模型。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 Efficiently Serving Large Multimodal Models Using EPD Disaggregation - ICML&#39;25</title>
      <link>https://jjl357.github.io/blog/posts/efficiently-serving-large-multimodal-models-using-epd-disaggregation---icml25/</link>
      <pubDate>Sat, 15 Nov 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/efficiently-serving-large-multimodal-models-using-epd-disaggregation---icml25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/EPDServe/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;ICML&#39;25&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/vbdi/epdserve&#34;&gt;https://github.com/vbdi/epdserve&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;Large Multimodal Models (LMMs) 将视觉/音频/视频等感知模态引入到 LLM 的推理流程中，从而带来更强的能力，但随之而来的是&lt;strong&gt;额外的编码（encoding）阶段&lt;/strong&gt;，该阶段会产生大量视觉（或音频）token，显著增加计算与内存消耗，并对关键的 SLO（如 TTFT、TPOT）造成负面影响。当前主流的 LLM-serving 系统（如 vLLM、DistServe 等）要么将编码与 prefill 聚合在同一资源上导致干扰与内存竞争，要么只对 LLM 的 prefill/decode 做优化，无法从根本上缓解 LMM 的编码瓶颈。因此论文提出通过**将 Encoding / Prefill / Decode 三阶段进行严格分离（EPD Disaggregation）**来重新设计服务架构，以解耦资源、并提供针对每阶段的定制优化，从而减少延迟、提升 SLO 达成率并大幅节省内存。&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/EPDServe/figure1.png&#34;&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-related-work&#34;&gt;2. Related Work&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/EPDServe/figure2.png&#34;&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;现有 LLM 服务（vLLM、SARATHI、Orca 等）与 Disaggregated-serving（SplitWise、DistServe、DéjàVu 等）对 LLM 的 prefill/decode 分离带来了可观改进，但这些工作&lt;strong&gt;通常忽略或未充分优化编码（encoding）阶段&lt;/strong&gt;，因此不适用于 LMM 的编码密集型工作负载。相较之下，本文填补该空白，提出将编码也作为独立可调度阶段，从而开启新的并行化、缓存与资源分配策略。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id=&#34;3-method&#34;&gt;3. Method&lt;/h2&gt;
&lt;h3 id=&#34;31-epd-disaggregation&#34;&gt;3.1. EPD Disaggregation&lt;/h3&gt;
&lt;p&gt;EPD 把推理流程明确划分为三个独立阶段：&lt;strong&gt;Encoding (E)&lt;/strong&gt;、&lt;strong&gt;Prefill (P)&lt;/strong&gt;、&lt;strong&gt;Decode (D)&lt;/strong&gt;，并定义两类跨阶段迁移（migration）函数：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;EP-migration&lt;/strong&gt;：编码阶段生成的 multimodal tokens $v^e_t$ 被传递到 prefill：
$$v^p_t = \psi_{EP}(v^e_t)$$&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;PD-migration&lt;/strong&gt;：prefill 生成的初始 KV cache 与首个 token 经迁移至 decode：
$$(kv^d_1, o^d_1) = \psi_{PD}(kv^p_1, o^p_1)$$&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;阶段内部流程：&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 ElasticMM: Efficient Multimodal LLMs Serving with Elastic Multimodal Parallelism - NeurIPS&#39;25 Oral</title>
      <link>https://jjl357.github.io/blog/posts/elasticmm---efficient-multimodal-llms-serving-with-elastic-multimodal-parallelism---neurips25-oral/</link>
      <pubDate>Thu, 13 Nov 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/elasticmm---efficient-multimodal-llms-serving-with-elastic-multimodal-parallelism---neurips25-oral/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/ElasticMM/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;NeurIPS&#39;25 Oral&lt;/strong&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-background-and-motivation&#34;&gt;1. Background and Motivation&lt;/h2&gt;
&lt;p&gt;多模态大语言模型（Multimodal Large Language Models, MLLMs）在传统 LLM 的基础上扩展了图像、视频、音频等输入模态，使模型能够进行跨模态理解与推理。然而，这些额外组件（如视觉编码器、投影模块等）带来了显著的推理开销。由于多模态推理流程复杂、任务异构，MLLM 的高效部署成为一个重大挑战。&lt;/p&gt;
&lt;p&gt;现有的大多数推理服务架构（serving architecture）采用紧耦合（tightly coupled）设计，无法区分不同请求类型，也无法在不同阶段灵活地调整并行策略，导致 &lt;strong&gt;time-to-first-token (TTFT)&lt;/strong&gt; 延迟增大、GPU 资源利用率低下。&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/ElasticMM/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;与传统仅处理文本的 LLM 不同，MLLM 需要同时处理多种模态的输入，因此推理流程更复杂，通常包括：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;Image Preprocessing&lt;/strong&gt;：对原始图像进行裁剪、缩放、分块；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Image Encoding&lt;/strong&gt;：通过视觉编码器提取特征并转化为 vision token；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Text Generation&lt;/strong&gt;：将 vision token 与文本 prompt 拼接后输入语言模型，经过 prefill 和 decode 阶段生成输出。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;这些额外阶段显著增加了推理复杂度和平均上下文长度，从而导致计算与内存开销的上升。&lt;/p&gt;
&lt;hr&gt;
&lt;h3 id=&#34;11-multimodal-large-language-models-inference&#34;&gt;1.1 Multimodal Large Language Models Inference&lt;/h3&gt;
&lt;p&gt;MLLM 的推理流水线可以拆分为三个关键阶段：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;图像预处理&lt;/strong&gt;：原图像被缩放或分块；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;图像编码&lt;/strong&gt;：视觉编码器提取视觉 token；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;文本生成阶段&lt;/strong&gt;：LLM 同时处理视觉与文本 token 并生成响应。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;现代 MLLM 的架构可分为两类：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;Decoder-only (DecOnly)&lt;/strong&gt;：如 LLaVA-OneVision、Qwen-VL、Janus、InternVL。视觉与文本 token 拼接后共同输入模型，视觉 token 参与每一步生成；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Encoder-decoder (EncDec)&lt;/strong&gt;：如 LLaMA-3.2 Vision、NVLM-X、Flamingo。视觉 token 通过 cross-attention 与文本 token 交互，仅在 cross-attention 层中出现。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;两者的主要差异在于视觉 token 的交互方式：前者在每一步生成都参与计算，后者仅在交叉注意力阶段出现。
由于视觉 token 的数量通常远大于文本 token，这两种架构都在推理中引入了大量的额外开销，包括更长的上下文、更高的显存使用率和更慢的推理速度。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference - NeurIPS&#39;25</title>
      <link>https://jjl357.github.io/blog/posts/chunkkv---semantic-preserving-kv-cache-compression-for-efficient-long-context-llm-inference---neurips25/</link>
      <pubDate>Wed, 12 Nov 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/chunkkv---semantic-preserving-kv-cache-compression-for-efficient-long-context-llm-inference---neurips25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/ChunkKv/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference&lt;/strong&gt;: NeurIPS&#39;25&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/NVIDIA/kvpress&#34;&gt;https://github.com/NVIDIA/kvpress&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;my-thoughts&#34;&gt;My Thoughts&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;ChunkKV 假定“删除部分 token 不会丢失极其关键的细节”，在&lt;strong&gt;法律/医疗等需要逐字级别保真&lt;/strong&gt;的场景可能不合适（论文明确指出）。&lt;/li&gt;
&lt;li&gt;当前实现使用固定 size chunk（效率高但语义边界未显式对齐）；未来可以尝试基于句法/语义边界的 adaptive chunk（但需权衡额外开销）。&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;随着 LLM 处理超长上下文（tens of thousands tokens），KV cache 的内存成为推理阶段的主要瓶颈——例如 7B 模型单 token 的 KV cache 大约占 0.5MB，导致 10k token 的 prompt 消耗约 5GB GPU 内存。&lt;/li&gt;
&lt;li&gt;现有压缩方法（H2O、SnapKV 等）通过删除被认为“不重要”的离散 token 来减少 KV 大小，但&lt;strong&gt;孤立地评估 token 重要度&lt;/strong&gt;会破坏语义连贯性（会把主语或宾语切碎），从而在一些需要语义完整的任务上产生明显性能下降。论文通过示例强调：按 token 剪枝会保留与问题相关的某些词但漏掉关键对象信息，导致语义丢失。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;问题&lt;/strong&gt;：如何避免孤立 token 重要度评估，并在 KV cache 压缩时最大限度保存语义信息？&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-challenge&#34;&gt;2. Challenge&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/ChunkKv/figure1.png&#34;&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;以往方法在 token 维度上进行稀疏化/删减，忽略了自然语言语义通常以连续片段（chunk）出现的事实；因此需要一个&lt;strong&gt;按语义连续段（chunk）作为压缩单位&lt;/strong&gt;的方法以保留“完整的语义单元”。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id=&#34;3-contribution&#34;&gt;3. Contribution&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/ChunkKv/table1.png&#34;&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;发现并量化了“离散 token 压缩会破坏语义”的现象&lt;/li&gt;
&lt;li&gt;提出 &lt;strong&gt;ChunkKV&lt;/strong&gt;：以固定大小（或可调整）chunk 为单位做 KV 压缩，保留最有信息量的 chunk，尽可能保留主谓宾等语义完整性，并设计了&lt;strong&gt;layer-wise index reuse&lt;/strong&gt; 技术来复用所选索引，从而显著降低额外计算开销。&lt;/li&gt;
&lt;li&gt;在 LongBench、NIAH、GSM8K、JailbreakV 等多项 benchmark 以及多个模型（DeepSeek-R1、LLaMA-3、Qwen2、Mistral）上进行大规模评测，展示在相同压缩率下 ChunkKV 在准确率/召回/检索等方面优于现有方法，且在 latency/throughput 上得益于索引复用与向量化实现。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id=&#34;4-method&#34;&gt;4. Method&lt;/h2&gt;
&lt;h3 id=&#34;41-chunk-level-compression&#34;&gt;4.1 Chunk-level compression&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;核心假设&lt;/strong&gt;：自然语言中的“完整语义信息”通常由一段连续 token 构成（例如主语 + 谓语 + 宾语或整个短语）。将这些 token 作为整体（chunk）保留或删除，比以 token 为单位做稀疏更能保留语义。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Chunk 的定义&lt;/strong&gt;：论文采用&lt;strong&gt;固定大小滑窗分块&lt;/strong&gt;（chunk size = $c$），将整个 Key/Value 序列按顺序分为 $C=\lceil T_k / c\rceil$ 个 chunk（最后一个 chunk 可能不足 $c$）。保留策略基于 chunk 的“重要性分数”（由 observe window 的 attention 得到）。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;算法伪码:&lt;/strong&gt;&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 Stop Looking for “Important Tokens” in Multimodal Language Models: Duplication Matters More - EMNLP&#39;25</title>
      <link>https://jjl357.github.io/blog/posts/stop-looking-for-important-tokens-in-multimodal-language-models---duplication-matters-more---emnlp25/</link>
      <pubDate>Wed, 12 Nov 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/stop-looking-for-important-tokens-in-multimodal-language-models---duplication-matters-more---emnlp25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/Dart/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;EMNLP&#39;25&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/ZichenWen1/DART&#34;&gt;https://github.com/ZichenWen1/DART&lt;/a&gt;&lt;/p&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;Vision tokens 在多模态大模型（MLLMs）中因数量巨大而成为主要计算瓶颈，尤其是高分辨率图像或多帧视频，会将图像编码为成千上万的视觉 token，使得模型推理的时间和内存成本迅速上升。为此，许多近期工作提出了&lt;strong&gt;训练免费（training-free）&lt;strong&gt;的 token pruning 方法，通常采用“先度量每个 token 的importance，再删除importance低的 token”的范式来加速推理。论文指出并实证了：以 attention-score 作为 importance 的方式&lt;/strong&gt;存在严重缺陷&lt;/strong&gt;，在某些场景下竟然&lt;strong&gt;比随机丢弃（random pruning）更差&lt;/strong&gt;，并且与硬件加速（如 FlashAttention）不兼容，从而无法在实际部署时取得理想的速度-性能折中。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;直觉动机&lt;/strong&gt;：论文提出另一种思路——&lt;strong&gt;把重复（duplication）作为 token reduction 的主要考虑因素&lt;/strong&gt;。当多个视觉 token 表示高度相似时，保留其中一个便足以维持信息完整度；相反，删除“重复”token 不但能大幅削减计算，也更不容易损害下游性能。基于该想法，作者提出了 DART（Duplication-Aware Reduction of Tokens）这一简单、训练免费、对硬件友好的 token 削减 Pipeline。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-challenge&#34;&gt;2. Challenge&lt;/h2&gt;
&lt;p&gt;论文系统性地列举并分析了当前 importance-based token pruning 的问题：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;(I) 忽略 token 间的交互（dynamic interaction）&lt;/strong&gt;：importance-based 方法往往把每个 token 的分数当作对全集 $X$ 的函数 $s_i=F(x_i\mid X)$ 并进行静态选择，但当某些 token 被移除后，剩下 token 的“重要性”应发生改变（例如两近似 token 存在互补性，移除其中之一会提高另一个的相对重要性），而静态评分忽略了这一点。论文通过形式化说明和实证展示了该偏差来源（见式 (4)-(6)）。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;(II) 与高效注意力算子（FlashAttention）不兼容&lt;/strong&gt;：许多 importance-based 方法需要访问 attention scores，但高效实现（FlashAttention / FlashAttention-2）在内部并不暴露中间 attention map，这就迫使要么禁用高效实现（带来速度和内存损失），要么放弃这些方法。论文强调在保持 FlashAttention 的同时设计 pruning 方法的重要性。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders -CVPR 2025 </title>
      <link>https://jjl357.github.io/blog/posts/move-kd---knowledge-distillation-for-vlms-with-mixture-of-visual-encoders---cvpr25/</link>
      <pubDate>Mon, 10 Nov 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/move-kd---knowledge-distillation-for-vlms-with-mixture-of-visual-encoders---cvpr25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/MoVE-KD/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;CVPR 2025&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github：&lt;/strong&gt; &lt;a href=&#34;https://github.com/hey-cjj/MoVE-KD&#34;&gt;https://github.com/hey-cjj/MoVE-KD&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;视觉编码器（Visual Encoder）是视觉语言模型（VLM）的核心组件，每个编码器通常源自不同的视觉基础模型（Visual Foundation Model），因此具备不同的特长与感知能力。为了充分利用这些差异化优势，近年来许多研究在单一 VLM 中整合多个视觉编码器。然而，这种设计虽然能融合多源知识，却导致计算量大幅上升、模型复杂度增加，严重影响了效率与可扩展性。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;核心问题：&lt;/strong&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;是否可以将多个视觉编码器的特长“蒸馏”进一个单一编码器中，从而兼具多编码器的性能与单编码器的高效性？&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;MoVE-KD（Mixture-of-Visual-Encoder Knowledge Distillation）正是为了解决这一问题而提出的。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-challenge&#34;&gt;2. Challenge&lt;/h2&gt;
&lt;p&gt;现有方法（如 [24, 38, 42]）通常通过特征拼接（feature concatenation）或注意力融合（attention fusion）等方式结合多个视觉编码器，但多编码器必然带来高计算开销和复杂模型结构，削弱了训练与推理效率。&lt;/p&gt;
&lt;p&gt;此外，尽管知识蒸馏（Knowledge Distillation, KD）为知识压缩提供了思路，但传统 KD 主要是 &lt;strong&gt;一对一（one-to-one）&lt;/strong&gt; 蒸馏，即单个教师到单个学生。而如何从多个来源、不同预训练目标的视觉教师模型中同时学习，是一个尚未充分探索的问题。&lt;/p&gt;
&lt;p&gt;此前如 &lt;strong&gt;AM-RADIO [36]&lt;/strong&gt; 虽引入多教师思路，但由于共享主干、学习冲突严重，性能受限。
MoVE-KD 的目标是建立一个统一框架，将多教师视觉知识高效压缩进单一学生模型中，同时解决知识冲突与效率问题。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;3-contribution&#34;&gt;3. Contribution&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/MoVE-KD/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;MoVE-KD 的提出灵感来自 ViT 的 token 扩展方法 [9]，其核心思想是利用注意力机制引导多教师的知识蒸馏过程，通过 [CLS] token 判断视觉 token 的重要性，并分配动态权重，从而“选择性”吸收有价值的信息。&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;提出 MoVE-KD 框架&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;首个从知识蒸馏角度实现“多视觉编码器融合”的统一框架；&lt;/li&gt;
&lt;li&gt;可在不增加模型复杂度的情况下，将不同视觉编码器的知识压缩进单模型。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;提出 Attention-guided KD 机制&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;通过 [CLS] token 的注意力图，动态评估每个视觉 token 的重要性；&lt;/li&gt;
&lt;li&gt;引入多教师权重自适应机制（Teacher Weighting），使更有价值的教师贡献更大；&lt;/li&gt;
&lt;li&gt;使用 &lt;strong&gt;Mixture-of-LoRA-Experts (MoLE)&lt;/strong&gt; 结构缓解教师间知识冲突。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;在 LLaVA / LLaVA-NeXT 等主流 VLM 上取得 SOTA&lt;/strong&gt;&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 DartQuant: Efficient Rotational Distribution Calibration for LLM Quantization - NeurIPS&#39;25</title>
      <link>https://jjl357.github.io/blog/posts/dartquant---efficient-rotational-distribution-calibration-for-llm-quantization---neurips25/</link>
      <pubDate>Sun, 09 Nov 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/dartquant---efficient-rotational-distribution-calibration-for-llm-quantization---neurips25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/DartQuant/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;NeurIPS&#39;25&lt;/strong&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;my-thoughts&#34;&gt;My Thoughts&lt;/h2&gt;
&lt;p&gt;当时在复现 &lt;strong&gt;SpinQuant&lt;/strong&gt; 的时候，确实感受到了 training 的计算资源需求非常大。记得训练一个 epoch 都一些时间，而 SpinQuant 官方给的 example script 甚至建议训练 100 个 epoch。当时就意识到：&lt;strong&gt;针对旋转矩阵的优化（Rotation Optimization）需要更高效的方式&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;结果果然别人的手速很快，NeurIPS’25 上就出现了这个 &lt;strong&gt;DartQuant&lt;/strong&gt; 工作，它不仅加速了旋转矩阵的优化过程，还能缓解 calibration 阶段的 &lt;strong&gt;task-specific overfitting&lt;/strong&gt; 问题和通过QR分解解决必须正交的问题，非常巧妙。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;近年来，大型语言模型（LLMs）在多种 NLP 任务上表现卓越，如文本生成、翻译、问答系统等。然而，其推理阶段的计算与内存开销极高，限制了在边缘设备或资源受限场景下的部署。&lt;/p&gt;
&lt;p&gt;在各种模型压缩方法中（剪枝、蒸馏、参数共享、量化等），&lt;strong&gt;后训练量化（Post-Training Quantization, PTQ）&lt;/strong&gt; 因为不需要重新训练、可直接作用于现成模型，而在实际部署中最具实用价值。&lt;/p&gt;
&lt;p&gt;不过，激活分布中存在的极端值（outliers）严重影响了低比特量化效果。为了解决这一问题，研究者提出了 &lt;strong&gt;旋转变换（rotation transformation）&lt;/strong&gt; 来改变激活分布，使其更适合量化。旋转矩阵具有以下优势：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;保持范数不变；&lt;/li&gt;
&lt;li&gt;可逆；&lt;/li&gt;
&lt;li&gt;能在推理阶段与权重线性层融合，不增加推理时延。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;例如，&lt;strong&gt;QuaRot&lt;/strong&gt; 和 &lt;strong&gt;SpinQuant&lt;/strong&gt; 分别使用随机或可训练旋转矩阵来削弱 outlier 的影响。然而，SpinQuant 的 end-to-end 旋转训练开销巨大（显存、时间都极高），同时容易在小规模 calibration set 上 &lt;strong&gt;过拟合&lt;/strong&gt;。
这正是 DartQuant 要解决的痛点：&lt;strong&gt;如何在不做昂贵端到端微调的情况下，快速获得合适的旋转矩阵。&lt;/strong&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-challenge&#34;&gt;2. Challenge&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/DartQuant/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;现有的基于旋转的量化方法（如 SpinQuant、OSTQuant）主要问题如下：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;计算与显存开销过大&lt;/strong&gt;：
对 70B 模型进行旋转矩阵优化需要上百 GiB 显存与数十 GPU 小时，完全不符合 PTQ 快速部署的目标。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 HEADINFER: Memory-Efficient LLM Inference by Head-wise Offloading</title>
      <link>https://jjl357.github.io/blog/posts/headinfer---memory-efficient-llm-inference-by-head-wise-offloading/</link>
      <pubDate>Sun, 09 Nov 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/headinfer---memory-efficient-llm-inference-by-head-wise-offloading/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/HeadInfer/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;ICML&#39;25 Workshop on Long-Context Foundation Models&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/wdlctc/headinfer&#34;&gt;https://github.com/wdlctc/headinfer&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/HeadInfer/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;Transformer-based LLM 在长上下文场景下的推理性能显著，但随着上下文长度的扩展，&lt;strong&gt;KV cache&lt;/strong&gt;（key-value cache）迅速成为内存占用的主要瓶颈。论文指出：例如对 Llama-3-8B 进行 1M token 推理时，KV cache 可达 128 GB，整体内存可达 207 GB（权重 + activation + KV cache），这是在常见 BF16 设置下的估算，使得在消费级 GPU（如 RTX-4090，24GB）上无法直接执行长上下文推理。为解决此类问题，作者提出 HEADINFER —— 通过&lt;strong&gt;按 attention head 维度进行细粒度 KV cache 离线/回传（offload）&lt;/strong&gt;，仅在 GPU 上保留部分 attention heads 的 KV，从而极大地压缩 GPU 端 KV 的占用，同时保证数学等价性（lossless）和兼容各种 attention 形式（dense / sparse）。论文摘要与引言的核心论点与数据来自原文说明。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-relative-work&#34;&gt;2. Relative Work&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;生成式推理与 KV 缓存（Generative Inference &amp;amp; KV Caching）&lt;/strong&gt;：预填（prefill）和解码（decoding）阶段的概念与常用 chunked prefill 思路（将长输入切为若干 chunk 逐步构建 KV cache）被回顾，用以说明激活内存与 KV cache 在不同阶段的不同开销特征。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 Efficient Multi-modal Large Language Models via Progressive Consistency Distillation - NeurIPS&#39;25</title>
      <link>https://jjl357.github.io/blog/posts/efficient-multi-modal-large-language-models-via-progressive-consistency-distillation---neurips25/</link>
      <pubDate>Fri, 07 Nov 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/efficient-multi-modal-large-language-models-via-progressive-consistency-distillation---neurips25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/EPIC/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference：&lt;/strong&gt; NeurIPS 2025&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github：&lt;/strong&gt; &lt;a href=&#34;https://github.com/ZichenWen1/EPIC&#34;&gt;https://github.com/ZichenWen1/EPIC&lt;/a&gt;&lt;/p&gt;
&lt;h2&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/EPIC/figure3.png&#34;&gt;&lt;/h2&gt;
&lt;h2 id=&#34;my-thoughts&#34;&gt;My Thoughts&lt;/h2&gt;
&lt;p&gt;EPIC 这篇论文的核心思想是在&lt;strong&gt;不改动模型结构&lt;/strong&gt;的前提下，通过&lt;strong&gt;渐进式一致性蒸馏（Progressive Consistency Distillation）&lt;/strong&gt;，让多模态大语言模型在&lt;strong&gt;token 层面（Token Consistency Distillation, TCD）&lt;/strong&gt; 和 &lt;strong&gt;层级层面（Layer Consistency Distillation, LCD）&lt;/strong&gt; 逐步适应视觉 token 压缩带来的特征分布变化，从而实现从低压缩到高压缩的平滑过渡，在显著降低计算量与显存占用的同时仍保持甚至提升模型性能。这种从训练策略层面解决效率问题的思路，兼具理论优雅性与实用性。&lt;/p&gt;
&lt;p&gt;日后如果有需要用到 Knowledge  Dsitillation 的 idea 或者 训练策略，可以借鉴其思想。&lt;/p&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;多模态大语言模型（MLLM）需要同时处理文本与视觉模态的信息。与仅需处理少量高信息密度文本 token 的 LLM 不同，MLLM 在输入中包含大量视觉 token，这些 token 在高分辨率图像或多帧视频任务中尤为庞大。这种“视觉 token 爆炸”（visual token explosion）带来了显著的&lt;strong&gt;计算负担与存储压力&lt;/strong&gt;，尤其在推理时对 KV cache 和显存的占用极大。&lt;/p&gt;
&lt;p&gt;因此，如何在不显著降低性能的前提下&lt;strong&gt;减少视觉 token 的数量&lt;/strong&gt;，成为提升 MLLM 效率的核心问题。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-challenge&#34;&gt;2. Challenge&lt;/h2&gt;
&lt;p&gt;视觉 token 数量通常比文本 token 多出几个数量级，但其包含的空间信息高度冗余。近年来，研究者提出了两大类视觉 token 压缩方法：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;Training-free 方法：&lt;/strong&gt; 不需要额外训练，通过简单的启发式规则压缩视觉 token。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;基于重要性（importance-based）&lt;/strong&gt;：如 FastV、SparseVLM，依据注意力得分筛选重要 token。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;基于冗余（redundancy-based）&lt;/strong&gt;：如 DART、G-Prune，通过 token 相似度评估合并或舍弃冗余特征。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;Training-aware 方法：&lt;/strong&gt; 在训练阶段显式引入压缩模块，让模型学习在压缩下保持性能。
典型工作包括：&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 SPINQUANT: LLM QUANTIZATION WITH LEARNED ROTATIONS - ICLR&#39;25</title>
      <link>https://jjl357.github.io/blog/posts/spinquant---llm-quantization-with-learned-rotations---iclr25/</link>
      <pubDate>Thu, 06 Nov 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/spinquant---llm-quantization-with-learned-rotations---iclr25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/SpinQuant/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;ICLR&#39;25&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/facebookresearch/SpinQuant&#34;&gt;https://github.com/facebookresearch/SpinQuant&lt;/a&gt;&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/SpinQuant/figure1.png&#34;&gt;&lt;/p&gt;
&lt;h2 id=&#34;my-thoughts&#34;&gt;My Thoughts&lt;/h2&gt;
&lt;p&gt;这篇工作里的可学习、可融入权重的 Rotation ($R_1, R_2$) 以及 learned rotations ($R_1 R_2$)，再加上 Hadamard rotations ($R_3, R_4$)（其中 $R_3$ 和 $R_4$ 可以通过快速哈达玛核计算）共同组成了整套旋转框架。
理解这些旋转的组合与吸收方式（merge into weights）是理解 SpinQuant 的关键所在。&lt;/p&gt;
&lt;p&gt;就像论文中提到的：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;“This opens up intriguing research avenues, such as determining if, given an activation distribution with known outlier axes and magnitudes, a closed-form solution for the optimal rotation matrix that evenly distributes magnitude across different axes can be derived&amp;hellip;”&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;作者提出了未来方向：若能已知激活分布的异常方向及幅度，是否能推导出解析的最优旋转矩阵，使不同轴上的幅值均衡？并进一步验证该理论旋转是否能达到最优量化性能。这一点与本工作提出的“可学习旋转”思想一脉相承。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;Post-training quantization (PTQ) 技术通过对权重、激活和 KV cache 进行低比特量化，可显著降低 LLM 的内存占用、延迟和功耗，但当存在 outliers（离群值）时，量化误差往往会非常大。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 ViSpec: Accelerating Vision-Language Models with Vision-Aware Speculative Decoding - NeurIPS&#39;25 </title>
      <link>https://jjl357.github.io/blog/posts/vispec---accelerating-vision-language-models-with-vision-aware-speculative-decoding---neurips25/</link>
      <pubDate>Wed, 05 Nov 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/vispec---accelerating-vision-language-models-with-vision-aware-speculative-decoding---neurips25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/ViSpec/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;NeurIPS&#39;25&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;GitHub:&lt;/strong&gt; &lt;a href=&#34;https://github.com/KangJialiang/ViSpec&#34;&gt;https://github.com/KangJialiang/ViSpec&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;my-thoughts&#34;&gt;My Thoughts&lt;/h2&gt;
&lt;p&gt;个人感觉这篇工作是将Eagle应用于VLM， 并针对VLM带来的问题进行了解决。&lt;/p&gt;
&lt;p&gt;但这篇工作也是需要training，构造数据集和进行训练花销还是挺大的， 好奇能否有更efficient甚至是training-free的method来实现Vision-Aware Speculative Decoding。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;Speculative Decoding（推测解码）是一种在大型语言模型（LLM）中被广泛采用的推理加速技术。然而，其在视觉语言模型（Vision-Language Models, VLMs）中的应用仍然非常有限，已有方法的加速收益通常不足 &lt;strong&gt;1.5×&lt;/strong&gt;。&lt;br&gt;
随着多模态能力逐渐成为大规模模型的核心能力，这一加速差距变得愈发显著。&lt;/p&gt;
&lt;p&gt;ViSpec 的核心动机在于突破当前 VLM 加速的瓶颈：现有推测式解码方法主要针对纯文本推理设计，在视觉输入冗余较高的多模态场景下，小型草稿（draft）模型在生成过程中难以高效处理图像特征，从而限制了整体加速效率。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-challenge&#34;&gt;2. Challenge&lt;/h2&gt;
&lt;p&gt;目前针对 Vision-Language Models 的 Speculative Decoding 工作非常少。仅有的尝试[7] 在 LLaVA-7B 上应用了一个小型仅语言模型的 draft 模型，获得了大约 &lt;strong&gt;1.5×&lt;/strong&gt; 的加速。当他们将 image encoder 融入小型多模态草稿模型中时，加速效果并未显著提升，主要原因包括：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;图像信息冗余较高&lt;/strong&gt;：大量重复或低信息密度的视觉块（patch）对小模型造成干扰；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;多模态处理复杂性高&lt;/strong&gt;：视觉 token 的嵌入维度高、数量多，导致 draft 模型计算成本上升而收益有限。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;这些问题说明：在现有的 speculative decoding 框架中，草稿模型无法充分理解和整合图像特征信息。因此，作者需要一个 &lt;strong&gt;能高效处理视觉与语言双模态特征并保持高预测精度&lt;/strong&gt; 的专门框架。ViSpec 即是在此背景下提出。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;3-contribution&#34;&gt;3. Contribution&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/ViSpec/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;ViSpec 旨在解决小型 draft 模型在视觉冗余与上下文一致性方面的弱点。作者观察到，大型 VLM 能逐层过滤图像中冗余信息而保持语义理解，但小模型无法做到这一点。&lt;br&gt;
为解决这一问题，ViSpec 提出了 &lt;strong&gt;Vision-Aware Speculative Decoding&lt;/strong&gt; 框架，核心贡献如下：&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 SpecEdge: Scalable Edge-Assisted Serving Framework for Interactive LLMs - NeurIPS&#39;25 Spotlight</title>
      <link>https://jjl357.github.io/blog/posts/specedge---scalable-edge-assisted-serving-framework-for-interactive-llms-neurips25-spotlight/</link>
      <pubDate>Mon, 03 Nov 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/specedge---scalable-edge-assisted-serving-framework-for-interactive-llms-neurips25-spotlight/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/SpecEdge/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;NeurIPS&#39;25 Spotlight&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/kaist-ina/specedge&#34;&gt;https://github.com/kaist-ina/specedge&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;my-thought&#34;&gt;My Thought&lt;/h2&gt;
&lt;p&gt;个人感觉这篇工作是将&lt;strong&gt;ICLR25 PEARL: Parallel Speculative Decoding with Adaptive Draft Length&lt;/strong&gt;中 大小模型彼此互不等待的协同Speculative Decoding模式放在了云边协同场景下(一般来说Pearl中的大小模型协同需要放在不同的卡上，在单卡场景下没法实现，而云边协同的场景下刚好符合Pearl的研究场景)，用来掩盖和减小 draft 和 target model 的网络通信开销。&lt;/p&gt;
&lt;p&gt;同时也对 多edge draft models 的情况进行了优化，提出&lt;strong&gt;Server-Side Pipeline-Aware Scheduling&lt;/strong&gt;来进一步提高target model的利用率。&lt;/p&gt;
&lt;p&gt;这篇工作真正实现上还有许多细节，有时间可以看看开源代码中是否涉及到。&lt;/p&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;Large language models (LLMs) power many modern applications, but serving them at scale remains costly and resource-intensive. Current server-centric systems overlook consumer-grade GPUs at the edge.&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;大型语言模型（LLMs）支撑了众多现代智能应用，但其部署和推理成本极高。目前的主流推理系统普遍采用“服务器中心化”架构，忽视了边缘侧日益强大的消费级 GPU 资源。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;A compelling opportunity exists to dramatically reduce LLM serving costs by leveraging consumer-grade GPUs at the network edge.
The GeForce RTX 4090 delivers up to &lt;strong&gt;330.3 TFLOPS (FP16 tensor)&lt;/strong&gt;, even exceeding the &lt;strong&gt;312 TFLOPS&lt;/strong&gt; of data-center-class A100, while costing &lt;strong&gt;14.43× less&lt;/strong&gt;.&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference - NeurIPS&#39;25</title>
      <link>https://jjl357.github.io/blog/posts/ada-kv---optimizing-kv-cache-eviction-by-adaptive-budget-allocation-for-efficient-llm-inference---neurips25/</link>
      <pubDate>Sat, 01 Nov 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/ada-kv---optimizing-kv-cache-eviction-by-adaptive-budget-allocation-for-efficient-llm-inference---neurips25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/AdaKV/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference&lt;/strong&gt;: &lt;strong&gt;NeurIPS&#39;25&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github&lt;/strong&gt;: &lt;a href=&#34;https://github.com/FFY0/AdaKV&#34;&gt;https://github.com/FFY0/AdaKV&lt;/a&gt;&lt;/p&gt;
&lt;h2 id=&#34;my-thoughts&#34;&gt;My Thoughts&lt;/h2&gt;
&lt;p&gt;这篇工作的idea在各个head之间adaptive 分配 budget, 直觉上就能知道这种设计是有效的，实验也验证了这一点。&lt;/p&gt;
&lt;p&gt;比较惊喜的是作者实现了With efficient CUDA kernel implementations来解决variable-sized cache elements across attention heads，从而来真正实现了计算加速，以及其他KV Cache工作在也实现了对AdaKV集成，再次证明了其作为通用增强模块的价值。&lt;/p&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;大型语言模型（LLM）在各个领域表现出色，但由于长序列推理所需的不断增长的键值（KV）cache，面临着效率挑战。LLM 的广泛应用推动了其处理扩展序列能力的发展。例如，GPT 支持长达 128K 的序列，Claude3 支持 200K，Gemini-Pro-1.5 甚至支持高达 2M 个 token。然而，这种 token 长度的增长带来了显著的挑战，尤其是在推理过程中cache大小的急剧膨胀。对于一个 8B 的 LLM，处理一个 2M token 的序列可能需要高达 256GB 的cache，这严重影响了 GPU 内存效率和计算运行时效率。&lt;/p&gt;
&lt;p&gt;现有的 KV cache驱逐方法通常在所有注意力head上&lt;strong&gt;均匀分配&lt;/strong&gt;压缩预算，忽略了每个head独特的注意力模式。如 &lt;strong&gt;Figure 1a&lt;/strong&gt; 所示，不同head的注意力集中度（concentration）差异巨大：一些head（sparse heads）的注意力高度集中在少数几个 token 上，而另一些head（dispersed heads）的注意力则分布得更广。这种均匀分配导致了效率低下——要么在稀疏集中的head上浪费cache预算，要么在分散分布的head上造成显著的驱逐损失。&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/AdaKV/figure1.png&#34;&gt;&lt;/p&gt;
&lt;h2 id=&#34;2-relative-work&#34;&gt;2. Relative Work&lt;/h2&gt;
&lt;h3 id=&#34;21-cache-eviction-methods&#34;&gt;2.1 Cache Eviction Methods&lt;/h3&gt;
&lt;p&gt;cache驱逐方法主要分为两类：滑动窗口驱逐和 Top-k 驱逐。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;滑动窗口方法&lt;/strong&gt;（如 StreamingLLM）简单地保留初始cache元素和滑动窗口内的元素，但这种无差别的驱逐会显著降低生成质量。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Top-k 驱逐方法&lt;/strong&gt;（如 H2O, SnapKV, Pyramid）基于注意力权重识别并保留 &lt;code&gt;k&lt;/code&gt; 个关键cache元素。然而，现有 Top-k 方法通常在不同head上&lt;strong&gt;均匀分配&lt;/strong&gt;总预算。Ada-KV 通过&lt;strong&gt;自适应预算分配&lt;/strong&gt;来增强这些方法。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id=&#34;22-sparse-attention-methods&#34;&gt;2.2 Sparse Attention Methods&lt;/h3&gt;
&lt;p&gt;稀疏注意力方法与 KV cache驱逐在根本上不同：前者保留所有cache，但在计算时只选择性地使用关键子集，因此&lt;strong&gt;不减少内存占用&lt;/strong&gt;。而 KV cache驱逐直接移除非关键条目，从而减小内存占用。这两种技术是正orthogonal的，未来可以结合使用。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 NOT ALL HEADS MATTER: A HEAD-LEVEL KV CACHE COMPRESSION METHOD WITH INTEGRATED RETRIEVAL AND REASONING - ICLR&#39;25</title>
      <link>https://jjl357.github.io/blog/posts/not-all-heads-matter---a-head-level-kv-cache-compression-method-with-integrated-retrieval-and-reasoning---iclr25/</link>
      <pubDate>Fri, 31 Oct 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/not-all-heads-matter---a-head-level-kv-cache-compression-method-with-integrated-retrieval-and-reasoning---iclr25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/HeadKV/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; ICLR&#39;25&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/FYYFU/HeadKV&#34;&gt;https://github.com/FYYFU/HeadKV&lt;/a&gt;.&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;my-thoughts&#34;&gt;My Thoughts&lt;/h2&gt;
&lt;p&gt;这篇工作和 DuoAttention 的关注点类似，都是关注不同 attention head 对模型不同能力的贡献不同，这篇工作更关注 attention head 对模型 &lt;strong&gt;Retrieval&lt;/strong&gt; 与 &lt;strong&gt;Reasoning&lt;/strong&gt; 的 importance score, 来实现 KV Cache 的 nonuniform budget allocation 。&lt;/p&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;现代 LLM 越来越支持极长上下文（例如 GPT-4、Llama-3、Qwen-2、Claude 等），但随着输入长度增长，Transformer 的 self-attention 导致 KV cache（attention 的 key/value 状态）占用内存线性增长，成为推理阶段的主要瓶颈。已有工作通过 token eviction / 层级缓存压缩来缓解，但&lt;strong&gt;几乎没有研究在“头（head）级别”上对 KV cache 大小进行差异化分配&lt;/strong&gt;。作者观察到 attention heads 在功能上高度异质（如 retrieval heads、reasoning heads 等），因此提出基于头重要性的 head-level KV cache 压缩方法（HeadKV），并在此基础上提出结合检索与推理能力评估的 HeadKV-R2。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-relative-work&#34;&gt;2. Relative Work&lt;/h2&gt;
&lt;h3 id=&#34;21-attention-heads&#34;&gt;2.1 Attention heads&lt;/h3&gt;
&lt;p&gt;回顾了对多头注意力中 head 功能的研究（Voita et al., Olsson et al., Wu et al., Zheng et al. 等），并指出不同 head 在词法、结构、复制（induction）、检索等方面扮演不同角色。这些观察为按 head 分配 KV cache 提供理论基础。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 QSVD: Efficient Low-rank Approximation for Unified Query-Key-Value Weight Compression in Low-Precision Vision-Language Models - NeurIPS&#39;25 Spotlight</title>
      <link>https://jjl357.github.io/blog/posts/qsvd----efficient-low-rank-approximation-for-unified-query-key-value-weight-compression-in-low-precision-vision-language-models---neurips25-spotlight/</link>
      <pubDate>Thu, 30 Oct 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/qsvd----efficient-low-rank-approximation-for-unified-query-key-value-weight-compression-in-low-precision-vision-language-models---neurips25-spotlight/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/QSVD/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;NeurIPS&#39;25 Spotlight&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/SAI-Lab-NYU/QSVD&#34;&gt;https://github.com/SAI-Lab-NYU/QSVD&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;Vision–Language Models (VLMs) 如 LLaVA、BLIP2 等在图像描述、视觉问答 (VQA) 等任务中表现卓越，但这些模型需要极大的计算与存储开销，尤其在推理时：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;KV Cache 占用高&lt;/strong&gt;：注意力机制中需存储 Key、Value，每层缓存大小随序列长度线性增长。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Q/K/V 投影重复计算&lt;/strong&gt;：三组权重矩阵独立计算，造成算力浪费。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;模型量化困难&lt;/strong&gt;：激活分布存在极端 outliers，难以稳定进行低比特量化。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;QSVD 的目标是&lt;strong&gt;统一地对 Q/K/V 权重矩阵进行低秩近似&lt;/strong&gt;并结合&lt;strong&gt;后训练量化 (PTQ)&lt;/strong&gt;，实现以下三点：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;减少参数量、计算量、缓存占用；&lt;/li&gt;
&lt;li&gt;保持模型性能；&lt;/li&gt;
&lt;li&gt;支持低精度硬件部署。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/QSVD/figure1.png&#34;&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-related-work&#34;&gt;2. Related Work&lt;/h2&gt;
&lt;h3 id=&#34;21-svd-in-large-models&#34;&gt;2.1 SVD in Large Models&lt;/h3&gt;
&lt;p&gt;&lt;strong&gt;Singular Value Decomposition (SVD)&lt;/strong&gt; 是经典的矩阵分解方法。
对于矩阵 ( W \in \mathbb{R}^{m \times n} )，可分解为：&lt;/p&gt;
&lt;p&gt;$$
W = U \Sigma V^T
$$&lt;/p&gt;
&lt;p&gt;其中：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;(U, V) 为正交矩阵；&lt;/li&gt;
&lt;li&gt;(\Sigma) 为奇异值对角矩阵；&lt;/li&gt;
&lt;li&gt;保留前 (r) 个奇异值可得到 rank-(r) 近似：&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;$$
W \approx U_r \Sigma_r V_r^T
$$&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 SPECVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruning - EMNLP&#39;25</title>
      <link>https://jjl357.github.io/blog/posts/specvlm---enhancingspeculative-decoding-of-video-llms-via-verifier-guided-token-pruning---emnlp25/</link>
      <pubDate>Wed, 29 Oct 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/specvlm---enhancingspeculative-decoding-of-video-llms-via-verifier-guided-token-pruning---emnlp25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/SpecVLM/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;EMNLP&#39;25&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/zju-jiyicheng/SpecVLM&#34;&gt;https://github.com/zju-jiyicheng/SpecVLM&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;Video large language models (Vid-LLMs) have shown strong capabilities in understanding video content. However, their reliance on dense video token representations introduces substantial memory and computational overhead in both prefilling and decoding.&lt;/p&gt;
&lt;p&gt;例如：
LLaVA-OneVision (Li et al., 2024a) 将每一帧处理为 196 个视觉 token。若视频为两分钟、60 FPS，则总 token 数量超过 100 万。
如此大量的 video tokens 导致：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;序列长度急剧增加；&lt;/li&gt;
&lt;li&gt;Prefill 阶段的 attention 开销呈平方级增长；&lt;/li&gt;
&lt;li&gt;Decoding 阶段 KV cache 急速膨胀，成为显著的 GPU 内存瓶颈。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;在 autoregressive 生成过程中，每步生成的 KV cache 都必须与模型参数一起加载与存储于 GPU 显存，导致显著的 memory-bound 现象。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 AdaSPEC: Selective Knowledge Distillation for Efficient Speculative Decoders - NeurIPS&#39;25 Spotlight</title>
      <link>https://jjl357.github.io/blog/posts/adaspec---selective-knowledge-distillation-for-efficient-speculative-decoders---neurips25-spotlight/</link>
      <pubDate>Mon, 27 Oct 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/adaspec---selective-knowledge-distillation-for-efficient-speculative-decoders---neurips25-spotlight/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/AdaSpec/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;NeurIPS&#39;25 Spotlight&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/yuezhouhu/adaspec&#34;&gt;https://github.com/yuezhouhu/adaspec&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;my-thoughts&#34;&gt;My Thoughts&lt;/h2&gt;
&lt;p&gt;有个问题在于：对于论文中提到的“hard tokens”，是否能 distill 出一个合适且有用的 draft model？&lt;br&gt;
论文结果显示当前方法对这些 token 效果较差（甚至比 reference model 还差），  因此好奇是否可能需要新的方式来改进这一部分的蒸馏与利用机制。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;Speculative Decoding (SD) accelerates large language model inference by employing a small &lt;strong&gt;draft model&lt;/strong&gt; to generate predictions, which are then verified by a larger &lt;strong&gt;target model&lt;/strong&gt;.&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/AdaSpec/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;SD 的加速性能依赖于 draft 与 target 模型的&lt;strong&gt;对齐度（alignment）&lt;/strong&gt;。传统 Knowledge Distillation (KD) 的目标是最小化 KL 散度，但这与 SD 的最终目标——&lt;strong&gt;最大化 token acceptance rate（被 target 接受的比例）&lt;/strong&gt;——并不一致。&lt;/p&gt;
&lt;p&gt;因此，即使 KD 能使分布接近，也不一定提升 SD 的实际加速效果。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 R-KV: Redundancy-aware KV Cache Compression for Reasoning Models - NeurIPS&#39;25</title>
      <link>https://jjl357.github.io/blog/posts/r-kv---redundancy-aware-kv-cache-compression-for-reasoning-models---neurips25/</link>
      <pubDate>Sat, 25 Oct 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/r-kv---redundancy-aware-kv-cache-compression-for-reasoning-models---neurips25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/RKV/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; NeurIPS&#39;25&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/Zefan-Cai/R-KV&#34;&gt;https://github.com/Zefan-Cai/R-KV&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;my-thoughts&#34;&gt;My Thoughts&lt;/h2&gt;
&lt;p&gt;R-KV 针对previous works在efficient reasoning中由于只依靠attention scores而造成过多地保留了redundant tokens(重复而且对推理没有信息增益的token),R-KV的重点我觉得是增加了Redundancy Estimation via Semantic Similarity来解决这个问题,就Evaluation的结果来说，R-KV的效果是非常好的，即提升了Throughput还maintain了performance，甚至在budget充足的情况下还可以做到提点。&lt;/p&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;Reasoning models have demonstrated impressive performance in self-reflection and chain-of-thought reasoning.
However, they often produce excessively long outputs, leading to prohibitively large key-value (KV) caches during inference.&lt;/p&gt;
&lt;p&gt;For instance, a &lt;strong&gt;DeepSeek-R1-Distill-Llama-8B&lt;/strong&gt; model may generate &lt;strong&gt;32K tokens&lt;/strong&gt; to solve a complex math problem, consuming &lt;strong&gt;15.5GB&lt;/strong&gt; of memory to load model weights and &lt;strong&gt;4.1GB&lt;/strong&gt; to store the KV cache.
This long CoT (chain-of-thought) generation necessitates the development of &lt;strong&gt;KV cache compression&lt;/strong&gt;.&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs - *NeurIPS&#39;25</title>
      <link>https://jjl357.github.io/blog/posts/cdpruner---beyond-attention-or-similarity---maximizing-conditional-diversity-for-token-pruning-in-mllms-neuirips25/</link>
      <pubDate>Fri, 24 Oct 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/cdpruner---beyond-attention-or-similarity---maximizing-conditional-diversity-for-token-pruning-in-mllms-neuirips25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/CDPruner%20-%20Beyond%20Attention%20or%20Similarity%20-/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference&lt;/strong&gt;:  &lt;strong&gt;NeurIPS&#39;25&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;github&lt;/strong&gt;: &lt;a href=&#34;https://github.com/Theia-4869/CDPruner&#34;&gt;https://github.com/Theia-4869/CDPruner&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;my-thoughts&#34;&gt;My Thoughts&lt;/h2&gt;
&lt;p&gt;相较于 Attention-based methods 中的 &lt;strong&gt;attention shift&lt;/strong&gt; 问题和 Similarity-based methods 中忽略了 query 的问题，这篇论文从 &lt;strong&gt;增加 visual tokens 全局多样性（同时保持对 query 的关注）&lt;/strong&gt; 的角度出发，提出了 &lt;strong&gt;CDPruner&lt;/strong&gt;，通过将 token 多样性建模为 DPP（Determinantal Point Process）求解问题，实现了 SOTA 的 pruning 效果。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;motivations&#34;&gt;Motivations&lt;/h2&gt;
&lt;p&gt;在多模态大语言模型（MLLMs）中，视觉 token 的输入长度往往远大于文本 token，从而带来高昂的推理开销。例如：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;LLaVA-1.5 将一张 336×336 图像转换为 &lt;strong&gt;576 tokens&lt;/strong&gt;；&lt;/li&gt;
&lt;li&gt;LLaVA-NeXT 的高分辨率版本在输入加倍的情况下生成 &lt;strong&gt;2,880 tokens&lt;/strong&gt;；&lt;/li&gt;
&lt;li&gt;LongVA 处理 2,000 帧视频时生成超过 &lt;strong&gt;200K visual tokens&lt;/strong&gt;；&lt;/li&gt;
&lt;li&gt;LongVILA 能处理 &lt;strong&gt;6,000 帧&lt;/strong&gt;并产生 &lt;strong&gt;超过 1M visual tokens&lt;/strong&gt;，导致巨大的计算成本。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id=&#34;challenges&#34;&gt;Challenges&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/CDPruner%20-%20Beyond%20Attention%20or%20Similarity%20-/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;现有的视觉 token 剪枝方法主要分为两类：&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 Cache-to-Cache: Direct Semantic Communication Between Large Language Models - ICLR&#39;26</title>
      <link>https://jjl357.github.io/blog/posts/cache-to-cache---direct-semantic-communication-between-large-language-models/</link>
      <pubDate>Wed, 15 Oct 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/cache-to-cache---direct-semantic-communication-between-large-language-models/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/C2C/title.png&#34;&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;github：&lt;a href=&#34;https://github.com/thu-nics/C2C&#34;&gt;https://github.com/thu-nics/C2C&lt;/a&gt;&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;Conference:ICLR&#39;26&lt;/p&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id=&#34;-motivation动机--背景&#34;&gt;💡 Motivation（动机 / 背景）&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/C2C/figure1.png&#34;&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;现状：多-LLM 系统通常通过 &lt;strong&gt;文本（Text-to-Text, T2T）&lt;/strong&gt; 相互通信 —— 一个模型生成文本，另一个模型再读入文本并处理。这种方式存在的信息瓶颈（高维内部表示被压成文本）、歧义性（自然语言本身的模糊性）以及 &lt;strong&gt;串行解码带来的延迟&lt;/strong&gt; 等问题。&lt;/li&gt;
&lt;li&gt;问题：文本通信无法完整保留模型内部的高维语义信息（例如 KV-Cache 中的 rich semantics），同时文本通信需要逐 token 解码，增加通信与推理延迟。&lt;/li&gt;
&lt;li&gt;提出的问题（核心研究问）：&lt;strong&gt;LLM之间能否“超越文本”直接通信？能否通过共享/转换/融合 KV-Cache（key/value cache）来实现更丰富、更低延迟的语义通信？&lt;/strong&gt;（文中以 “Can LLMs communicate beyond text?” 作核心驱动。）&lt;/li&gt;
&lt;li&gt;主要观察驱动：作者的 Oracle 实验显示
(1) 在不扩大序列长度的前提下，丰富 KV-Cache 可以提升回答质量；
(2) 不同模型的 KV-Cache 在表示空间上是可转换/可对齐的（经过训练的简单 MLP 可将一个模型的 KV 映射到另一个模型空间）。
这些观察支持用 KV-Cache 作为通信媒介的可行性。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id=&#34;-challenges挑战&#34;&gt;⚔ Challenges（挑战）&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/C2C/figure2.png&#34;&gt;&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;跨模型的 KV-Cache 表示差异&lt;/strong&gt;：不同模型（不同族、不同规模、不同 tokenizer）在同一输入上产生的 KV-Cache 分布差异显著（t-SNE 可视化）。如何可靠地将一个模型的 cache “投影”到另一个模型的语义空间并被有效利用是挑战。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;对齐问题（token-level &amp;amp; layer-level）&lt;/strong&gt;：不同 tokenizer 产生不同 token 划分，且模型层数不同，必须处理 token 对齐和层对齐问题（避免信息丢失或错位注入）。文中提出了 token 解码再 re-encode 的对齐策略和 “terminal alignment” 层对齐策略。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;避免破坏接收者原有语义&lt;/strong&gt;：直接用别人 cache 覆盖会破坏接收模型已有语义/结构，需设计残差式、可控的融合机制（即 Fuser 的设计）。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;选择性注入（哪些层注入、注入多少）&lt;/strong&gt;：并非所有层注入都有利，单层/多层注入效果差异明显（Appendix 的单层实验显示有层增益也有层下降），因此需要 learnable gate 来选择注入位置与比例。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;效率 / 延迟权衡&lt;/strong&gt;：虽然 C2C 目标是降低延迟，但在实现上要保证投影/融合本身不会引入比文本通信更高的开销（设计轻量 Fuser 并冻结主模型参数以降低训练/推理成本）。&lt;/li&gt;
&lt;/ol&gt;
&lt;hr&gt;
&lt;h2 id=&#34;-observations--analysis&#34;&gt;🔍 Observations / Analysis&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/C2C/f34t12.png&#34;&gt;&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
