<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>MLLM on JJ&#39;s Blog</title>
    <link>https://jjl357.github.io/blog/tags/mllm/</link>
    <description>Recent content in MLLM on JJ&#39;s Blog</description>
    <generator>Hugo -- 0.152.2</generator>
    <language>zh-cn</language>
    <lastBuildDate>Sat, 09 May 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://jjl357.github.io/blog/tags/mllm/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>📝 LEARNPRUNER: RETHINKING ATTENTION-BASED TOKEN PRUNING IN VISION LANGUAGE MODELS  - ICLR&#39;26</title>
      <link>https://jjl357.github.io/blog/posts/learnpruner---rethinking-attention-based-token-pruning-in-vision-language-models---iclr26/</link>
      <pubDate>Sat, 09 May 2026 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/learnpruner---rethinking-attention-based-token-pruning-in-vision-language-models---iclr26/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/LearnPruner/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference: ICLR 2026&lt;/strong&gt;&lt;/p&gt;
&lt;h2 id=&#34;1-abstract-摘要&#34;&gt;1. Abstract (摘要)&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;【核心内容与总结】&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;研究背景：&lt;/strong&gt; 视觉语言模型（VLMs）在视觉理解和推理上表现出色，但由于长视觉序列输入（如高分辨率图像或视频），带来了显著的计算负担。现有的“Token剪枝”技术通过删除不重要的视觉 Token 来缓解该问题，但其核心在于“如何决定 Token 的重要性”，现有方法通常直接依赖于视觉编码器（Vision Encoder）或大语言模型（LLM）的注意力分数（Attention Scores）。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;核心发现：&lt;/strong&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;视觉编码器端：&lt;/strong&gt; 存在“注意力下沉（Attention Sink）”现象，导致其难以有效聚焦于包含丰富信息的前景区域。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;大语言模型端（LLM）：&lt;/strong&gt; 尽管先前的研究表明 LLM 存在对 Token 位置的注意力偏差（位置越后分数越高），但本文发现，&lt;strong&gt;文本到视觉（Text-to-Vision）的注意力机制能够抵抗这种偏差&lt;/strong&gt;，并在 LLM 的**中间层（Middle Layers）**提供了有效的剪枝指导。&lt;/li&gt;
&lt;/ol&gt;
&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;本文贡献：&lt;/strong&gt; 提出了一种&lt;strong&gt;双阶段（Two-stage）Token 剪枝框架 LearnPruner&lt;/strong&gt;。
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;第一阶段：&lt;/strong&gt; 在视觉编码器之后，通过一个&lt;strong&gt;可学习的剪枝模块 (Learnable Pruning Module, LPM)&lt;/strong&gt; 剔除视觉冗余 Token。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;第二阶段：&lt;/strong&gt; 在 LLM 的中间层，保留与任务（Query）相关的 Token。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;实验效果：&lt;/strong&gt; LearnPruner 在仅使用原始视觉 Token 数量 $ 5.5% $ 的情况下，保留了约 $ 95% $ 的原始性能，实现了 $ 3.2 \times $ 的推理加速，展示了良好的精度-效率权衡。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-introduction-引言&#34;&gt;2. Introduction (引言)&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/LearnPruner/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;【背景引入与动机分析】&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;重新审视注意力机制（结合 Figure 1）：&lt;/strong&gt;
&lt;ul&gt;
&lt;li&gt;如图 1 所示，Vision Encoder 使用的 &lt;code&gt;[CLS]&lt;/code&gt; token 注意力虽然能部分覆盖前景目标，但通常会将过多注意力分配给信息量较低的背景区域。这与视觉 Transformer 倾向于在均匀背景区域生成高范数离群 Token（Artifacts）的现象一致。&lt;/li&gt;
&lt;li&gt;在 LLM 端，尽管存在“注意力偏移（Attention Shift，偏向图像下半部分）”现象，但这种偏差主要存在于视觉到视觉（V2V）或全 Token 注意力中。相反，**文本到视觉（Text-to-Vision）**的注意力能够有效地聚焦于与查询（Query）相关的区域。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;现有剪枝方法的局限性：&lt;/strong&gt;
&lt;ul&gt;
&lt;li&gt;(1) 在视觉编码器中，&lt;code&gt;[CLS]&lt;/code&gt; token 无法充分关注显著前景，导致剪枝结果次优（尤其在 Token 预算有限时）。&lt;/li&gt;
&lt;li&gt;(2) 在 LLM 中，文本到视觉的注意力具有抵抗注意力偏移的鲁棒性，能提供可靠指导，但如果将剪枝推迟到中间层进行，前期浅层网络仍需处理完整的视觉序列，导致加速收益有限。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;LearnPruner 解决方案：&lt;/strong&gt;
&lt;ul&gt;
&lt;li&gt;提出双阶段框架顺序移除冗余 Token。首先，采用轻量级可学习模块（取代传统的 &lt;code&gt;[CLS]&lt;/code&gt; 分数）预测 Token 重要性，以消除固有的视觉冗余，并保留少量多样性 Token 提供补充信息。随后，剩余 Token 进入 LLM，在中间层基于文本查询进行第二次剪枝，进一步丢弃与指令无关的 Token。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id=&#34;3-method-方法设计&#34;&gt;3. Method (方法设计)&lt;/h2&gt;
&lt;p&gt;本节首先通过分析验证现有注意力机制在剪枝中的局限性，随后详细阐述 LearnPruner 的算法架构。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 DOCPRUNE: Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning - CVPR&#39;26</title>
      <link>https://jjl357.github.io/blog/posts/docprune---efficient-document-question-answering-via-background-question-and-comprehension-aware-token-pruning---cvpr26/</link>
      <pubDate>Wed, 29 Apr 2026 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/docprune---efficient-document-question-answering-via-background-question-and-comprehension-aware-token-pruning---cvpr26/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/DocPrune/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;CVPR&#39;26&lt;/strong&gt;&lt;/p&gt;
&lt;h2 id=&#34;1-abstract&#34;&gt;1. Abstract&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/DocPrune/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;近年来，视觉-语言大模型（Vision-Language Models, VLMs）在多模态任务中展现了卓越的性能，其中包括文档问答（Document Question Answering, DocQA）。DocQA 任务不仅依赖文本，还需要利用排版、表格和图表中的结构化视觉线索（structured visual cues）。
然而，文档图像与自然图像存在显著差异：&lt;strong&gt;文档图像包含大量的背景区域（large backgrounds），并且支持回答问题的证据极其稀疏（only sparse supporting evidence）&lt;/strong&gt;。这种特性导致在处理尤其是长文档时，计算资源被极其低效地消耗。&lt;/p&gt;
&lt;p&gt;作者观察到，现有的针对自然图像和视频的 Token 减少方法（token-reduction methods，例如 FastV 等），在利用文档独有的“结构稀疏性（structural sparsity）”时显得力不从心。为了解决这一痛点，作者提出了 &lt;strong&gt;DOCPRUNE&lt;/strong&gt;——一个&lt;strong&gt;免训练（training-free）&lt;/strong&gt; 且 &lt;strong&gt;渐进式（progressive）&lt;/strong&gt; 的文档 Token 剪枝框架，专为高效的长文档理解而设计。&lt;/p&gt;
&lt;p&gt;DOCPRUNE 的核心优势在于：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;它只保留对当前任务至关重要的 Token，同时剔除不必要的 Token（如纯背景或与问题无关的 Token）。&lt;/li&gt;
&lt;li&gt;它能够根据模型内部的“理解力水平（level of comprehension）”，自动选择在哪一层网络触发 Token 剪枝。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;最终，在 M3DocRAG 基准上的实验表明，DOCPRUNE 在 Vision Encoder（视觉编码器）和 LLM Decoder（大语言模型解码器）中分别将吞吐量（throughput）提升了 &lt;strong&gt;3.0倍&lt;/strong&gt; 和 &lt;strong&gt;3.3倍&lt;/strong&gt;，同时 F1 分数还提升了 &lt;strong&gt;+1.0&lt;/strong&gt;。实现了在&lt;strong&gt;不进行任何额外训练（without any additional training）&lt;/strong&gt; 的前提下，精度与效率的提升。&lt;/p&gt;
&lt;h2 id=&#34;2-introduction&#34;&gt;2. Introduction&lt;/h2&gt;
&lt;p&gt;在文档理解中，长文档通常包含数百页，但有用的内容（文本、表格、图表等）却散布在巨大的背景中。Transformer 架构处理单页就会产生数千个视觉 Token，计算成本极其高昂。&lt;/p&gt;
&lt;p&gt;传统的降低成本的方法是 Token Reduction（如针对自然图像或视频的合并和剪枝），其核心假设是“相邻 patch 通常包含相似的视觉信息”。然而，这一假设在文档中是失效的：&lt;strong&gt;文档排版（如文本行、表格）具有极其严格的空间组织规律，即使是微小的 Token 删减也极易破坏文本连贯性或丢失重要的排版线索（destroy important layout cues）。&lt;/strong&gt; 因此，基于视觉冗余的传统方法在文档上性能下降严重。
另外，现有的剪枝方法往往通过固定的启发式规则（fixed heuristics）来决定剪枝层，忽略了模型理解力在各层之间的演变（neglecting how comprehension evolves across layers）。这种忽略导致剪枝可能发生得过早或不一致，造成性能不稳定及效率提升有限。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 Empirical Recipes for Efficient and Compact Vision-Language Models</title>
      <link>https://jjl357.github.io/blog/posts/empirical-recipes-for-efficient-and-compact-vision-language-models/</link>
      <pubDate>Tue, 24 Mar 2026 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/empirical-recipes-for-efficient-and-compact-vision-language-models/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/ARGUSVLM/title.png&#34;&gt;&lt;/p&gt;
&lt;h2 id=&#34;1-abstract&#34;&gt;1. Abstract&lt;/h2&gt;
&lt;p&gt;在资源受限的环境中部署视觉语言模型 (VLMs) 要求低延迟和高吞吐量。然而，现有的轻量级 (Compact) VLMs 往往无法达到其参数量缩减所应带来的推理加速。为了解释这一现象，作者进行了端到端的效率分析，并系统地剖析了推理过程以识别主要瓶颈。&lt;/p&gt;
&lt;p&gt;基于这些发现，作者为轻量级 VLMs 量身定制了一系列优化方案 (Recipes)，在保持准确性的同时大幅降低了延迟。这些技术将 InternVL3-2B 的首字生成时间 (Time To First Token, TTFT) 降低了 53%，在 SmolVLM-256M 上降低了 93%。作者的优化方案广泛适用于各种 VLM 架构和主流服务框架。&lt;/p&gt;
&lt;p&gt;此外，作者研究了如何扩展轻量级 VLM 以支持结构化感知输出，并推出了 &lt;strong&gt;ARGUSVLM&lt;/strong&gt; 模型系列。ARGUSVLM 在多个基准测试中表现强劲，同时保持了紧凑且高效的设计。&lt;/p&gt;
&lt;h2 id=&#34;2-introduction&#34;&gt;2. Introduction&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/ARGUSVLM/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;尽管紧凑型模型参数量更小，但它们在端到端效率上的表现往往不如预期。例如，SmolVLM-256M 的参数量远小于 InternVL3-8B，但其 TTFT (344.7 ms) 却比后者 (177.4 ms) 更长。&lt;/p&gt;
&lt;p&gt;通过系统性分析，作者发现：在轻量级模型中，以往被忽视的 &lt;strong&gt;CPU 端操作&lt;/strong&gt;（如图像预处理、文本分词）往往主导了整体延迟。相比之下，得益于 FlashAttention、CUDA Graphs 和算子融合 (Kernel Fusion) 等技术，GPU 端的计算占比反而较低。&lt;/p&gt;
&lt;p&gt;本研究通过针对性的 CPU 端优化，将 InternVL3-2B 的 TTFT 从 124.0 ms 降至 57.7 ms，将 SmolVLM-256M 的 TTFT 从 344.7 ms 降至 22.8 ms (如图 1 所示)。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 Variation-aware Vision Token Dropping for Faster Large Vision-Language Models - CVPR&#39;26</title>
      <link>https://jjl357.github.io/blog/posts/variation-aware-vision-token-dropping-for-faster-large-vision-language-models---cvpr26/</link>
      <pubDate>Mon, 23 Mar 2026 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/variation-aware-vision-token-dropping-for-faster-large-vision-language-models---cvpr26/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/V2drop/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;CVPR&#39;26&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/xuyang-liu16/V2Drop&#34;&gt;https://github.com/xuyang-liu16/V2Drop&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;abstract&#34;&gt;Abstract&lt;/h2&gt;
&lt;p&gt;Large vision-language models（LVLMs）在多模态理解任务上表现强大，但随着高分辨率图像与长视频理解需求不断增加，视觉 token 数量急剧上升，从而显著降低推理效率。Token compression 提供了一条直接路径：在不改变模型结构的前提下减少待处理 token 数，从而提升计算效率。作者通过系统分析指出，现有 inner-LLM token compression 方法主要存在两个关键问题：&lt;strong&gt;positional bias&lt;/strong&gt; 和 &lt;strong&gt;incompatibility with efficient operators&lt;/strong&gt;，这两点严重阻碍了它们在 LVLM 加速中的实际部署。本文提出了&lt;strong&gt;首个从动态 token variation 视角出发的方法&lt;/strong&gt;，发现 LLM 内部的视觉 token variation 具有 task-agnostic 特性。基于这一观察，作者提出 &lt;strong&gt;Variation-aware Vision Token Dropping（V2Drop）&lt;/strong&gt;，在 LVLM 推理过程中逐步移除 variation 最小的视觉 token，从而提升计算效率。大量实验表明，V2Drop 在图像理解任务和视频理解任务上分别保留了原始性能的 &lt;strong&gt;94.0%&lt;/strong&gt; 和 &lt;strong&gt;98.6%&lt;/strong&gt;，同时将 LLM generation latency 分别降低了 &lt;strong&gt;31.5%&lt;/strong&gt; 和 &lt;strong&gt;74.2%&lt;/strong&gt;。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-introduction&#34;&gt;1. Introduction&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/V2drop/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/V2drop/figure2.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/V2drop/figure3.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;Large vision-language models（LVLMs）在视觉理解与推理任务上表现突出，能够覆盖多种 vision-language 任务；但高分辨率图像理解和长视频理解会引入大量视觉 token，导致推理开销快速增长并限制实际部署。作者指出，随着输入分辨率和视频长度的提升，视觉 token 的数量增加会带来明显的计算复杂度压力，尤其是在 LLM 侧的 prefilling 和 generation 阶段。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 PRUNE REDUNDANCY, PRESERVE ESSENCE: VISION TOKEN COMPRESSION IN VLMS VIA SYNERGISTIC IMPORTANCE–DIVERSITY - ICLR&#39;26</title>
      <link>https://jjl357.github.io/blog/posts/prune-redundancy-preserve-essence---vision-token-compression-in-vlms-via-syner-gistic-importance-diversity---iclr26/</link>
      <pubDate>Sun, 01 Mar 2026 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/prune-redundancy-preserve-essence---vision-token-compression-in-vlms-via-syner-gistic-importance-diversity---iclr26/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/PruneSID/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference&lt;/strong&gt;: &lt;strong&gt;ICLR&#39;26&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github&lt;/strong&gt;: &lt;a href=&#34;https://github.com/ZhengyaoFang/PruneSID&#34;&gt;https://github.com/ZhengyaoFang/PruneSID&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-abstract&#34;&gt;1. Abstract&lt;/h2&gt;
&lt;p&gt;视觉-语言模型（VLMs）因产生大量视觉 token 导致计算效率低下。先前研究指出大比例 visual tokens 存在冗余，但现有压缩方法难以在“重要性（importance）保存”和“信息多样性（diversity）保留”之间取得良好平衡。为了解决该问题，论文提出 &lt;strong&gt;PRUNESID&lt;/strong&gt;：一种&lt;strong&gt;无训练（training-free）&lt;/strong&gt;、&lt;strong&gt;协同重要性—多样性（Synergistic Importance–Diversity）&lt;/strong&gt; 的 two-stage 框架，包含：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;PSCA（Principal Semantic Components Analysis）&lt;/strong&gt;：将 tokens 按语义主方向聚类成多个语义相干组（semantic groups），确保概念覆盖。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;组内 NMS（Intra-group Non-Maximum Suppression）&lt;/strong&gt;：在每组内按相似度动态阈值去重，保留最具代表性的 token。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;此外，PRUNESID 引入 &lt;strong&gt;信息感知动态压缩率（information-aware dynamic compression ratio）&lt;/strong&gt;，根据图像复杂度动态分配 token 预算，从而在多样化场景上实现更优的平均信息保留。大量实验表明：在 LLaVA-1.5 上仅保留 $11.1%$ token（64 tokens）时可达 $96.3%$ 精度；在极端压缩（$5.6%$）下在 LLaVA-NeXT 仍达 $92.8%$，相较此前方法有显著提升，并在 prefilling 时间上有 $7.8\times$ 的加速。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-introduction&#34;&gt;2. Introduction&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/PruneSID/figure1.png&#34;&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;现状：主流 VLM（如 LLaVA-1.5 与 LLaVA-NeXT）通常为每张图像产生数百到几千 visual tokens（例如 576 或 2880），远超捕捉图像语义所需。相关研究表明约 $70%$ tokens 可丢弃而对准确率影响甚微。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;两类现有方案：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Attention-guided selection&lt;/strong&gt;：依据 attention score 保留高 attention token（优点：保留局部显著性；缺点：忽视背景与多样性，可能重保重复区域）。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Duplication-aware（相似性/去重）方法&lt;/strong&gt;：依据相似性去重，提升多样性，但可能丢弃语义重要但相似的高 attention token。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;本文关键观点：设计一个 &lt;strong&gt;组引导（group-guided）&lt;/strong&gt; 的训练免费方法，使得“重要性”和“多样性”得到协同优化。通过 PSCA 先将 tokens 按语义方向分组，再在组内用 NMS 去冗余，同时用信息感知机制在图像间自动分配 token 预算，从而在极端压缩下仍保留丰富语义。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 MMTok: Multimodal Coverage Maximization for Efficient Inference of VLMs - ICLR&#39;26</title>
      <link>https://jjl357.github.io/blog/posts/mmtok---multimodal-coverage-maximization-for-efficient-inference-of-vlms/</link>
      <pubDate>Sat, 28 Feb 2026 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/mmtok---multimodal-coverage-maximization-for-efficient-inference-of-vlms/</guid>
      <description>&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;ICLR 2026&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Note:&lt;/strong&gt; &lt;a href=&#34;https://zhuanlan.zhihu.com/p/1944299907109348831&#34;&gt;https://zhuanlan.zhihu.com/p/1944299907109348831&lt;/a&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/Ironieser/MMTok&#34;&gt;https://github.com/Ironieser/MMTok&lt;/a&gt;&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 ONE PATCH DOESN’T FIT ALL: ADAPTIVE PATCHING FOR NATIVE-RESOLUTION MULTIMODAL LARGE LANGUAGE MODELS - ICLR&#39;26</title>
      <link>https://jjl357.github.io/blog/posts/one-patch-doesnt-fit-all----adaptive-patching-for-native-resolution-multimodal-large-language-models---iclr26/</link>
      <pubDate>Mon, 02 Feb 2026 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/one-patch-doesnt-fit-all----adaptive-patching-for-native-resolution-multimodal-large-language-models---iclr26/</guid>
      <description>&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; ICLR&#39;26&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-abstract&#34;&gt;1. Abstract&lt;/h2&gt;
&lt;p&gt;现实世界中的视觉信号在分辨率上天然具有高度的多样性，因此，让多模态大语言模型（Multimodal Large Language Models, MLLMs）具备&lt;strong&gt;原生分辨率（native-resolution）感知能力&lt;/strong&gt;是一个自然且必要的目标。原则上，对于一般且直观的多模态理解任务，低分辨率图像往往已经足够；但对于包含大量细节的信息密集型图像（如文档、表格、图表等），则必须保留高分辨率输入，否则简单的缩放操作会不可避免地导致关键信息丢失。&lt;/p&gt;
&lt;p&gt;近期的研究通过 &lt;strong&gt;sequence packing&lt;/strong&gt; 技术，使模型能够处理任意分辨率和任意宽高比的图像。然而，尽管这些方法在形式上支持 Any-Resolution（AnyRes）输入，模型在低分辨率和高分辨率下的性能仍然明显下降，同时高分辨率输入还会带来显著的计算开销。&lt;/p&gt;
&lt;p&gt;本文提出一个核心观点：&lt;strong&gt;“单一固定 patch size”是导致上述问题的根本原因&lt;/strong&gt;。当图像分辨率或信息密度发生变化时，固定 patch size 在建模上天然是次优的。&lt;/p&gt;
&lt;p&gt;为此，论文提出 &lt;strong&gt;Adaptive Patching（AdaPatch）&lt;/strong&gt;：一种&lt;strong&gt;无需额外训练&lt;/strong&gt;、可直接插入到现有固定 patch MLLMs 中的策略。AdaPatch 根据图像的&lt;strong&gt;原生分辨率&lt;/strong&gt;和&lt;strong&gt;信息密度&lt;/strong&gt;动态调整 patch size，从而在不同类型、不同分辨率的图像上取得更稳定、更优的性能。实验表明，该方法在不增加训练成本的前提下，显著提升了 AnyRes 场景下的准确率和稳定性；此外，论文还提出了一种&lt;strong&gt;训练版方法&lt;/strong&gt;，进一步增强模型对动态 patch size 的适应能力。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-introduction&#34;&gt;2. Introduction&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/AdaPatch/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;早期的多模态大模型（如 LLaVA、InternVL 系列）通常依赖&lt;strong&gt;固定分辨率的视觉编码器&lt;/strong&gt;：要么将输入图像统一 resize 到某个标准尺寸，要么先切分成多个 tile 再分别处理。这类预处理不可避免地会改变原始视觉内容，对于需要保留细粒度细节或整体结构的任务（例如图表、示意图）尤其不利。&lt;/p&gt;
&lt;p&gt;受 NaViT 启发，近期工作开始直接保留图像的&lt;strong&gt;原生分辨率&lt;/strong&gt;，并将图像划分为固定大小的 non-overlapping patches，使 token 数量随分辨率线性增长。随后通过 &lt;strong&gt;sequence packing&lt;/strong&gt; 将多张图像的 token 序列拼接为一个长序列，并通过 block-diagonal attention mask 保证不同图像之间不互相注意。Qwen2.5-VL、Ovis2.5、Kimi-VL 等 SOTA 模型均采用了这一范式，并宣称支持任意分辨率输入。&lt;/p&gt;
&lt;p&gt;然而，本文通过系统性实验指出：&lt;strong&gt;当前 AnyRes 设计并未真正实现“原生分辨率鲁棒性”&lt;/strong&gt;。在跨越大范围像素预算的测试中，模型性能在不同分辨率区间显著波动，且在极低或极高分辨率下普遍退化。&lt;/p&gt;
&lt;p&gt;论文进一步分析发现，问题的根源在于：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;在&lt;strong&gt;低分辨率或高信息密度图像&lt;/strong&gt;中，大 patch 会过于粗糙，无法捕获细节；&lt;/li&gt;
&lt;li&gt;在&lt;strong&gt;高分辨率或低信息密度图像&lt;/strong&gt;中，小 patch 过于局部，导致全局上下文建模能力不足。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;因此，&lt;strong&gt;patch size 与分辨率、信息密度之间的失配&lt;/strong&gt;，是 AnyRes 性能不稳定的主要架构性原因。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 Matryoshka Multimodal Models - ICLR&#39;25</title>
      <link>https://jjl357.github.io/blog/posts/matryoshka-multimodal-models---iclr25/</link>
      <pubDate>Fri, 30 Jan 2026 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/matryoshka-multimodal-models---iclr25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/M3/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;ICLR&#39;25&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/mu-cai/matryoshka-mm&#34;&gt;https://github.com/mu-cai/matryoshka-mm&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-introduction&#34;&gt;1. Introduction&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/M3/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;Large Multimodal Models (LMMs) such as LLaVA have shown strong performance in visual-linguistic reasoning. These models first embed images into a fixed large number of visual tokens and then feed them into a Large Language Model (LLM). However, this design causes an excessive number of tokens for dense visual scenarios such as high-resolution images and videos, leading to great inefficiency.&lt;/p&gt;
&lt;p&gt;While token pruning and merging methods exist, they produce a single-length output for each image and cannot afford flexibility in trading off information density v.s. efficiency. 受到俄罗斯套娃（Matryoshka Dolls）概念的启发，本文提出 &lt;strong&gt;Matryoshka Multimodal Models (M³)&lt;/strong&gt;。该模型学习将视觉内容表示为&lt;strong&gt;嵌套的视觉 Token 集合&lt;/strong&gt;（nested sets of visual tokens），从而捕捉从粗糙到精细（coarse-to-fine）的多尺度粒度信息。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 Video Compression Commander: Plug-and-Play Inference Acceleration for Video Large Language Models - EMNLP&#39;25</title>
      <link>https://jjl357.github.io/blog/posts/video-compression-commander---plug-and-play-inference-acceleration-for-video-large-language-models---emnlp25/</link>
      <pubDate>Thu, 22 Jan 2026 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/video-compression-commander---plug-and-play-inference-acceleration-for-video-large-language-models---emnlp25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/VidCom2/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;EMNLP&#39;25&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/xuyang-liu16/VidCom2&#34;&gt;https://github.com/xuyang-liu16/VidCom2&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-introduction&#34;&gt;1. Introduction&lt;/h2&gt;
&lt;p&gt;视频大语言模型（VideoLLMs）在视频理解任务（如视频问答、视频推理、时序理解等）上表现出色，但其推理效率受到&lt;strong&gt;视觉 token 数量过多&lt;/strong&gt;的严重制约。具体而言，当前主流 VideoLLM 通常将视频拆解为多帧图像，每一帧再由 ViT 等视觉编码器转化为大量 patch-level tokens，这些视觉 tokens 会与文本 tokens 一同送入 LLM 进行跨模态建模。&lt;/p&gt;
&lt;p&gt;由于 Transformer 自注意力的复杂度为 $O(N^2)$，当视频帧数 $T$ 和每帧 token 数 $M$ 较大时，总 token 数 $N = T \times M$ 会迅速膨胀，导致推理延迟和显存消耗急剧上升。这一问题在&lt;strong&gt;长视频理解&lt;/strong&gt;和&lt;strong&gt;高分辨率视频&lt;/strong&gt;场景中尤为突出。&lt;/p&gt;
&lt;p&gt;作者系统性地分析了现有 VideoLLM token compression 方法，发现其普遍存在两个关键问题：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;忽视帧间差异性（Frame-level Distinctiveness）&lt;/strong&gt;
多数方法对所有帧采用统一的压缩比例，默认每一帧“信息密度相同”，从而容易在关键帧上丢失重要视觉线索。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;工程实现受限（Implementation Constraints）&lt;/strong&gt;
一些方法依赖特定模型结构（如 ViT 的 [CLS] token）或显式 attention 权重，导致难以兼容现代视觉编码器（如 SigLIP）或高效注意力算子（如 FlashAttention）。&lt;/p&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;为此，作者总结出 &lt;strong&gt;三条 VideoLLM token compression 的设计原则&lt;/strong&gt;，并提出一种**即插即用（plug-and-play）**的推理加速框架 &lt;strong&gt;Video Compression Commander（VidCom2）&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;VidCom2 的核心思想是：&lt;strong&gt;量化每一帧在整个视频中的“独特性（uniqueness）”&lt;/strong&gt;，并据此动态调整不同帧的压缩强度，从而在保证信息保真的前提下最大化冗余削减。&lt;/p&gt;
&lt;p&gt;大量实验表明，VidCom2 在多种 VideoLLM 架构和 benchmark 上均取得了更优的性能-效率权衡。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 VLCACHE: Computing 2% Vision Tokens and Reusing 98% for Vision–Language Inference</title>
      <link>https://jjl357.github.io/blog/posts/vlcache---computing-2vision-tokens-and-reusing-98-for-visionlanguage-inference/</link>
      <pubDate>Tue, 06 Jan 2026 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/vlcache---computing-2vision-tokens-and-reusing-98-for-visionlanguage-inference/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/VLCACHE/title.png&#34;&gt;&lt;/p&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;前缀缓存（Prefix Cache）的局限性&lt;/strong&gt;：目前的 KV Cache 重用机制（如前缀缓存）要求新请求的初始片段（即前缀）与已有缓存序列&lt;strong&gt;精确匹配&lt;/strong&gt;。这种严格的匹配标准虽然保证了输出准确性，但在多模态场景下引入了严重的效率瓶颈：即便&lt;strong&gt;图像完全相同&lt;/strong&gt;，只要系统提示词或用户问题不同，也无法触发缓存命中。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;位置无关重用的必要性&lt;/strong&gt;：如果允许在&lt;strong&gt;不同位置&lt;/strong&gt;重用预缓存的 KV Cache，将显著提升多模态推理的灵活性。然而，位置变化会破坏因果注意力中的位置一致性，因此为了保持输出准确性，&lt;strong&gt;必须对部分 token 进行重新计算（recompute）&lt;/strong&gt;。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;现有启发式方法的缺陷&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;CacheBlend [14]&lt;/strong&gt;：通过比较&lt;strong&gt;前三层&lt;/strong&gt;的 KV Cache 距离来识别“最不可靠”的 token 并重计算。但该方法仅依赖&lt;strong&gt;浅层局部信息&lt;/strong&gt;，无法刻画 token 在整个 Transformer 堆栈中的&lt;strong&gt;全局重要性&lt;/strong&gt;。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;EPIC [6] 与 MPIC [16]&lt;/strong&gt;：以 chunk 为单位，重计算每个数据块的&lt;strong&gt;初始 token&lt;/strong&gt;。其中 MPIC 假设存在“注意力汇聚（attention sink）”效应，但该假设在视觉 token 上并不成立，因为视觉 token 不像系统提示词那样在注意力中占据主导地位。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;KVShare [13]&lt;/strong&gt;：基于注意力分布偏差选择性重计算关键 token，但仍然缺乏对&lt;strong&gt;重用误差如何在解码阶段传播&lt;/strong&gt;的系统性分析。&lt;/p&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;缺乏系统性研究&lt;/strong&gt;：上述方法普遍缺少以下两点：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;不同 Transformer 层对最终输出贡献差异的系统研究；&lt;/li&gt;
&lt;li&gt;重用误差在自回归解码过程中&lt;strong&gt;跨 token、跨层传播机制&lt;/strong&gt;的深入分析。&lt;/li&gt;
&lt;/ol&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-contribution&#34;&gt;2. Contribution&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;识别累积重用误差效应&lt;/strong&gt;：系统性分析了多模态大语言模型（VLM）中 KV Cache 重用所引入的误差，提出并验证了 &lt;strong&gt;累积重用误差效应（Cumulative Reuse Error Effect）&lt;/strong&gt;，即早期 token 的重用误差会在后续生成过程中不断传播和放大。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;层级重要性差异分析&lt;/strong&gt;：通过实验发现，不同 Transformer 层对最终模型输出的影响高度不均衡，并首次从实证角度揭示了 VLM 中的&lt;strong&gt;层级重要性多样性&lt;/strong&gt;。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;提出 VLCache 框架&lt;/strong&gt;：设计了一个端到端的视觉 token KV Cache 重用流水线，兼顾算法有效性与系统可落地性。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 Accelerating Streaming Video Large Language Models via Hierarchical Token Compression - CVPR&#39;26</title>
      <link>https://jjl357.github.io/blog/posts/accelerating-streaming-video-large-language-models-via--hierarchical-token-compression/</link>
      <pubDate>Sat, 27 Dec 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/accelerating-streaming-video-large-language-models-via--hierarchical-token-compression/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/STC/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/lern-to-write/STC&#34;&gt;https://github.com/lern-to-write/STC&lt;/a&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference: CVPR&#39;26&lt;/strong&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;最近，随着直播体育解说和增强现实眼镜等新兴应用的出现，对&lt;strong&gt;流式视频理解 (Streaming Video Understanding, SVU)&lt;/strong&gt; 的需求日益迫切。在这些场景中，模型必须持续处理输入的视频帧，并以极低的延迟生成响应 。然而，现有 VideoLLM 在处理来自连续视频流的高密度视觉标记（tokens）时，计算成本极高，导致其在延迟敏感的应用中难以实时部署 。&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/STC/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;通过图 1 的推理时间分解可以发现：视频理解与图像理解存在显著差异 。在 Qwen2-VL 和 LLaVA-OV 等模型中，ViT 编码的计算成本通常比图像理解高出 2-3 倍，成为主要的延迟瓶颈 。例如，当 LLaVA-OV 处理 32 帧视频时，会有  个视觉标记输入 LLM，是普通图像任务（约 1,900 个标记）的三倍以上 。&lt;/p&gt;
&lt;p&gt;针对流式场景，本研究通过实证分析揭示了两个关键特征：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;ViT 编码中的时间冗余 (Temporal Redundancy)&lt;/strong&gt;：流式视频需要更密集的帧采样，导致相邻帧之间存在大量重复内容 。实验显示，在 ViT 的深层（如 Layer 20），相邻帧特征的平均余弦相似度在流式设置下高达 0.85，而离线设置仅为 0.60 。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;不完整的视频与未知的指令 (Incomplete Video and Unknown Instructions)&lt;/strong&gt;：流式场景下，模型无法预先获取完整视频或用户指令，这使得依赖全局视频特征或指令感知的压缩策略（如 Instruction-aware pruning）失效，因为查询通常在视频帧处理完后才到达 。&lt;/p&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;因此，迫切需要一种能够**因果式（causally）**运行、利用编码过程中的时间冗余且不依赖全局上下文的压缩方法 。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-contribution&#34;&gt;2. Contribution&lt;/h2&gt;
&lt;p&gt;基于上述分析，我们提出了 &lt;strong&gt;Streaming Token Compression (STC)&lt;/strong&gt;，这是一个即插即用的分层加速框架，旨在共同优化 ViT 编码和 LLM 预填充（prefilling）阶段 。其核心贡献包括：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;流式场景的实证分析&lt;/strong&gt;：分析了现有压缩方法在 SVU 中的局限性，强调了因果压缩的必要性，即在不依赖未来指令的情况下降低 ViT 成本 。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 HyperVL: An Efficient and Dynamic Multimodal Large Language Model for Edge Devices</title>
      <link>https://jjl357.github.io/blog/posts/hypervl---an-efficient-and-dynamic-multimodal-large-language-model-for-edge-devices/</link>
      <pubDate>Tue, 23 Dec 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/hypervl---an-efficient-and-dynamic-multimodal-large-language-model-for-edge-devices/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/HyperVL/title.png&#34;&gt;&lt;/p&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/HyperVL/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;随着数据质量的提高和模型架构设计的成熟，LLM 的 &lt;strong&gt;Densing Law&lt;/strong&gt; [Yao et al., 2024] 不断提升，使得小参数模型也能获得强大的通用能力。这一趋势为大模型的端侧部署（On-device deployment）提供了实际的基础。最近，紧凑型 MLLM（如 Qwen3 VL 2B [Bai et al., 2025a] 和 InternVL 2B [Zhu et al., 2025, Wang et al., 2025]）展示了极具竞争力的性能。&lt;/p&gt;
&lt;p&gt;然而，一个关键的瓶颈依然存在：这些模型通常依赖标准的 &lt;strong&gt;Vision Transformer (ViT)&lt;/strong&gt; 编码器，而 ViT 具有二次复杂度（Quadratic Complexity）。当处理高分辨率输入（这在用户界面 UI 理解和 grounding 等典型端侧场景中至关重要）时，它们在端侧部署期间容易产生高内存消耗和明显的推理延迟。为了缓解这一问题，一些尝试（如 Apple 的 FastVLM [Vasu et al., 2025]）通常诉诸于通过激进的卷积下采样（Convolutional Downsampling）来减少视觉 token，但这往往以性能大幅下降为代价。&lt;/p&gt;
&lt;h2 id=&#34;2-conclusion&#34;&gt;2. Conclusion&lt;/h2&gt;
&lt;p&gt;为此，作者推出了 &lt;strong&gt;HyperVL&lt;/strong&gt;，这是一种专为端侧推理量身定制的高效多模态大语言模型。&lt;/p&gt;
&lt;p&gt;具体而言，作者采用了&lt;strong&gt;图像切片策略（Image-tiling strategy）&lt;/strong&gt;，将高分辨率输入划分为可以独立编码的小块，从而降低峰值内存消耗。在此基础上，作者通过两项关键技术进一步降低端侧推理成本：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;视觉分辨率压缩器 (Visual Resolution Compressor, VRC)&lt;/strong&gt;：自适应地根据图像信息密度预测最佳视觉编码分辨率，避免不必要的高分辨率计算，降低视觉编码延迟。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;双重一致性学习 (Dual Consistency Learning, DCL)&lt;/strong&gt;：在不同容量的 ViT 编码器上应用 DCL，使它们能够无缝连接到共享的 LLM，从而根据任务类型、延迟预算或设备计算能力，在轻量级和高精度视觉路径之间实现动态切换。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;strong&gt;总结作者的贡献如下：&lt;/strong&gt;&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning - NeurIPS&#39;25</title>
      <link>https://jjl357.github.io/blog/posts/visionthink---smart-and-efficient-vision-language-model-via-reinforcement-learning---neurips25/</link>
      <pubDate>Sun, 21 Dec 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/visionthink---smart-and-efficient-vision-language-model-via-reinforcement-learning---neurips25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/VisionThink/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;NeurIPS&#39;25&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/dvlab-research/VisionThink&#34;&gt;https://github.com/dvlab-research/VisionThink&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/VisionThink/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;最近，视觉语言模型（VLMs） 通过将视觉标记（visual tokens）投影并适配到大语言模型（LLM）空间中，在通用视觉问答（General VQA）和各种现实场景中取得了显著成就。然而，随着 VLM 性能的不断提升，视觉标记的消耗呈指数级增长。例如，一张使用智能手机拍摄的 $2048 \times 1024$ 照片在 LLaVA 1.5 中需要 576 个视觉标记，而现在在 Qwen2.5-VL 中则需要 2,678 个。因此，避免过度使用视觉标记已成为当务之急。&lt;/p&gt;
&lt;p&gt;目前已经有大量关于视觉标记压缩的研究被提出。大多数方法使用预定义的阈值来修剪或合并固定数量的视觉标记。然而，不同问题和图像的冗余程度各不相同，这引发了一个自然的问题：作者真的应该在所有场景中应用统一的标记压缩比吗？为了回答这个问题，作者简单地通过降低图像分辨率来减少视觉标记的数量，并评估了 Qwen2.5-VL 在多个基准测试上的性能。如 Fig. 1 左侧所示，作者发现对于大多数现实场景（如 MME 和 RealWorldQA），即使将图像分辨率降低四倍（显著减少 75% 的视觉标记），对模型性能的影响也微乎其微。然而，如 Fig. 1 右侧所示，对于 ChartQA 和 OCRBench 等需要细节理解和 OCR 相关能力的基准测试，减少视觉标记会导致性能大幅下降。&lt;/p&gt;
&lt;p&gt;基于这些观察，作者发现大多数现实世界的问题并不需要带有长视觉标记的高分辨率图像，而一小部分 OCR 相关任务对这类细节输入的要求非常高 。因此，如果作者能够动态区分哪些样本需要高分辨率处理，哪些不需要，那么效率优化将具有巨大的潜力 。&lt;/p&gt;
&lt;p&gt;在本文中，作者提出了 &lt;strong&gt;VisionThink&lt;/strong&gt;，这是一种利用模型推理能力的新型高效 VLM 范式 。与之前处理全图后丢弃冗余标记的方法不同，VisionThink 直接输入压缩后的视觉标记，并允许模型在需要时请求原始高分辨率图像 。这使得在大多数现实场景中能够进行更高效的推理，同时保留在 OCR 相关任务上的性能 。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-contribution&#34;&gt;2. Contribution&lt;/h2&gt;
&lt;p&gt;在本文中，作者提出了 VisionThink，这是一种新的高效 VLM 范式，它利用了模型的推理能力 。与之前处理完整图像然后丢弃冗余标记的方法不同，VisionThink 直接输入压缩后的视觉标记，并允许模型在需要时请求原始高分辨率图像 。这使得在大多数现实场景中能够实现更高效的推理，同时在 OCR 相关任务上保持性能 。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 Empower Vision Applications with LoRA LMM - Eurosys&#39;25</title>
      <link>https://jjl357.github.io/blog/posts/empower-vision-applications-with-lora-lmm---eurosys25/</link>
      <pubDate>Mon, 15 Dec 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/empower-vision-applications-with-lora-lmm---eurosys25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/VaLora/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;Eurosys&#39;25&lt;/strong&gt;&lt;/p&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;尽管 LMMs (Large Multimodal Models) 在通用视觉任务上表现出色，但在应用于需要&lt;strong&gt;领域特定知识 (Domain-specific knowledge)&lt;/strong&gt; 的实际场景时，其表现往往不如人意，类似于早期 LLM 的幻觉问题。&lt;/p&gt;
&lt;p&gt;虽然 RAG (Retrieval-Augmented Generation) 是 LLM 中常用的补充知识的方法，但对于&lt;strong&gt;时间敏感的视觉应用 (Time-sensitive vision applications)&lt;/strong&gt; 来说并不适用：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;RAG 的检索过程和附加的长上下文请求会导致超过 10 倍的响应延迟。&lt;/li&gt;
&lt;li&gt;相比之下，&lt;strong&gt;LoRA (Low-Rank Adaptation)&lt;/strong&gt; 提供了一种更有前景的方案。它通过在运行时将微调后的 Adapter 合并到 LMM 中，能够高效地生成高质量且一致的领域特定响应，且没有额外的推理开销。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;然而，现有的 LoRA 服务系统（如 Punica, S-LoRA, dLoRA）主要针对纯文本 LLM 优化，无法满足视觉应用的高效性和多样化需求：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;Unmerged Inference (不合并推理)&lt;/strong&gt;：为了支持多 Adapter 并行，现有系统通常采用不合并推理模式。虽然这解决了并发问题，但额外引入的计算开销导致了极高的延迟。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Vision Workloads (视觉负载)&lt;/strong&gt;：视觉任务通常包含大量的视觉 Token 处理，对计算资源的消耗与纯文本不同，现有系统的 Batching 策略效率低下。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;strong&gt;Research Question:&lt;/strong&gt; 我们能否利用 LoRA LMM 来丰富视觉应用，同时满足其严格的性能要求？
作者认为答案是肯定的，但必须解决 Capacity、Batching Efficiency 和 Orchestration Flexibility 三大挑战。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 Venus: An Efficient Edge Memory-and-Retrieval System for VLM-based Online Video Understanding - INFOCOM&#39;26</title>
      <link>https://jjl357.github.io/blog/posts/venus---an-efficient-edge-memory-and-retrieval-system-for-vlm-based-online-video-understanding---infocom26/</link>
      <pubDate>Fri, 12 Dec 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/venus---an-efficient-edge-memory-and-retrieval-system-for-vlm-based-online-video-understanding---infocom26/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/Venus/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;INFOCOM&#39;26&lt;/strong&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-motivation-动机&#34;&gt;1. Motivation (动机)&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/Venus/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;图 1 抽象了一个部署在智能家居场景中的&lt;strong&gt;基于VLM（视觉-语言模型）的在线视频理解应用&lt;/strong&gt;。在这个应用中，家庭成员可以随时发起针对当前或历史录制视频片段的查询。该应用包含三个关键模块：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;流媒体感知模块 (Streaming Perception Module):&lt;/strong&gt; 配备板载计算能力的边缘摄像头持续捕获家庭场景的视频，并即时处理多模态数据。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;历史记忆模块 (Historical Memory Module):&lt;/strong&gt; 构建历史视频流并存储在记忆数据库中，以支持高效准确地检索与查询相关的信息。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;推理模块 (Reasoning Module):&lt;/strong&gt; 在接收到用户查询后，利用云托管的 VLM 进行推理并生成答案，由历史记忆提供上下文基础 (contextual grounding)。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/Venus/figure2.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;AI 社区中新兴的研究工作（如 [13]–[15]）探索了 VLM 在视频理解中的有效性，但大多数工作都侧重于&lt;strong&gt;算法性能 (algorithmic performance)&lt;/strong&gt;，而&lt;strong&gt;忽略了部署相关的约束 (deployment-related constraints)&lt;/strong&gt;，这限制了它们在边缘智能场景中的直接适用性。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;纯云端部署 (Fully Cloud-based Deployment):&lt;/strong&gt;
&lt;ul&gt;
&lt;li&gt;利用强大的服务器端计算来减少设备端处理。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;缺点：&lt;/strong&gt; 需要上传&lt;strong&gt;整个相关视频 (entire relevant video)&lt;/strong&gt;，导致显著的&lt;strong&gt;通信延迟 (communication latency)&lt;/strong&gt;。图 2 显示，通信延迟可占总响应延迟的 &lt;strong&gt;80%&lt;/strong&gt;，且随着视频时长的增加而大幅增长。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;边缘-云端策略（边缘执行选择算法）(Edge-Cloud Strategy):&lt;/strong&gt;
&lt;ul&gt;
&lt;li&gt;一些方法 [3], [13] 通过在推理前执行**帧选择 (frame selection)**来提高准确性。&lt;/li&gt;
&lt;li&gt;在边缘设备上执行选择算法，只将选定的帧上传到云端，可以显著减少通信开销。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;缺点：&lt;/strong&gt; 边缘设备的计算能力有限，导致&lt;strong&gt;逐帧处理&lt;/strong&gt;产生&lt;strong&gt;巨大的设备端处理成本 (substantial on-device processing costs)&lt;/strong&gt;，例如高达 &lt;strong&gt;924秒&lt;/strong&gt; 的设备端延迟（图 2）。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;现有方法的共同限制：&lt;/strong&gt; 除了通信和计算开销，现有方法&lt;strong&gt;固有地受限于离线执行 (offline execution)&lt;/strong&gt;，不适用于涉及&lt;strong&gt;在线用户查询&lt;/strong&gt;并需要**长期上下文记忆 (long-term contextual memory)**的在线流媒体应用。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-contribution-贡献&#34;&gt;2. Contribution (贡献)&lt;/h2&gt;
&lt;p&gt;为解决上述限制，作者提出了 &lt;strong&gt;Venus&lt;/strong&gt;，一种新颖的&lt;strong&gt;设备端记忆和检索系统 (on-device memory-and-retrieval system)&lt;/strong&gt;，专为高效在线边缘视频理解而设计。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 RServe: Overlapping Encoding and Prefill for Efficient LMM Inference</title>
      <link>https://jjl357.github.io/blog/posts/rserve---overlapping-encoding-and-prefill-for-efficient--lmminference/</link>
      <pubDate>Sat, 06 Dec 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/rserve---overlapping-encoding-and-prefill-for-efficient--lmminference/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/Rserve/title.png&#34;&gt;&lt;/p&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;大型多模态模型（LMMs）通常采用编码模块将多模态数据输入转换为 Embedding，然后将其馈送给语言模型进行进一步处理。然而，由于其推理流程的固有复杂性，高效地服务 LMM 仍然极具挑战性。传统的服务引擎将编码模块和语言模型部署在一起，导致显著的资源干扰和紧密的数据依赖。最近的研究通过将编码模块从模型中解（Disaggregating），采用预填充-解码（Prefill-Decode）分离的设计风格来缓解这一问题。尽管如此，这些方法未能充分利用单个请求内（Intra-request）和多个请求间（Inter-request）的并行性。&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/Rserve/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;与纯语言模型相比，多模态模型推理通常依赖于更丰富的提示输入，如图 1 所示。当前的 LMM 依赖额外的编码器来生成与传统 LLM 兼容的多模态输入 Embedding。尽管如此，LMM 面临另一个挑战：在单个请求内编码所有多模态数据会引入显著的延迟（其比例可高达 26%，如图 2 所示），这会干扰 LLM 的前向计算。&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/Rserve/figure2.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;随着模型规模的不断增长，LLM 或 LMM 的分布式部署已成为主流。最广泛使用的方法包括张量并行（Tensor Parallelism, TP）和流水线并行（Pipeline Parallelism, PP）。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;张量并行 (TP):&lt;/strong&gt; 通常用于具有高带宽互连的节点内，可有效降低推理延迟。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;流水线并行 (PP):&lt;/strong&gt; 通常用于带宽有限的节点间场景，可提高推理吞吐量。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;最近提出的 &lt;strong&gt;分块流水线并行 (Chunked Pipeline Parallelism, CPP)&lt;/strong&gt; 1改变了这一格局，使流水线并行能够实现与张量并行相当的延迟降低。具体而言，CPP 将整个输入 Embedding 分割成多个块（Chunks），并按原始输入顺序对预填充（Prefill）计算进行流水线处理，允许单个请求的不同块在流水线内同时处理。如图 2 所示，对于单个多模态请求，流水线并行和张量并行可以保持相当的推理延迟。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-contribution&#34;&gt;2. Contribution&lt;/h2&gt;
&lt;p&gt;为了实现交错和重叠执行，作者提出了 &lt;strong&gt;RServe&lt;/strong&gt;，这是一个 LMM 推理系统，能够以全并行方式高效编排请求内（Intra-request）和请求间（Inter-request）的流水线。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;请求内优化 (Intra-request Optimization):&lt;/strong&gt; 对于具有丰富多模态输入（即大量图像）的请求，RServe 将多模态编码过程与 Prefill 执行重叠，构建请求内流水线。为实现这一点，RServe 将输入 Embedding 分为两类：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;就绪 Embedding (Ready embeddings):&lt;/strong&gt; 包括文本 Embedding 和已经编码完成的多模态 Embedding。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;未就绪 Embedding (Not-ready embeddings):&lt;/strong&gt; 指尚未被编码模块处理的那些数据。
RServe 以细粒度从左到右顺序编码多模态数据，允许 LLM 在部分 Embedding 生成后立即启动 Prefill 执行。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;请求间优化 (Inter-request Optimization):&lt;/strong&gt; 为了保持高吞吐量和低延迟，RServe 进一步对不同请求进行批处理执行，并利用 &lt;strong&gt;可调度 Token (Schedulable Tokens)&lt;/strong&gt; 来平衡各个微批次（Micro-batches）之间的计算负载，构建请求间流水线。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 ModServe - Modality- and Stage-Aware Resource Disaggregation for Scalable Multimodal Model Serving - SoCC&#39;25</title>
      <link>https://jjl357.github.io/blog/posts/modserve---modality--and-stage-aware-resource-disaggregation-for-scalable-multimodal-model-serving---socc25/</link>
      <pubDate>Thu, 27 Nov 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/modserve---modality--and-stage-aware-resource-disaggregation-for-scalable-multimodal-model-serving---socc25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/ModServe/title.png&#34;&gt;
&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;SoCC&#39;25&lt;/strong&gt;&lt;/p&gt;
&lt;h3 id=&#34;1-动机motivation&#34;&gt;1. 动机（Motivation）&lt;/h3&gt;
&lt;p&gt;大型多模态模型（LMMs）需要处理本质上不同的输入类型，每种类型都需要独特的处理流程。这种固有的异构性为服务带来了特殊的复杂性，呼唤新的分析和服务策略。以图像-文本到文本模型[25]为例，推理流程包括多个专业阶段：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;图像预处理：&lt;/strong&gt; 将原始图像转换为张量表示。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;图像编码：&lt;/strong&gt; 将这些张量转换为图像标记（tokens）。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;语言模型后端：&lt;/strong&gt; 结合文本提示和图像标记生成文本输出。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;当前，这些阶段通常以&lt;strong&gt;单体系统&lt;/strong&gt;[5, 27, 62]形式提供服务，所有组件集成在单个实例中并作为一个统一实体进行扩展。虽然最新的LLM服务系统已采用预填充-解码（PD）分解[46, 65]来减轻LLM后端性能干扰，但这些优化仍以文本为中心，忽略了上游的多模态预处理和编码阶段。这些上游阶段在单体服务实例中依然紧密耦合。&lt;/p&gt;
&lt;p&gt;这种缺乏模态-aware解耦的设计，限制了现有系统在处理非文本工作负载时的效率和可扩展性。由于多模态输入预处理和编码位于关键路径上，这些系统难以满足&lt;strong&gt;首令牌时间（TTFT）的服务水平目标（SLOs）。&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/ModServe/figure1.png&#34;&gt;清晰地展示了，在每个请求的图像数量增加（这在多图像或视频工作负载中很常见）时，单体部署所面临的扩展挑战，这会导致TTFT急剧恶化。因此，图像密集型请求可能引发队头（HoL）阻塞&lt;/strong&gt;，进而降低系统响应能力并导致资源过度配置。&lt;/p&gt;
&lt;h3 id=&#34;2-贡献contribution&#34;&gt;2. 贡献（Contribution）&lt;/h3&gt;
&lt;p&gt;&lt;strong&gt;作者的工作：&lt;/strong&gt; 本文首次对两种主流LMM架构——&lt;strong&gt;交叉注意力（CroAttn）和仅解码器（DecOnly）&lt;/strong&gt;——进行了全面的系统分析。分析对象包括六个代表性的开源LMMs以及来自Azure数据中心的真实生产LMM推理轨迹。作者深入剖析了它们的多阶段推理流程、性能与资源之间的权衡，以及生产工作负载模式（包括可变的请求率、多样化的多模态输入和突发流量）。为促进研究，作者发布了来自生产集群的首个开源多模态轨迹，以供社区研究真实世界的部署模式。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;关键洞察（Insights）：&lt;/strong&gt; 作者的分析确定了三个优化LMM推理的关键洞察：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;Insight 1：&lt;/strong&gt; 不同的LMM推理阶段（如预处理、编码、预填充、解码）表现出不同的性能特征，并且对资源和模型配置（如批处理、模型分片）具有不同的敏感性，因此需要&lt;strong&gt;解耦执行&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Insight 2：&lt;/strong&gt; 图像编码是影响TTFT的主要瓶颈，因此需要&lt;strong&gt;高效的编码器并行化&lt;/strong&gt;来减少延迟和队头（HoL）阻塞。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Insight 3：&lt;/strong&gt; 生产多模态流量展现出独特的突发模式，主要由&lt;strong&gt;每个请求的图像数量增加&lt;/strong&gt;所驱动，这强调了需要&lt;strong&gt;模态感知路由策略&lt;/strong&gt;来管理突发流量并减轻尾部延迟峰值。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;strong&gt;ModServe架构：&lt;/strong&gt; 基于上述洞察，作者提出了&lt;strong&gt;ModServe&lt;/strong&gt;，一种新型的模块化架构，专为可扩展和资源高效的LMM服务而设计，旨在直接解决分析中发现的挑战。以图像-文本到文本任务为例，ModServe将图像和文本特定的推理阶段分离到不同的实例中进行解耦执行：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;图像实例：&lt;/strong&gt; 处理图像预处理和编码。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;文本实例：&lt;/strong&gt; 管理LLM的预填充和解码（见&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/ModServe/figure1.png&#34;&gt;）。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;请求流：&lt;/strong&gt; 纯文本请求绕过图像实例直接由文本实例服务；图像-文本请求则先通过图像实例将图像转换为标记，再转发给文本实例进行文本生成。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;ModServe的优化能力：&lt;/strong&gt; 这种模块化架构实现了阶段特定的优化：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;独立资源管理：&lt;/strong&gt; ModServe独立地使用阶段感知自动扩展、模型分片和批处理来管理图像和文本实例。通过单独扩展各个阶段，它最大程度地减少了资源过度配置。例如，在生产流量中观察到的图像驱动突发期间，图像实例可以独立扩展，从而比单体推理系统更具资源效率。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;并行化编码：&lt;/strong&gt; 为解决图像编码瓶颈，ModServe在多个图像实例上并行化单个请求的编码（&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/ModServe/figure1.png&#34;&gt;）。这是基于一个关键发现：请求中的图像在编码期间不进行相互注意力计算，因此请求可以在图像级别并行化。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;模态感知路由：&lt;/strong&gt; 为管理图像驱动的突发，ModServe为图像和文本实例实现了模态感知请求路由。例如，图像-文本请求中的图像被路由到具有最少待处理图像标记的图像实例，以减少HoL阻塞和尾部延迟峰值。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;性能表现：&lt;/strong&gt; 作者在高性能推理系统vLLM[27]之上实现了ModServe，并通过在运行Azure生产LMM推理轨迹的16服务器（128 GPU）集群上进行广泛评估，验证了ModServe的有效性。与最先进的基线相比，ModServe在静态资源分配下实现了&lt;strong&gt;3.3至5.5倍&lt;/strong&gt;更高的吞吐量，同时在满足P99 TTFT SLOs的前提下，将LMM服务成本降低了&lt;strong&gt;25%至41.3%&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;互补性：&lt;/strong&gt; 虽然现有的PD分解技术[46, 65]有助于优化LLM推理（通过分离预填充和解码），但它们对于处理多模态工作负载来说是不够的。生产环境中异构且突发的多模态流量性质，使得在以文本为中心背景下研究的PD分解难以扩展；模态特定的优化（如并行化编码、模态感知路由和阶段自动扩展）对于在保持资源效率的同时满足SLOs至关重要。作者在第5节中证明，ModServe可以与LLM后端的两种配置（共置LLM后端/混合PD批处理，以及文本节点的PD分解）结合，且提出的模态感知技术在两种配置下都能改善服务延迟。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;适用范围：&lt;/strong&gt; 作者重点研究了图像-文本到文本和视频-文本到文本（视频被视为图像帧序列处理[31]）任务，但其洞察可推广到其他多模态场景，例如音频-文本到文本任务[23]，因为它们与研究所用的模型具有相似的模型架构和推理阶段。&lt;/p&gt;
&lt;h3 id=&#34;3-基础知识preliminary&#34;&gt;3. 基础知识（Preliminary）&lt;/h3&gt;
&lt;p&gt;LMMs通过整合多模态理解能力，将以文本为中心的LLMs扩展到视觉问答[52]、计算机使用代理[42, 45]等任务。&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/ModServe/figure2.png&#34;&gt;描绘了视觉理解任务中LMM推理的典型流程[25]，它涉及三个关键阶段：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;图像预处理：&lt;/strong&gt; 将原始图像转换为统一大小的图块。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;图像编码：&lt;/strong&gt; 编码器提取视觉特征并生成一系列图像标记。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;文本生成：&lt;/strong&gt; LLM后端处理图像和文本标记以生成输出文本标记。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;strong&gt;LMM主流架构：&lt;/strong&gt; 主流LMM架构在LLM后端处理图像标记和文本标记的方式上存在差异：&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 Efficiently Serving Large Multimodal Models Using EPD Disaggregation - ICML&#39;25</title>
      <link>https://jjl357.github.io/blog/posts/efficiently-serving-large-multimodal-models-using-epd-disaggregation---icml25/</link>
      <pubDate>Sat, 15 Nov 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/efficiently-serving-large-multimodal-models-using-epd-disaggregation---icml25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/EPDServe/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;ICML&#39;25&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/vbdi/epdserve&#34;&gt;https://github.com/vbdi/epdserve&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;Large Multimodal Models (LMMs) 将视觉/音频/视频等感知模态引入到 LLM 的推理流程中，从而带来更强的能力，但随之而来的是&lt;strong&gt;额外的编码（encoding）阶段&lt;/strong&gt;，该阶段会产生大量视觉（或音频）token，显著增加计算与内存消耗，并对关键的 SLO（如 TTFT、TPOT）造成负面影响。当前主流的 LLM-serving 系统（如 vLLM、DistServe 等）要么将编码与 prefill 聚合在同一资源上导致干扰与内存竞争，要么只对 LLM 的 prefill/decode 做优化，无法从根本上缓解 LMM 的编码瓶颈。因此论文提出通过**将 Encoding / Prefill / Decode 三阶段进行严格分离（EPD Disaggregation）**来重新设计服务架构，以解耦资源、并提供针对每阶段的定制优化，从而减少延迟、提升 SLO 达成率并大幅节省内存。&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/EPDServe/figure1.png&#34;&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-related-work&#34;&gt;2. Related Work&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/EPDServe/figure2.png&#34;&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;现有 LLM 服务（vLLM、SARATHI、Orca 等）与 Disaggregated-serving（SplitWise、DistServe、DéjàVu 等）对 LLM 的 prefill/decode 分离带来了可观改进，但这些工作&lt;strong&gt;通常忽略或未充分优化编码（encoding）阶段&lt;/strong&gt;，因此不适用于 LMM 的编码密集型工作负载。相较之下，本文填补该空白，提出将编码也作为独立可调度阶段，从而开启新的并行化、缓存与资源分配策略。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id=&#34;3-method&#34;&gt;3. Method&lt;/h2&gt;
&lt;h3 id=&#34;31-epd-disaggregation&#34;&gt;3.1. EPD Disaggregation&lt;/h3&gt;
&lt;p&gt;EPD 把推理流程明确划分为三个独立阶段：&lt;strong&gt;Encoding (E)&lt;/strong&gt;、&lt;strong&gt;Prefill (P)&lt;/strong&gt;、&lt;strong&gt;Decode (D)&lt;/strong&gt;，并定义两类跨阶段迁移（migration）函数：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;EP-migration&lt;/strong&gt;：编码阶段生成的 multimodal tokens $v^e_t$ 被传递到 prefill：
$$v^p_t = \psi_{EP}(v^e_t)$$&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;PD-migration&lt;/strong&gt;：prefill 生成的初始 KV cache 与首个 token 经迁移至 decode：
$$(kv^d_1, o^d_1) = \psi_{PD}(kv^p_1, o^p_1)$$&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;阶段内部流程：&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 ElasticMM: Efficient Multimodal LLMs Serving with Elastic Multimodal Parallelism - NeurIPS&#39;25 Oral</title>
      <link>https://jjl357.github.io/blog/posts/elasticmm---efficient-multimodal-llms-serving-with-elastic-multimodal-parallelism---neurips25-oral/</link>
      <pubDate>Thu, 13 Nov 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/elasticmm---efficient-multimodal-llms-serving-with-elastic-multimodal-parallelism---neurips25-oral/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/ElasticMM/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;NeurIPS&#39;25 Oral&lt;/strong&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-background-and-motivation&#34;&gt;1. Background and Motivation&lt;/h2&gt;
&lt;p&gt;多模态大语言模型（Multimodal Large Language Models, MLLMs）在传统 LLM 的基础上扩展了图像、视频、音频等输入模态，使模型能够进行跨模态理解与推理。然而，这些额外组件（如视觉编码器、投影模块等）带来了显著的推理开销。由于多模态推理流程复杂、任务异构，MLLM 的高效部署成为一个重大挑战。&lt;/p&gt;
&lt;p&gt;现有的大多数推理服务架构（serving architecture）采用紧耦合（tightly coupled）设计，无法区分不同请求类型，也无法在不同阶段灵活地调整并行策略，导致 &lt;strong&gt;time-to-first-token (TTFT)&lt;/strong&gt; 延迟增大、GPU 资源利用率低下。&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/ElasticMM/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;与传统仅处理文本的 LLM 不同，MLLM 需要同时处理多种模态的输入，因此推理流程更复杂，通常包括：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;Image Preprocessing&lt;/strong&gt;：对原始图像进行裁剪、缩放、分块；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Image Encoding&lt;/strong&gt;：通过视觉编码器提取特征并转化为 vision token；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Text Generation&lt;/strong&gt;：将 vision token 与文本 prompt 拼接后输入语言模型，经过 prefill 和 decode 阶段生成输出。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;这些额外阶段显著增加了推理复杂度和平均上下文长度，从而导致计算与内存开销的上升。&lt;/p&gt;
&lt;hr&gt;
&lt;h3 id=&#34;11-multimodal-large-language-models-inference&#34;&gt;1.1 Multimodal Large Language Models Inference&lt;/h3&gt;
&lt;p&gt;MLLM 的推理流水线可以拆分为三个关键阶段：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;图像预处理&lt;/strong&gt;：原图像被缩放或分块；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;图像编码&lt;/strong&gt;：视觉编码器提取视觉 token；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;文本生成阶段&lt;/strong&gt;：LLM 同时处理视觉与文本 token 并生成响应。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;现代 MLLM 的架构可分为两类：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;Decoder-only (DecOnly)&lt;/strong&gt;：如 LLaVA-OneVision、Qwen-VL、Janus、InternVL。视觉与文本 token 拼接后共同输入模型，视觉 token 参与每一步生成；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Encoder-decoder (EncDec)&lt;/strong&gt;：如 LLaMA-3.2 Vision、NVLM-X、Flamingo。视觉 token 通过 cross-attention 与文本 token 交互，仅在 cross-attention 层中出现。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;两者的主要差异在于视觉 token 的交互方式：前者在每一步生成都参与计算，后者仅在交叉注意力阶段出现。
由于视觉 token 的数量通常远大于文本 token，这两种架构都在推理中引入了大量的额外开销，包括更长的上下文、更高的显存使用率和更慢的推理速度。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 Stop Looking for “Important Tokens” in Multimodal Language Models: Duplication Matters More - EMNLP&#39;25</title>
      <link>https://jjl357.github.io/blog/posts/stop-looking-for-important-tokens-in-multimodal-language-models---duplication-matters-more---emnlp25/</link>
      <pubDate>Wed, 12 Nov 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/stop-looking-for-important-tokens-in-multimodal-language-models---duplication-matters-more---emnlp25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/Dart/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;EMNLP&#39;25&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/ZichenWen1/DART&#34;&gt;https://github.com/ZichenWen1/DART&lt;/a&gt;&lt;/p&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;Vision tokens 在多模态大模型（MLLMs）中因数量巨大而成为主要计算瓶颈，尤其是高分辨率图像或多帧视频，会将图像编码为成千上万的视觉 token，使得模型推理的时间和内存成本迅速上升。为此，许多近期工作提出了&lt;strong&gt;训练免费（training-free）&lt;strong&gt;的 token pruning 方法，通常采用“先度量每个 token 的importance，再删除importance低的 token”的范式来加速推理。论文指出并实证了：以 attention-score 作为 importance 的方式&lt;/strong&gt;存在严重缺陷&lt;/strong&gt;，在某些场景下竟然&lt;strong&gt;比随机丢弃（random pruning）更差&lt;/strong&gt;，并且与硬件加速（如 FlashAttention）不兼容，从而无法在实际部署时取得理想的速度-性能折中。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;直觉动机&lt;/strong&gt;：论文提出另一种思路——&lt;strong&gt;把重复（duplication）作为 token reduction 的主要考虑因素&lt;/strong&gt;。当多个视觉 token 表示高度相似时，保留其中一个便足以维持信息完整度；相反，删除“重复”token 不但能大幅削减计算，也更不容易损害下游性能。基于该想法，作者提出了 DART（Duplication-Aware Reduction of Tokens）这一简单、训练免费、对硬件友好的 token 削减 Pipeline。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-challenge&#34;&gt;2. Challenge&lt;/h2&gt;
&lt;p&gt;论文系统性地列举并分析了当前 importance-based token pruning 的问题：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;(I) 忽略 token 间的交互（dynamic interaction）&lt;/strong&gt;：importance-based 方法往往把每个 token 的分数当作对全集 $X$ 的函数 $s_i=F(x_i\mid X)$ 并进行静态选择，但当某些 token 被移除后，剩下 token 的“重要性”应发生改变（例如两近似 token 存在互补性，移除其中之一会提高另一个的相对重要性），而静态评分忽略了这一点。论文通过形式化说明和实证展示了该偏差来源（见式 (4)-(6)）。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;(II) 与高效注意力算子（FlashAttention）不兼容&lt;/strong&gt;：许多 importance-based 方法需要访问 attention scores，但高效实现（FlashAttention / FlashAttention-2）在内部并不暴露中间 attention map，这就迫使要么禁用高效实现（带来速度和内存损失），要么放弃这些方法。论文强调在保持 FlashAttention 的同时设计 pruning 方法的重要性。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders -CVPR 2025 </title>
      <link>https://jjl357.github.io/blog/posts/move-kd---knowledge-distillation-for-vlms-with-mixture-of-visual-encoders---cvpr25/</link>
      <pubDate>Mon, 10 Nov 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/move-kd---knowledge-distillation-for-vlms-with-mixture-of-visual-encoders---cvpr25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/MoVE-KD/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;CVPR 2025&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github：&lt;/strong&gt; &lt;a href=&#34;https://github.com/hey-cjj/MoVE-KD&#34;&gt;https://github.com/hey-cjj/MoVE-KD&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;视觉编码器（Visual Encoder）是视觉语言模型（VLM）的核心组件，每个编码器通常源自不同的视觉基础模型（Visual Foundation Model），因此具备不同的特长与感知能力。为了充分利用这些差异化优势，近年来许多研究在单一 VLM 中整合多个视觉编码器。然而，这种设计虽然能融合多源知识，却导致计算量大幅上升、模型复杂度增加，严重影响了效率与可扩展性。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;核心问题：&lt;/strong&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;是否可以将多个视觉编码器的特长“蒸馏”进一个单一编码器中，从而兼具多编码器的性能与单编码器的高效性？&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;MoVE-KD（Mixture-of-Visual-Encoder Knowledge Distillation）正是为了解决这一问题而提出的。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-challenge&#34;&gt;2. Challenge&lt;/h2&gt;
&lt;p&gt;现有方法（如 [24, 38, 42]）通常通过特征拼接（feature concatenation）或注意力融合（attention fusion）等方式结合多个视觉编码器，但多编码器必然带来高计算开销和复杂模型结构，削弱了训练与推理效率。&lt;/p&gt;
&lt;p&gt;此外，尽管知识蒸馏（Knowledge Distillation, KD）为知识压缩提供了思路，但传统 KD 主要是 &lt;strong&gt;一对一（one-to-one）&lt;/strong&gt; 蒸馏，即单个教师到单个学生。而如何从多个来源、不同预训练目标的视觉教师模型中同时学习，是一个尚未充分探索的问题。&lt;/p&gt;
&lt;p&gt;此前如 &lt;strong&gt;AM-RADIO [36]&lt;/strong&gt; 虽引入多教师思路，但由于共享主干、学习冲突严重，性能受限。
MoVE-KD 的目标是建立一个统一框架，将多教师视觉知识高效压缩进单一学生模型中，同时解决知识冲突与效率问题。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;3-contribution&#34;&gt;3. Contribution&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/MoVE-KD/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;MoVE-KD 的提出灵感来自 ViT 的 token 扩展方法 [9]，其核心思想是利用注意力机制引导多教师的知识蒸馏过程，通过 [CLS] token 判断视觉 token 的重要性，并分配动态权重，从而“选择性”吸收有价值的信息。&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;提出 MoVE-KD 框架&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;首个从知识蒸馏角度实现“多视觉编码器融合”的统一框架；&lt;/li&gt;
&lt;li&gt;可在不增加模型复杂度的情况下，将不同视觉编码器的知识压缩进单模型。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;提出 Attention-guided KD 机制&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;通过 [CLS] token 的注意力图，动态评估每个视觉 token 的重要性；&lt;/li&gt;
&lt;li&gt;引入多教师权重自适应机制（Teacher Weighting），使更有价值的教师贡献更大；&lt;/li&gt;
&lt;li&gt;使用 &lt;strong&gt;Mixture-of-LoRA-Experts (MoLE)&lt;/strong&gt; 结构缓解教师间知识冲突。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;在 LLaVA / LLaVA-NeXT 等主流 VLM 上取得 SOTA&lt;/strong&gt;&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 Efficient Multi-modal Large Language Models via Progressive Consistency Distillation - NeurIPS&#39;25</title>
      <link>https://jjl357.github.io/blog/posts/efficient-multi-modal-large-language-models-via-progressive-consistency-distillation---neurips25/</link>
      <pubDate>Fri, 07 Nov 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/efficient-multi-modal-large-language-models-via-progressive-consistency-distillation---neurips25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/EPIC/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference：&lt;/strong&gt; NeurIPS 2025&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github：&lt;/strong&gt; &lt;a href=&#34;https://github.com/ZichenWen1/EPIC&#34;&gt;https://github.com/ZichenWen1/EPIC&lt;/a&gt;&lt;/p&gt;
&lt;h2&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/EPIC/figure3.png&#34;&gt;&lt;/h2&gt;
&lt;h2 id=&#34;my-thoughts&#34;&gt;My Thoughts&lt;/h2&gt;
&lt;p&gt;EPIC 这篇论文的核心思想是在&lt;strong&gt;不改动模型结构&lt;/strong&gt;的前提下，通过&lt;strong&gt;渐进式一致性蒸馏（Progressive Consistency Distillation）&lt;/strong&gt;，让多模态大语言模型在&lt;strong&gt;token 层面（Token Consistency Distillation, TCD）&lt;/strong&gt; 和 &lt;strong&gt;层级层面（Layer Consistency Distillation, LCD）&lt;/strong&gt; 逐步适应视觉 token 压缩带来的特征分布变化，从而实现从低压缩到高压缩的平滑过渡，在显著降低计算量与显存占用的同时仍保持甚至提升模型性能。这种从训练策略层面解决效率问题的思路，兼具理论优雅性与实用性。&lt;/p&gt;
&lt;p&gt;日后如果有需要用到 Knowledge  Dsitillation 的 idea 或者 训练策略，可以借鉴其思想。&lt;/p&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;多模态大语言模型（MLLM）需要同时处理文本与视觉模态的信息。与仅需处理少量高信息密度文本 token 的 LLM 不同，MLLM 在输入中包含大量视觉 token，这些 token 在高分辨率图像或多帧视频任务中尤为庞大。这种“视觉 token 爆炸”（visual token explosion）带来了显著的&lt;strong&gt;计算负担与存储压力&lt;/strong&gt;，尤其在推理时对 KV cache 和显存的占用极大。&lt;/p&gt;
&lt;p&gt;因此，如何在不显著降低性能的前提下&lt;strong&gt;减少视觉 token 的数量&lt;/strong&gt;，成为提升 MLLM 效率的核心问题。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-challenge&#34;&gt;2. Challenge&lt;/h2&gt;
&lt;p&gt;视觉 token 数量通常比文本 token 多出几个数量级，但其包含的空间信息高度冗余。近年来，研究者提出了两大类视觉 token 压缩方法：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;Training-free 方法：&lt;/strong&gt; 不需要额外训练，通过简单的启发式规则压缩视觉 token。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;基于重要性（importance-based）&lt;/strong&gt;：如 FastV、SparseVLM，依据注意力得分筛选重要 token。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;基于冗余（redundancy-based）&lt;/strong&gt;：如 DART、G-Prune，通过 token 相似度评估合并或舍弃冗余特征。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;Training-aware 方法：&lt;/strong&gt; 在训练阶段显式引入压缩模块，让模型学习在压缩下保持性能。
典型工作包括：&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 ViSpec: Accelerating Vision-Language Models with Vision-Aware Speculative Decoding - NeurIPS&#39;25 </title>
      <link>https://jjl357.github.io/blog/posts/vispec---accelerating-vision-language-models-with-vision-aware-speculative-decoding---neurips25/</link>
      <pubDate>Wed, 05 Nov 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/vispec---accelerating-vision-language-models-with-vision-aware-speculative-decoding---neurips25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/ViSpec/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;NeurIPS&#39;25&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;GitHub:&lt;/strong&gt; &lt;a href=&#34;https://github.com/KangJialiang/ViSpec&#34;&gt;https://github.com/KangJialiang/ViSpec&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;my-thoughts&#34;&gt;My Thoughts&lt;/h2&gt;
&lt;p&gt;个人感觉这篇工作是将Eagle应用于VLM， 并针对VLM带来的问题进行了解决。&lt;/p&gt;
&lt;p&gt;但这篇工作也是需要training，构造数据集和进行训练花销还是挺大的， 好奇能否有更efficient甚至是training-free的method来实现Vision-Aware Speculative Decoding。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;Speculative Decoding（推测解码）是一种在大型语言模型（LLM）中被广泛采用的推理加速技术。然而，其在视觉语言模型（Vision-Language Models, VLMs）中的应用仍然非常有限，已有方法的加速收益通常不足 &lt;strong&gt;1.5×&lt;/strong&gt;。&lt;br&gt;
随着多模态能力逐渐成为大规模模型的核心能力，这一加速差距变得愈发显著。&lt;/p&gt;
&lt;p&gt;ViSpec 的核心动机在于突破当前 VLM 加速的瓶颈：现有推测式解码方法主要针对纯文本推理设计，在视觉输入冗余较高的多模态场景下，小型草稿（draft）模型在生成过程中难以高效处理图像特征，从而限制了整体加速效率。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-challenge&#34;&gt;2. Challenge&lt;/h2&gt;
&lt;p&gt;目前针对 Vision-Language Models 的 Speculative Decoding 工作非常少。仅有的尝试[7] 在 LLaVA-7B 上应用了一个小型仅语言模型的 draft 模型，获得了大约 &lt;strong&gt;1.5×&lt;/strong&gt; 的加速。当他们将 image encoder 融入小型多模态草稿模型中时，加速效果并未显著提升，主要原因包括：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;图像信息冗余较高&lt;/strong&gt;：大量重复或低信息密度的视觉块（patch）对小模型造成干扰；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;多模态处理复杂性高&lt;/strong&gt;：视觉 token 的嵌入维度高、数量多，导致 draft 模型计算成本上升而收益有限。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;这些问题说明：在现有的 speculative decoding 框架中，草稿模型无法充分理解和整合图像特征信息。因此，作者需要一个 &lt;strong&gt;能高效处理视觉与语言双模态特征并保持高预测精度&lt;/strong&gt; 的专门框架。ViSpec 即是在此背景下提出。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;3-contribution&#34;&gt;3. Contribution&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/ViSpec/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;ViSpec 旨在解决小型 draft 模型在视觉冗余与上下文一致性方面的弱点。作者观察到，大型 VLM 能逐层过滤图像中冗余信息而保持语义理解，但小模型无法做到这一点。&lt;br&gt;
为解决这一问题，ViSpec 提出了 &lt;strong&gt;Vision-Aware Speculative Decoding&lt;/strong&gt; 框架，核心贡献如下：&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 QSVD: Efficient Low-rank Approximation for Unified Query-Key-Value Weight Compression in Low-Precision Vision-Language Models - NeurIPS&#39;25 Spotlight</title>
      <link>https://jjl357.github.io/blog/posts/qsvd----efficient-low-rank-approximation-for-unified-query-key-value-weight-compression-in-low-precision-vision-language-models---neurips25-spotlight/</link>
      <pubDate>Thu, 30 Oct 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/qsvd----efficient-low-rank-approximation-for-unified-query-key-value-weight-compression-in-low-precision-vision-language-models---neurips25-spotlight/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/QSVD/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;NeurIPS&#39;25 Spotlight&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/SAI-Lab-NYU/QSVD&#34;&gt;https://github.com/SAI-Lab-NYU/QSVD&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;Vision–Language Models (VLMs) 如 LLaVA、BLIP2 等在图像描述、视觉问答 (VQA) 等任务中表现卓越，但这些模型需要极大的计算与存储开销，尤其在推理时：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;KV Cache 占用高&lt;/strong&gt;：注意力机制中需存储 Key、Value，每层缓存大小随序列长度线性增长。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Q/K/V 投影重复计算&lt;/strong&gt;：三组权重矩阵独立计算，造成算力浪费。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;模型量化困难&lt;/strong&gt;：激活分布存在极端 outliers，难以稳定进行低比特量化。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;QSVD 的目标是&lt;strong&gt;统一地对 Q/K/V 权重矩阵进行低秩近似&lt;/strong&gt;并结合&lt;strong&gt;后训练量化 (PTQ)&lt;/strong&gt;，实现以下三点：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;减少参数量、计算量、缓存占用；&lt;/li&gt;
&lt;li&gt;保持模型性能；&lt;/li&gt;
&lt;li&gt;支持低精度硬件部署。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/QSVD/figure1.png&#34;&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-related-work&#34;&gt;2. Related Work&lt;/h2&gt;
&lt;h3 id=&#34;21-svd-in-large-models&#34;&gt;2.1 SVD in Large Models&lt;/h3&gt;
&lt;p&gt;&lt;strong&gt;Singular Value Decomposition (SVD)&lt;/strong&gt; 是经典的矩阵分解方法。
对于矩阵 ( W \in \mathbb{R}^{m \times n} )，可分解为：&lt;/p&gt;
&lt;p&gt;$$
W = U \Sigma V^T
$$&lt;/p&gt;
&lt;p&gt;其中：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;(U, V) 为正交矩阵；&lt;/li&gt;
&lt;li&gt;(\Sigma) 为奇异值对角矩阵；&lt;/li&gt;
&lt;li&gt;保留前 (r) 个奇异值可得到 rank-(r) 近似：&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;$$
W \approx U_r \Sigma_r V_r^T
$$&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 SPECVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruning - EMNLP&#39;25</title>
      <link>https://jjl357.github.io/blog/posts/specvlm---enhancingspeculative-decoding-of-video-llms-via-verifier-guided-token-pruning---emnlp25/</link>
      <pubDate>Wed, 29 Oct 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/specvlm---enhancingspeculative-decoding-of-video-llms-via-verifier-guided-token-pruning---emnlp25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/SpecVLM/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;EMNLP&#39;25&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/zju-jiyicheng/SpecVLM&#34;&gt;https://github.com/zju-jiyicheng/SpecVLM&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;Video large language models (Vid-LLMs) have shown strong capabilities in understanding video content. However, their reliance on dense video token representations introduces substantial memory and computational overhead in both prefilling and decoding.&lt;/p&gt;
&lt;p&gt;例如：
LLaVA-OneVision (Li et al., 2024a) 将每一帧处理为 196 个视觉 token。若视频为两分钟、60 FPS，则总 token 数量超过 100 万。
如此大量的 video tokens 导致：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;序列长度急剧增加；&lt;/li&gt;
&lt;li&gt;Prefill 阶段的 attention 开销呈平方级增长；&lt;/li&gt;
&lt;li&gt;Decoding 阶段 KV cache 急速膨胀，成为显著的 GPU 内存瓶颈。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;在 autoregressive 生成过程中，每步生成的 KV cache 都必须与模型参数一起加载与存储于 GPU 显存，导致显著的 memory-bound 现象。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs - *NeurIPS&#39;25</title>
      <link>https://jjl357.github.io/blog/posts/cdpruner---beyond-attention-or-similarity---maximizing-conditional-diversity-for-token-pruning-in-mllms-neuirips25/</link>
      <pubDate>Fri, 24 Oct 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/cdpruner---beyond-attention-or-similarity---maximizing-conditional-diversity-for-token-pruning-in-mllms-neuirips25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/CDPruner%20-%20Beyond%20Attention%20or%20Similarity%20-/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference&lt;/strong&gt;:  &lt;strong&gt;NeurIPS&#39;25&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;github&lt;/strong&gt;: &lt;a href=&#34;https://github.com/Theia-4869/CDPruner&#34;&gt;https://github.com/Theia-4869/CDPruner&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;my-thoughts&#34;&gt;My Thoughts&lt;/h2&gt;
&lt;p&gt;相较于 Attention-based methods 中的 &lt;strong&gt;attention shift&lt;/strong&gt; 问题和 Similarity-based methods 中忽略了 query 的问题，这篇论文从 &lt;strong&gt;增加 visual tokens 全局多样性（同时保持对 query 的关注）&lt;/strong&gt; 的角度出发，提出了 &lt;strong&gt;CDPruner&lt;/strong&gt;，通过将 token 多样性建模为 DPP（Determinantal Point Process）求解问题，实现了 SOTA 的 pruning 效果。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;motivations&#34;&gt;Motivations&lt;/h2&gt;
&lt;p&gt;在多模态大语言模型（MLLMs）中，视觉 token 的输入长度往往远大于文本 token，从而带来高昂的推理开销。例如：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;LLaVA-1.5 将一张 336×336 图像转换为 &lt;strong&gt;576 tokens&lt;/strong&gt;；&lt;/li&gt;
&lt;li&gt;LLaVA-NeXT 的高分辨率版本在输入加倍的情况下生成 &lt;strong&gt;2,880 tokens&lt;/strong&gt;；&lt;/li&gt;
&lt;li&gt;LongVA 处理 2,000 帧视频时生成超过 &lt;strong&gt;200K visual tokens&lt;/strong&gt;；&lt;/li&gt;
&lt;li&gt;LongVILA 能处理 &lt;strong&gt;6,000 帧&lt;/strong&gt;并产生 &lt;strong&gt;超过 1M visual tokens&lt;/strong&gt;，导致巨大的计算成本。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id=&#34;challenges&#34;&gt;Challenges&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/CDPruner%20-%20Beyond%20Attention%20or%20Similarity%20-/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;现有的视觉 token 剪枝方法主要分为两类：&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
