<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>KV Cache on JJ&#39;s Blog</title>
    <link>https://jjl357.github.io/blog/tags/kv-cache/</link>
    <description>Recent content in KV Cache on JJ&#39;s Blog</description>
    <generator>Hugo -- 0.152.2</generator>
    <language>zh-cn</language>
    <lastBuildDate>Sat, 20 Jun 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://jjl357.github.io/blog/tags/kv-cache/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>📝 KVFlow: Efficient Prefix Caching for Accelerating LLM-Based Multi-Agent Workflows</title>
      <link>https://jjl357.github.io/blog/posts/kvflow---efficient-prefix-caching-for-accelerating-llm-based-multi-agent-workflows/</link>
      <pubDate>Sat, 20 Jun 2026 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/kvflow---efficient-prefix-caching-for-accelerating-llm-based-multi-agent-workflows/</guid>
      <description>&lt;h1 id=&#34;kvflow-efficient-prefix-caching-for-accelerating-llm-based-multi-agent-workflows&#34;&gt;KVFlow: Efficient Prefix Caching for Accelerating LLM-Based Multi-Agent Workflows&lt;/h1&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/KVFlow/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;NeurIPS&#39;25&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/PanZaifeng/KVFlow/tree/main&#34;&gt;https://github.com/PanZaifeng/KVFlow/tree/main&lt;/a&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;论文主题概括：&lt;/strong&gt;
这篇论文研究的是 &lt;strong&gt;LLM-based multi-agent workflows&lt;/strong&gt; 中的系统级推理加速问题，重点不是提升模型能力，也不是改 prompt 或 agent 协作策略，而是优化底层 LLM serving system 中的 &lt;strong&gt;KV cache 管理机制&lt;/strong&gt;。论文指出，现有系统通常使用 &lt;strong&gt;LRU&lt;/strong&gt; 策略管理 prefix KV cache，但 LRU 只根据过去访问时间做决策，无法理解多智能体工作流中 agent 的未来执行顺序，因此容易把“马上就要再次使用”的 agent prefix cache 提前驱逐掉。KVFlow 利用 workflow 结构预测 agent 的未来调用顺序，并据此进行 cache eviction 和 prefetching，从而减少 cache miss、降低 prefill 或 CPU-GPU loading 开销，提高多智能体工作流的执行效率。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;核心关键词：&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;LLM Serving&lt;/li&gt;
&lt;li&gt;Agentic Workflow&lt;/li&gt;
&lt;li&gt;Multi-Agent Workflow&lt;/li&gt;
&lt;li&gt;Prefix Caching&lt;/li&gt;
&lt;li&gt;KV Cache&lt;/li&gt;
&lt;li&gt;Cache Eviction&lt;/li&gt;
&lt;li&gt;LRU&lt;/li&gt;
&lt;li&gt;Radix Tree Cache&lt;/li&gt;
&lt;li&gt;Workflow-aware Cache Management&lt;/li&gt;
&lt;li&gt;Agent Step Graph&lt;/li&gt;
&lt;li&gt;Steps-to-execution&lt;/li&gt;
&lt;li&gt;KV Prefetching&lt;/li&gt;
&lt;li&gt;CPU-GPU Transfer&lt;/li&gt;
&lt;li&gt;SGLang&lt;/li&gt;
&lt;li&gt;HiCache&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id=&#34;abstract&#34;&gt;Abstract&lt;/h2&gt;
&lt;p&gt;这篇论文的出发点是：
现在很多复杂任务会通过 &lt;strong&gt;LLM-based agentic workflows&lt;/strong&gt; 来完成，即把一个复杂任务拆成多个 agent，每个 agent 有自己的角色、固定 prompt 和子任务。例如一个软件开发类 workflow 可能包含 Product Manager、Architect、Engineer、Reviewer 等 agent。每个 agent 在 workflow 中会被反复调用，每次调用 LLM 时都要处理自己的 prompt。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 ThunderAgent: A Simple, Fast and Program-Aware Agentic Inference System - ICML&#39;26 Spotlight</title>
      <link>https://jjl357.github.io/blog/posts/thunderagent---a-simple-fast-and-program-aware-agentic-inference-system---icml26-spotlight/</link>
      <pubDate>Thu, 18 Jun 2026 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/thunderagent---a-simple-fast-and-program-aware-agentic-inference-system---icml26-spotlight/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/ThunderAgent/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;ICML&#39;26 Spotlight&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/ThunderAgent-org/ThunderAgent&#34;&gt;https://github.com/ThunderAgent-org/ThunderAgent&lt;/a&gt;&lt;/p&gt;
&lt;h2 id=&#34;abstract&#34;&gt;Abstract&lt;/h2&gt;
&lt;p&gt;这篇论文研究的是 &lt;strong&gt;agentic inference system&lt;/strong&gt;，也就是面向 LLM Agent 多轮推理、多轮工具调用、多轮环境交互的推理系统。论文的核心问题是：现在的大模型不再只是一次性回答用户问题，而是越来越多地作为 Agent 使用，例如代码修复 Agent、科学发现 Agent、routing Agent、computer-use Agent 等。这类 Agent 往往需要在一个长时间运行的 workflow 中不断执行：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;LLM reasoning $\rightarrow$ tool call $\rightarrow$ tool observation $\rightarrow$ LLM reasoning $\rightarrow$ tool call $\rightarrow \cdots$&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这与传统 LLM serving 中“一个 prompt 对应一次 request”的模式不同。传统系统通常把 agentic inference 拆成两个彼此独立的组件：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;LLM inference engine&lt;/strong&gt;，例如 vLLM、SGLang；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;tool orchestrator&lt;/strong&gt;，例如 Kubernetes、Docker sandbox、API server 管理器等。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;这种组合虽然工程上容易实现，但系统只在 &lt;strong&gt;per-request&lt;/strong&gt; 层面调度资源，而没有看到整个 agent workflow 的 end-to-end 生命周期。论文指出，这种 request-aware 设计会导致两个关键资源管理不佳：&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 EPIC: Efficient Position-Independent Caching for Serving Large Language Models - ICML&#39;25</title>
      <link>https://jjl357.github.io/blog/posts/epic---efficient-position-independent-caching-for-serving-large-language-models---icml25/</link>
      <pubDate>Fri, 05 Jun 2026 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/epic---efficient-position-independent-caching-for-serving-large-language-models---icml25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/EPIC-ICML&#39;25/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;ICML&#39;25&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/DerekHJH/epic&#34;&gt;https://github.com/DerekHJH/epic&lt;/a&gt;&lt;/p&gt;
&lt;h2 id=&#34;1-abstract-摘要&#34;&gt;1. Abstract (摘要)&lt;/h2&gt;
&lt;p&gt;大型语言模型 (LLMs) 在广泛的应用中展现了强大的能力，但随着请求 (prompts) 变得越来越复杂，如何高效地进行模型服务 (serving) 成为一个日益严峻的挑战。
上下文缓存 (Context caching) 通过重用跨请求重复出现的 token 的中间表示——键值向量 (Key-Value vectors, KV cache)，显著提升了服务性能。然而，现有的上下文缓存技术&lt;strong&gt;要求跨请求的完全前缀匹配 (exact prefix matches)&lt;/strong&gt;，这极大地限制了其在少样本学习 (few-shot learning) 和检索增强生成 (RAG) 等场景下的重用率。在这些场景中，不可变的内容（例如检索到的文档）在不同请求之间保持不变，但它们往往被不同的前缀（如不同的用户指令或系统提示）所引导。&lt;/p&gt;
&lt;p&gt;为了解决这一问题，&lt;strong&gt;位置无关缓存 (Position-Independent Caching, PIC)&lt;/strong&gt; 应运而生，它使得 KV 向量的模块化重用成为可能，而不再受限于前缀是否一致。
本论文对 PIC 进行了形式化定义，并在前人工作的基础上提出了 &lt;strong&gt;EPIC&lt;/strong&gt; 服务系统。EPIC 结合了作者全新提出的 &lt;strong&gt;LegoLink 算法&lt;/strong&gt;。该算法巧妙地缓解了每个文档开头出现的不合理的“注意力下沉” (attention sink) 效应，从而以极小的计算代价维持了模型的准确率。&lt;/p&gt;
&lt;p&gt;实验结果表明，EPIC 在首字延迟 (Time-To-First-Token, TTFT) 上实现了高达 &lt;strong&gt;8倍&lt;/strong&gt; 的提升，在吞吐量上相较于现有系统获得了 &lt;strong&gt;7倍&lt;/strong&gt; 的增益，同时几乎没有带来任何准确率的损失。&lt;/p&gt;
&lt;h2 id=&#34;2-introduction-引言&#34;&gt;2. Introduction (引言)&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/EPIC-ICML&#39;25/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;首先，基于前缀的上下文缓存 (prefix-based CC) 通过将当前请求与之前的请求进行匹配，从而重用最长公共前缀的 KV 向量。尽管基于前缀的 CC 仍然是现有系统（如 kim; gem, b; Zheng 等人, 2024; Kwon 等人, 2023）中的主流方法，但它要求请求之间必须有&lt;strong&gt;精确的前缀匹配&lt;/strong&gt;。这限制了其在少样本学习和检索增强生成 (RAG) 等场景中的重用，在这些场景中，不可变的数据块（immutable chunks，例如文档）在请求之间保持不变，但前面的前缀却在不断变化。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 VLCACHE: Computing 2% Vision Tokens and Reusing 98% for Vision–Language Inference</title>
      <link>https://jjl357.github.io/blog/posts/vlcache---computing-2vision-tokens-and-reusing-98-for-visionlanguage-inference/</link>
      <pubDate>Tue, 06 Jan 2026 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/vlcache---computing-2vision-tokens-and-reusing-98-for-visionlanguage-inference/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/VLCACHE/title.png&#34;&gt;&lt;/p&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;前缀缓存（Prefix Cache）的局限性&lt;/strong&gt;：目前的 KV Cache 重用机制（如前缀缓存）要求新请求的初始片段（即前缀）与已有缓存序列&lt;strong&gt;精确匹配&lt;/strong&gt;。这种严格的匹配标准虽然保证了输出准确性，但在多模态场景下引入了严重的效率瓶颈：即便&lt;strong&gt;图像完全相同&lt;/strong&gt;，只要系统提示词或用户问题不同，也无法触发缓存命中。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;位置无关重用的必要性&lt;/strong&gt;：如果允许在&lt;strong&gt;不同位置&lt;/strong&gt;重用预缓存的 KV Cache，将显著提升多模态推理的灵活性。然而，位置变化会破坏因果注意力中的位置一致性，因此为了保持输出准确性，&lt;strong&gt;必须对部分 token 进行重新计算（recompute）&lt;/strong&gt;。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;现有启发式方法的缺陷&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;CacheBlend [14]&lt;/strong&gt;：通过比较&lt;strong&gt;前三层&lt;/strong&gt;的 KV Cache 距离来识别“最不可靠”的 token 并重计算。但该方法仅依赖&lt;strong&gt;浅层局部信息&lt;/strong&gt;，无法刻画 token 在整个 Transformer 堆栈中的&lt;strong&gt;全局重要性&lt;/strong&gt;。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;EPIC [6] 与 MPIC [16]&lt;/strong&gt;：以 chunk 为单位，重计算每个数据块的&lt;strong&gt;初始 token&lt;/strong&gt;。其中 MPIC 假设存在“注意力汇聚（attention sink）”效应，但该假设在视觉 token 上并不成立，因为视觉 token 不像系统提示词那样在注意力中占据主导地位。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;KVShare [13]&lt;/strong&gt;：基于注意力分布偏差选择性重计算关键 token，但仍然缺乏对&lt;strong&gt;重用误差如何在解码阶段传播&lt;/strong&gt;的系统性分析。&lt;/p&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;缺乏系统性研究&lt;/strong&gt;：上述方法普遍缺少以下两点：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;不同 Transformer 层对最终输出贡献差异的系统研究；&lt;/li&gt;
&lt;li&gt;重用误差在自回归解码过程中&lt;strong&gt;跨 token、跨层传播机制&lt;/strong&gt;的深入分析。&lt;/li&gt;
&lt;/ol&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-contribution&#34;&gt;2. Contribution&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;识别累积重用误差效应&lt;/strong&gt;：系统性分析了多模态大语言模型（VLM）中 KV Cache 重用所引入的误差，提出并验证了 &lt;strong&gt;累积重用误差效应（Cumulative Reuse Error Effect）&lt;/strong&gt;，即早期 token 的重用误差会在后续生成过程中不断传播和放大。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;层级重要性差异分析&lt;/strong&gt;：通过实验发现，不同 Transformer 层对最终模型输出的影响高度不均衡，并首次从实证角度揭示了 VLM 中的&lt;strong&gt;层级重要性多样性&lt;/strong&gt;。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;提出 VLCache 框架&lt;/strong&gt;：设计了一个端到端的视觉 token KV Cache 重用流水线，兼顾算法有效性与系统可落地性。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 KVzip: Query-Agnostic KV Cache Compression with Context Reconstruction - NeuIPS&#39;25 Oral</title>
      <link>https://jjl357.github.io/blog/posts/kvzipquery-agnostic-kv-cache-compression-with-context-reconstruction/</link>
      <pubDate>Fri, 21 Nov 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/kvzipquery-agnostic-kv-cache-compression-with-context-reconstruction/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/KVzip/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;NeuIPS&#39;25 Oral&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;GIthub:&lt;/strong&gt; &lt;a href=&#34;https://github.com/snu-mllab/KVzip&#34;&gt;https://github.com/snu-mllab/KVzip&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h1 id=&#34;1-motivation&#34;&gt;&lt;strong&gt;1. Motivation&lt;/strong&gt;&lt;/h1&gt;
&lt;p&gt;大型语言模型（LLMs）在长上下文推理过程中，其 Key/Value（KV）缓存会随上下文长度线性增长，从而带来如下两个核心挑战：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;显存占用随 $n_c$ 线性扩张&lt;/strong&gt;
例如 Qwen2.5-14B 在 120k context 下需 &lt;strong&gt;33GB&lt;/strong&gt; KV Cache（论文 Figure 1）。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;解码阶段 Attention 的延迟随 KV 数量线性增加&lt;/strong&gt;
解码 token 的每一步都需对全部 KV 执行 attention，因此减少 KV 数量是最直接的加速策略。&lt;/p&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;已有 KV 压缩方法（如 &lt;strong&gt;SnapKV / PyramidKV&lt;/strong&gt;）依赖 &lt;strong&gt;query-aware importance&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;每个 query 都要重新 prefill 来获取 attention pattern。&lt;/li&gt;
&lt;li&gt;得到的重要 token 只对当前 query 有效，不可复用。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;论文的动机部分指出：&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/KVzip/figure2.png&#34;&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;在 multi-query 复用场景中，query-aware 方法的性能快速退化。&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;因此本论文目标是：&lt;/p&gt;
&lt;h3 id=&#34;构建一种-query-agnostic一次预处理多-query-复用-的-kv-cache-压缩方法&#34;&gt;构建一种 &lt;strong&gt;query-agnostic、一次预处理、多 query 复用&lt;/strong&gt; 的 KV Cache 压缩方法。&lt;/h3&gt;
&lt;hr&gt;
&lt;h1 id=&#34;2-challenge&#34;&gt;&lt;strong&gt;2. Challenge&lt;/strong&gt;&lt;/h1&gt;
&lt;h2 id=&#34;21-为什么-query-aware-kv-importance-无法泛化&#34;&gt;&lt;strong&gt;2.1 为什么 query-aware KV importance 无法泛化？&lt;/strong&gt;&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/KVzip/figure6.png&#34;&gt;&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference - NeurIPS&#39;25</title>
      <link>https://jjl357.github.io/blog/posts/chunkkv---semantic-preserving-kv-cache-compression-for-efficient-long-context-llm-inference---neurips25/</link>
      <pubDate>Wed, 12 Nov 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/chunkkv---semantic-preserving-kv-cache-compression-for-efficient-long-context-llm-inference---neurips25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/ChunkKv/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference&lt;/strong&gt;: NeurIPS&#39;25&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/NVIDIA/kvpress&#34;&gt;https://github.com/NVIDIA/kvpress&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;my-thoughts&#34;&gt;My Thoughts&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;ChunkKV 假定“删除部分 token 不会丢失极其关键的细节”，在&lt;strong&gt;法律/医疗等需要逐字级别保真&lt;/strong&gt;的场景可能不合适（论文明确指出）。&lt;/li&gt;
&lt;li&gt;当前实现使用固定 size chunk（效率高但语义边界未显式对齐）；未来可以尝试基于句法/语义边界的 adaptive chunk（但需权衡额外开销）。&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;随着 LLM 处理超长上下文（tens of thousands tokens），KV cache 的内存成为推理阶段的主要瓶颈——例如 7B 模型单 token 的 KV cache 大约占 0.5MB，导致 10k token 的 prompt 消耗约 5GB GPU 内存。&lt;/li&gt;
&lt;li&gt;现有压缩方法（H2O、SnapKV 等）通过删除被认为“不重要”的离散 token 来减少 KV 大小，但&lt;strong&gt;孤立地评估 token 重要度&lt;/strong&gt;会破坏语义连贯性（会把主语或宾语切碎），从而在一些需要语义完整的任务上产生明显性能下降。论文通过示例强调：按 token 剪枝会保留与问题相关的某些词但漏掉关键对象信息，导致语义丢失。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;问题&lt;/strong&gt;：如何避免孤立 token 重要度评估，并在 KV cache 压缩时最大限度保存语义信息？&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-challenge&#34;&gt;2. Challenge&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/ChunkKv/figure1.png&#34;&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;以往方法在 token 维度上进行稀疏化/删减，忽略了自然语言语义通常以连续片段（chunk）出现的事实；因此需要一个&lt;strong&gt;按语义连续段（chunk）作为压缩单位&lt;/strong&gt;的方法以保留“完整的语义单元”。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id=&#34;3-contribution&#34;&gt;3. Contribution&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/ChunkKv/table1.png&#34;&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;发现并量化了“离散 token 压缩会破坏语义”的现象&lt;/li&gt;
&lt;li&gt;提出 &lt;strong&gt;ChunkKV&lt;/strong&gt;：以固定大小（或可调整）chunk 为单位做 KV 压缩，保留最有信息量的 chunk，尽可能保留主谓宾等语义完整性，并设计了&lt;strong&gt;layer-wise index reuse&lt;/strong&gt; 技术来复用所选索引，从而显著降低额外计算开销。&lt;/li&gt;
&lt;li&gt;在 LongBench、NIAH、GSM8K、JailbreakV 等多项 benchmark 以及多个模型（DeepSeek-R1、LLaMA-3、Qwen2、Mistral）上进行大规模评测，展示在相同压缩率下 ChunkKV 在准确率/召回/检索等方面优于现有方法，且在 latency/throughput 上得益于索引复用与向量化实现。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id=&#34;4-method&#34;&gt;4. Method&lt;/h2&gt;
&lt;h3 id=&#34;41-chunk-level-compression&#34;&gt;4.1 Chunk-level compression&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;核心假设&lt;/strong&gt;：自然语言中的“完整语义信息”通常由一段连续 token 构成（例如主语 + 谓语 + 宾语或整个短语）。将这些 token 作为整体（chunk）保留或删除，比以 token 为单位做稀疏更能保留语义。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Chunk 的定义&lt;/strong&gt;：论文采用&lt;strong&gt;固定大小滑窗分块&lt;/strong&gt;（chunk size = $c$），将整个 Key/Value 序列按顺序分为 $C=\lceil T_k / c\rceil$ 个 chunk（最后一个 chunk 可能不足 $c$）。保留策略基于 chunk 的“重要性分数”（由 observe window 的 attention 得到）。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;算法伪码:&lt;/strong&gt;&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 HEADINFER: Memory-Efficient LLM Inference by Head-wise Offloading</title>
      <link>https://jjl357.github.io/blog/posts/headinfer---memory-efficient-llm-inference-by-head-wise-offloading/</link>
      <pubDate>Sun, 09 Nov 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/headinfer---memory-efficient-llm-inference-by-head-wise-offloading/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/HeadInfer/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;ICML&#39;25 Workshop on Long-Context Foundation Models&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/wdlctc/headinfer&#34;&gt;https://github.com/wdlctc/headinfer&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/HeadInfer/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;Transformer-based LLM 在长上下文场景下的推理性能显著，但随着上下文长度的扩展，&lt;strong&gt;KV cache&lt;/strong&gt;（key-value cache）迅速成为内存占用的主要瓶颈。论文指出：例如对 Llama-3-8B 进行 1M token 推理时，KV cache 可达 128 GB，整体内存可达 207 GB（权重 + activation + KV cache），这是在常见 BF16 设置下的估算，使得在消费级 GPU（如 RTX-4090，24GB）上无法直接执行长上下文推理。为解决此类问题，作者提出 HEADINFER —— 通过&lt;strong&gt;按 attention head 维度进行细粒度 KV cache 离线/回传（offload）&lt;/strong&gt;，仅在 GPU 上保留部分 attention heads 的 KV，从而极大地压缩 GPU 端 KV 的占用，同时保证数学等价性（lossless）和兼容各种 attention 形式（dense / sparse）。论文摘要与引言的核心论点与数据来自原文说明。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-relative-work&#34;&gt;2. Relative Work&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;生成式推理与 KV 缓存（Generative Inference &amp;amp; KV Caching）&lt;/strong&gt;：预填（prefill）和解码（decoding）阶段的概念与常用 chunked prefill 思路（将长输入切为若干 chunk 逐步构建 KV cache）被回顾，用以说明激活内存与 KV cache 在不同阶段的不同开销特征。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference - NeurIPS&#39;25</title>
      <link>https://jjl357.github.io/blog/posts/ada-kv---optimizing-kv-cache-eviction-by-adaptive-budget-allocation-for-efficient-llm-inference---neurips25/</link>
      <pubDate>Sat, 01 Nov 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/ada-kv---optimizing-kv-cache-eviction-by-adaptive-budget-allocation-for-efficient-llm-inference---neurips25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/AdaKV/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference&lt;/strong&gt;: &lt;strong&gt;NeurIPS&#39;25&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github&lt;/strong&gt;: &lt;a href=&#34;https://github.com/FFY0/AdaKV&#34;&gt;https://github.com/FFY0/AdaKV&lt;/a&gt;&lt;/p&gt;
&lt;h2 id=&#34;my-thoughts&#34;&gt;My Thoughts&lt;/h2&gt;
&lt;p&gt;这篇工作的idea在各个head之间adaptive 分配 budget, 直觉上就能知道这种设计是有效的，实验也验证了这一点。&lt;/p&gt;
&lt;p&gt;比较惊喜的是作者实现了With efficient CUDA kernel implementations来解决variable-sized cache elements across attention heads，从而来真正实现了计算加速，以及其他KV Cache工作在也实现了对AdaKV集成，再次证明了其作为通用增强模块的价值。&lt;/p&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;大型语言模型（LLM）在各个领域表现出色，但由于长序列推理所需的不断增长的键值（KV）cache，面临着效率挑战。LLM 的广泛应用推动了其处理扩展序列能力的发展。例如，GPT 支持长达 128K 的序列，Claude3 支持 200K，Gemini-Pro-1.5 甚至支持高达 2M 个 token。然而，这种 token 长度的增长带来了显著的挑战，尤其是在推理过程中cache大小的急剧膨胀。对于一个 8B 的 LLM，处理一个 2M token 的序列可能需要高达 256GB 的cache，这严重影响了 GPU 内存效率和计算运行时效率。&lt;/p&gt;
&lt;p&gt;现有的 KV cache驱逐方法通常在所有注意力head上&lt;strong&gt;均匀分配&lt;/strong&gt;压缩预算，忽略了每个head独特的注意力模式。如 &lt;strong&gt;Figure 1a&lt;/strong&gt; 所示，不同head的注意力集中度（concentration）差异巨大：一些head（sparse heads）的注意力高度集中在少数几个 token 上，而另一些head（dispersed heads）的注意力则分布得更广。这种均匀分配导致了效率低下——要么在稀疏集中的head上浪费cache预算，要么在分散分布的head上造成显著的驱逐损失。&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/AdaKV/figure1.png&#34;&gt;&lt;/p&gt;
&lt;h2 id=&#34;2-relative-work&#34;&gt;2. Relative Work&lt;/h2&gt;
&lt;h3 id=&#34;21-cache-eviction-methods&#34;&gt;2.1 Cache Eviction Methods&lt;/h3&gt;
&lt;p&gt;cache驱逐方法主要分为两类：滑动窗口驱逐和 Top-k 驱逐。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;滑动窗口方法&lt;/strong&gt;（如 StreamingLLM）简单地保留初始cache元素和滑动窗口内的元素，但这种无差别的驱逐会显著降低生成质量。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Top-k 驱逐方法&lt;/strong&gt;（如 H2O, SnapKV, Pyramid）基于注意力权重识别并保留 &lt;code&gt;k&lt;/code&gt; 个关键cache元素。然而，现有 Top-k 方法通常在不同head上&lt;strong&gt;均匀分配&lt;/strong&gt;总预算。Ada-KV 通过&lt;strong&gt;自适应预算分配&lt;/strong&gt;来增强这些方法。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id=&#34;22-sparse-attention-methods&#34;&gt;2.2 Sparse Attention Methods&lt;/h3&gt;
&lt;p&gt;稀疏注意力方法与 KV cache驱逐在根本上不同：前者保留所有cache，但在计算时只选择性地使用关键子集，因此&lt;strong&gt;不减少内存占用&lt;/strong&gt;。而 KV cache驱逐直接移除非关键条目，从而减小内存占用。这两种技术是正orthogonal的，未来可以结合使用。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 NOT ALL HEADS MATTER: A HEAD-LEVEL KV CACHE COMPRESSION METHOD WITH INTEGRATED RETRIEVAL AND REASONING - ICLR&#39;25</title>
      <link>https://jjl357.github.io/blog/posts/not-all-heads-matter---a-head-level-kv-cache-compression-method-with-integrated-retrieval-and-reasoning---iclr25/</link>
      <pubDate>Fri, 31 Oct 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/not-all-heads-matter---a-head-level-kv-cache-compression-method-with-integrated-retrieval-and-reasoning---iclr25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/HeadKV/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; ICLR&#39;25&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/FYYFU/HeadKV&#34;&gt;https://github.com/FYYFU/HeadKV&lt;/a&gt;.&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;my-thoughts&#34;&gt;My Thoughts&lt;/h2&gt;
&lt;p&gt;这篇工作和 DuoAttention 的关注点类似，都是关注不同 attention head 对模型不同能力的贡献不同，这篇工作更关注 attention head 对模型 &lt;strong&gt;Retrieval&lt;/strong&gt; 与 &lt;strong&gt;Reasoning&lt;/strong&gt; 的 importance score, 来实现 KV Cache 的 nonuniform budget allocation 。&lt;/p&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;现代 LLM 越来越支持极长上下文（例如 GPT-4、Llama-3、Qwen-2、Claude 等），但随着输入长度增长，Transformer 的 self-attention 导致 KV cache（attention 的 key/value 状态）占用内存线性增长，成为推理阶段的主要瓶颈。已有工作通过 token eviction / 层级缓存压缩来缓解，但&lt;strong&gt;几乎没有研究在“头（head）级别”上对 KV cache 大小进行差异化分配&lt;/strong&gt;。作者观察到 attention heads 在功能上高度异质（如 retrieval heads、reasoning heads 等），因此提出基于头重要性的 head-level KV cache 压缩方法（HeadKV），并在此基础上提出结合检索与推理能力评估的 HeadKV-R2。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-relative-work&#34;&gt;2. Relative Work&lt;/h2&gt;
&lt;h3 id=&#34;21-attention-heads&#34;&gt;2.1 Attention heads&lt;/h3&gt;
&lt;p&gt;回顾了对多头注意力中 head 功能的研究（Voita et al., Olsson et al., Wu et al., Zheng et al. 等），并指出不同 head 在词法、结构、复制（induction）、检索等方面扮演不同角色。这些观察为按 head 分配 KV cache 提供理论基础。&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 QSVD: Efficient Low-rank Approximation for Unified Query-Key-Value Weight Compression in Low-Precision Vision-Language Models - NeurIPS&#39;25 Spotlight</title>
      <link>https://jjl357.github.io/blog/posts/qsvd----efficient-low-rank-approximation-for-unified-query-key-value-weight-compression-in-low-precision-vision-language-models---neurips25-spotlight/</link>
      <pubDate>Thu, 30 Oct 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/qsvd----efficient-low-rank-approximation-for-unified-query-key-value-weight-compression-in-low-precision-vision-language-models---neurips25-spotlight/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/QSVD/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;NeurIPS&#39;25 Spotlight&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/SAI-Lab-NYU/QSVD&#34;&gt;https://github.com/SAI-Lab-NYU/QSVD&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;Vision–Language Models (VLMs) 如 LLaVA、BLIP2 等在图像描述、视觉问答 (VQA) 等任务中表现卓越，但这些模型需要极大的计算与存储开销，尤其在推理时：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;KV Cache 占用高&lt;/strong&gt;：注意力机制中需存储 Key、Value，每层缓存大小随序列长度线性增长。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Q/K/V 投影重复计算&lt;/strong&gt;：三组权重矩阵独立计算，造成算力浪费。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;模型量化困难&lt;/strong&gt;：激活分布存在极端 outliers，难以稳定进行低比特量化。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;QSVD 的目标是&lt;strong&gt;统一地对 Q/K/V 权重矩阵进行低秩近似&lt;/strong&gt;并结合&lt;strong&gt;后训练量化 (PTQ)&lt;/strong&gt;，实现以下三点：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;减少参数量、计算量、缓存占用；&lt;/li&gt;
&lt;li&gt;保持模型性能；&lt;/li&gt;
&lt;li&gt;支持低精度硬件部署。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/QSVD/figure1.png&#34;&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-related-work&#34;&gt;2. Related Work&lt;/h2&gt;
&lt;h3 id=&#34;21-svd-in-large-models&#34;&gt;2.1 SVD in Large Models&lt;/h3&gt;
&lt;p&gt;&lt;strong&gt;Singular Value Decomposition (SVD)&lt;/strong&gt; 是经典的矩阵分解方法。
对于矩阵 ( W \in \mathbb{R}^{m \times n} )，可分解为：&lt;/p&gt;
&lt;p&gt;$$
W = U \Sigma V^T
$$&lt;/p&gt;
&lt;p&gt;其中：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;(U, V) 为正交矩阵；&lt;/li&gt;
&lt;li&gt;(\Sigma) 为奇异值对角矩阵；&lt;/li&gt;
&lt;li&gt;保留前 (r) 个奇异值可得到 rank-(r) 近似：&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;$$
W \approx U_r \Sigma_r V_r^T
$$&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 R-KV: Redundancy-aware KV Cache Compression for Reasoning Models - NeurIPS&#39;25</title>
      <link>https://jjl357.github.io/blog/posts/r-kv---redundancy-aware-kv-cache-compression-for-reasoning-models---neurips25/</link>
      <pubDate>Sat, 25 Oct 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/r-kv---redundancy-aware-kv-cache-compression-for-reasoning-models---neurips25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/RKV/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; NeurIPS&#39;25&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/Zefan-Cai/R-KV&#34;&gt;https://github.com/Zefan-Cai/R-KV&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;my-thoughts&#34;&gt;My Thoughts&lt;/h2&gt;
&lt;p&gt;R-KV 针对previous works在efficient reasoning中由于只依靠attention scores而造成过多地保留了redundant tokens(重复而且对推理没有信息增益的token),R-KV的重点我觉得是增加了Redundancy Estimation via Semantic Similarity来解决这个问题,就Evaluation的结果来说，R-KV的效果是非常好的，即提升了Throughput还maintain了performance，甚至在budget充足的情况下还可以做到提点。&lt;/p&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;Reasoning models have demonstrated impressive performance in self-reflection and chain-of-thought reasoning.
However, they often produce excessively long outputs, leading to prohibitively large key-value (KV) caches during inference.&lt;/p&gt;
&lt;p&gt;For instance, a &lt;strong&gt;DeepSeek-R1-Distill-Llama-8B&lt;/strong&gt; model may generate &lt;strong&gt;32K tokens&lt;/strong&gt; to solve a complex math problem, consuming &lt;strong&gt;15.5GB&lt;/strong&gt; of memory to load model weights and &lt;strong&gt;4.1GB&lt;/strong&gt; to store the KV cache.
This long CoT (chain-of-thought) generation necessitates the development of &lt;strong&gt;KV cache compression&lt;/strong&gt;.&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs - *NeurIPS&#39;25</title>
      <link>https://jjl357.github.io/blog/posts/cdpruner---beyond-attention-or-similarity---maximizing-conditional-diversity-for-token-pruning-in-mllms-neuirips25/</link>
      <pubDate>Fri, 24 Oct 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/cdpruner---beyond-attention-or-similarity---maximizing-conditional-diversity-for-token-pruning-in-mllms-neuirips25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/CDPruner%20-%20Beyond%20Attention%20or%20Similarity%20-/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference&lt;/strong&gt;:  &lt;strong&gt;NeurIPS&#39;25&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;github&lt;/strong&gt;: &lt;a href=&#34;https://github.com/Theia-4869/CDPruner&#34;&gt;https://github.com/Theia-4869/CDPruner&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;my-thoughts&#34;&gt;My Thoughts&lt;/h2&gt;
&lt;p&gt;相较于 Attention-based methods 中的 &lt;strong&gt;attention shift&lt;/strong&gt; 问题和 Similarity-based methods 中忽略了 query 的问题，这篇论文从 &lt;strong&gt;增加 visual tokens 全局多样性（同时保持对 query 的关注）&lt;/strong&gt; 的角度出发，提出了 &lt;strong&gt;CDPruner&lt;/strong&gt;，通过将 token 多样性建模为 DPP（Determinantal Point Process）求解问题，实现了 SOTA 的 pruning 效果。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;motivations&#34;&gt;Motivations&lt;/h2&gt;
&lt;p&gt;在多模态大语言模型（MLLMs）中，视觉 token 的输入长度往往远大于文本 token，从而带来高昂的推理开销。例如：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;LLaVA-1.5 将一张 336×336 图像转换为 &lt;strong&gt;576 tokens&lt;/strong&gt;；&lt;/li&gt;
&lt;li&gt;LLaVA-NeXT 的高分辨率版本在输入加倍的情况下生成 &lt;strong&gt;2,880 tokens&lt;/strong&gt;；&lt;/li&gt;
&lt;li&gt;LongVA 处理 2,000 帧视频时生成超过 &lt;strong&gt;200K visual tokens&lt;/strong&gt;；&lt;/li&gt;
&lt;li&gt;LongVILA 能处理 &lt;strong&gt;6,000 帧&lt;/strong&gt;并产生 &lt;strong&gt;超过 1M visual tokens&lt;/strong&gt;，导致巨大的计算成本。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id=&#34;challenges&#34;&gt;Challenges&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/CDPruner%20-%20Beyond%20Attention%20or%20Similarity%20-/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;现有的视觉 token 剪枝方法主要分为两类：&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 Cache-to-Cache: Direct Semantic Communication Between Large Language Models - ICLR&#39;26</title>
      <link>https://jjl357.github.io/blog/posts/cache-to-cache---direct-semantic-communication-between-large-language-models/</link>
      <pubDate>Wed, 15 Oct 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/cache-to-cache---direct-semantic-communication-between-large-language-models/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/C2C/title.png&#34;&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;github：&lt;a href=&#34;https://github.com/thu-nics/C2C&#34;&gt;https://github.com/thu-nics/C2C&lt;/a&gt;&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;Conference:ICLR&#39;26&lt;/p&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id=&#34;-motivation动机--背景&#34;&gt;💡 Motivation（动机 / 背景）&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/C2C/figure1.png&#34;&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;现状：多-LLM 系统通常通过 &lt;strong&gt;文本（Text-to-Text, T2T）&lt;/strong&gt; 相互通信 —— 一个模型生成文本，另一个模型再读入文本并处理。这种方式存在的信息瓶颈（高维内部表示被压成文本）、歧义性（自然语言本身的模糊性）以及 &lt;strong&gt;串行解码带来的延迟&lt;/strong&gt; 等问题。&lt;/li&gt;
&lt;li&gt;问题：文本通信无法完整保留模型内部的高维语义信息（例如 KV-Cache 中的 rich semantics），同时文本通信需要逐 token 解码，增加通信与推理延迟。&lt;/li&gt;
&lt;li&gt;提出的问题（核心研究问）：&lt;strong&gt;LLM之间能否“超越文本”直接通信？能否通过共享/转换/融合 KV-Cache（key/value cache）来实现更丰富、更低延迟的语义通信？&lt;/strong&gt;（文中以 “Can LLMs communicate beyond text?” 作核心驱动。）&lt;/li&gt;
&lt;li&gt;主要观察驱动：作者的 Oracle 实验显示
(1) 在不扩大序列长度的前提下，丰富 KV-Cache 可以提升回答质量；
(2) 不同模型的 KV-Cache 在表示空间上是可转换/可对齐的（经过训练的简单 MLP 可将一个模型的 KV 映射到另一个模型空间）。
这些观察支持用 KV-Cache 作为通信媒介的可行性。&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;h2 id=&#34;-challenges挑战&#34;&gt;⚔ Challenges（挑战）&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/C2C/figure2.png&#34;&gt;&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;跨模型的 KV-Cache 表示差异&lt;/strong&gt;：不同模型（不同族、不同规模、不同 tokenizer）在同一输入上产生的 KV-Cache 分布差异显著（t-SNE 可视化）。如何可靠地将一个模型的 cache “投影”到另一个模型的语义空间并被有效利用是挑战。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;对齐问题（token-level &amp;amp; layer-level）&lt;/strong&gt;：不同 tokenizer 产生不同 token 划分，且模型层数不同，必须处理 token 对齐和层对齐问题（避免信息丢失或错位注入）。文中提出了 token 解码再 re-encode 的对齐策略和 “terminal alignment” 层对齐策略。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;避免破坏接收者原有语义&lt;/strong&gt;：直接用别人 cache 覆盖会破坏接收模型已有语义/结构，需设计残差式、可控的融合机制（即 Fuser 的设计）。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;选择性注入（哪些层注入、注入多少）&lt;/strong&gt;：并非所有层注入都有利，单层/多层注入效果差异明显（Appendix 的单层实验显示有层增益也有层下降），因此需要 learnable gate 来选择注入位置与比例。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;效率 / 延迟权衡&lt;/strong&gt;：虽然 C2C 目标是降低延迟，但在实现上要保证投影/融合本身不会引入比文本通信更高的开销（设计轻量 Fuser 并冻结主模型参数以降低训练/推理成本）。&lt;/li&gt;
&lt;/ol&gt;
&lt;hr&gt;
&lt;h2 id=&#34;-observations--analysis&#34;&gt;🔍 Observations / Analysis&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/C2C/f34t12.png&#34;&gt;&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
