<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>Knowledge Distillation on JJ&#39;s Blog</title>
    <link>https://jjl357.github.io/blog/tags/knowledge-distillation/</link>
    <description>Recent content in Knowledge Distillation on JJ&#39;s Blog</description>
    <generator>Hugo -- 0.152.2</generator>
    <language>zh-cn</language>
    <lastBuildDate>Mon, 10 Nov 2025 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://jjl357.github.io/blog/tags/knowledge-distillation/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>📝 MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders -CVPR 2025 </title>
      <link>https://jjl357.github.io/blog/posts/move-kd---knowledge-distillation-for-vlms-with-mixture-of-visual-encoders---cvpr25/</link>
      <pubDate>Mon, 10 Nov 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/move-kd---knowledge-distillation-for-vlms-with-mixture-of-visual-encoders---cvpr25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/MoVE-KD/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;CVPR 2025&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github：&lt;/strong&gt; &lt;a href=&#34;https://github.com/hey-cjj/MoVE-KD&#34;&gt;https://github.com/hey-cjj/MoVE-KD&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;视觉编码器（Visual Encoder）是视觉语言模型（VLM）的核心组件，每个编码器通常源自不同的视觉基础模型（Visual Foundation Model），因此具备不同的特长与感知能力。为了充分利用这些差异化优势，近年来许多研究在单一 VLM 中整合多个视觉编码器。然而，这种设计虽然能融合多源知识，却导致计算量大幅上升、模型复杂度增加，严重影响了效率与可扩展性。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;核心问题：&lt;/strong&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;是否可以将多个视觉编码器的特长“蒸馏”进一个单一编码器中，从而兼具多编码器的性能与单编码器的高效性？&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;MoVE-KD（Mixture-of-Visual-Encoder Knowledge Distillation）正是为了解决这一问题而提出的。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-challenge&#34;&gt;2. Challenge&lt;/h2&gt;
&lt;p&gt;现有方法（如 [24, 38, 42]）通常通过特征拼接（feature concatenation）或注意力融合（attention fusion）等方式结合多个视觉编码器，但多编码器必然带来高计算开销和复杂模型结构，削弱了训练与推理效率。&lt;/p&gt;
&lt;p&gt;此外，尽管知识蒸馏（Knowledge Distillation, KD）为知识压缩提供了思路，但传统 KD 主要是 &lt;strong&gt;一对一（one-to-one）&lt;/strong&gt; 蒸馏，即单个教师到单个学生。而如何从多个来源、不同预训练目标的视觉教师模型中同时学习，是一个尚未充分探索的问题。&lt;/p&gt;
&lt;p&gt;此前如 &lt;strong&gt;AM-RADIO [36]&lt;/strong&gt; 虽引入多教师思路，但由于共享主干、学习冲突严重，性能受限。
MoVE-KD 的目标是建立一个统一框架，将多教师视觉知识高效压缩进单一学生模型中，同时解决知识冲突与效率问题。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;3-contribution&#34;&gt;3. Contribution&lt;/h2&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/MoVE-KD/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;MoVE-KD 的提出灵感来自 ViT 的 token 扩展方法 [9]，其核心思想是利用注意力机制引导多教师的知识蒸馏过程，通过 [CLS] token 判断视觉 token 的重要性，并分配动态权重，从而“选择性”吸收有价值的信息。&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;提出 MoVE-KD 框架&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;首个从知识蒸馏角度实现“多视觉编码器融合”的统一框架；&lt;/li&gt;
&lt;li&gt;可在不增加模型复杂度的情况下，将不同视觉编码器的知识压缩进单模型。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;提出 Attention-guided KD 机制&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;通过 [CLS] token 的注意力图，动态评估每个视觉 token 的重要性；&lt;/li&gt;
&lt;li&gt;引入多教师权重自适应机制（Teacher Weighting），使更有价值的教师贡献更大；&lt;/li&gt;
&lt;li&gt;使用 &lt;strong&gt;Mixture-of-LoRA-Experts (MoLE)&lt;/strong&gt; 结构缓解教师间知识冲突。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;在 LLaVA / LLaVA-NeXT 等主流 VLM 上取得 SOTA&lt;/strong&gt;&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 Efficient Multi-modal Large Language Models via Progressive Consistency Distillation - NeurIPS&#39;25</title>
      <link>https://jjl357.github.io/blog/posts/efficient-multi-modal-large-language-models-via-progressive-consistency-distillation---neurips25/</link>
      <pubDate>Fri, 07 Nov 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/efficient-multi-modal-large-language-models-via-progressive-consistency-distillation---neurips25/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/EPIC/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference：&lt;/strong&gt; NeurIPS 2025&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github：&lt;/strong&gt; &lt;a href=&#34;https://github.com/ZichenWen1/EPIC&#34;&gt;https://github.com/ZichenWen1/EPIC&lt;/a&gt;&lt;/p&gt;
&lt;h2&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/EPIC/figure3.png&#34;&gt;&lt;/h2&gt;
&lt;h2 id=&#34;my-thoughts&#34;&gt;My Thoughts&lt;/h2&gt;
&lt;p&gt;EPIC 这篇论文的核心思想是在&lt;strong&gt;不改动模型结构&lt;/strong&gt;的前提下，通过&lt;strong&gt;渐进式一致性蒸馏（Progressive Consistency Distillation）&lt;/strong&gt;，让多模态大语言模型在&lt;strong&gt;token 层面（Token Consistency Distillation, TCD）&lt;/strong&gt; 和 &lt;strong&gt;层级层面（Layer Consistency Distillation, LCD）&lt;/strong&gt; 逐步适应视觉 token 压缩带来的特征分布变化，从而实现从低压缩到高压缩的平滑过渡，在显著降低计算量与显存占用的同时仍保持甚至提升模型性能。这种从训练策略层面解决效率问题的思路，兼具理论优雅性与实用性。&lt;/p&gt;
&lt;p&gt;日后如果有需要用到 Knowledge  Dsitillation 的 idea 或者 训练策略，可以借鉴其思想。&lt;/p&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;多模态大语言模型（MLLM）需要同时处理文本与视觉模态的信息。与仅需处理少量高信息密度文本 token 的 LLM 不同，MLLM 在输入中包含大量视觉 token，这些 token 在高分辨率图像或多帧视频任务中尤为庞大。这种“视觉 token 爆炸”（visual token explosion）带来了显著的&lt;strong&gt;计算负担与存储压力&lt;/strong&gt;，尤其在推理时对 KV cache 和显存的占用极大。&lt;/p&gt;
&lt;p&gt;因此，如何在不显著降低性能的前提下&lt;strong&gt;减少视觉 token 的数量&lt;/strong&gt;，成为提升 MLLM 效率的核心问题。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;2-challenge&#34;&gt;2. Challenge&lt;/h2&gt;
&lt;p&gt;视觉 token 数量通常比文本 token 多出几个数量级，但其包含的空间信息高度冗余。近年来，研究者提出了两大类视觉 token 压缩方法：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;Training-free 方法：&lt;/strong&gt; 不需要额外训练，通过简单的启发式规则压缩视觉 token。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;基于重要性（importance-based）&lt;/strong&gt;：如 FastV、SparseVLM，依据注意力得分筛选重要 token。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;基于冗余（redundancy-based）&lt;/strong&gt;：如 DART、G-Prune，通过 token 相似度评估合并或舍弃冗余特征。&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;Training-aware 方法：&lt;/strong&gt; 在训练阶段显式引入压缩模块，让模型学习在压缩下保持性能。
典型工作包括：&lt;/p&gt;</description>
    </item>
    <item>
      <title>📝 AdaSPEC: Selective Knowledge Distillation for Efficient Speculative Decoders - NeurIPS&#39;25 Spotlight</title>
      <link>https://jjl357.github.io/blog/posts/adaspec---selective-knowledge-distillation-for-efficient-speculative-decoders---neurips25-spotlight/</link>
      <pubDate>Mon, 27 Oct 2025 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/adaspec---selective-knowledge-distillation-for-efficient-speculative-decoders---neurips25-spotlight/</guid>
      <description>&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/AdaSpec/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;NeurIPS&#39;25 Spotlight&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/yuezhouhu/adaspec&#34;&gt;https://github.com/yuezhouhu/adaspec&lt;/a&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;my-thoughts&#34;&gt;My Thoughts&lt;/h2&gt;
&lt;p&gt;有个问题在于：对于论文中提到的“hard tokens”，是否能 distill 出一个合适且有用的 draft model？&lt;br&gt;
论文结果显示当前方法对这些 token 效果较差（甚至比 reference model 还差），  因此好奇是否可能需要新的方式来改进这一部分的蒸馏与利用机制。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;1-motivation&#34;&gt;1. Motivation&lt;/h2&gt;
&lt;p&gt;Speculative Decoding (SD) accelerates large language model inference by employing a small &lt;strong&gt;draft model&lt;/strong&gt; to generate predictions, which are then verified by a larger &lt;strong&gt;target model&lt;/strong&gt;.&lt;/p&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/AdaSpec/figure1.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;SD 的加速性能依赖于 draft 与 target 模型的&lt;strong&gt;对齐度（alignment）&lt;/strong&gt;。传统 Knowledge Distillation (KD) 的目标是最小化 KL 散度，但这与 SD 的最终目标——&lt;strong&gt;最大化 token acceptance rate（被 target 接受的比例）&lt;/strong&gt;——并不一致。&lt;/p&gt;
&lt;p&gt;因此，即使 KD 能使分布接近，也不一定提升 SD 的实际加速效果。&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
