<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>Edge Inference on JJ&#39;s Blog</title>
    <link>https://jjl357.github.io/blog/tags/edge-inference/</link>
    <description>Recent content in Edge Inference on JJ&#39;s Blog</description>
    <generator>Hugo -- 0.152.2</generator>
    <language>zh-cn</language>
    <lastBuildDate>Wed, 19 Aug 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://jjl357.github.io/blog/tags/edge-inference/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>📝 FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution</title>
      <link>https://jjl357.github.io/blog/posts/freetoken---efficient-edge-native-moe-serving-with-bandwidth-adaptive-execution/</link>
      <pubDate>Wed, 19 Aug 2026 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/freetoken---efficient-edge-native-moe-serving-with-bandwidth-adaptive-execution/</guid>
      <description>&lt;h1 id=&#34;freetoken-efficient-edge-native-moe-serving-with-bandwidth-adaptive-execution&#34;&gt;FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution&lt;/h1&gt;
&lt;p&gt;&lt;strong&gt;Status:&lt;/strong&gt; &lt;strong&gt;arXiv v1, 2026-08-17&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Paper:&lt;/strong&gt; &lt;a href=&#34;https://arxiv.org/abs/2608.16157&#34;&gt;https://arxiv.org/abs/2608.16157&lt;/a&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;GitHub:&lt;/strong&gt; &lt;a href=&#34;https://github.com/FlashML-org/FreeToken&#34;&gt;https://github.com/FlashML-org/FreeToken&lt;/a&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Project / Download:&lt;/strong&gt; &lt;a href=&#34;https://flashml.ai&#34;&gt;https://flashml.ai&lt;/a&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Authors:&lt;/strong&gt; Shuo Yang, Xiaoze Fan, Melissa Pan, Haocheng Xi, Zhe Wang, Shanlin Sun, Kurt Keutzer, Song Han, Matei Zaharia, Chenfeng Xu, Ion Stoica&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;一句话总结：&lt;/strong&gt; FreeToken 不把个人电脑看成“一块放不下模型的小 GPU”，而是把 GPU、CPU、主存、PCIe 和 SSD 组织成一个统一的弹性推理平台：Prefill 时整层双缓冲隐藏专家搬运，Decode 时根据机器实测带宽把缓存 miss 动态分给 GPU 加载和 CPU 原地计算，Agent 上下文被编辑时则从语义边界的状态检查点恢复。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;版本说明：&lt;/strong&gt; 本文严格对应 2026 年 8 月 17 日发布的 arXiv v1。论文是一篇刚发布的预印本，文中的模型、软硬件支持与性能数字应按该版本理解。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id=&#34;abstract&#34;&gt;Abstract&lt;/h2&gt;
&lt;p&gt;MoE 模型有一个很诱人的性质：虽然总参数量可能达到数百 B，但每个 token 只激活少量专家，因此一次 token 计算真正用到的参数远少于完整模型。以论文中的 DeepSeek-V4-Flash 为例，它有 &lt;strong&gt;284B 总参数、13B 激活参数&lt;/strong&gt;，每层只从 256 个 routed experts 中选择 6 个。13B 的活跃计算量对消费级 GPU 并非不可承受，真正困难的是：&lt;strong&gt;没有被当前 token 激活的专家仍然要被存放，而 284B 的完整权重远超消费级显存。&lt;/strong&gt;&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
