<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>Test-Time Scaling on JJ&#39;s Blog</title>
    <link>https://jjl357.github.io/blog/tags/test-time-scaling/</link>
    <description>Recent content in Test-Time Scaling on JJ&#39;s Blog</description>
    <generator>Hugo -- 0.152.2</generator>
    <language>zh-cn</language>
    <lastBuildDate>Thu, 06 Aug 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://jjl357.github.io/blog/tags/test-time-scaling/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>📝 Deep Think with Confidence - ICLR&#39;26</title>
      <link>https://jjl357.github.io/blog/posts/deep-think-with-confidence---iclr26/</link>
      <pubDate>Thu, 06 Aug 2026 00:00:00 +0000</pubDate>
      <guid>https://jjl357.github.io/blog/posts/deep-think-with-confidence---iclr26/</guid>
      <description>&lt;h1 id=&#34;deep-think-with-confidence&#34;&gt;Deep Think with Confidence&lt;/h1&gt;
&lt;p&gt;&lt;img loading=&#34;lazy&#34; src=&#34;https://jjl357.github.io/blog/image/DeepConf/title.png&#34;&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Conference:&lt;/strong&gt; &lt;strong&gt;ICLR 2026 Poster&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Paper:&lt;/strong&gt; &lt;a href=&#34;https://openreview.net/forum?id=8LqHs0KIM7&#34;&gt;OpenReview&lt;/a&gt; · &lt;a href=&#34;https://arxiv.org/abs/2508.15260&#34;&gt;arXiv&lt;/a&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Project:&lt;/strong&gt; &lt;a href=&#34;https://jiaweizzhao.github.io/deepconf/&#34;&gt;https://jiaweizzhao.github.io/deepconf/&lt;/a&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Github:&lt;/strong&gt; &lt;a href=&#34;https://github.com/facebookresearch/deepconf&#34;&gt;https://github.com/facebookresearch/deepconf&lt;/a&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Authors:&lt;/strong&gt; Yichao Fu, Xuewei Wang, Hao Zhang, Yuandong Tian, Jiawei Zhao&lt;/p&gt;
&lt;h2 id=&#34;abstract&#34;&gt;Abstract&lt;/h2&gt;
&lt;p&gt;推理模型的 test-time scaling 通常沿两个方向展开：一是让单条 Chain-of-Thought 更长，二是并行采样更多推理轨迹，再通过 majority voting 或 verifier 聚合答案。第二种方法也称 &lt;strong&gt;parallel thinking&lt;/strong&gt; 或 self-consistency。它简单且有效，但成本随轨迹数量近似线性增加，而且普通多数投票默认每条轨迹同样可靠，低质量推理同样拥有一票。&lt;/p&gt;
&lt;p&gt;Deep Think with Confidence（DeepConf）提出一个无需训练、无需外部奖励模型的改进：直接读取生成模型内部的 top-k token 概率，用局部低置信度片段判断整条推理是否可靠。它包含两个工作模式：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;Offline DeepConf&lt;/strong&gt;：所有推理轨迹生成完成后，按置信度过滤低质量轨迹，再执行置信度加权投票，主要目标是提高准确率；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Online DeepConf&lt;/strong&gt;：生成过程中维护滑动窗口置信度，当一条轨迹跌破由 warmup 样本确定的阈值时立即停止，并根据当前答案共识度决定是否继续采样，主要目标是节省推理 token。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;论文在 AIME 2024/2025、BRUMO 2025、HMMT 2025 与 GPQA-Diamond 上评测 DeepSeek-8B、Qwen3-8B/32B、GPT-OSS-20B/120B。离线模式中，GPT-OSS-120B 在 AIME 2025 上由 pass@1 的 91.8% 和 cons@512 的 97.0% 提升到 &lt;strong&gt;99.9%&lt;/strong&gt;；在线模式在同一模型和数据集上将 token 数从 \(3.23\times10^8\) 降到 \(0.49\times10^8\)，节省 &lt;strong&gt;84.7%&lt;/strong&gt;，准确率为 97.9%。&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
