Deep Think with Confidence

Conference: ICLR 2026 Poster

Paper: OpenReview · arXiv

Project: https://jiaweizzhao.github.io/deepconf/

Github: https://github.com/facebookresearch/deepconf

Authors: Yichao Fu, Xuewei Wang, Hao Zhang, Yuandong Tian, Jiawei Zhao

Abstract

推理模型的 test-time scaling 通常沿两个方向展开:一是让单条 Chain-of-Thought 更长,二是并行采样更多推理轨迹,再通过 majority voting 或 verifier 聚合答案。第二种方法也称 parallel thinking 或 self-consistency。它简单且有效,但成本随轨迹数量近似线性增加,而且普通多数投票默认每条轨迹同样可靠,低质量推理同样拥有一票。

Deep Think with Confidence(DeepConf)提出一个无需训练、无需外部奖励模型的改进:直接读取生成模型内部的 top-k token 概率,用局部低置信度片段判断整条推理是否可靠。它包含两个工作模式:

  1. Offline DeepConf:所有推理轨迹生成完成后,按置信度过滤低质量轨迹,再执行置信度加权投票,主要目标是提高准确率;
  2. Online DeepConf:生成过程中维护滑动窗口置信度,当一条轨迹跌破由 warmup 样本确定的阈值时立即停止,并根据当前答案共识度决定是否继续采样,主要目标是节省推理 token。

论文在 AIME 2024/2025、BRUMO 2025、HMMT 2025 与 GPQA-Diamond 上评测 DeepSeek-8B、Qwen3-8B/32B、GPT-OSS-20B/120B。离线模式中,GPT-OSS-120B 在 AIME 2025 上由 pass@1 的 91.8% 和 cons@512 的 97.0% 提升到 99.9%;在线模式在同一模型和数据集上将 token 数从 \(3.23\times10^8\) 降到 \(0.49\times10^8\),节省 84.7%,准确率为 97.9%。

这里必须区分:99.9% 是离线 Tail Confidence 过滤结果,84.7% 是在线 DeepConf-low 的 token 节省,它们并非同一配置下同时取得。

1. Motivation

1.1 The Cost of Parallel Thinking

设一个问题采样 \(K\) 条独立推理轨迹,每条平均生成 \(L\) 个 token,那么生成成本近似为:

$$ \operatorname{Cost}_{\mathrm{parallel}}=\mathcal{O}(KL). $$

论文给出的直观例子是:使用 Qwen3-8B 在 AIME 2025 上将 pass@1 从约 68% 提升到 cons@512 的约 82%,需要额外生成 511 条轨迹,每道题的总额外开销累积到约一亿 token。

更大的 \(K\) 也不保证一直变好。多数投票只有在“正确答案比任一错误答案更容易形成多数”时才有效。当模型反复犯同一种系统性错误,增加采样数会让错误答案获得更稳定的多数;当大量低质量轨迹分散到不同错误答案时,也会稀释高质量少数轨迹的贡献。因此 self-consistency 经常出现收益递减、饱和,甚至准确率下降。

1.2 Why Equal Voting Is Wasteful

普通多数投票只使用每条轨迹的最终答案:

$$ V(a)=\sum_{t\in\mathcal{T}}\mathbb{I}\!\left[\operatorname{answer}(t)=a\right]. $$

最终选择:

$$ \hat{a}=\arg\max_a V(a). $$

这个规则会丢掉轨迹内部的大量信息:模型在哪一步开始犹豫、是否反复出现 “wait” 或 “think again”、最后结论是否低置信度,都不影响投票权重。DeepConf 的基本假设是:生成模型自己的 token 分布已经包含推理质量信号,不应只保留最终答案字符串。

1.3 Limitations of Global Confidence

已有方法常把整条轨迹的 token 置信度求平均。全局平均能区分一部分正确和错误轨迹,却有两个缺陷:

  • 一段关键推理发生低置信度崩溃,可能被大量简单、高置信度的连接词和常规计算步骤掩盖;
  • 必须等整条轨迹生成结束后才能得到完整平均值,无法在生成过程中提前停止。

DeepConf 因此把注意力从“整条轨迹平均有多自信”转向“这条轨迹最不自信的局部片段有多糟糕”。

2. Confidence as a Reasoning Quality Signal

2.1 Token Entropy

模型在位置 \(i\) 给出的词表概率分布为 \(P_i\),token entropy 定义为:

$$ H_i=-\sum_jP_i(j)\log P_i(j). $$

如果概率集中在少数候选上,熵较低,说明下一 token 选择更确定;如果概率分布平坦,熵较高,说明模型对接下来如何继续存在不确定性。

2.2 Token Confidence

DeepConf 没有直接使用完整词表熵,而是读取 top-k 候选 token 的 log probability,定义:

$$ C_i=-\frac{1}{k}\sum_{j=1}^{k}\log P_i(j). $$

其中 \(P_i(j)\) 是位置 \(i\) 的第 \(j\) 个 top-k 候选概率。这个值反映 top-k 分布的集中程度。论文实验及 vLLM 实现使用 top_logprobs=20

附录给出的最小 vLLM 修改在代码层面会跳过 logprobs[0] 中已经采样的 token,对其余候选 logprob 求负均值:

new_conf = -sum(logprobs[1:]) / len(logprobs[1:])

因此实际部署必须保证推理后端能够返回多个候选 logprob。若 API 只返回采样 token 本身的概率,无法原样实现论文的在线置信度。

2.3 Average Trace Confidence

对于长度为 \(N\) 的完整推理轨迹 \(t\),全局平均置信度为:

$$ C_{\mathrm{avg}}(t)=\frac{1}{N}\sum_{i=1}^{N}C_i. $$

它是论文的基础对照。该指标平滑、稳定,但会把所有位置等权平均,因此不敏感于短暂却致命的推理错误。

2.4 Group Confidence

DeepConf 使用长度为 \(n\) 的重叠滑动窗口 \(G_i\) 聚合 token 置信度:

$$ C_{G_i}=\frac{1}{\lvert G_i\rvert}\sum_{r\in G_i}C_r. $$

窗口在每个生成位置更新,因此相邻 group 高度重叠。论文主要使用 \(n=2048\),也在附录比较 512、1024 和 2048。group confidence 有两个作用:

  • 比单 token 分数更平滑,不会因为一个罕见符号或数字的偶然低概率就错误停止;
  • 比全轨迹平均更局部,能够定位中间步骤持续数百或数千 token 的不确定区间。

2.5 Bottom-10% Group Confidence

设一条轨迹的全部 group 集合为 \(\mathcal{G}\),其中置信度最低的 10% group 构成 \(\mathcal{G}_b\),则:

$$ C_{\mathrm{bottom\text{-}10}}(t)=\frac{1}{\lvert\mathcal{G}_b\rvert}\sum_{G_j\in\mathcal{G}_b}C_{G_j}. $$

该指标不会只看一个极端最小值,而是评估整条轨迹最差的那一小部分。它适合离线排序,因为完整轨迹生成后才能知道哪些 group 位于最低 10%。

2.6 Lowest Group Confidence

最激进的局部指标只取整条轨迹中最低的 group confidence:

$$ C_{\mathrm{least}}(t)=\min_{G_j\in\mathcal{G}}C_{G_j}. $$

它可以边生成边维护。一旦当前窗口置信度低于停止阈值,最终的 minimum 不可能再回升,因此可以立即判定该轨迹不会进入高置信度候选集。这是 Online DeepConf 能够提前停止的关键。

2.7 Tail Confidence

设 \(\mathcal{T}_{\mathrm{tail}}\) 为轨迹最后固定数量的 token,论文默认取最后 2048 个,则:

$$ C_{\mathrm{tail}}(t)=\frac{1}{\lvert\mathcal{T}_{\mathrm{tail}}\rvert}\sum_{i\in\mathcal{T}_{\mathrm{tail}}}C_i. $$

Tail Confidence 的动机是:数学推理的最终化简、答案选择和结论包装直接决定正确性。一条轨迹前半段思路正确,但结尾计算或结论低置信度,仍然应该降低权重。论文的 99.9% AIME 2025 结果正是使用最后 2048 token 的 Tail Confidence、保留 top 10% 轨迹得到的。

2.8 Why Local Measurements Work

论文在 HMMT 2025 的 30 道题上为每题采样 4096 条轨迹,比较正确与错误轨迹的置信度分布。结果表明:

  • Average Trace Confidence 已能提供一定区分;
  • Bottom-10% 与 Tail Confidence 的正确/错误分布分离更明显;
  • 轨迹中最低置信度局部通常对应重新思考、否定前一步或推理方向不稳定的位置。

这并不意味着低置信度必然错误,而是它提供一个无需标注、无需 verifier 的排序信号。

3. Offline DeepConf

3.1 Confidence-weighted Majority Voting

对于轨迹 \(t\) 的置信度 \(C_t\),加权投票写成:

$$ V_C(a)=\sum_{t\in\mathcal{T}}C_t\cdot\mathbb{I}\!\left[\operatorname{answer}(t)=a\right]. $$

最终答案仍取 \(\arg\max_aV_C(a)\),但高置信度轨迹拥有更大权重。与 reward model 或外部 verifier 不同,\(C_t\) 完全来自正在生成答案的模型本身。

3.2 Confidence Filtering

仅加权仍允许大量低置信度轨迹参与投票。DeepConf 先按 \(C_t\) 排序,只保留 top-\(\eta\%\),然后在保留集合上执行加权多数投票。论文固定比较:

  • top 10%:激进过滤,只保留最自信的十分之一;
  • top 90%:保守过滤,只删除最差的十分之一。

top 10% 往往带来更高峰值准确率,但如果模型对某个错误模式高度自信,会把投票集中到错误答案;top 90% 保留更多多样性,通常更稳定。

3.3 Offline Algorithm

Input: prompt P, trace count K, retention ratio η, confidence metric C(t)

1. Independently generate K complete reasoning traces.
2. Extract each trace's final answer and compute C(t).
3. Rank traces by confidence and retain the top η%.
4. Accumulate confidence-weighted votes for every candidate answer.
5. Return the answer with the largest weighted vote.

需要强调:在固定 \(K\) 下,Offline DeepConf 已经生成了全部完整轨迹,所以过滤本身不会返还生成成本。它的直接收益是更准确的聚合;只有当它以更小 \(K\) 达到普通多数投票在更大 \(K\) 下的准确率时,才能间接节省 token。

4. Online DeepConf

在线模式将置信度计算放入 decode loop,包含 offline warmup、confidence early stopping、confidence filtering、adaptive sampling 四个环节。

4.1 Per-prompt Offline Warmup

对每个新问题先完整生成 \(N_{\mathrm{init}}\) 条轨迹,论文默认 \(N_{\mathrm{init}}=16\)。计算这些轨迹的 Lowest Group Confidence,再建立当前问题专属阈值:

$$ s=\operatorname{Percentile}_{100-\eta}\!\left(\{C_t:t\in\mathcal{T}_{\mathrm{warmup}}\}\right). $$
  • DeepConf-low 设置 \(\eta=10\%\),因此 \(s\) 是 warmup 置信度的第 90 百分位,只允许最高置信度区域继续生成;
  • DeepConf-high 设置 \(\eta=90\%\),因此 \(s\) 是第 10 百分位,仅提前停止明显较差的轨迹。

这里的 low/high 不是置信度数值高低,而是两种过滤强度的名字:low 更激进、更省 token;high 更保守、更稳健。

4.2 Confidence-based Early Stopping

warmup 后,每条新轨迹生成一个 token 就更新长度为 2048 的滑动窗口。当前 group confidence 满足:

$$ C_{G_i}\lt s $$

时立刻终止这条轨迹。直觉是:既然该轨迹的局部 minimum 已低于保留阈值,即使继续生成,它也会在最终离线过滤中被删除,因此没有必要支付剩余 token 成本。

官方动画直观展示了多条轨迹的置信度随 token 位置变化,跌破虚线阈值的轨迹会被提前停止:

4.3 Adaptive Sampling by Answer Consensus

仅停止单条低质量轨迹仍可能继续启动很多新样本。DeepConf 还根据当前答案的一致程度决定整个问题是否已经“想够了”。设当前加权多数答案为 \(\hat{a}\),定义共识度:

$$ \beta=\frac{V_C(\hat{a})}{\sum_aV_C(a)}. $$

若 \(\beta\ge\tau\),说明当前答案已经占据足够高的投票权重,可以停止继续采样;若 \(\beta\lt\tau\),则继续生成,直到达到最大轨迹预算 \(B\)。论文默认 \(\tau=0.95\),并使用:

$$ B\in\{32,64,128,256,512\}. $$

这让不同难度问题消耗不同算力:简单问题在少量轨迹后形成高共识,困难问题则继续使用剩余预算。

4.4 Online Algorithm

Input: prompt P, total budget B, warmup size N_init,
       retention ratio η, consensus threshold τ

Warmup:
1. Generate N_init complete traces.
2. Compute each trace's lowest group confidence.
3. Set threshold s from the corresponding confidence percentile.
4. Filter and confidence-weight the warmup answers.

Online generation:
5. While weighted consensus β < τ and trace count < B:
   a. start a new reasoning trace;
   b. update 2048-token group confidence after every token;
   c. terminate this trace immediately if group confidence < s;
   d. otherwise extract its answer and update weighted votes.
6. Return the highest-weight answer.

随着 \(N_{\mathrm{init}}\) 增大,warmup 对置信度分布的估计更稳定,在线阈值会逐渐逼近离线 top-\(\eta\%\) 过滤策略。但 warmup 本身必须完整生成,因此 \(N_{\mathrm{init}}\) 过大会侵蚀节省。

5. Experimental Setup

5.1 Models

Model Parameters Family Max Generation Length
DeepSeek-8B 8B DeepSeek-R1-0528 distilled to Qwen3-8B 64K
Qwen3-8B 8B Qwen3 32K
Qwen3-32B 32B Qwen3 32K
GPT-OSS-20B 20B GPT-OSS 130K
GPT-OSS-120B 120B GPT-OSS 130K

其中论文所称 DeepSeek-8B,具体是 DeepSeek-R1-0528-Qwen3-8B

5.2 Benchmarks

Benchmark Domain Main Characteristic
AIME 2024 Competition Math 高难度整数答案题
AIME 2025 Competition Math 新近、难度较高的 AIME 题目
BRUMO 2025 Competition Math Brown University Math Olympiad
HMMT 2025 Competition Math Harvard–MIT 数学竞赛题
GPQA-Diamond Graduate STEM 研究生级科学推理与知识问答

前四个基准以数学推理为主,GPQA-Diamond 用于验证方法是否只对数学答案投票有效。

5.3 Sampling and Evaluation Protocol

论文先为每个问题预生成 4096 条完整轨迹,建立共同采样池。每次实验从池中重新采样工作集:

  • Offline:从池中采样 \(K\) 条完整轨迹,比较普通投票、置信度加权和过滤;
  • Online:使用相同池模拟逐条生成与提前停止,提前终止轨迹只计实际产生的 token;
  • 每个配置独立重采样并重复 64 次,最终报告平均准确率与 token 数;
  • 主要结果使用 \(K=512\),扩展实验扫描 32、64、128、256、512。

这种 protocol 保证各方法看到一致的候选分布,降低单次随机采样造成的方差。但在线实验基于预生成池回放,主要测量 token 数和答案质量,并不是包含调度、batch fragmentation 与硬件利用率的真实端到端吞吐测试。

5.4 Generation Hyperparameters

Model Temperature Top-p Top-k
DeepSeek-8B 0.6 0.95
Qwen3-8B / 32B 0.6 0.95 20
GPT-OSS-20B / 120B 1.0 1.0 40

Qwen3 与 GPT-OSS 使用相同的 step-by-step 指令,并要求最终答案放进 \boxed{};GPT-OSS 保留官方 system prompt,设置 reasoning effort 为 high。DeepSeek-8B 使用其官方 system prompt。

6. Offline Results

6.1 Confidence Filtering at 512 Traces

下面选取 Table 1 中最有代表性的配置。Bottom-10@10 表示按 Bottom-10% Group Confidence 只保留 top 10%,Tail@10 表示按最后 2048 token 的 Tail Confidence 只保留 top 10%。

Model / Dataset Pass@1 Cons@512 Mean Conf Bottom-10@10 Tail@10
DeepSeek-8B / AIME24 83.0 86.7 86.7 93.3 93.3
DeepSeek-8B / AIME25 76.9 82.3 82.3 87.5 87.4
DeepSeek-8B / HMMT25 58.1 69.6 69.9 79.5 83.9
Qwen3-32B / AIME24 80.6 85.3 85.7 90.8 89.4
GPT-OSS-120B / AIME25 91.8 97.0 97.1 98.1 99.9
GPT-OSS-120B / BRUMO25 75.6 86.7 86.8 82.9 89.4
GPT-OSS-120B / HMMT25 78.9 92.9 92.9 90.5 88.9

结果说明:

  1. 单纯 Mean Confidence 加权通常只比普通多数投票高一点;
  2. 局部置信度加上过滤能够带来更大增益,例如 DeepSeek-8B/HMMT25 从 69.6 提升到 83.9;
  3. 没有一个激进指标对所有模型和数据集都最优。GPT-OSS-120B/HMMT25 中,top 10% 过滤反而从 92.9 降到 88.9;
  4. top 90% 过滤更接近普通多数投票,适合不愿承担准确率回退的场景。

6.2 Lowest Group Confidence

在 DeepSeek-8B 的 AIME24、AIME25、BRUMO25、HMMT25 上,使用 2048-token Lowest Group Confidence:

  • top 10% 相比每个数据集的最佳多数投票提高 0.26–9.38 个百分点,平均提高 5.27
  • top 90% 在四个数据集上匹配或略超多数投票,平均提高 0.29
  • 相比单轨迹推理,top 10% 平均提高 14.30 个百分点。

扩展到 5 个模型、4 个数学数据集的 20 个配置后,top 90% 相比多数投票平均提高 0.17 个百分点,范围为 -0.21 到 +0.73;top 10% 在 12/20 个配置中提高 0.26–9.38,在另外 8 个配置中下降 0.31–4.69,整体平均提高 1.22。

因此 top 10% 是“高收益、高方差”的选择,top 90% 则是接近保守替换多数投票的选择。

7. Online Results

7.1 Matched Budget at 512 Traces

表中的 token 单位为 \(10^8\)。DeepConf-high 保留 top 90%,DeepConf-low 保留 top 10%。

Model / Dataset Majority Tokens / Acc. High Tokens / Acc. Low Tokens / Acc.
DeepSeek-8B / AIME24 3.55 / 86.7 1.45 (-59.0%) / 86.7 0.78 (-77.9%) / 92.5
DeepSeek-8B / AIME25 4.01 / 82.3 2.37 (-40.9%) / 81.4 1.24 (-69.0%) / 86.4
DeepSeek-8B / HMMT25 4.49 / 69.8 3.43 (-23.5%) / 70.0 1.60 (-64.4%) / 77.6
Qwen3-8B / AIME25 2.77 / 82.5 1.99 (-28.1%) / 82.8 1.31 (-52.7%) / 78.1
Qwen3-32B / AIME24 2.00 / 84.8 0.88 (-56.0%) / 86.4 0.66 (-66.8%) / 89.5
GPT-OSS-20B / AIME25 6.26 / 95.4 3.18 (-49.2%) / 95.3 1.21 (-80.7%) / 96.1
GPT-OSS-120B / AIME25 3.23 / 97.1 1.42 (-56.0%) / 97.0 0.49 (-84.7%) / 97.9
GPT-OSS-120B / HMMT25 4.09 / 92.8 2.78 (-32.0%) / 93.0 0.97 (-76.2%) / 92.0

整体规律为:

  • DeepConf-low 通常减少约 43%–84% token,并在多数配置中保持或提高准确率;
  • DeepConf-high 通常减少约 16%–59% token,准确率变化更小;
  • 激进策略并非无损,例如 Qwen3-8B/AIME25 节省 52.7%,但准确率下降 4.4 个百分点;
  • 最大节省 84.7% 来自 GPT-OSS-120B/AIME25,在线准确率为 97.9%,而不是离线结果中的 99.9%。

7.2 Accuracy–Token Pareto Frontier

论文扫描不同预算后发现,在能够匹配多数投票准确率的配置中:

  • adaptive DeepConf-low 可减少约 19%–96% token;
  • adaptive DeepConf-high 可减少约 13%–84% token;
  • 相同轨迹上限下,加入答案共识停止的 adaptive 版本通常优于固定运行到预算上限的 budget-only DeepConf。

但论文也列出未能同时匹配多数投票准确率并减少 token 的例外,包括 Qwen3-8B/AIME25、若干 GPT-OSS 的 BRUMO/HMMT 配置等。因此更准确的结论是:DeepConf 显著改善多数设置的 Pareto frontier,而不是对每个模型—任务组合都严格无损。

7.3 GPQA-Diamond

GPQA-Diamond 上的总体结论与数学任务一致:

  • Qwen3-8B 和 Qwen3-32B 的离线 top 10% 能超过多数投票峰值;
  • DeepSeek-8B 上 top 90% 更安全,top 10% 略低;
  • 两种离线方法相对单轨迹平均提高约 6%;
  • 在线 adaptive 策略在相同预算下进一步减少 token,但激进策略在 DeepSeek-8B 上可能退化。

8. Ablation Study

8.1 Consensus Threshold \(\tau\)

论文在 Qwen3-32B/AIME24 上比较 \(\tau\in\{1.0,0.95,0.90,0.85\}\)。相对于没有答案共识停止的 budget-only 版本:

Variant \(\tau\) B=512 Accuracy Change B=512 Token Saving
DeepConf-high 1.00 0.00 pp 33.4%
DeepConf-high 0.95 0.00 pp 54.7%
DeepConf-high 0.85 0.00 pp 69.0%
DeepConf-low 1.00 0.00 pp 36.3%
DeepConf-low 0.95 0.00 pp 52.8%
DeepConf-low 0.90 -0.05 pp 63.4%
DeepConf-low 0.85 -0.31 pp 69.6%

\(\tau=0.95\) 在该实验中兼顾准确率和节省,因此被选为默认值。阈值越低,越容易在答案尚未完全稳定时停止;DeepConf-high 因为保留候选更多,对 \(\tau\) 更稳健。

8.2 Warmup Size

论文比较 \(N_{\mathrm{init}}\in\{8,16,32\}\):

  • 更大 warmup 一般能更准确地估计阈值,使在线准确率接近离线版本;
  • 这种关系不保证单调,不同模型和任务的置信度分布不同;
  • 更大 warmup 会增加固定完整生成成本,但有时也能建立更严格阈值,从而提高后续提前停止率;
  • 多数配置下不同 warmup size 的准确率变化通常不超过约 1 个百分点。

论文最终选择 16,是阈值稳定性和固定开销之间的折中。值得注意的是,当总预算只有 32 时,16 条 warmup 已占一半预算,因此自适应节省远小于预算 512 时。

8.3 Retention Ratio

从 top 90% 扫描到 top 10% 时,更激进过滤在多数配置中能提高峰值准确率,但最佳 \(\eta\) 依赖数据集。有些组合在 top 25% 或 top 50% 达到最好结果,说明固定 top 10% 不是普适最优超参数。

作者仍将 top 10% 和 top 90% 作为两个统一配置,是为了分别代表激进和保守端点,而不是声称它们对每个任务都经过调优。

8.4 Confidence Metric and Window Size

附录系统比较了 Mean、Head、Tail、Bottom-q% 与 Lowest Group Confidence:

  • 只看轨迹开头的 Head Confidence 与最终正确性相关性较弱,过滤后平均表现可能下降;
  • Tail Confidence 更接近最终结论,在 GPT-OSS-120B/AIME25 上获得最佳 99.9%;
  • Bottom 与 Lowest Group Confidence 能捕获中间局部崩溃,并且 Lowest 可以在线增量维护;
  • 对 Lowest Group Confidence,512/1024/2048 三种窗口没有在所有配置上一致最优,但 2048 整体较稳,因此作为默认值;
  • 极小窗口容易被单个异常 token 干扰,极大窗口则逐渐退化成全局平均。

9. System Implementation

9.1 Official Package

官方实现提供 DeepThinkLLM,封装在 vLLM 之上:

from deepconf import DeepThinkLLM

deep_llm = DeepThinkLLM(
    model="deepseek-ai/DeepSeek-R1-0528-Qwen3-8B"
)

# Offline: generate all traces, then compare voting strategies.
offline_result = deep_llm.deepthink(
    prompt=prompt,
    mode="offline",
    budget=64,
    compute_multiple_voting=True,
)

# Online: warm up, then perform confidence-based early stopping.
online_result = deep_llm.deepthink(
    prompt=prompt,
    mode="online",
    warmup_traces=16,
    total_budget=256,
)

返回的 DeepThinkOutput 包含最终答案、不同投票策略结果、warmup/final traces、置信度阈值、token 统计和耗时信息。

9.2 Minimal vLLM Changes

论文附录基于 vLLM commit 31f09c6、Python 3.12、CUDA 12.8,只修改两个位置:

  1. 扩展 LogprobsProcessor,维护定长 deque、窗口置信度和停止阈值;
  2. output_processor.py 构造 RequestOutput 前调用 check_conf_stop()

OpenAI-compatible API 请求需要打开候选 logprob:

responses = client.chat.completions.create(
    model=model_path,
    messages=messages,
    max_tokens=max_tokens,
    temperature=0.6,
    top_p=0.95,
    logprobs=True,
    top_logprobs=20,
    n=real_gen,
    extra_body={
        "top_k": 0,
        "vllm_xargs": {
            "enable_conf": True,
            "window_size": 2048,
            "threshold": conf_threshold,
        },
    },
)

若窗口未填满则不停止;窗口均值低于 threshold 时,将 FinishReason 设为 STOP,并在 stop_reason 中记录置信度阈值,便于追踪提前终止原因。

10. Practical Interpretation

10.1 When to Use DeepConf-high

适合准确率回退代价很高、模型校准情况未知的服务:

  • 只删除最低置信度 10% 左右的轨迹;
  • 保留更多答案多样性;
  • token 节省较小,但结果通常接近普通多数投票。

10.2 When to Use DeepConf-low

适合推理预算昂贵、能够容忍小概率回退,或已经在目标数据上确认置信度有效的服务:

  • 只保留最高置信度 10% 左右的轨迹;
  • 更早停止大量低质量生成;
  • 通常提供最大 token 节省和更高峰值准确率;
  • 需要重点监控 confidently-wrong 错误。

10.3 Deployment Checklist

  1. 先在目标模型和真实任务上画出 accuracy–token curve,而不是直接采用 top 10%;
  2. 确认服务后端能返回至少两个候选 logprob,论文使用 20;
  3. 把 warmup token 纳入总成本,不要只统计 warmup 之后的节省;
  4. 分别记录置信度提前停止与答案共识停止带来的收益;
  5. 检查提前停止轨迹是否产生不完整 \boxed{}、JSON 或工具调用,避免错误进入投票;
  6. 对不同题型、语言和 prompt 模板重新校准阈值分布;
  7. 高风险任务可将置信度与独立 verifier、可执行检查或规则约束组合。

11. Limitations

11.1 Confidently Wrong

DeepConf 的核心信号来自模型自身,因此无法解决系统性过度自信。当模型对同一个错误推理模式高度确定时,激进过滤会删除持不同意见的低置信度轨迹,反而放大错误多数。这是 top 10% 在部分 GPT-OSS、Qwen3 配置中退化的主要原因。

11.2 Warmup Is Not Free

每个问题都要先完整生成 16 条轨迹,DeepConf 更适合原本就计划进行大规模并行采样的场景。如果总预算很小,warmup 会占据大部分成本;单次普通问答也不一定值得为阈值估计额外采样。

11.3 Backend Requirements

在线方法必须访问 top-k logprob 并修改 decode loop。许多闭源 API 不提供足够的候选概率,或者无法在服务端按滑动置信度终止生成。在这种情况下只能做离线后处理,无法获得论文中的在线 token 节省。

11.4 Benchmark Scope

主要结果集中在竞赛数学,GPQA-Diamond 提供了一定 STEM 泛化证据,但论文没有系统评测长文本生成、代码 Agent、多轮工具使用或开放式答案。官方仓库声称框架支持 math、science 和 coding,不等于论文已经在所有这些任务上证明同等收益。

11.5 Token Savings Are Not Throughput Measurements

实验通过预生成的 4096-trace pool 模拟在线停止,能公平比较 token 数,却没有完整覆盖真实 serving 中的 continuous batching、提前退出导致的 batch 空洞、logprob 返回带宽和调度开销。减少 84.7% token 不应直接解释为端到端延迟或吞吐提高 84.7%。

11.6 Confidence Is Model- and Prompt-dependent

temperature、top-p、top-k、system prompt、reasoning effort 和答案格式都会改变概率分布。论文的 \(s\) 是 per-prompt warmup 阈值,说明一个全局固定 threshold 很难跨模型直接复用。更换解码配置后应重新校准,而不能照搬数值。

12. Conclusion

DeepConf 的核心观点是:并行推理不应该把每条 Chain-of-Thought 当成等价样本。模型生成时暴露的局部概率分布能够识别一部分推理崩溃,因此既可以在离线阶段改善答案聚合,也可以在在线阶段停止原本会被过滤的低质量轨迹。

方法可以概括为:

$$ \text{Top-k Logprobs} \rightarrow \text{Local Group Confidence} \rightarrow \text{Trace Filtering / Early Stopping} \rightarrow \text{Confidence-weighted Voting}. $$

Offline DeepConf 展示了局部置信度对轨迹质量排序的价值,最高将 GPT-OSS-120B 在 AIME 2025 上的 cons@512 从 97.0% 提升到 99.9%;Online DeepConf 则把这个排序信号转化为推理期间的控制策略,在大量配置中减少 43%–84% token,同时保持或提高准确率。

它的优势是无需训练、无需外部 verifier、只需很小的 serving 修改;它的边界也同样清楚:模型可能 confident but wrong,warmup 有固定成本,top-k logprob 并非所有服务都能提供,token 节省也不等价于真实系统加速。作为 test-time scaling 的控制器,DeepConf 更适合与自适应采样、可验证奖励和真实 serving 调度共同使用,而不是被理解为对所有并行推理都无条件无损的剪枝器。