LLM作为验证器:一个通用验证框架
将验证确立为LLM新的扩展轴,通过对评分token对数概率取期望获取连续细粒度反馈,无需训练即在多领域达到SOTA。
通讯作者
Jacky Kwok <jackykwok@stanford.edu>
Shulu Li²
Pranav Atreya²
Yuejiang Liu¹
Yixing Jiang¹
Chelsea Finn¹
Marco Pavone¹,³
Ion Stoica²
Azalia Mirhoseini¹
¹斯坦福大学 ²加州大学伯克利分校 ³英伟达研究院

图 1:整体性能结果。 我们提出的框架 LLM-as-a-Verifier 在编程、机器人及医疗领域均达到了最先进水平:Terminal-Bench V2(86.5%)、SWE-Bench Verified(78.2%)、RoboRewardBench(87.4%)以及 MedAgentBench(73.3%)。
引言
扩展预训练、后训练以及测试时计算,已成为提升大型语言模型(LLM)能力的主要范式。在本工作中,我们识别出验证——即判断解决方案正确性的能力——作为一个新的扩展维度。为解锁这一能力并展示其有效性,我们引入了 LLM-as-a-Verifier,一个通用的验证框架,能够为智能体任务提供细粒度反馈,且无需额外训练。
与标准的大模型评判器(LM judges)不同——后者通过提示 LLM 为候选方案生成离散分数——LLM-as-a-Verifier 通过计算评分 token 对数概率分布的期望值,来生成连续分数。这种概率公式显著降低了比较复杂方案时的平局率,并使验证能够在多个维度上扩展:
- 分数粒度
- 重复评估
- 标准分解
具体而言,我们展示了扩展评分粒度能更好地分离正负方案,从而产生更校准的比较结果。此外,扩展重复评估和标准分解,通过降低方差和复杂度,持续提升验证准确率。为使验证扩展更实用,我们进一步引入了一种成本高效的排序算法,利用验证器连续分数导出的偏好概率,从候选方案中选出最佳方案。
LLM-as-a-Verifier 在编码、机器人学和医学领域均表现出色。它在 Terminal-Bench V2(86.5%)、SWE-Bench Verified(78.2%)、RoboRewardBench(87.4%)和 MedAgentBench(73.3%)上取得了最先进的性能。除了验证,LLM-as-a-Verifier 的细粒度信号还可作为任务进展的代理估计。我们为 Claude Code 和 Codex 构建了扩展,使开发者能够监控和改进自己的智能体系统。最后,我们展示了 LLM-as-a-Verifier 可作为密集奖励信号用于强化学习(RL),提升 SAC 和 GRPO 在机器人学和数学推理基准上的样本效率。

图 2:多种模态、众多应用、一个统一的验证框架。 我们提出“LLM-as-a-Verifier”(大模型即验证器),这是一个通用框架,能够为任意模态提供细粒度反馈,且无需额外训练。通过利用评分令牌对数概率的完整分布,我们的方法能够捕捉评估的不确定性,并使验证沿着三个维度进行扩展:评分粒度、重复评估与标准分解。由此产生的细粒度反馈可用于测试时扩展、进度追踪以及强化学习。
1 引言
近年来,大语言模型(LLM)的进步已将“扩展”确立为提升其能力的核心范式。性能的提升得益于在多个维度上的扩展,包括预训练数据与算力、后训练优化以及测试时推理 [kaplan_scaling_2020, gao_scaling_2022, snell_scaling_2024]。

图 3:大语言模型的扩展范式。
然而,尽管生成过程已从这些扩展范式中显著受益,但验证——即判断解决方案质量或正确性的能力——却未能实现同等程度的扩展。在本研究中,我们认为验证本身构成了一条独特且尚未充分探索的扩展轴。与生成不同,生成受益于成熟的扩展定律,而当前系统中的验证从根本上仍受限制。具体而言,标准语言模型评判者会将评分分布压缩为粗略的离散分数 [zheng_judging_nodate, singh_v_1_2026],导致平局和区分度差;而学习型奖励模型则受限于训练数据,且往往难以跨领域泛化 [zhang2025generativeverifiersrewardmodeling, cobbe_training_2021]。这些局限性阻碍了验证的可扩展性,从而限制了性能的进一步提升。

图 4:验证扩展。 我们发现,随着我们在多个维度上扩展,验证准确率持续提升:(1) 评分令牌的粒度,(2) 重复评估的次数,以及 (3) 评估标准的分解。验证准确率通过验证器在 Terminal-Bench V2 上对同一任务中,将更高分数分配给真实成功解决方案而非失败解决方案的成对准确率来衡量。
LLM-as-a-Verifier:通用验证框架
为此,我们提出 LLM-as-a-Verifier,一种无需额外训练的通用验证框架,能够提供密集且细粒度的反馈。与传统方法(即提示 LLM 在语言空间中输出离散分数 [zheng_judging_nodate])不同,LLM-as-a-Verifier 通过计算评分 token 对数概率分布的期望值,来评估候选解的质量。
在图 4 中,我们展示了这种概率化公式如何为验证解锁多个扩展维度。首先,我们证明:在比较复杂解时,提取更多 token 对数概率能持续降低平局率,并提升正负解之间的区分度。
我们观察到,单次评估或单一标准可能存在偏差或噪声。为缓解这一问题,我们从另外两个维度扩展验证:重复评估(降低方差)和标准分解(减少提示偏差),从而提升验证准确率。我们在受控预算下量化了这些扩展收益,并在第 4 节中将 LLM-as-a-Verifier 与离散 LM 评判基线进行了对比。
为使验证扩展具备实用性,我们进一步引入一种成本高效的排序算法,利用验证器连续分数导出的偏好概率,从候选解中选出最优解。
核心思想:通过概率化评分与多维扩展,LLM-as-a-Verifier 在无需额外训练的前提下,实现了更可靠、更细粒度的验证能力。
有趣的是,我们发现由 LLM 作为验证器 产生的细粒度信号,能够评估完整的交互轨迹,而不仅仅是像过程奖励模型(PRM)和结果奖励模型(ORM)那样只评估中间步骤或最终结果 [cobbe_training_2021, lightman_lets_2023]。当与我们的低成本排序算法结合,作为轨迹奖励模型使用时,LLM 作为验证器在编程、机器人和医疗领域的挑战性基准测试中均超越了前沿模型。它在 Terminal-Bench V2(86.5%)、SWE-Bench Verified(78.2%)、RoboRewardBench(轨迹偏好准确率 87.4%)和 MedAgentBench(73.3%)上取得了最先进的性能。
除了作为验证器,我们的方法还可以充当任务进度估算的代理。值得注意的是,我们观察到步骤的时间顺序与验证器得分之间存在强相关性(图 8)。为了实例化这些能力,我们为 Claude Code 和 Codex 提供了扩展,使用户能够监控任务进度,并利用 LLM 作为验证器的优势来改进自己的智能体系统。在机器人领域,我们的方法优于最先进的奖励模型,包括 Robometer [liang2026robometer]、TOPRevard [chen2026topreward] 和 RoboReward [lee2026roboreward],实现了平均价值顺序相关性(VOC)达到 0.966。总体而言,LLM 作为验证器提供了一种可扩展的机制,用于改进现实环境中自主智能体和机器人的评估与监控。
此外,我们证明,将 LLM-as-a-Verifier 作为密集奖励信号,能够提升离策略(off-policy)与在策略(on-policy)强化学习算法的样本效率。在 LIBERO 基准 [liu2023liberobenchmarkingknowledgetransfer] 上,当使用 DSRL-SAC [wagenmaker2025steeringdiffusionpolicylatent] 微调 \pi_{0} 策略时,LLM-as-a-Verifier 的样本效率比稀疏奖励基线高出 约 1.8 倍,同时最终成功率也更高。在 MATH 推理基准上,当使用 GRPO [deepseek-ai_deepseek-r1_2025] 微调 Qwen3-8B 时,其样本效率提升了 约 1.1 倍。
总结:我们的贡献如下
- 引入 LLM-as-a-Verifier:一种概率验证框架,利用评分 token 对数概率的完整分布来生成细粒度反馈,并刻画验证扩展的三个关键维度:
- (1) 评分粒度
- (2) 重复评估
- (3) 标准分解
- 提出一种成本高效的候选排序算法,并证明:当与验证扩展相结合时,LLM-as-a-Verifier 无需额外训练,即可在编程、机器人学和医学基准上达到 最先进性能。
- 证明细粒度验证器分数与智能体的任务进展相关,可用于监控智能体与机器人的行为。
- 证明 LLM-as-a-Verifier 能为强化学习提供密集反馈,在机器人学和数学推理基准上,同时提升在策略与离策略算法的样本效率。
2 预备知识
我们将智能体与环境的交互建模为一个有限时域马尔可夫决策过程(MDP)\mathcal{M}=(\mathcal{C},\mathcal{S},\mathcal{A},P,R,H),其中 \mathcal{C} 表示上下文空间,\mathcal{S} 表示状态空间,\mathcal{A} 表示动作空间,P:\mathcal{C}\times\mathcal{S}\times\mathcal{A}\rightarrow\Delta(\mathcal{S}) 为转移动态,R:\mathcal{C}\times\mathcal{S}\times\mathcal{A}\rightarrow\mathbb{R} 为奖励函数,H\in\mathbb{N}^{+} 为时域长度。在每个回合开始时,采样一个任务提示 x\in\mathcal{C},智能体从初始状态 s_{1}\in\mathcal{S} 开始。在每个时间步 t\in[1,H],智能体观察当前状态 s_{t},选择动作 a_{t}\in\mathcal{A},并转移到下一个状态 s_{t+1}\sim P(\cdot\mid x,s_{t},a_{t})。在基于大语言模型(LLM)的智能体中,状态对应先前的交互历史,动作对应令牌序列,例如自然语言回复、代码编辑和工具调用。一条轨迹定义为 \tau=(s_{1},a_{1},s_{2},a_{2},\dots,s_{H},a_{H})。我们假设可以访问一个由参数 \theta 定义的语言模型 \pi_{\theta}:\mathcal{C}\times\mathcal{S}\rightarrow\Delta(\mathcal{A}),动作通过自回归方式从中采样。奖励模型为动作或轨迹分配一个标量分数。传统方法依赖提示 LLM 在语言空间中生成离散分数。形式上,此类奖励模型可写为 R_{\text{LM}}(x,\tau)\in\{1,\dots,G\},其中分数即为生成的令牌。
3 提出的方法:LLM 作为验证器
3.1 动机

图 5:Oracle Pass@K 在 Terminal-Bench V2 上达到 98.9%。
大多数模型已经具备解决许多任务的能力:当重复执行时,它们往往至少能产生一次正确的解。如图5(左)所示,在Terminal-Bench上,假设我们拥有一个始终能选出最优轨迹的预言验证器,随着采样轨迹数量的增加,已解决任务的占比持续上升。在此设置下,当汇总整个Terminal-Bench V2排行榜上的所有轨迹时,成功率达到了98.9%,几乎解决了整个基准测试。然而,要利用这一潜力,需要一个能够可靠区分正确与错误轨迹的验证器。
虽然标准的LM评判器 [zheng_judging_nodate] 可以用作验证器,但它们无法提供足够细粒度的反馈。具体来说,它们会提示模型输出一个离散的评分令牌,并选择概率最高的令牌作为最终分数,从而将整个评分分布压缩为单一值。这导致了本质上的粗糙评估。在比较复杂解时,标准LM评判器常常给出相同的分数,导致平局,无法区分它们。结果,粗糙的评分在Terminal-Bench上导致了高达27%的平局率,不同的轨迹往往坍缩到相同的分数,如图7所示。另一种方法是训练一个奖励模型 [stiennon_learning_2022],但此类方法受限于其训练数据,且往往难以跨领域泛化。这些局限性促使我们需要一个可泛化的框架,以提供细粒度的验证信号。
3.2 方法论
细粒度奖励估计
从定义上看,裁判(judge)是形成整体意见并做出裁决的人,而验证者(verifier)则是确认某事物真实性或正确性的人,需要更详细的评估。为此,我们提出 LLM-as-a-Verifier(大语言模型即验证者)这一概率验证框架,通过扩展评分粒度、重复评估和标准分解来提供细粒度反馈。
设 V_{\text{score}}=\{v_{1},\ldots,v_{G}\} 为表示离散评分等级的有序令牌集合。给定任务提示 x、语言模型 p_{\theta}、评估标准 c 以及两个候选轨迹 \tau_{i} 和 \tau_{j},我们构建评分提示,并通过从 <score_A> 和 <score_B> 标签中提取对数概率,得到其条件分布 p_{\theta}(v\mid x,c,\tau_{i}) 和 p_{\theta}(v\mid x,c,\tau_{j}),具体使用以下提示:
你是一位[领域]专家评审员。你将看到一项任务描述和两个轨迹。
评估标准:[领域特定标准]
任务:{任务提示}
轨迹 A:{A} 轨迹 B:{B}
仔细分析每个轨迹,然后给出最终评分:<score_A> 整数_1_到_20 </score_A><score_B> 整数_1_到_20 </score_B>
评分规则:根据评估标准按 1–20 分制评定正确性(1 = 不正确,10 = 临界,20 = 正确)
注:我们使用字母制评分而非数字,以便提取对数概率实现粒度缩放。
我们并非将每个分布压缩为单一离散分数,而是将轨迹的奖励近似为:
(3.1)
其中 C 是评估准则的数量,K 是重复验证的次数,G 是评分令牌(粒度层级)的数量,p_{\theta}(v_{g}\mid x,c,\tau) 是模型 \theta 分配给评分令牌 v_{g} 的概率,而 \phi(v_{g}) 将每个评分令牌映射为一个标量值。
我们首先通过线性映射 R\mapsto(R-\phi_{\min})/(\phi_{\max}-\phi_{\min}) 将 R(x,\tau)\in[0,1] 归一化。然后,利用 Bradley–Terry 模型将这些连续奖励转化为成对偏好,将 R(x,\tau) 视为轨迹 \tau 的潜在强度:
(3.2)

图 6:概率枢轴锦标赛。 一个五阶段流程,用于在有限验证预算下从 N 个候选中选出最佳方案。
- 候选池:待排序的集合 \{\tau_{1},\dots,\tau_{N}\}。
- 环形传递:一个随机哈密顿环对 N 个相邻对进行评分,使每个候选在“A”位和“B”位各出现一次,从而消除模型的位置偏差。
- 枢轴选择:根据环形传递得分 w_{(i)} 对候选排序,前 k 个候选构成枢轴集合 \mathcal{P}。
- 枢轴锦标赛:通过公式 3.2 对所有非枢轴对枢轴以及枢轴对枢轴的对进行评分,将预算集中在不确定的顶尖候选上,并将成本从 \mathcal{O}(N^{2}) 降低到 \mathcal{O}(Nk^{2})。
- 选择:将比较结果汇总为胜场数 w_{i} 和场次数 c_{i},返回归一化后 w_{i}/c_{i} 最高的候选。
概率枢轴锦标赛。
为了从 N 个候选中选出最佳轨迹,我们可以运行一个循环锦标赛,对所有 \binom{N}{2} 个对进行评分并累积胜场。
使用公式 3.2 中的偏好概率。然而,这种调度需要进行 \mathcal{O}(N^{2}) 次两两验证,随着 N 的增长,验证成本会迅速占据主导地位。我们提出一种预算高效的替代方案——概率枢轴锦标赛(Probabilistic Pivot Tournament, PPT),如图 6 所示。在该方案中,每个候选仅与少量 k\!\ll\!N 个枢轴进行比较,从而将预算从 \mathcal{O}(N^{2}) 降低到 \mathcal{O}(Nk^{2})。关键在于,枢轴的选择决定了节省的预算是否被有效利用:任意的锚点会将验证浪费在明显较弱的候选上。因此,我们引入了一种基于环的枢轴选择步骤,既能消除验证器的位置偏差,又能将剩余预算集中在不确定的顶尖候选上。PPT 分为三个步骤:
- 环传递。我们在 \{1,\ldots,N\} 上采样一个均匀随机的哈密顿环 \gamma,并对 N 个相邻对 \{(\gamma_{t},\gamma_{t+1\,\mathrm{mod}\,N})\}_{t=1}^{N} 进行评分。由于环结构,每个候选在验证器提示的“A”位置和“B”位置各出现一次,因此语言模型对某一位置的系统性偏好会在环上期望相消。
- 枢轴选择。我们根据环传递的平均偏好 w_{i}/c_{i} 对候选进行排序,并选择前 k 个作为枢轴集 \mathcal{P}。从经验领先者中选取枢轴,可将剩余验证预算分配给最可能正确的候选,从而后续的两两比较能够区分不确定的顶尖候选,而不是将查询浪费在弱锚点上。
3) 枢轴轮次
固定枢轴集合后,我们对以下两类配对进行评分:
- (i) 每个非枢轴与枢轴的配对 (i,p),其中 i\!\notin\!\mathcal{P},\,p\!\in\!\mathcal{P}
- (ii) 枢轴集合内部的所有配对 \binom{\mathcal{P}}{2}
所有环比较和枢轴轮次比较的结果,都汇总到同一个 w_{i} 和 c_{i} 中。我们选择 i^{\star}\in\arg\max_{i}\,w_{i}/c_{i}。
用 c_{i} 做归一化,可以消除枢轴元素因参与更多比较而产生的偏差。
总的配对验证次数为 N+k(N-k)+\binom{k}{2},其规模为 \mathcal{O}(Nk^{2}),其中 k\!\ll\!N。完整的生成与验证流程见算法 1(附录 B.2)。
严格评估与基准测试
为了严格评估排序算法,并测试其在大型候选池上的表现,我们使用 Terminus-2 框架为每个任务整理了 20 条轨迹,并在该设置下对所有方法进行了基准测试。
表 9 展示了 PPT 方法的预算-准确率权衡,结果表明我们的方法在需要更少比较次数的同时,优于先前的方法(例如 V1 [singh_v_1_2026])。
| 指标 | PPT | 先前方法 (e.g., V1) |
|---|---|---|
| 比较次数 | 更少 | 更多 |
| 性能表现 | 更优 | 较差 |
值得注意的是,随着枢轴数量的增加,性能持续提升。更多消融实验见附录 B.2。
4 验证扩展
验证的可扩展性
方程 3.1 展示了验证可沿三个独立维度进行扩展:评分令牌的粒度 G、重复评估的次数 K,以及评估标准的数量 C。每个维度针对奖励估计中不同来源的误差,我们发现这三个维度互为补充杠杆:增加粒度可改善候选解之间的分数区分度,重复评估能平均掉单次验证过程中的偏差,而标准分解则能捕捉轨迹质量的不同互补方面。
在所有扩展实验中,我们使用 Gemini 2.5 Flash [gemini25flash] 作为验证器,该模型允许我们为每个评分令牌提取最多 20 个顶级对数概率。在图 4 中,我们展示了 Terminal-Bench 2.0 上的验证准确率沿所有三个维度均有提升:
- 从 G{=}1 时的 73.1\% 提升至 G{=}20 时的 77.5\%
- 从 K{=}1 时的 74.7\% 提升至 K{=}16 时的 77.4\%
- 从任意单一标准下的 75.2\%–76.4\% 提升至三个标准集成后的 78.3\%
我们在 Terminal-Bench 中随机抽取的 200 条轨迹上测量了成对验证准确率,这些轨迹跨越多个智能体框架。每个维度都是一个可调节的旋钮,实践者可根据下游应用的延迟预算进行调优。虽然我们的主要实验使用了可访问对数概率的模型,但附录 B.6 表明,我们的框架也兼容那些不暴露令牌级对数概率的前沿模型——只需通过一个简单的两阶段变通方案即可。
4.1 评分令牌粒度
标准LM评判器的评分分布坍缩
标准语言模型(LM)评判器会将评分分布坍缩到单一最高概率的token上,从而产生一个离散奖励 R_{\text{LM}}(t,\tau)\in\{1,\ldots,G\},其分辨率为 1/G。直观上,扩大有序token集合 V_{\text{score}} 并不会为验证器提供关于轨迹的任何新信息。然而,它却为解码器提供了一个更精细的空间,用以投射模型的内在信念——这样一来,原本会被四舍五入到同一整数的邻近信念,现在被映射为连续的奖励。
(4.1)
粒度 G 与信噪比
| 粒度 G | 1 | 4 | 16 | 20 |
|---|---|---|---|---|
| 信噪比 (k{=}16) | 0.775 | 0.786 | 0.797 | 0.799 |
表 1:信噪比(SNR)。 (左)信噪比衡量验证器将正确轨迹(s_{c})与错误轨迹(s_{i})区分开的可靠程度(式 4.1)。(右)随着评分token数量 G 的增加,信噪比也随之增长,表明评分分离的校准效果更好。
信噪比
细粒度如何提升验证效果:信号与噪声的分解
为了探究更细粒度为何能改善验证效果,我们将正确轨迹(s_{c})与错误轨迹(s_{i})之间的成对分数差距 \Delta = s_{c} - s_{i} 分解为信号与噪声两个部分。我们定义信噪比如式 4.1(表 1,左列)所示,其中分子 \mathbb{E}(s_{c} - s_{i}) 衡量验证器对正确轨迹相对于错误轨迹的偏好强度(即信号强度),分母 \mathrm{Var}(s_{c} - s_{i}) 则捕捉这种偏好在不同配对间的不一致性(即噪声)。
成对验证准确率是 \mathrm{SNR}(G) 的单调函数:在样本量固定的情况下,标准化差距越大,s_{c} > s_{i} 的概率就越高。在 Terminal-Bench 上,我们的实证结果表明,\mathrm{SNR}(G) 从 G=1 时的 0.775 提升至 G=20 时的 0.799(见表 1)。因此,更细粒度的 token 能够产生校准更佳的分数,从而更可靠地区分正确与错误轨迹,进而将成对准确率从 73.1\% 提升至 77.5\%。
案例研究:query-optimize
粒度缩放如何强化验证信号
为了具体说明将粒度缩放至 G{=}20 并采用概率化表述如何强化验证器的信号,我们分析一条来自 Terminal-Bench V2 上查询优化任务的代表性轨迹对。该轨迹由 Claude Opus 4.5 在 OpenHands 框架下生成,并由 Gemini 2.5 Flash 评分。在此任务中,智能体被给定一个针对数据库的慢速 SQL 查询,并要求生成一个等效的优化版本。
两条候选轨迹生成的查询执行速度都更快,但它们在验证流程上存在关键差异:
- 正确轨迹:等待原始查询在标准数据库上完整运行 5 分钟,然后对优化后的输出执行直接差异对比。
- 失败轨迹:从未在数据库上验证等效性,而是创建了一个新数据库。
如附录 B.4 中的推理轨迹所示,Gemini 2.5 Flash 可靠地识别了这种失败模式,但以分级、模糊的语言表述(例如“略微更清晰”、“勉强更直接”),仿佛差异微不足道。
当在 100 次重复评估中,标准语言模型裁判采用 1–5 分制 时,这些细微的评估被压缩为离散分数(表 2),在 100 次运行中有 88 次 出现平局(例如 5 分 vs. 5 分),从而无法有效区分候选轨迹。
| 评估方式 | 平局次数(共 100 次) | 正确轨迹排名更高次数 |
|---|---|---|
| 标准 1–5 分制 | 88 | — |
| 同一 5 分分布的期望值 | 0 | 69 |
| 粒度缩放至 G{=}20 | — | 77 |
对同一 5 分分布 取期望值可完全消除平局——在 69 次 运行中将正确轨迹排名更高——而将粒度缩放至 G{=}20 则进一步强化信号,使“LLM 作为验证器”在 100 次运行中有 77 次 将正确轨迹严格排名更高。
表 2:查询优化任务中评判者与验证者的对比
在 100 次重复评估 中,我们统计了正确轨迹的得分高于(s_{c}{>}s_{i})、持平(s_{c}{=}s_{i})或低于(s_{c}{<}s_{i})错误轨迹的次数。
- 离散的 1–5 分制 评判者在 88/100 次评估中产生平局。
- 对同一 1–5 分制 取期望值后,平局消失,正确轨迹在 69/100 次评估中排名更高。
- 将评分粒度提升至 G{=}20 进一步增强了区分度,正确轨迹在 77/100 次评估中排名更高。
4.2 重复评估
粒度与重复评估的互补效应
虽然粒度能在单次前向传播中提升分数校准,但它并未解决误差的第二个来源:验证器单次评估的方差。即使在 G 较高的情况下,单次评估 R^{(k)}(x,\tau) 也可能因提示中的虚假特征或验证器在特定轨迹上的失败模式而产生偏差。
对 K 次独立评估取平均 \frac{1}{K}\sum_{k=1}^{K}R^{(k)}(x,\tau),是底层期望奖励的蒙特卡洛估计量;其方差以 \mathcal{O}(1/K) 的速度缩小,而偏差保持不变。这一机制与粒度互补而非重复:粒度使每个单独的估计量更精确,而重复评估则平均掉粒度无法消除的噪声。
实验数据与收益递减
图 4(中间)显示,准确率从 K{=}1 时的 74.7\% 提升至 K{=}16 时的 77.5\%。然而,随着 K 增大,收益递减:
- 早期改进源于方差降低
- 后续评估因困难样本上的相关偏差而贡献递减
对离散评判者的特殊影响
重复评估对离散评判者尤为有益,其粗粒度评分在低 K 时会导致高平局率。虽然增加 K 可通过平均来打破这些平局,但这一机制对离散评判者而言存在根本性局限。
我们证明,单次通过验证器(K{=}1)已能与重度集成的评判者(K{=}16)匹敌,这凸显了细粒度概率评分提供了更强的信号。

图 7:连续型验证器 vs. 离散型评判器在 Terminal-Bench V2 上的表现(重复评估次数 k\in\{1,4,16\})
左图:成对验证准确率。 验证器在 k{=}1 时达到 74.7\%,在 k{=}16 时提升至 77.5\%,在所有评估预算下均持续优于评判器。
右图:平局率。 评判器在 k{=}1 时因粗粒度的离散评分,在 26.7\% 的比较中产生平局;随着 k{=}16 时取平均打破平局,平局率降至 5.5\%。相比之下,验证器的平局率为零。
4.3 标准分解
粒度化与重复评估都假设评分标准本身是充分的——如果单一的整体标准无法很好地代表轨迹质量,那么这两种方法都无济于事。在长周期智能体任务中,像"这条轨迹正确吗?"这样的判断,混淆了多个逻辑上不同的因素,而面对复合问题的验证器往往只抓住提示中最突出的那个因素。
因此,我们用一个由 C 个更简单的子标准组成的集成,来替代单一的整体标准。具体来说,针对代码智能体轨迹,我们将正确性分解为三个更容易单独验证的因素:
- 规范(Specification):轨迹是否满足所有任务要求
- 输出(Output):最终输出格式是否与预期结果匹配
- 错误(Errors):轨迹的日志和工具输出中是否没有失败信号
最终奖励取各标准期望分数的平均值,如公式 1 的外层求和所示。在图 4(右图)中,任何单一标准都能达到 75.2\%–76.4\% 的准确率,而它们的集成则达到了 78.3\%。
5 实验
我们评估了 LLM-as-a-Verifier(大语言模型作为验证器) 作为轨迹奖励模型(TRM)在测试时扩展中的表现,覆盖了四个基准测试,横跨三个领域:编程(Terminal-Bench V2 [merrill_terminal-bench_2026]、SWE-Bench Verified [jimenez_swe-bench_2024])、机器人(RoboRewardBench [lee2026roboreward])以及医学(MedAgentBench [jiang2025virtual])。在所有四个基准测试中,我们使用相同的协议:生成策略 \pi_{\theta} 为每个任务生成 N 条候选轨迹,验证器使用算法 1 中描述的概率性枢轴锦标赛(probabilistic pivot tournament)对每一对轨迹进行评分,并提交归一化得分最高的轨迹。除非另有说明,验证器以粒度 G{=}20、重复评估次数 K{=}8 以及第 4.3 节描述的三准则分解方式运行。我们的方法无需训练,即插即用:相同的验证框架应用于所有四个基准测试,无需任何领域特定的微调。总体结果总结于图 1,每个基准测试的关键数据(包括基线准确率、Pass@1 以及 oracle Pass@N)报告于表 3。
表 3:各基准测试的性能与验证带来的提升。 左侧的基线准确率是在固定智能体框架下获得的。在相同的候选池上,我们报告了 Pass@1、oracle Pass@N 上界以及 LLM-as-a-Verifier 实现的准确率(右侧)。我们的方法持续优于 Pass@1,并恢复了 oracle 上限中的大部分空间,在每个基准测试上都达到了最先进的性能。
5.1 Terminal-Bench V2
Terminal-Bench V2 基准测试
Terminal-Bench V2 [merrill_terminal-bench_2026] 衡量的是智能体在基于 shell 的环境中的熟练程度,其任务跨度长,需要多步推理、文件操作以及从失败的工具调用中恢复。对于验证器来说,这个基准测试尤其困难,因为许多轨迹会产生语法上看似合理但实际错误的终端状态。
我们使用 Capy [capy] 作为脚手架,并为每个任务从 GPT-5.5 中采样 N{=}5 条轨迹。Gemini 2.5 Flash 担任验证器。GPT-5.5 在 Capy 下的 Pass@1 为 83.1\%,而该候选池的 oracle Pass@5 上限为 92.1\%。
LLM 作为验证器将准确率从 83.1\% 提升至 86.5%,超越了以下系统:
- Claude Mythos + Terminus-2 [noauthor_terminal-benchterminal_benchagentsterminus_2_nodate](82.0\%)
- GPT-5.5 + NexAU-AHE(84.7\%)
- Claude Opus 4.7 + WOZCODE(80.2\%)
- Gemini 3.1 Pro + TongAgents(80.2\%)
并在 Terminal-Bench V2 上设立了新的最优水平¹¹¹。
基线准确率取自官方 Terminal-Bench V2 排行榜和模型卡。我们进一步证明,这些提升并非依赖于特定的框架。关于 Terminus-2 和 Terminus-Kira 的更多泛化结果,请参阅附录 B.1。
5.2 SWE-Bench Verified
SWE-Bench Verified 上的评估结果
SWE-Bench Verified [jimenez_swe-bench_2024] 是一个由人工精选的 500 个真实 GitHub Issue 子集。每个任务要求智能体生成一个补丁来解决问题,并通过维护者的隐藏测试套件。该基准测试强调长上下文推理、跨文件编辑以及对现有代码库的合规性。
我们使用 mini-swe-agent 作为脚手架。与 Terminal-Bench 中使用的同质化候选池不同,我们为每个任务构建了一个异质化候选池(N{=}3),分别从 Claude Opus 4.5、Gemini 3 Flash 和 MiniMax M2.5 各采样一条轨迹。Gemini 2.5 Flash 再次担任验证器。
该候选池的平均 Pass@1 为 76.1\%,Oracle Pass@3 上限为 84.4\%。
LLM-as-a-Verifier 在 SWE-Bench Verified 上达到了 \mathbf{78.2\%},超越了 Claude Opus 4.5(76.8\%)、Gemini 3 Flash(75.8\%)和 MiniMax M2.5(75.8\%)。这些结果突显了验证器从不同模型家族生成的多样化候选集中选择最强轨迹的能力。
5.3 RoboRewardBench
表 4:RoboRewardBench 上的偏好准确率。 LLM-as-a-Verifier 的表现优于经过训练的机器人奖励模型。
RoboRewardBench 上的验证器评估
RoboRewardBench [lee2026roboreward] 用于评估奖励模型在机器人操作轨迹上的表现。借鉴 liang2026robometer 的方法,我们筛选出遵循相同自然语言指令但进度不同的成对轨迹视频;奖励模型必须输出偏好,表明哪个轨迹取得了更大进展。与编码和临床基准不同,这里的输入是多帧视频,因此验证器必须跨帧整合视觉上下文,以推理出朝向目标的物理进展。
我们使用 Qwen 3.6 35B 作为基础 VLM 验证器,并应用相同的概率公式(公式 1),从 VLM 的 logits 中提取评分 token,粒度为 G{=}20,重复验证次数 K{=}8。我们在 RoboRewardBench 上随机抽取 500 个轨迹对进行评估,并与以下方法对比:(i) 使用相同 VLM 的离散式 LLM-as-a-Judge 基线,(ii) 专门在机器人数据上训练的奖励模型——RoboReward-8B(在约 45k 个片段上训练)和 Robometer-4B(在约 100 万次比较上训练),以及 (iii) TOPReward [chen2026topreward](Qwen 3.6)。如表 4 和附录 B.5 所示,LLM-as-a-Verifier 实现了 87.4% 的偏好准确率,优于离散式 LLM-as-a-Judge 基线(70.8%)、RoboReward-8B(81.4%)、Robometer-4B [liang2026robometer](78.8%)和 TOPReward(74.7%),尽管是零样本应用且未经过任何微调。
我们还通过测量预测奖励与人工标注之间的平均绝对误差(MAE)在 RoboRewardBench 上进行评估。如表 5 所示,使用公式 3.1 中的连续奖励公式并结合 K{=}8 次重复评估,显著提升了与人类判断的一致性,将 MAE 从 1.11 降至 0.72。
表 5:在 RoboRewardBench 上针对人工标注的评估
我们报告了人工标签与预测奖励之间的平均绝对误差(MAE;数值越低越好)。LLM-as-a-Verifier 使用连续奖励(K{=}8),而基线方法则从模型中提取离散分数。
5.4 MedAgentBench
MedAgentBench [jiang2025virtual] 在模拟电子健康记录(EHR)环境中,评估 LLM 智能体在涉及患者信息检索、指南查询以及多步骤工具使用的医疗任务上的表现。该基准涵盖了一个场景:构建真实轨迹检查器的成本高昂,且验证错误会带来实际的安全后果,因此它成为通用验证器的一个天然压力测试。我们使用 AgentBench 框架,从 Claude Opus 4.8 中为每个任务采样 N{=}5 条轨迹,然后应用相同的验证流程。Claude Opus 4.8 在该数据集上的 Pass@1 为 70.2\%,而 LLM-as-a-Verifier 达到了 73.3%,优于 Opus 4.8(70.2\%)、Gemini 3.5 Flash(66.3\%)和 GPT-5.5(65.1\%)。

图 8:代码生成步骤的时间顺序与 LLM-as-a-Verifier 的分数之间存在强相关性
上方的示例任务要求智能体运行 MNIST 推理。成功的轨迹遵循一个连贯的事件序列——读取 model.py → 安装 g++ 编译器 → 安装仅 CPU 版本的 torch → 更新 hidden_dim → 完成——并表现出持续上升的验证器分数。相比之下,失败的轨迹则以错误行为为特征——它不必要地安装了庞大的 torchvision 包,耗尽了可用磁盘空间并遭遇编译错误——导致分数显著降低。结果来自 Terminal-Bench V2 中的 pytorch-model-cli 任务,使用 Gemini 2.5 Pro(配备 Terminus 2)作为智能体,Gemini 2.5 Flash 作为验证器。
细粒度验证器信号作为任务进度的代理指标
除了选择最佳轨迹之外,LLM作为验证器产生的细粒度信号,还可以作为智能体在任务中进展程度的标量代理。我们通过值序相关性(Value-Order Correlation, VOC)来量化这一特性——即步骤的时间顺序索引与验证器对该步骤前缀的预测值之间的斯皮尔曼秩相关系数,该方法遵循 ICLR2025_54854cf1。直观而言,一个能够追踪任务进度的验证器,应当为成功轨迹中越靠后的前缀赋予单调递增的分数,从而使得 \mathrm{VOC}\to 1,并且应当对卡住或倒退等失败模式保持鲁棒性。
(6.1)
代码生成任务中的VOC表现
终端基准 V2 上的价值排序相关性
在 Terminal-Bench V2 上,我们测量了每个智能体动作的时间步与验证器对应轨迹前缀得分之间的价值排序相关性(VOC)。LLM 作为验证器 在成功 rollout 上会产生持续上升的分数,而在停滞或趋向失败的轨迹上则基本保持平缓,这使得同一个标量既能作为进度度量,又能充当早期预警信号。图 8 以 pytorch-model-cli 任务为例进行了说明:成功运行的分数单调上升,而失败运行的分数则持续低迷。
这种双重用途驱动了我们为 Claude Code 和 Codex 开发的扩展功能——将实时验证器得分展示给用户,从而让长时间运行的智能体任务在将损坏状态写入磁盘之前,可以被监控、暂停或回滚。
数据表现
从 Terminal-Bench V2 运行中抽取的 500 个(成功、失败)配对中,验证器(Gemini 2.5 Flash,G{=}20)在成功轨迹上达到了 Spearman VOC 0.848,在失败轨迹上达到 0.769(完整数据见表 6)。代码生成方面的 VOC 数值表明,LLM 作为验证器产生的细粒度信号不仅仅是一个更好的排序器,更是一个校准过的任务进度估计器,这为自主智能体更安全地部署到现实世界开辟了道路。
表 6:Terminal-Bench V2 上按轨迹结果划分的价值排序相关性
| 轨迹结果 | Spearman 相关系数 |
|---|---|
| 成功轨迹 | 0.848 |
| 失败轨迹 | 0.769 |
注:平均 Spearman 秩相关系数,计算自 Terminal-Bench V2 中随机抽取的 500 条轨迹。验证器(Gemini 2.5 Flash,G{=}20)在成功轨迹上表现出近乎单调的进度,而失败 rollout 的相关性较弱,表明进度有限或不一致。我们观察到,在同一任务上由同一智能体主干生成的成功轨迹与失败轨迹之间存在 0.08 的 Spearman 差距。
机器人领域的 VOC
这一发现表明,验证器提供的进度信号在不同领域具有通用性,为机器人等复杂环境中的任务监控与安全干预提供了可靠基础。
价值排序相关性
我们在 RoboReward 保留数据集中的 500 条轨迹上计算了 VOC(Value-Order Correlation)。如表 7 所示,LLM-as-a-Verifier(Qwen 3.6,K{=}5,G{=}20)达到了 0.966,显著超过了 RoboReward-8B(0.877)、Robometer-4B(0.780)和 TOPReward(0.565)。
从定性角度看,TOPReward 几乎会立即饱和在 P(\texttt{True}){=}1.0,因此当一次 rollout 最终失败时,它便丧失了区分轨迹中期进展的能力;而我们对完整评分分布的期望值,则能在整个回合中保持一个平滑、与时间顺序对齐的信号。
| 方法 | 价值排序相关性 |
|---|---|
| LLM-as-a-Verifier(Qwen 3.6,K{=}5,G{=}20) | 0.966 |
| RoboReward-8B | 0.877 |
| Robometer-4B | 0.780 |
| TOPReward | 0.565 |
表 7: 在 RoboRewardBench 的 500 条轨迹上的价值排序相关性。采用 K{=}5 次重复评估和 G{=}20 评分粒度的 LLM-as-a-Verifier,在时间步索引与验证器预测的进展分数之间取得了最高的秩相关性。
编码智能体扩展
为了展示 LLM-as-a-Verifier 在真实编码智能体中的适用性,我们开发了 TurboAgent——一个可直接插入 Claude Code 及其他兼容 OpenAI-API 客户端的扩展模块。TurboAgent 作为一个推理时代理运行,透明地置于客户端与 LLM 提供商之间,无需对底层智能体框架或后端模型做任何修改。
这种代理设计还使得 TurboAgent 能够无缝接入现有基准测试,例如 Terminal-Bench [merrill_terminal-bench_2026]。对于每个请求,它会并行地向后端模型分发 N 条候选轨迹,并使用所提出的概率枢轴锦标赛(PPT)选择最佳响应。除验证功能外,TurboAgent 还提供了一个基于 Web 的界面,用于实时可视化验证器输出并监控智能体进展。
7 强化学习的密集奖励

LLM 作为验证器提升 RL 样本效率
图 9 展示了 LLM 作为验证器(LLM-as-a-Verifier)如何提升强化学习(RL)的样本效率。图中对比了离策略(左)与在策略(右)强化学习中,稀疏奖励基线与来自 LLM 验证器的密集奖励的成功率随训练步数的变化。
- 左图:在 LIBERO ketchup 任务上,使用 DSRL-SAC 微调 \pi_{0} 策略。验证器的进度奖励(公式 7.1)仅需约 1.8 倍 更少的环境交互步数即可达到相同的成功率,并最终取得更高的成功率(0.76 vs. 0.69)。
- 右图:在 MATH 数据集上,使用 GRPO 微调 Qwen3-8B 模型。验证器的推理奖励(公式 7.2)将样本效率提升了约 1.1 倍。
结果在多个随机种子下取平均值(LIBERO 任务 n=5,MATH 任务 n=3)。
解决信用分配难题
上一节中的进度信号还有助于解决强化学习中一个长期存在的难题:信用分配问题。我们证明,LLM 作为验证器提供的细粒度评分(公式 3.1)是一种即插即用的密集奖励,可同时应用于离策略和在策略强化学习,无需任何奖励模型训练或特定于环境的奖励塑造,即可提升样本效率。
离策略 RL:DSRL-SAC 的密集进度奖励
我们使用 Soft Actor-Critic(SAC)算法,在 LIBERO 环境中通过 DSRL 微调 \pi_{0} [black2026pi0visionlanguageactionflowmodel] 视觉-语言-动作模型。在每个 rollout 结束时,我们向 VLM 验证器查询任务指令 x 以及一组均匀采样的渲染帧序列,从而获得每一步的进度曲线 \rho_{t}=R\!\left(x,\tau_{1:t}\right)\in[0,1]。然后,我们使用以下塑形奖励对 rollout 进行重新标记:
(7.1)
将重新标注的转移 (s_{t},a_{t},r_{t},s_{t+1}) 存入回放缓冲区 \mathcal{D},并基于从 \mathcal{D} 中采样的重新标注回报来训练 SAC 评论家。系数 \lambda 用于权衡环境奖励与验证器奖励。由于塑形是离线应用于已存储轨迹,且不改变 SAC 目标函数,因此它能在不增加额外算法成本的前提下,提供密集的中间信号。
在线策略强化学习:GRPO 的密集推理奖励
我们使用组相对策略优化(GRPO)[deepseek-ai_deepseek-r1_2025] 对 Qwen3-8B [yang2025qwen3] 在 MATH 数据集上进行微调。该方法为每个提示 x 采样一组 G 个响应 \{y_{i}\}_{i=1}^{G},并估计每个响应相对于该组的优势值。
在训练的早期阶段,所有采样的响应通常都会得出错误的最终答案,导致组相对优势坍塌为零,从而无法产生梯度。LLM 作为验证器通过使用概率性枢轴锦标赛(公式 3.2)评估每个完成的推理轨迹,为每个响应分配一个归一化的偏好分数 \bar{R}_{i}\in[0,1],从而缓解了这一问题。该分数能够捕捉推理质量上的细微差异,即使最终答案完全相同。
我们将此验证器得出的分数以权重 \beta 融入标准的正确性与格式奖励中:
(7.2)
实证发现
两种机制下,密集验证器奖励相比稀疏基线均能提升样本效率(图 9)。我们将样本效率量化为稀疏基线达到目标成功率所需的训练步数与密集奖励所需步数之比。在 LIBERO 上,使用 DSRL-SAC 训练的 \pi_{0} 策略经过塑形后,能以显著更少的环境交互步数达到匹配的成功率——在 0.2 至 0.6 的成功率目标区间内,样本效率提升 1.8 倍——同时最终成功率也更高(0.76 对比 0.69)。在 MATH 上,用推理奖励增强 GRPO 带来了较小但一致的增益,约为 1.1 倍(达到匹配精度所需的优化器步数减少约 10%)。我们在附录 B.7 中报告了奖励塑形的超参数及额外消融实验。
8 讨论
在本工作中,我们主张验证构成了一个尚未充分探索的扩展维度。为实现这一目标,我们提出了 LLM-as-a-Verifier,一个为智能体任务提供细粒度反馈的通用框架。与输出单一离散分数的标准语言模型评判器不同,我们的方法通过对评分 token 对数几率分布取期望来计算连续奖励,并支持在多个维度上进行验证扩展,包括:(1) 评分粒度、(2) 重复评估、(3) 标准分解。当作为测试时扩展的轨迹奖励模型使用时,它在 Terminal-Bench V2、SWE-Bench Verified、RoboRewardBench 和 MedAgentBench 上均达到了最先进性能。除排序外,细粒度验证器信号还可作为进度估计器,为自主智能体更安全的实际部署开辟道路。最后,我们证明 LLM-as-a-Verifier 可作为密集奖励信号用于强化学习,在机器人和数学推理基准上提升 SAC 和 GRPO 的样本效率。
9 相关工作
测试时扩展。
测试时扩展通过推理提升模型性能
测试时扩展通过在推理阶段增加额外计算量(如深思、搜索或候选生成)来提升模型性能。一类工作通过以下方式改进单个响应质量:利用思维链激发中间推理过程 [wei_chain--thought_nodate, kojima2022large],将问题分解为更简单的子问题 [zhou2022least],或对采样得到的推理路径进行边际化处理 [wang_self-consistency_2023]。另一类工作则基于测试时反馈 [weng2022selfverification, madaan_self-refine_nodate, shinn_reflexion_nodate, gou2023critic, agrawal_gepa_2025, novikov_alphaevolve_2025],对中间思考步骤 [yao2023tree, besta2023graph]、行动 [yao_react_2023, zhou2023language] 或潜在世界状态 [hao2023rap] 进行搜索。
重复采样与最佳-N 选择进一步扩展了候选池,应用于代码生成 [li2022alphacode]、通用推理 [brown2024largelanguagemonkeysscaling, snell_scaling_2024]、并行自我验证 [singh_v_1_2026] 以及推理感知训练 [chow2024inferenceaware] 等场景。这些方法能够揭示出巨大的 oracle 潜力空间,但要将这种潜力转化为实际收益,需要可靠的筛选器。
LLM 作为验证器
我们的 LLM-as-a-Verifier 方法表明,通过扩展评分粒度、重复评估以及标准分解,可以提升验证器的质量;而更优的验证能力将直接改善长程决策场景中最佳-N 选择的效果。
LLM 作为评判者
LLM 作为评判者的方法
LLM 作为评判者的方法通过提示大型模型对生成输出进行评分或比较,提供了一种可扩展的人工评估替代方案。基于概率和表单填充的评估器能从 LLM 中提取更丰富的评分信号 [fu2023gptscore, liu2023geval],而基准风格的评估器则利用 LLM 的偏好来评估指令遵循系统 [zheng2023judging, dubois2024alpacaeval, li2024arenahard]。一条互补的研究路线通过技能分解 [ye2023flask]、定制化评分标准与专门的开放评判模型 [kim2024prometheus, kim2024prometheus2, li2024autoj, hu2024themis] 以及分层标准 [liu2024hdeval],使评估更加细粒度。
其他工作训练了可扩展的评判模型 [wang2024pandalm, zhu2025judgelm],或通过辩论和弱验证器集成来组合多个评判者 [chan2023chateval, saad2025shrinking]。近期研究还分析了评判者的可靠性,包括公平性和位置偏差 [wang2024large, zeng2024llmbar]、认知偏差和自我增强偏差 [koo2023cobbler, liu2023narcissistic]、通用评判基准 [tan2025judgebench, huang2025empirical],以及特定领域的评判评估 [jiang2025codejudgebench]。多模态评判模型将这一范式扩展到图像和视觉语言评估 [chen2024mllmjudge, lee2024prometheusvision, xiong2024llavacritic]。
我们的工作建立在上述研究之上,但在设置、目标和扩展特性方面有所不同。LLM 作为验证器并非评估孤立的自然语言响应,而是验证涉及工具使用、代码执行、机器人技术和医疗决策的长期智能体轨迹。此外,我们系统性地研究了验证质量如何随评分粒度、重复评估和标准分解而扩展。
可验证奖励
奖励模型:从语言推理到机器人控制的通用验证框架
奖励模型将候选解决方案、动作或轨迹转换为标量反馈,用于选择、监控或策略优化。在语言推理领域,已训练出多种学习型验证器:作为结果奖励模型用于最终答案选择 [cobbe_training_2021];作为过程奖励模型提供步骤级监督 [uesato2022solving, lightman_lets_2023];以及作为生成式验证器,将奖励建模转化为下一个词元预测 [zhang2025generativeverifiersrewardmodeling]。
在机器人学中,奖励信号的来源更为多样:
- 价值隐含的视觉表征 [ma2022vip]
- 语言-图像奖励表征 [ma2023liv]
- 预训练的视觉-语言模型 [sontakke2023roboclip, rocamonde2023vlmrm, ICLR2025_54854cf1]
- VLM 反馈或偏好 [wang2024rlvlmf]
- LLM 生成的奖励代码 [yu2023languagetorewards, xie2023text2reward, ma2023eureka]
- 词元概率进展 [chen2026topreward]
- 基于大规模轨迹或偏好数据训练的通用机器人奖励模型 [zhang2025rewind, chen2025sarm, lee2026roboreward, liang2026robometer]
动作级验证器与分解式验证
近期工作还开发了动作级验证器,用于:
- 引导采样 [nakamoto2024steering, liu2024bidirectional, kwok2025robomonkey]
- 运行时监控 [agia2024unpacking]
- 多模态对齐 [kwok2026scalingverificationeffectivescaling]
一条互补的研究路线通过将整体判断分解为更小的检查,使验证更加可靠 [min2023factscore, fabbri2021qafacteval, manakul2023selfcheckgpt, liu2024hdeval, liu2026worldactionverifierselfimproving, tseng2026sc3]。
与这些方法正交,我们的工作在一个通用框架下,跨多个领域研究验证器质量如何随评分粒度、重复评估和标准分解而扩展。
10 致谢
我们感谢加州大学伯克利分校天空计算实验室、斯坦福扩展智能实验室、IRIS 实验室以及自主系统实验室成员的建设性反馈与富有启发性的讨论。本研究得到了以下机构的支持:Google、Google DeepMind、Google Cloud、斯坦福 HAI、DARPA(HR00112520038、Fallingwater)、NSF(24-554、AIMing)、NASA ULI、Schmidt Sciences 以及 Lightspeed。同时,我们也感谢 IBM 和 Felicis 作为斯坦福 HAI 行业联盟成员所提供的支持。
参考文献
附录
附录 A 局限性与未来工作
当前框架存在若干局限性,为未来工作指明了方向。
- 第一,它假设能够访问评分 token 的 logits,这排除了若干仅通过受限 API 可用的前沿模型;在附录 B.6 中,我们描述了一种简单的两阶段变通方法,通过将封闭模型的推理路由至一个 logits 可访问的开放验证器,从而恢复大部分收益。
- 第二,所提出的扩展维度并非详尽无遗:标准分解可以针对不同领域进行学习或动态生成,而非手工设计;重复评估也可替换为一种由验证器自身不确定性引导的自适应计算分配策略。
- 最后,尽管我们已经证明验证器可以作为强化学习的密集奖励,但我们的实验仅限于单轮设置;将其扩展至多轮强化学习——即验证器在长程智能体交互中提供每步奖励,以塑造跨多个相互依赖动作的信用分配——是未来工作的一个富有前景的方向。
附录 B 额外结果与分析
B.1 智能体框架在 Terminal-Bench V2 上的泛化能力
验证器框架泛化性验证
为确认 LLM-as-a-Verifier 的性能提升并非依赖于特定智能体框架(scaffold),我们在主实验所用的 Capy 框架之外,额外引入两种框架,在 Terminal-Bench V2 上重复评估。每种框架均搭配其原作者调优的模型:Terminus-Kira 搭配 Claude Opus 4.6,Terminus-2 搭配 GPT-5.3-Codex。所有情况下,我们对每个任务采样 N{=}5 条轨迹,并使用相同的 Gemini 2.5 Flash 验证器,参数设为 G{=}20、K{=}8,并采用第 4.3 节的三准则分解方案;唯一变化的是提案生成器(proposal generator)和框架本身。表 8 报告了各框架下的验证器准确率,以及官方单轨迹准确率(Claude Opus 4.6 和 Gemini 3.1 Pro 在各框架下的表现)。
| 框架 | 官方单轨迹准确率 | 验证器准确率 |
|---|---|---|
| Terminus-2 (GPT-5.3-Codex) | — | 71.2% |
| Terminus-Kira (Claude Opus 4.6) | — | 79.4% |
| Claude Opus 4.6 (单轨迹) | — | — |
| Gemini 3.1 Pro (单轨迹) | — | — |
表 8:Terminal-Bench V2 上的框架泛化性。 LLM-as-a-Verifier 在另外两个框架上均显著提升了准确率:Terminus-2(71.2%)和 Terminus-Kira(79.4%)。
尽管两个框架的设置、观测格式和模型各不相同,验证器仍带来了同等的定性提升。Terminus-Kira(Opus 4.6 提案)相比最强基线提升了约 5 个百分点;而 Terminus-2(GPT-5.3-Codex 提案)——绝对性能较弱的框架——仍比 Gemini 3.1 Pro 高出 2.7 个百分点,比 Claude Opus 4.6 高出 8.3 个百分点。这种迁移性表明,验证器推理的是终端状态和任务进度,而非框架特定的句法模式:相同的提示模板能够泛化到风格迥异的轨迹上。
B.2 概率性淘汰赛:预算与准确率的权衡
我们提供 LLM 作为验证器(LLM-as-a-Verifier)流程的完整伪代码。算法 1 将式 (3.1) 的细粒度奖励——即验证器评分令牌分布的期望,在 C 个准则和 K 次重复评估上取平均——嵌入到基于环状枢轴选择的概率枢轴锦标赛(Probabilistic Pivot Tournament)中:一个随机哈密顿环为每个候选者分配一个“A”位置和一个“B”位置,以消除验证器的位置偏差;环平均偏好得分最高的前 k 个候选者构成枢轴集合 \mathcal{P};其余每个候选者仅与 \mathcal{P} 通过式 (3.2) 的 Bradley–Terry 偏好进行比较。返回计数归一化得分最高的轨迹,从而将预算从 \mathcal{O}(N^{2}) 降低至 \mathcal{O}(Nk^{2}),同时将验证集中在最可能正确的候选者上。
算法 1:基于环状枢轴选择的概率枢轴锦标赛
首先对一个随机哈密顿环进行评分,为每个候选者分配一个“A”位置和一个“B”位置;环平均偏好得分最高的前 k 个候选者成为枢轴;其余每个候选者仅与枢轴集合通过式 (3.2) 的软偏好概率进行比较。
- 输入:任务 x;生成策略 \pi_{\theta};验证器语言模型 p_{\theta};评分令牌 V_{\text{score}} 及映射 \phi;准则 \mathcal{C};候选者数量 N;重复次数 K;枢轴数量 k
- 输出:选定的轨迹 \tau^{\star}
- for i = 1, \ldots, N do ▷ 候选者生成
- 采样 \tau_{i} \sim \pi_{\theta}(\cdot \mid x)
- end for
- 初始化 w_{i} \leftarrow 0,\ c_{i} \leftarrow 0,其中 i \in \{1, \ldots, N\}
- 采样 \{1, \ldots, N\} 的随机排列 \gamma ▷ 环遍历
- \mathcal{E}_{\text{ring}} \leftarrow \{(\gamma_{t}, \gamma_{t+1 \,\mathrm{mod}\, N}) : t = 1, \ldots, N\}
- for 每一对 (i, j) \in \mathcal{E}_{\text{ring}} do
10: (R_{i},R_{j})\leftarrow\big(R(x,\tau_{i}),\,R(x,\tau_{j})\big) \triangleright 通过公式 3.1 计算奖励
11: p\leftarrow\sigma(R_{i}-R_{j}) \triangleright 公式 3.2
12: w_{i}\mathrel{+}=p,\ w_{j}\mathrel{+}=1-p,\ c_{i}\mathrel{+}=1,\ c_{j}\mathrel{+}=1
13: 结束循环
14: \mathcal{P}\leftarrow 根据 w_{i}/c_{i} 选出的 top-k 候选者 \triangleright 基于环的枢轴选择
15: \mathcal{E}_{\text{piv}}\leftarrow\big(\{(i,p):i\!\notin\!\mathcal{P},\,p\!\in\!\mathcal{P}\}\cup\{(p_{1},p_{2})\!\in\!\mathcal{P}^{2}:p_{1}<p_{2}\}\big)\setminus\mathcal{E}_{\text{ring}}
16: 对于每一对 (i,j)\in\mathcal{E}_{\text{piv}} 执行 \triangleright \mathcal{O}(Nk^{2}) 枢轴轮次
17: (R_{i},R_{j})\leftarrow\big(R(x,\tau_{i}),\,R(x,\tau_{j})\big) \triangleright 通过公式 3.1 计算奖励
18: p\leftarrow\sigma(R_{i}-R_{j}) \triangleright 公式 3.2
19: w_{i}\mathrel{+}=p,\ w_{j}\mathrel{+}=1-p,\ c_{i}\mathrel{+}=1,\ c_{j}\mathrel{+}=1
20: 结束循环
21: 返回 \tau^{\star}\leftarrow\tau_{i^{\star}},其中 i^{\star}\in\arg\max_{i}\,w_{i}/c_{i}
预算–精度权衡分析
我们刻画了概率枢轴锦标赛(PPT,算法 1)的预算–精度权衡,并将其与 V1 基线(singh_v_1_2026)进行比较。我们在 Terminal-Bench V2(89 个任务,Terminus-2 框架)上为每个任务整理了 N=20 条候选轨迹,并在表 9 中报告了查询对的总数和选择精度。
PPT 随着枢轴数量的增加而稳步提升,在可比验证预算下优于 V1。仅使用 k{=}3 时,PPT 就已超越 V1 的最佳结果,以 4{,}723 个查询对达到 66.17\% 的精度。进一步增加枢轴数量可继续提升精度:k{=}5 使用 6{,}609 个查询对达到 66.27\% 的精度,而 k{=}9 使用 9{,}630 个查询对达到 67.13\% 的精度,接近完整的循环赛性能,同时使用的比较次数大幅减少。
表 9:概率枢轴锦标赛(PPT) 的规模随枢轴数量增长,在 Terminal-Bench V2 上,随着 k 增加,准确率提升,同时保持较低的验证预算。
B.3 作为过程与结果奖励模型的 LLM-as-a-Verifier
我们将 LLM-as-a-Verifier 评估为两种模型:
- 过程奖励模型(PRM):用于智能体任务中每步验证。
- 结果奖励模型(ORM):用于编码和数学基准测试中的 Best-of-N 采样。
作为 PRM 使用时,pass@1 随每步采样动作数量 k 单调递增:
- 在 TauBench 上,从 48.7\% 提升至 55.7\%。
- 在 Terminal-Bench 上,从 49.8\% 提升至 54.3\%(k 从 1 增至 9,见表 10)。
- 计算量仅为 V_{1} [singh_v_1_2026] 的 \frac{1}{3}。
作为 ORM 使用时(见表 11),相比基础模型,pass@1 提升显著:
- SWE-Bench Lite:+9.5\%
- AIME:+18.5\%
- HMMT:+21.3\%
- 同时,验证准确率比 V_{1} 高出 +6.2 个百分点,计算量仅为后者的 \frac{1}{1.5}。
表 10:LLM-as-a-Verifier 作为 PRM:pass@1 随每步采样动作数量增长。 使用 LLM-as-a-Verifier 进行每步验证,pass@1 随候选动作数量 k 的增加而单调递增。
表 11:LLM-as-a-Verifier 作为 ORM:在编码和数学基准测试中提升 pass@1 准确率。 在 Best-of-N 采样下,LLM-as-a-Verifier 优于基础模型以及逐点/成对验证器基线,相比基础模型在 SWE-Bench Lite 上绝对提升 9.5\%,AIME 上 18.5\%,HMMT 上 21.3\%,同时使用的验证预算比 V_{1} [singh_v_1_2026] 更少。
B.4 案例研究:query-optimize
本附录扩展了第 4.1 节中的 query-optimize 案例研究,包含完整的任务规范、真实答案分解以及验证器推理轨迹。该轨迹对是在 OpenHands 框架下生成的,其中 Claude Opus 4.5 作为提案生成器,Gemini 2.5 Flash 作为验证器。
任务指令。
SELECT s.wordid, s.synsetid, sy.definition, sy.lexdomainid
FROM senses s
JOIN synsets sy ON s.synsetid = sy.synsetid
ORDER BY s.wordid, s.synsetid
LIMIT 500;在 16 条开启思考的推理轨迹中,验证器可靠地识别出了正确性问题。摘录如下:
“代理无法在合理的时间范围内,在提供的 /app/oewn.sqlite 数据库上完整执行原始查询(它被中断了两次,一次在 60 秒后,一次在 5 分 2 秒后)。为了获得用于比较的参考输出,代理复制了数据库(……),然后向这个复制的数据库添加了索引。……通过修改数据库来获取参考输出,代理违反了任务的隐含约束。因此,它并未正确验证其优化后的查询,是否与在原始、无索引数据库上运行的原始查询产生相同的输出。”B.5 在 RoboRewardBench 上扩展重复评估与视觉上下文
图 10 将第 4.2 节的重复评估分析扩展到了机器人操控领域。在 RoboRewardBench 上,轨迹偏好准确率从 K{=}1 时的 81.5\% 提升至 K{=}8 时的 87.4\%,并在 K 值较大时趋于饱和,达到噪声基底。LLM-as-a-Verifier 在每个预算水平上均优于 LLM-as-a-Judge 以及经过训练的基线模型(TOPReward、RoboReward-8B 和 Robometer-4B),这表明重复评估带来的收益能够跨模态干净地迁移,尽管输入形式从文本变为了多帧视频。

| 重复评估次数 (k) | 轨迹偏好准确率 |
|---|---|
| 1 | 81.5% |
| 8 | 87.4% |
图 10: 随着重复评估次数 k 的增加,轨迹偏好准确率持续提升,从 k{=}1 时的 81.5\% 上升至 k{=}8 时的 87.4\%。LLM-as-a-Verifier 在所有预算水平上均优于 LLM-as-a-Judge 及先前的奖励模型(TOPReward、RoboReward-8B、Robometer-4B),其增益在 k 值较大时趋于饱和。
B.6 为受限 Logit 的前沿模型恢复连续奖励
LLM 作为验证器
使用 LLM 作为验证器需要访问验证器的评分 token 对数几率,以评估公式 3.1。然而,包括 GPT-5.5 和 Claude Opus 4.7 在内的日益增多的一类前沿模型,仅通过其公共 API 暴露采样后的补全内容,并不返回 token 级别的对数概率,这阻碍了直接对验证器主干进行原位替换。我们描述了一种简单的两阶段变通方法,通过将推理与评分解耦,恢复了大部分校准后的奖励信号。
两阶段流程
对于每一对 (\tau_{i},\tau_{j}),我们首先使用标准的成对模板提示闭源模型(GPT-5.5),并要求其生成一个自由格式的 $<$reasoning$>$…$<$/reasoning$>$ 分析块,对两条轨迹进行分析,然后给出一个离散的 1–10 分。接着,我们将任务、两条轨迹以及闭源模型的推理结果传递给一个开源验证器(Gemini 2.5 Flash,G{=}20),并读取其在 $<$score_A$>$ 和 $<$score_B$>$ 位置的 token 对数概率,以计算公式 3.1 中的连续奖励。第一阶段贡献了来自前沿模型的领域特定推理质量;第二阶段则提供了闭源 API 所隐藏的校准概率分布。
设置与发现
评估设置
我们在第4.2节全程使用的同一套 Terminal-Bench V2 摆动配对套件上进行评估。对于每一对,我们用 GPT-5.5 生成 16 条独立的推理轨迹,再用 Gemini 2.5 Flash 进行 16 次独立的第二阶段评估,然后对每条轨迹中 K\!\in\!\{1,2,4,8,16\} 个子采样分数取平均,并检查是否满足 \bar{R}(x,\tau_{\text{correct}})>\bar{R}(x,\tau_{\text{incorrect}})。每个 K 值下,通过 400 次 bootstrap 子采样来估计平均准确率和平局率。
关键结果
表12显示,变通方法在所有预算下都优于离散基线:
- 当 K{=}1 时,通过 Gemini 2.5 Flash 路由推理过程,相比直接使用 GPT-5.5 的整数分数,准确率提升了 +5.2 个百分点(80.1% 对比 74.9%),并消除了封闭模型粗粒度输出导致的 10.9% 平局率。
- 连续变体的性能几乎立即饱和——从 K{=}1 到 K{=}16,准确率仅变动 1.1 个百分点;而离散变体主要依赖大量集成(从 K{=}1 到 K{=}16 提升 +4.2 个百分点)来打破平局。
- 即使在 K{=}16 时,连续变体仍领先 +2.1 个百分点,并保持零平局率。
表12:Terminal-Bench V2 上的准确率与平局率
| 重复评估次数 K | GPT-5.5(离散) | GPT-5.5 → Gemini 2.5 Flash(连续) |
|---|---|---|
| 1 | 74.9% (10.9% 平局) | 80.1% (0% 平局) |
| 2 | 76.3% (8.2% 平局) | 80.5% (0% 平局) |
| 4 | 77.8% (5.1% 平局) | 80.9% (0% 平局) |
| 8 | 78.9% (2.3% 平局) | 81.1% (0% 平局) |
| 16 | 79.1% (0.8% 平局) | 81.2% (0% 平局) |
注:GPT-5.5(离散)对 GPT-5.5 返回的整数 1–10 分数取平均;GPT-5.5 → Gemini 2.5 Flash(连续)将 GPT-5.5 的推理结果转发给 Gemini 2.5 Flash,并从其评分 token 的 logits 中读取连续奖励值。
B.7 将 LLM-as-a-Verifier 作为 RL 的密集奖励
本附录详细介绍了第7节的 RL 实验。在两种设置中,基线方法与我们的方法之间唯一的区别在于奖励函数:策略、优化器、超参数、评估协议和随机种子均保持不变。
离策略 RL(DSRL-SAC)
使用 DSRL-SAC 在 LIBERO-90 番茄酱任务上微调策略
我们在 LIBERO-90 番茄酱任务上,使用 DSRL-SAC 对 \pi_{0} 策略进行微调。验证器为 Qwen 3.6 35B,通过 SGLang 提供服务,并依据任务指令以及每次 rollout 中均匀子采样的 N_{f}{=}10 个渲染帧进行查询;每帧的完成度按照公式 3.1 中粒度 20 的尺度进行评分,解码为前 20 个评分 token 对数概率的期望值,评估重复 K=3 次,系数 \lambda{=}1(公式 7.1)。默认情况下,对成功的 rollout 应用奖励塑形;对全部 rollout(成功与失败)进行重新标注是代码库中的一个可选变体。重新标注的转移被写入 SAC 回放缓冲区,评论家(critic)则在塑形后的回报上进行训练。每个条件运行 5 个随机种子,直至 1.5\mathrm{M} 环境步数,并报告模拟器成功率的跨种子均值。
在策略强化学习(GRPO)
我们使用 Tinker,通过 GRPO 对 Qwen3-8B 在 Hendrycks MATH 数据集上进行微调,组大小为 M{=}16,每个优化批次包含 64 个组,学习率为 2\times 10^{-5},最大生成长度为 512 个 token。对于每组补全,Gemini 2.5 Flash 通过概率枢轴锦标赛(公式 3.2)对推理轨迹进行评分。该偏好得分在组内进行标准化,并以权重 \beta=0.1(公式 7.2)添加到正确性与格式奖励中。