1. 项目概述
OptScale是一项由香港理工大学与四川大学联合提出的创新性研究,它从根本上改变了传统大模型推理时盲目增加采样次数的做法。这项发表在AAAI 2026上的工作,首次为inference-time scaling问题提供了概率意义上的最优解。
1.1 核心问题解析
当前大模型推理领域存在一个普遍误区:认为采样次数越多,模型表现就越好。从Self-Consistency到Best-of-N,各种方法都在不断增加采样规模N。但问题在于:
- N的选择缺乏理论依据,通常凭经验设置为8、16或32等固定值
- 不同难度的问题分配相同的计算资源
- 没有量化的成功概率保证
这导致大量计算资源被浪费在边际收益极低的额外采样上。OptScale正是要解决这个根本性问题:在保证目标性能的前提下,如何确定最小必要采样次数?
1.2 方法创新点
OptScale的核心突破在于:
- 概率化建模:将verifier评分视为随机变量,建立完整的概率框架
- 最优停止理论:推导出满足置信度要求的最小采样数计算公式
- 自适应机制:根据问题难度动态调整采样预算
这种方法不需要额外训练大模型,仅通过优化采样策略就能显著降低推理成本。实验表明,在保持相同准确率的情况下,OptScale平均可减少51%的token消耗。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 技术原理深度解析
2.1 概率框架构建
OptScale将传统Best-of-N过程重新表述为概率问题。对于给定的问题q,模型生成N个候选答案{a₁,...,a_N},每个答案aᵢ获得verifier评分sᵢ∈[0,1]。
关键假设是:这些评分{sᵢ}是从某个未知分布fₚ(s)中独立采样的。这个分布反映了模型在当前问题上的表现特性:
- μₚ:平均推理质量
- σₚ:推理不确定性/问题难度
2.2 极值分布理论
设Sₙ = max{s₁,...,sₙ}为n次采样中的最高分。在i.i.d.假设下,其累积分布函数为:
Fₙ(s) = P(Sₙ ≤ s) = [Fₚ(s)]ⁿ
其中Fₚ(s)是fₚ(s)的CDF。这个简单的公式揭示了三个重要性质:
- 随着n增加,E[Sₙ]单调递增
- 但增量ΔE = E[Sₙ] - E[Sₙ₋₁]逐渐减小
- 存在
