目录

读《Reasoning with Sampling》:RL 没让模型变聪明,它只是在重分配推理能力

按第一性原理重读 reasoning:问题也许不是学习新能力,而是从旧能力里采得更准

这篇论文真正危险的地方,不是它提出了一个新采样器,而是它在追问一个更深的解释问题:

reasoning model 的进步,到底是模型学会了新能力,还是我们终于学会了怎么从旧能力里采样?

如果这个问题问对了,很多关于 RL for reasoning 的叙事都得重写。

1. Task

把表象都拿掉,这篇文章真正要解决的问题是:

给定一个已经训练好的 base model p(x),在不改权重的前提下,能不能通过更多的 inference-time compute,更稳定地抽到高质量的完整推理轨迹?

如果形式化一点,它要做的是从新的目标分布里采样:

q_alpha(x) = p(x)^alpha / Z_alpha

其中:

  • x 是完整输出序列,不是单个 token
  • alpha > 1 表示希望把原本高概率的整条轨迹进一步放大
  • Z_alpha 是归一化常数

从第一性原理看,这不是“学习一个新模型”的问题,而是一个带计算预算约束的采样优化问题

  1. 模型权重固定,不允许改参数。
  2. 想优化的是 single-shot 成功率,而不是 pass@k 里的最好一次。
  3. 允许付出更多 test-time compute。
  4. 希望尽量不损害模型本来就有的多样性储备。

换句话说,这篇论文的 Task 不是“怎样继续训练”,而是:

怎样重新设计推理时的采样分布。

2. Challenge

传统方法大概有三路。

第一路是 RL post-training

它的逻辑很自然:

  • 单次回答不够强
  • 用奖励去调权重
  • 让模型第一次就更可能走到正确路径

问题在于,这条路默认了一个很强的前提:

single-shot 变强,等于模型学会了新能力。

而这篇论文怀疑,事情未必是这样。
如果 base model 在 pass@k 下本来就能多次尝试后找到正确解,那说明正确路径本来就在分布里。
RL 可能只是把这些已有路径的概率重新集中,而不是创造了新路径。

第二路是低温采样。

它的问题也很本质:

  • 它确实会让输出更稳
  • 但它是逐 token 地局部变贪心
  • 它优化的是局部 next-token 分布,不是整条推理轨迹

所以它不够“全局”。

第三路如果再往前一步想,就是:

  • 既然目标是整条序列的分布重排
  • 那直接对完整序列做 MCMC 不就好了?

但这又会撞上高维序列空间的老问题:

  • 序列太长
  • 状态空间太大
  • mixing 很慢
  • 初始化很容易落在坏区域

所以传统方法真正的 Challenge 是三重的:

  1. RL 太重,而且提升来源解释不干净。
  2. 低温太局部,不是在优化完整轨迹。
  3. 直接整句采样又太贵、太慢。

3. Insight & Novelty

3.1 作者的 Inspiration 是什么

我觉得这篇论文背后的 Inspiration 主要有两个。

第一个来自统计物理/能量模型的直觉:

  • 如果想让系统更偏向高质量状态
  • 不一定要改系统本身
  • 也可以改采样分布

第二个来自对 pass@k 现象的直觉观察:

  • 一个模型如果多试几次就能做对
  • 那说明“会做”这件事本来就在模型里
  • 问题可能不在“有没有能力”,而在“第一次能不能抽到那条路径”

这两个直觉一合起来,整篇论文就已经基本成型了。

3.2 作者的 Insight 究竟是什么

我觉得这篇论文至少有四个层层推进的 Insight。

Insight 1:pass@k 更像能力储备,single-shot 更像提取效率

这条 Insight 受第二个 Inspiration 启发,也就是对 pass@k 现象的重新理解。

它修正了一个常见偏见:

我们平时看到的单次输出,不一定是模型真实能力上限,它更像是模型内部能力分布被采出来的一次结果。

这是一种关于能力表征方式的 Insight。

Insight 2:RL 的收益可能是“重分配”,不一定是“增益”

这条 Insight 也是由 pass@k 现象启发出来的。

如果正确路径本来就在,那 RL 很可能是在做一件更朴素的事:

  • 把原本分散在多次采样中的正确概率质量
  • 往第一次回答上集中

这是一种关于RL 提升来源的 Insight。

Insight 3:真正该被优化的是整条轨迹,而不是每一步 token

这条 Insight 更接近统计物理/能量模型的 Inspiration。

如果 reasoning 的质量属于“完整解的质量”,那采样分布也该定义在完整序列上,而不是每一步的局部 token 上。

这是一种关于目标分布定义方式的 Insight。

Insight 4:自回归结构本身就是高维采样的桥

这条 Insight 来自对 LLM 生成过程本身的常识理解。

既然整句 MCMC 太难,那为什么不利用 LLM 天生的前缀扩展结构,先在低维短前缀上站稳,再逐步往高维长前缀走?

这是一种关于如何让高维采样变得可算的 Insight。

3.3 Novelty

这篇论文的 Novelty 不在新架构,而主要在方法级和策略级

它做的不是:

  • 再训练一个更大的模型
  • 再设计一个更复杂的 reasoning head
  • 再引入一个更重的 RL loop

它做的是:

  • 重新定义推理时真正该采的分布
  • 再设计一个尽量可算的近似采样过程

严格按你的格式来写:

【RL 提升了 single-shot,但代价可能是多样性塌缩,而且提升来源解释不干净】 -> 【受 Insight 1 和 Insight 2 启发:能力可能本来就在,只是分布被重新集中】 -> 【设计了 power distribution,也就是直接考虑从 q_alpha(x) = p(x)^alpha / Z_alpha 中采样,把目标从“学新参数”改成“采新分布”】

【低温采样只是在局部 token 上变贪心,不能代表整条推理轨迹的质量】 -> 【受 Insight 3 启发:真正该被优化的是完整轨迹】 -> 【把采样目标定义在整条序列上,而不是 next-token 分布上,从而把 reasoning 问题转成完整路径分布重排问题】

【目标分布 p(x)^alpha 不能直接采样】 -> 【受 Insight 3 启发:既然只需要相对概率,那就可以用通用采样方法逼近】 -> 【设计了基于 Metropolis-Hastings 的 power sampling 框架,用 proposal model 生成候选,再按目标分布比值决定接受与否】

【整条序列上的 MCMC 在高维空间 mixing 太慢】 -> 【受 Insight 4 启发:自回归前缀本身可以充当从低维到高维的桥】 -> 【设计了 blockwise 的中间分布和逐块扩展策略,先采短前缀,再逐步扩展更长前缀,并用 warm start 避免整句采样直接爆炸】

4. Potential Flaw

4.1 当前情境的局限,以及能否延伸到新情境

这篇论文的成立前提其实挺强:

  • base model 本身已经包含大量潜在正确轨迹
  • 更高 likelihood 的轨迹,往往也更接近高质量推理
  • 用更多 test-time compute 去搜索,是划算的

所以它最适合的情境是:

  • base model 底子不错
  • 正确解本来就在分布里
  • 只是 single-shot 抽不准

但如果换到更复杂的新情境,比如:

  • 多模态推理
  • 外部工具调用
  • 强约束规划
  • 多阶段决策

那单靠 p(x)^alpha 可能不够。
这时可以往外延:

  • 引入 verifier 或外部奖励
  • 引入 learned proposal
  • 只对关键局部决策做自适应重采样

4.2 数据如果有什么坏性质,会特别困难

如果数据分布有下面这些坏性质,论文的方法会明显吃力:

  • 正确答案本身不是高 likelihood,而是低 likelihood 但高 correctness
  • 模型对“看起来很顺”的错误解释天然更自信
  • 任务需要依赖外部事实验证,而不是语言流畅性
  • 关键错误只发生在少数 pivot token 上,整条后缀都重采样很浪费

这种情况下,power sampling 会有一种很典型的挫败感:

它会在错误但高概率的山峰上爬得越来越认真。

4.3 哪种困难最值得挖成 paper

最值得深挖的一条,我觉得是:

如何在“likelihood 不是 correctness 的好代理”时,把采样目标改成更贴近真实推理质量的目标。

这条线特别适合继续写成 paper,因为它正好卡在这篇论文最核心、也最脆弱的假设上。

更具体地说,可以继续做:

  • verifier-guided power sampling
  • adaptive local resampling
  • learned proposal + verifier 联合加速 mixing

5. Motivation

如果按第一性原理去推这篇文章的 general idea,我觉得最自然的问句链大概就是这样:

  • 之前的方法主要靠 RL 去提升 single-shot,那 RL 到底是在创造新能力,还是只是在重排已有能力?
  • 如果一个 base model 在 pass@k 里本来就能做对不少题,那是不是说明正确轨迹本来就在模型分布里?
  • 如果正确轨迹本来就在,那为什么一定要改权重,为什么不直接改采样?
  • 可如果只是把 temperature 调低,那不还是在每一步 token 上局部变贪心吗?
  • reasoning 的质量既然属于整条轨迹,那可不可以直接对整条序列的联合概率做重排?
  • 如果想更偏向高质量轨迹,那是不是最自然的做法就是把 p(x) 锐化成 p(x)^alpha
  • 但这个新分布没法直接 sample,为什么不考虑 MCMC?
  • 可整句 MCMC 为什么会慢得不可接受?是不是因为序列空间太高维?
  • 既然 LLM 天生就是自回归的,那为什么不先在短前缀上采一个靠谱状态,再逐步向长前缀推进?
  • 如果每一步都只处理一个 block,并且以前一步做 warm start,那高维采样是不是就变成了一个更自然的逐级修正过程?

顺着这串问句走下来,这篇论文的核心 idea 几乎是自然而然出现的。

参考链接