读《Reasoning with Sampling》:RL 没让模型变聪明,它只是在重分配推理能力
按第一性原理重读 reasoning:问题也许不是学习新能力,而是从旧能力里采得更准
这篇论文真正危险的地方,不是它提出了一个新采样器,而是它在追问一个更深的解释问题:
reasoning model 的进步,到底是模型学会了新能力,还是我们终于学会了怎么从旧能力里采样?
如果这个问题问对了,很多关于 RL for reasoning 的叙事都得重写。
1. Task
把表象都拿掉,这篇文章真正要解决的问题是:
给定一个已经训练好的 base model p(x),在不改权重的前提下,能不能通过更多的 inference-time compute,更稳定地抽到高质量的完整推理轨迹?
如果形式化一点,它要做的是从新的目标分布里采样:
q_alpha(x) = p(x)^alpha / Z_alpha
其中:
x是完整输出序列,不是单个 tokenalpha > 1表示希望把原本高概率的整条轨迹进一步放大Z_alpha是归一化常数
从第一性原理看,这不是“学习一个新模型”的问题,而是一个带计算预算约束的采样优化问题:
- 模型权重固定,不允许改参数。
- 想优化的是 single-shot 成功率,而不是 pass@k 里的最好一次。
- 允许付出更多 test-time compute。
- 希望尽量不损害模型本来就有的多样性储备。
换句话说,这篇论文的 Task 不是“怎样继续训练”,而是:
怎样重新设计推理时的采样分布。
2. Challenge
传统方法大概有三路。
第一路是 RL post-training。
它的逻辑很自然:
- 单次回答不够强
- 用奖励去调权重
- 让模型第一次就更可能走到正确路径
问题在于,这条路默认了一个很强的前提:
single-shot 变强,等于模型学会了新能力。
而这篇论文怀疑,事情未必是这样。
如果 base model 在 pass@k 下本来就能多次尝试后找到正确解,那说明正确路径本来就在分布里。
RL 可能只是把这些已有路径的概率重新集中,而不是创造了新路径。
第二路是低温采样。
它的问题也很本质:
- 它确实会让输出更稳
- 但它是逐 token 地局部变贪心
- 它优化的是局部 next-token 分布,不是整条推理轨迹
所以它不够“全局”。
第三路如果再往前一步想,就是:
- 既然目标是整条序列的分布重排
- 那直接对完整序列做 MCMC 不就好了?
但这又会撞上高维序列空间的老问题:
- 序列太长
- 状态空间太大
- mixing 很慢
- 初始化很容易落在坏区域
所以传统方法真正的 Challenge 是三重的:
- RL 太重,而且提升来源解释不干净。
- 低温太局部,不是在优化完整轨迹。
- 直接整句采样又太贵、太慢。
3. Insight & Novelty
3.1 作者的 Inspiration 是什么
我觉得这篇论文背后的 Inspiration 主要有两个。
第一个来自统计物理/能量模型的直觉:
- 如果想让系统更偏向高质量状态
- 不一定要改系统本身
- 也可以改采样分布
第二个来自对 pass@k 现象的直觉观察:
- 一个模型如果多试几次就能做对
- 那说明“会做”这件事本来就在模型里
- 问题可能不在“有没有能力”,而在“第一次能不能抽到那条路径”
这两个直觉一合起来,整篇论文就已经基本成型了。
3.2 作者的 Insight 究竟是什么
我觉得这篇论文至少有四个层层推进的 Insight。
Insight 1:pass@k 更像能力储备,single-shot 更像提取效率
这条 Insight 受第二个 Inspiration 启发,也就是对 pass@k 现象的重新理解。
它修正了一个常见偏见:
我们平时看到的单次输出,不一定是模型真实能力上限,它更像是模型内部能力分布被采出来的一次结果。
这是一种关于能力表征方式的 Insight。
Insight 2:RL 的收益可能是“重分配”,不一定是“增益”
这条 Insight 也是由 pass@k 现象启发出来的。
如果正确路径本来就在,那 RL 很可能是在做一件更朴素的事:
- 把原本分散在多次采样中的正确概率质量
- 往第一次回答上集中
这是一种关于RL 提升来源的 Insight。
Insight 3:真正该被优化的是整条轨迹,而不是每一步 token
这条 Insight 更接近统计物理/能量模型的 Inspiration。
如果 reasoning 的质量属于“完整解的质量”,那采样分布也该定义在完整序列上,而不是每一步的局部 token 上。
这是一种关于目标分布定义方式的 Insight。
Insight 4:自回归结构本身就是高维采样的桥
这条 Insight 来自对 LLM 生成过程本身的常识理解。
既然整句 MCMC 太难,那为什么不利用 LLM 天生的前缀扩展结构,先在低维短前缀上站稳,再逐步往高维长前缀走?
这是一种关于如何让高维采样变得可算的 Insight。
3.3 Novelty
这篇论文的 Novelty 不在新架构,而主要在方法级和策略级。
它做的不是:
- 再训练一个更大的模型
- 再设计一个更复杂的 reasoning head
- 再引入一个更重的 RL loop
它做的是:
- 重新定义推理时真正该采的分布
- 再设计一个尽量可算的近似采样过程
严格按你的格式来写:
【RL 提升了 single-shot,但代价可能是多样性塌缩,而且提升来源解释不干净】 -> 【受 Insight 1 和 Insight 2 启发:能力可能本来就在,只是分布被重新集中】 -> 【设计了 power distribution,也就是直接考虑从 q_alpha(x) = p(x)^alpha / Z_alpha 中采样,把目标从“学新参数”改成“采新分布”】
【低温采样只是在局部 token 上变贪心,不能代表整条推理轨迹的质量】 -> 【受 Insight 3 启发:真正该被优化的是完整轨迹】 -> 【把采样目标定义在整条序列上,而不是 next-token 分布上,从而把 reasoning 问题转成完整路径分布重排问题】
【目标分布 p(x)^alpha 不能直接采样】 -> 【受 Insight 3 启发:既然只需要相对概率,那就可以用通用采样方法逼近】 -> 【设计了基于 Metropolis-Hastings 的 power sampling 框架,用 proposal model 生成候选,再按目标分布比值决定接受与否】
【整条序列上的 MCMC 在高维空间 mixing 太慢】 -> 【受 Insight 4 启发:自回归前缀本身可以充当从低维到高维的桥】 -> 【设计了 blockwise 的中间分布和逐块扩展策略,先采短前缀,再逐步扩展更长前缀,并用 warm start 避免整句采样直接爆炸】
4. Potential Flaw
4.1 当前情境的局限,以及能否延伸到新情境
这篇论文的成立前提其实挺强:
- base model 本身已经包含大量潜在正确轨迹
- 更高 likelihood 的轨迹,往往也更接近高质量推理
- 用更多 test-time compute 去搜索,是划算的
所以它最适合的情境是:
- base model 底子不错
- 正确解本来就在分布里
- 只是 single-shot 抽不准
但如果换到更复杂的新情境,比如:
- 多模态推理
- 外部工具调用
- 强约束规划
- 多阶段决策
那单靠 p(x)^alpha 可能不够。
这时可以往外延:
- 引入 verifier 或外部奖励
- 引入 learned proposal
- 只对关键局部决策做自适应重采样
4.2 数据如果有什么坏性质,会特别困难
如果数据分布有下面这些坏性质,论文的方法会明显吃力:
- 正确答案本身不是高 likelihood,而是低 likelihood 但高 correctness
- 模型对“看起来很顺”的错误解释天然更自信
- 任务需要依赖外部事实验证,而不是语言流畅性
- 关键错误只发生在少数 pivot token 上,整条后缀都重采样很浪费
这种情况下,power sampling 会有一种很典型的挫败感:
它会在错误但高概率的山峰上爬得越来越认真。
4.3 哪种困难最值得挖成 paper
最值得深挖的一条,我觉得是:
如何在“likelihood 不是 correctness 的好代理”时,把采样目标改成更贴近真实推理质量的目标。
这条线特别适合继续写成 paper,因为它正好卡在这篇论文最核心、也最脆弱的假设上。
更具体地说,可以继续做:
- verifier-guided power sampling
- adaptive local resampling
- learned proposal + verifier 联合加速 mixing
5. Motivation
如果按第一性原理去推这篇文章的 general idea,我觉得最自然的问句链大概就是这样:
- 之前的方法主要靠 RL 去提升 single-shot,那 RL 到底是在创造新能力,还是只是在重排已有能力?
- 如果一个 base model 在
pass@k里本来就能做对不少题,那是不是说明正确轨迹本来就在模型分布里? - 如果正确轨迹本来就在,那为什么一定要改权重,为什么不直接改采样?
- 可如果只是把 temperature 调低,那不还是在每一步 token 上局部变贪心吗?
- reasoning 的质量既然属于整条轨迹,那可不可以直接对整条序列的联合概率做重排?
- 如果想更偏向高质量轨迹,那是不是最自然的做法就是把
p(x)锐化成p(x)^alpha? - 但这个新分布没法直接 sample,为什么不考虑 MCMC?
- 可整句 MCMC 为什么会慢得不可接受?是不是因为序列空间太高维?
- 既然 LLM 天生就是自回归的,那为什么不先在短前缀上采一个靠谱状态,再逐步向长前缀推进?
- 如果每一步都只处理一个 block,并且以前一步做 warm start,那高维采样是不是就变成了一个更自然的逐级修正过程?
顺着这串问句走下来,这篇论文的核心 idea 几乎是自然而然出现的。