# 读《Reasoning with Sampling》：RL 没让模型变聪明，它只是在重分配推理能力


这篇论文真正危险的地方，不是它提出了一个新采样器，而是它在追问一个更深的解释问题：

**reasoning model 的进步，到底是模型学会了新能力，还是我们终于学会了怎么从旧能力里采样？**

如果这个问题问对了，很多关于 `RL for reasoning` 的叙事都得重写。

<!--more-->

## 1. Task

把表象都拿掉，这篇文章真正要解决的问题是：

**给定一个已经训练好的 base model `p(x)`，在不改权重的前提下，能不能通过更多的 inference-time compute，更稳定地抽到高质量的完整推理轨迹？**

如果形式化一点，它要做的是从新的目标分布里采样：

`q_alpha(x) = p(x)^alpha / Z_alpha`

其中：

- `x` 是完整输出序列，不是单个 token
- `alpha > 1` 表示希望把原本高概率的整条轨迹进一步放大
- `Z_alpha` 是归一化常数

从第一性原理看，这不是“学习一个新模型”的问题，而是一个**带计算预算约束的采样优化问题**：

1. 模型权重固定，不允许改参数。
2. 想优化的是 single-shot 成功率，而不是 pass@k 里的最好一次。
3. 允许付出更多 test-time compute。
4. 希望尽量不损害模型本来就有的多样性储备。

换句话说，这篇论文的 Task 不是“怎样继续训练”，而是：

**怎样重新设计推理时的采样分布。**

## 2. Challenge

传统方法大概有三路。

第一路是 `RL post-training`。

它的逻辑很自然：

- 单次回答不够强
- 用奖励去调权重
- 让模型第一次就更可能走到正确路径

问题在于，这条路默认了一个很强的前提：

**single-shot 变强，等于模型学会了新能力。**

而这篇论文怀疑，事情未必是这样。  
如果 base model 在 `pass@k` 下本来就能多次尝试后找到正确解，那说明正确路径本来就在分布里。  
RL 可能只是把这些已有路径的概率重新集中，而不是创造了新路径。

第二路是低温采样。

它的问题也很本质：

- 它确实会让输出更稳
- 但它是逐 token 地局部变贪心
- 它优化的是局部 next-token 分布，不是整条推理轨迹

所以它不够“全局”。

第三路如果再往前一步想，就是：

- 既然目标是整条序列的分布重排
- 那直接对完整序列做 MCMC 不就好了？

但这又会撞上高维序列空间的老问题：

- 序列太长
- 状态空间太大
- mixing 很慢
- 初始化很容易落在坏区域

所以传统方法真正的 Challenge 是三重的：

1. RL 太重，而且提升来源解释不干净。
2. 低温太局部，不是在优化完整轨迹。
3. 直接整句采样又太贵、太慢。

## 3. Insight & Novelty

### 3.1 作者的 Inspiration 是什么

我觉得这篇论文背后的 Inspiration 主要有两个。

第一个来自统计物理/能量模型的直觉：

- 如果想让系统更偏向高质量状态
- 不一定要改系统本身
- 也可以改采样分布

第二个来自对 `pass@k` 现象的直觉观察：

- 一个模型如果多试几次就能做对
- 那说明“会做”这件事本来就在模型里
- 问题可能不在“有没有能力”，而在“第一次能不能抽到那条路径”

这两个直觉一合起来，整篇论文就已经基本成型了。

### 3.2 作者的 Insight 究竟是什么

我觉得这篇论文至少有四个层层推进的 Insight。

#### Insight 1：`pass@k` 更像能力储备，`single-shot` 更像提取效率

这条 Insight 受第二个 Inspiration 启发，也就是对 `pass@k` 现象的重新理解。

它修正了一个常见偏见：

> 我们平时看到的单次输出，不一定是模型真实能力上限，它更像是模型内部能力分布被采出来的一次结果。

这是一种关于**能力表征方式**的 Insight。

#### Insight 2：RL 的收益可能是“重分配”，不一定是“增益”

这条 Insight 也是由 `pass@k` 现象启发出来的。

如果正确路径本来就在，那 RL 很可能是在做一件更朴素的事：

- 把原本分散在多次采样中的正确概率质量
- 往第一次回答上集中

这是一种关于**RL 提升来源**的 Insight。

#### Insight 3：真正该被优化的是整条轨迹，而不是每一步 token

这条 Insight 更接近统计物理/能量模型的 Inspiration。

如果 reasoning 的质量属于“完整解的质量”，那采样分布也该定义在完整序列上，而不是每一步的局部 token 上。

这是一种关于**目标分布定义方式**的 Insight。

#### Insight 4：自回归结构本身就是高维采样的桥

这条 Insight 来自对 LLM 生成过程本身的常识理解。

既然整句 MCMC 太难，那为什么不利用 LLM 天生的前缀扩展结构，先在低维短前缀上站稳，再逐步往高维长前缀走？

这是一种关于**如何让高维采样变得可算**的 Insight。

### 3.3 Novelty

这篇论文的 Novelty 不在新架构，而主要在**方法级和策略级**。

它做的不是：

- 再训练一个更大的模型
- 再设计一个更复杂的 reasoning head
- 再引入一个更重的 RL loop

它做的是：

- 重新定义推理时真正该采的分布
- 再设计一个尽量可算的近似采样过程

严格按你的格式来写：

【RL 提升了 single-shot，但代价可能是多样性塌缩，而且提升来源解释不干净】 -> 【受 Insight 1 和 Insight 2 启发：能力可能本来就在，只是分布被重新集中】 -> 【设计了 power distribution，也就是直接考虑从 `q_alpha(x) = p(x)^alpha / Z_alpha` 中采样，把目标从“学新参数”改成“采新分布”】

【低温采样只是在局部 token 上变贪心，不能代表整条推理轨迹的质量】 -> 【受 Insight 3 启发：真正该被优化的是完整轨迹】 -> 【把采样目标定义在整条序列上，而不是 next-token 分布上，从而把 reasoning 问题转成完整路径分布重排问题】

【目标分布 `p(x)^alpha` 不能直接采样】 -> 【受 Insight 3 启发：既然只需要相对概率，那就可以用通用采样方法逼近】 -> 【设计了基于 `Metropolis-Hastings` 的 power sampling 框架，用 proposal model 生成候选，再按目标分布比值决定接受与否】

【整条序列上的 MCMC 在高维空间 mixing 太慢】 -> 【受 Insight 4 启发：自回归前缀本身可以充当从低维到高维的桥】 -> 【设计了 blockwise 的中间分布和逐块扩展策略，先采短前缀，再逐步扩展更长前缀，并用 warm start 避免整句采样直接爆炸】

## 4. Potential Flaw

### 4.1 当前情境的局限，以及能否延伸到新情境

这篇论文的成立前提其实挺强：

- base model 本身已经包含大量潜在正确轨迹
- 更高 likelihood 的轨迹，往往也更接近高质量推理
- 用更多 test-time compute 去搜索，是划算的

所以它最适合的情境是：

- base model 底子不错
- 正确解本来就在分布里
- 只是 single-shot 抽不准

但如果换到更复杂的新情境，比如：

- 多模态推理
- 外部工具调用
- 强约束规划
- 多阶段决策

那单靠 `p(x)^alpha` 可能不够。  
这时可以往外延：

- 引入 verifier 或外部奖励
- 引入 learned proposal
- 只对关键局部决策做自适应重采样

### 4.2 数据如果有什么坏性质，会特别困难

如果数据分布有下面这些坏性质，论文的方法会明显吃力：

- 正确答案本身不是高 likelihood，而是低 likelihood 但高 correctness
- 模型对“看起来很顺”的错误解释天然更自信
- 任务需要依赖外部事实验证，而不是语言流畅性
- 关键错误只发生在少数 pivot token 上，整条后缀都重采样很浪费

这种情况下，power sampling 会有一种很典型的挫败感：

**它会在错误但高概率的山峰上爬得越来越认真。**

### 4.3 哪种困难最值得挖成 paper

最值得深挖的一条，我觉得是：

**如何在“likelihood 不是 correctness 的好代理”时，把采样目标改成更贴近真实推理质量的目标。**

这条线特别适合继续写成 paper，因为它正好卡在这篇论文最核心、也最脆弱的假设上。

更具体地说，可以继续做：

- verifier-guided power sampling
- adaptive local resampling
- learned proposal + verifier 联合加速 mixing

## 5. Motivation

如果按第一性原理去推这篇文章的 general idea，我觉得最自然的问句链大概就是这样：

- 之前的方法主要靠 RL 去提升 single-shot，那 RL 到底是在创造新能力，还是只是在重排已有能力？
- 如果一个 base model 在 `pass@k` 里本来就能做对不少题，那是不是说明正确轨迹本来就在模型分布里？
- 如果正确轨迹本来就在，那为什么一定要改权重，为什么不直接改采样？
- 可如果只是把 temperature 调低，那不还是在每一步 token 上局部变贪心吗？
- reasoning 的质量既然属于整条轨迹，那可不可以直接对整条序列的联合概率做重排？
- 如果想更偏向高质量轨迹，那是不是最自然的做法就是把 `p(x)` 锐化成 `p(x)^alpha`？
- 但这个新分布没法直接 sample，为什么不考虑 MCMC？
- 可整句 MCMC 为什么会慢得不可接受？是不是因为序列空间太高维？
- 既然 LLM 天生就是自回归的，那为什么不先在短前缀上采一个靠谱状态，再逐步向长前缀推进？
- 如果每一步都只处理一个 block，并且以前一步做 warm start，那高维采样是不是就变成了一个更自然的逐级修正过程？

顺着这串问句走下来，这篇论文的核心 idea 几乎是自然而然出现的。

## 参考链接

- [Reasoning with Sampling: Your Base Model is Smarter Than You Think - arXiv](https://arxiv.org/abs/2510.14901)
- [Reasoning with Sampling - ar5iv HTML 版](https://ar5iv.org/html/2510.14901v1)

