# 告别盲目堆算力：让AI编程智能体从经验中学会“思考”


Scaling Test-Time Compute for Agentic Coding


# 告别盲目堆算力：让AI编程智能体从经验中学会“思考”

## 一个根本性问题：为什么让AI多试几次反而没用？

想象一下，你让一位程序员去修复一个复杂的Bug。他第一次尝试失败了，你又让他试了第二次、第三次……结果发现，后面的尝试似乎并没有比第一次更好。这听起来很反直觉，因为我们通常认为“多试几次总有一次会成功”。

这就是当前AI编程智能体面临的困境。在面对需要几十步推理、操作、观察和纠错的**长程任务**时，简单地让模型多试几次（扩大测试时计算），效果远不如预期。

**问题出在哪里？**

现在大多数让AI“表现更好”的方法，都是为那种“短平快”的任务设计的。比如，让模型生成一个短答案，然后马上能判断好坏、排序、再生成更好的。但长程编程智能体的工作方式完全不同：**每一次尝试都是一条包含思考、写代码、报错、部分进展的超长轨迹**。这条路行不通。

那么，核心挑战就不再是“生成更多的尝试”，而是**如何表示、选择和复用这些尝试中的宝贵经验**。

这篇文章将为你介绍一种全新的测试时扩展框架。它教会了AI一种更聪明的工作方式：**不是盲目重试，而是有目的地复盘、评审，并在下一次尝试时站在前人的肩膀上。**

它的本质，就是在推理时，为AI注入一套更高级的 **“认知技能”**。

---

## 核心洞察：把“经验”变成可以筛选和复用的“知识块”

传统方法失效的原因，是这些长轨迹太“脏”了。一条轨迹里充满了重复的终端输出、走过又放弃的弯路，这些低价值噪音把真正有价值的信号（比如一个巧妙的诊断、一个失败模式的记录）给淹没了。

要让模型从经验中学习，首先要让经验变得可以操作。因此，研究者提出了最关键的一步：**将每条杂乱无章的长轨迹，提炼成一个结构化、紧凑的摘要**。

这个“摘要”就像一个标准化的“Bug修复复盘报告”，它只保留最关键的信息：

-   **核心假设**：“我最初认为问题出在哪个模块？”
-   **关键进展**：“我成功定位到了哪个文件？解决了哪个子问题？”
-   **失败模式**：“我在哪里卡住了？哪个致命错误导致了尝试失败？”

一旦所有经验都被“编码”成这种统一、干净、高信息密度的格式，后续的筛选和复用就都有了坚实的基础。这，就是整个框架能够运转的基石。

---

## 三步工作流：一套更聪明的“认知技能”

有了“结构化摘要”这个标准接口，我们就能构建一套全新的工作流。它不是让模型“多试几次”，而是让它“聪明地试”。这套流程分为三步，完美地平衡了**多方向探索**与**聚焦最优解**。

### 第一步：并行探索与复盘
1.  **并行执行**：同时开启N个（比如16个）独立的编程任务，让模型在16个独立环境中各自尝试解决问题。
2.  **结构化复盘**：N次尝试结束后，模型立刻为每条尝试生成结构化的摘要报告。

### 第二步：并行聚合——递归锦标赛投票（RTV）
这是并行选择的艺术：如何从这N份“复盘报告”里，找出最有希望的那份？

-   **锦标赛机制**：不搞一次性排名，而是把16份报告随机分成小组，比如两两一组。
-   **小组内评审**：让模型扮演“评委”，阅读摘要后，对每组进行多次比较和投票，选出组内更优的方案，并提炼出其“制胜思路”。
-   **胜者晋级**：新提炼出的“思路”进入下一轮，继续两两对决。就像一场锦标赛，经过多轮淘汰，最终聚合出一个融合了所有尝试智慧的**“冠军思想”**。

研究表明，这种递归小范围比较，远比让模型一次性给16个方案排名要可靠得多。

### 第三步：串行精炼——并行蒸馏提炼（PDR）
现在，我们手上有了一组高质量的“冠军思想”作为经验包。如何让这些经验指导下一轮的行动？

-   **经验注入**：开启新一批N个并行任务。但这次，每个任务在启动时，都会被“注入”这些精选出的经验摘要。
-   **站在巨人肩膀上**：新的尝试不再是懵懂地从零开始，而是带着前人成功的思路和对失败陷阱的预警开工。这让它们从一开始就可能走了捷径，直奔关键问题而去。

这一步，把“复用经验的描述”，变成了“复用经验本身”，实现了高效的串行精炼。

### 最终选择
最后，对这轮精炼后的所有成功尝试，再次使用RTV，找出那个最终的、最好的解决方案。

**整个流程就是：筛选-复用-再筛选**。它巧妙地结合了并行探索的广度和串行精炼的深度，既避免了单次尝试的随机性，又克服了长程任务无法直接比较的难题。

---

## 效果如何？不只是准确，更是高效

这套框架的威力，在权威的SWE-Bench Verified和Terminal-Bench v2.0编程基准测试上得到了验证。它的效果可以总结为两点：**更准、更快**。

### 1. 准确率的全面提升
无论底层是Claude、Gemini还是GPT系列模型，在引入了这套“认知技能”后，能力都获得了显著提升。举两个例子：

-   **Claude-4.5-Opus**：在SWE-Bench Verified上，成功率从 **70.9% 提升到 77.6%**；在更难的Terminal-Bench v2.0上，更是从 **46.9% 跃升到 59.1%**。
-   **其他主流模型**：均取得了4%-16%不等的显著增长。

这证明，这套方法论的优势是跨模型普适的，它优化的是解决问题的“思维方式”，而不是某个特定模型的能力。

### 2. 质的飞跃：效率提升近50%
这可能是最振奋人心的发现。经检验，使用了PDR串行精炼的智能体，完成任务所需的平均步骤数**减少了约50%**。

它不再是那个在黑夜中摸索、试遍所有可能的无头苍蝇，而更像一个有经验的老手，带着清晰的路线图直击问题核心。这证明了，高质量的经验直接驱动了更高的搜索效率，避开了大量无谓的歧路和错误修复。

---

## 总结与展望：迈向“内外”兼修的智能体

这项工作的核心启示在于：**对于长程智能体，测试时计算扩展的根本问题，已经从单纯地“堆算力、拼数量”，转变为了对“经验”这一核心资产的表示、筛选和复用。**

它告诉我们，要让AI解决复杂问题，光有强大的基础模型（内功）还不够，还需要一套能自我复盘、博采众长、持续精进的“认知技能”（外功）。

这个框架，正是为AI装上了这样一套外功心法。它将抽象的经验具体化为可操作的结构化摘要，将无序的探索引导为有序的锦标赛选拔和世代传承。

未来的方向也已清晰：研究者们正在探索让智能体不仅能“阅读”过去的经验描述，更能直接复用过去产生的**持久化外部制品**——比如一份调试笔记、一个半成品补丁、一组测试脚本。这将是从“复用经验的描述”到“复用经验本身”的质变，让智能体在一个不断丰富的上下文世界中持续进化。

当长程智能体学会了如何更好地思考，它们的上限，将不止于我们今天所见。

## 参考链接

- [Scaling Test-Time Compute for Agentic Coding](https://arxiv.org/abs/2604.16529)

