目录

告别盲目堆算力:让AI编程智能体从经验中学会“思考”

Scaling Test-Time Compute for Agentic Coding

告别盲目堆算力:让AI编程智能体从经验中学会“思考”

一个根本性问题:为什么让AI多试几次反而没用?

想象一下,你让一位程序员去修复一个复杂的Bug。他第一次尝试失败了,你又让他试了第二次、第三次……结果发现,后面的尝试似乎并没有比第一次更好。这听起来很反直觉,因为我们通常认为“多试几次总有一次会成功”。

这就是当前AI编程智能体面临的困境。在面对需要几十步推理、操作、观察和纠错的长程任务时,简单地让模型多试几次(扩大测试时计算),效果远不如预期。

问题出在哪里?

现在大多数让AI“表现更好”的方法,都是为那种“短平快”的任务设计的。比如,让模型生成一个短答案,然后马上能判断好坏、排序、再生成更好的。但长程编程智能体的工作方式完全不同:每一次尝试都是一条包含思考、写代码、报错、部分进展的超长轨迹。这条路行不通。

那么,核心挑战就不再是“生成更多的尝试”,而是如何表示、选择和复用这些尝试中的宝贵经验

这篇文章将为你介绍一种全新的测试时扩展框架。它教会了AI一种更聪明的工作方式:不是盲目重试,而是有目的地复盘、评审,并在下一次尝试时站在前人的肩膀上。

它的本质,就是在推理时,为AI注入一套更高级的 “认知技能”


核心洞察:把“经验”变成可以筛选和复用的“知识块”

传统方法失效的原因,是这些长轨迹太“脏”了。一条轨迹里充满了重复的终端输出、走过又放弃的弯路,这些低价值噪音把真正有价值的信号(比如一个巧妙的诊断、一个失败模式的记录)给淹没了。

要让模型从经验中学习,首先要让经验变得可以操作。因此,研究者提出了最关键的一步:将每条杂乱无章的长轨迹,提炼成一个结构化、紧凑的摘要

这个“摘要”就像一个标准化的“Bug修复复盘报告”,它只保留最关键的信息:

  • 核心假设:“我最初认为问题出在哪个模块?”
  • 关键进展:“我成功定位到了哪个文件?解决了哪个子问题?”
  • 失败模式:“我在哪里卡住了?哪个致命错误导致了尝试失败?”

一旦所有经验都被“编码”成这种统一、干净、高信息密度的格式,后续的筛选和复用就都有了坚实的基础。这,就是整个框架能够运转的基石。


三步工作流:一套更聪明的“认知技能”

有了“结构化摘要”这个标准接口,我们就能构建一套全新的工作流。它不是让模型“多试几次”,而是让它“聪明地试”。这套流程分为三步,完美地平衡了多方向探索聚焦最优解

第一步:并行探索与复盘

  1. 并行执行:同时开启N个(比如16个)独立的编程任务,让模型在16个独立环境中各自尝试解决问题。
  2. 结构化复盘:N次尝试结束后,模型立刻为每条尝试生成结构化的摘要报告。

第二步:并行聚合——递归锦标赛投票(RTV)

这是并行选择的艺术:如何从这N份“复盘报告”里,找出最有希望的那份?

  • 锦标赛机制:不搞一次性排名,而是把16份报告随机分成小组,比如两两一组。
  • 小组内评审:让模型扮演“评委”,阅读摘要后,对每组进行多次比较和投票,选出组内更优的方案,并提炼出其“制胜思路”。
  • 胜者晋级:新提炼出的“思路”进入下一轮,继续两两对决。就像一场锦标赛,经过多轮淘汰,最终聚合出一个融合了所有尝试智慧的**“冠军思想”**。

研究表明,这种递归小范围比较,远比让模型一次性给16个方案排名要可靠得多。

第三步:串行精炼——并行蒸馏提炼(PDR)

现在,我们手上有了一组高质量的“冠军思想”作为经验包。如何让这些经验指导下一轮的行动?

  • 经验注入:开启新一批N个并行任务。但这次,每个任务在启动时,都会被“注入”这些精选出的经验摘要。
  • 站在巨人肩膀上:新的尝试不再是懵懂地从零开始,而是带着前人成功的思路和对失败陷阱的预警开工。这让它们从一开始就可能走了捷径,直奔关键问题而去。

这一步,把“复用经验的描述”,变成了“复用经验本身”,实现了高效的串行精炼。

最终选择

最后,对这轮精炼后的所有成功尝试,再次使用RTV,找出那个最终的、最好的解决方案。

整个流程就是:筛选-复用-再筛选。它巧妙地结合了并行探索的广度和串行精炼的深度,既避免了单次尝试的随机性,又克服了长程任务无法直接比较的难题。


效果如何?不只是准确,更是高效

这套框架的威力,在权威的SWE-Bench Verified和Terminal-Bench v2.0编程基准测试上得到了验证。它的效果可以总结为两点:更准、更快

1. 准确率的全面提升

无论底层是Claude、Gemini还是GPT系列模型,在引入了这套“认知技能”后,能力都获得了显著提升。举两个例子:

  • Claude-4.5-Opus:在SWE-Bench Verified上,成功率从 70.9% 提升到 77.6%;在更难的Terminal-Bench v2.0上,更是从 46.9% 跃升到 59.1%
  • 其他主流模型:均取得了4%-16%不等的显著增长。

这证明,这套方法论的优势是跨模型普适的,它优化的是解决问题的“思维方式”,而不是某个特定模型的能力。

2. 质的飞跃:效率提升近50%

这可能是最振奋人心的发现。经检验,使用了PDR串行精炼的智能体,完成任务所需的平均步骤数减少了约50%

它不再是那个在黑夜中摸索、试遍所有可能的无头苍蝇,而更像一个有经验的老手,带着清晰的路线图直击问题核心。这证明了,高质量的经验直接驱动了更高的搜索效率,避开了大量无谓的歧路和错误修复。


总结与展望:迈向“内外”兼修的智能体

这项工作的核心启示在于:对于长程智能体,测试时计算扩展的根本问题,已经从单纯地“堆算力、拼数量”,转变为了对“经验”这一核心资产的表示、筛选和复用。

它告诉我们,要让AI解决复杂问题,光有强大的基础模型(内功)还不够,还需要一套能自我复盘、博采众长、持续精进的“认知技能”(外功)。

这个框架,正是为AI装上了这样一套外功心法。它将抽象的经验具体化为可操作的结构化摘要,将无序的探索引导为有序的锦标赛选拔和世代传承。

未来的方向也已清晰:研究者们正在探索让智能体不仅能“阅读”过去的经验描述,更能直接复用过去产生的持久化外部制品——比如一份调试笔记、一个半成品补丁、一组测试脚本。这将是从“复用经验的描述”到“复用经验本身”的质变,让智能体在一个不断丰富的上下文世界中持续进化。

当长程智能体学会了如何更好地思考,它们的上限,将不止于我们今天所见。

参考链接