<rss xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title>Coding Agent - 标签 - lilfry's library</title><link>https://lilfry09.github.io/tags/coding-agent/</link><description>Coding Agent - 标签 - lilfry's library</description><generator>Hugo -- gohugo.io</generator><language>zh-CN</language><managingEditor>lilfry@sjtu.edu.cn (lilfry)</managingEditor><webMaster>lilfry@sjtu.edu.cn (lilfry)</webMaster><copyright>All rights reserved.</copyright><lastBuildDate>Thu, 06 Aug 2026 20:00:00 +0800</lastBuildDate><atom:link href="https://lilfry09.github.io/tags/coding-agent/" rel="self" type="application/rss+xml"/><item><title>FullStack-Agent：全栈 Coding Agent 的训练与评测数据是如何构造的</title><link>https://lilfry09.github.io/ai/fullstack-agent-data-construction/</link><pubDate>Thu, 06 Aug 2026 20:00:00 +0800</pubDate><author>fry</author><guid>https://lilfry09.github.io/ai/fullstack-agent-data-construction/</guid><description><![CDATA[<p>很多“网页生成 Agent”看起来已经能做出漂亮页面：按钮能点，表单能提交，页面还能弹出“保存成功”。但如果继续追问两步，问题就会暴露出来：数据真的写进数据库了吗？刷新页面之后还能读回来吗？后端 API 是否真的存在？</p>
<p><code>FullStack-Agent</code> 这篇论文的核心贡献，正是把网站生成从“看起来像全栈”推进到“前端、后端和数据库都能被验证”。不过，论文里更值得仔细看的其实不只是 Agent 框架，而是它的数据构造方法：<strong>它如何把真实网站代码库转换成 Coding Agent 的训练轨迹，又如何构造能够识别假后端的评测数据？</strong></p>
<p>本文只讨论这两个问题。论文原文是 <a href="https://arxiv.org/abs/2602.03798" target="_blank" rel="noopener noreffer ">FullStack-Agent: Enhancing Agentic Full-Stack Web Coding via Development-Oriented Testing and Repository Back-Translation</a>，代码仓库见 <a href="https://github.com/mnluzimu/FullStack-Agent" target="_blank" rel="noopener noreffer ">GitHub</a>。</p>]]></description></item><item><title>训练模型的长程软件工程能力：从 SWE-Marathon 到 FrontierSWE 与 SWE-Together</title><link>https://lilfry09.github.io/ai/long-horizon-swe-agent-training/</link><pubDate>Mon, 20 Jul 2026 21:30:00 +0800</pubDate><author>fry</author><guid>https://lilfry09.github.io/ai/long-horizon-swe-agent-training/</guid><description><![CDATA[<p>如果要训练模型做长程软件工程任务，最容易走错的一步，是把“长程能力”理解成“更长上下文 + 更多 token”。SWE-Marathon、FrontierSWE 和 SWE-Together 这三组工作放在一起看，会给出一个更锋利的答案：长程能力不是文本长度，而是 <strong>在一个可执行环境里，持续维护目标、状态、证据、风险和验证闭环</strong>。</p>
<p>SWE-bench 把真实 GitHub issue 变成了可评分 patch，这是很重要的一步。但它主要回答“模型能不能修一个相对局部的问题”。现在这三组新 benchmark 关心的是另一件事：模型能不能像一个还算可靠的工程师那样，连续几个小时推进一个项目，把中途实验、失败、回滚、测试、用户纠偏、最终提交都组织起来。</p>]]></description></item><item><title>SWE Agent 数据与评测版图</title><link>https://lilfry09.github.io/ai/swe-agent-benchmark-data-report/</link><pubDate>Tue, 14 Jul 2026 20:20:00 +0800</pubDate><author>fry</author><guid>https://lilfry09.github.io/ai/swe-agent-benchmark-data-report/</guid><description>这份 HTML 汇报梳理了 SWE agent 的评测版图、现成轨迹数据、可运行/可构建 SWE 环境资产，以及 rollout factory 和数据合成改进方向。</description></item><item><title>Coding Agent 最新论文与工程调研</title><link>https://lilfry09.github.io/ai/coding-agent-latest-research-survey/</link><pubDate>Tue, 14 Jul 2026 03:30:00 +0800</pubDate><author>fry</author><guid>https://lilfry09.github.io/ai/coding-agent-latest-research-survey/</guid><description><![CDATA[<p>这轮调研的核心问题是：<strong>为什么 GPT/Codex、Claude Code 这类 coding agent 突然变得这么能干？</strong></p>
<p>我的结论先放前面：它们不是单靠“模型会写代码”变强的，而是被一整套新的训练与工程范式推上去的：</p>
<ol>
<li><strong>数据从代码片段变成真实软件工程任务</strong>：GitHub issue、PR、测试、依赖、Docker 环境、终端日志、代码审查意见、失败轨迹都成了训练资产。</li>
<li><strong>训练从 next-token code completion 走向可验证交互</strong>：SFT 学轨迹，RL 学“跑测试、看失败、改补丁、再验证”的闭环，critic/verifier 学会挑更可能通过的 patch。</li>
<li><strong>terminal 成了核心训练环境</strong>：真实 agent 不是只输出 diff，而是在 shell 里安装依赖、读日志、运行测试、grep/rg、编辑文件、回滚、调试。</li>
<li><strong>长上下文不只是 1M token，而是 context engineering</strong>：强 agent 会把仓库当文件系统操作，用搜索、摘要、记忆、压缩、多窗口初始化来管理上下文。</li>
<li><strong>harness/runtime 的设计极其关键</strong>：同一个底座模型，换工具接口、权限模型、sandbox、上下文拼装、测试反馈方式，SWE-bench 分数和真实可用性都能差很多。</li>
</ol>
<p>还有一个必须诚实说清楚的点：<strong>OpenAI 和 Anthropic 没有公开完整训练配方</strong>。但它们的官方 blog/system card 已经泄露了足够多的方向信号。OpenAI 明确说 GPT-5-Codex 类模型是针对 agentic coding 优化，并使用真实 coding tasks 的强化学习，让模型学会贴近 human PR preference、遵循指令、迭代跑测试直到通过。Anthropic 则把 Claude Code 的进步拆成 context engineering、工具设计、sandbox、auto mode、long-running harness、多 agent 并行和 eval-aware 开发。把这些和开源论文拼起来，大致能还原“前沿 coding agent 为什么强”的工程轮廓。</p>]]></description></item><item><title>告别盲目堆算力：让AI编程智能体从经验中学会“思考”</title><link>https://lilfry09.github.io/ai/scaling-test-time-compute-for-agentic-coding/</link><pubDate>Tue, 05 May 2026 00:00:00 +0800</pubDate><author>fry</author><guid>https://lilfry09.github.io/ai/scaling-test-time-compute-for-agentic-coding/</guid><description>本文介绍一种面向长程编程智能体的测试时扩展框架：通过结构化复盘、递归锦标赛投票和并行蒸馏提炼，让智能体复用经验而不是盲目重试。</description></item><item><title>coding agent数据合成-qwen调研</title><link>https://lilfry09.github.io/ai/coding-agent-data-synthesis-qwen-research/</link><pubDate>Sun, 19 Apr 2026 20:05:00 +0800</pubDate><author>fry</author><guid>https://lilfry09.github.io/ai/coding-agent-data-synthesis-qwen-research/</guid><description><![CDATA[<p>这篇调研聚焦 <code>coding agent</code> 训练里最关键的一环：<strong>高质量、可验证、可复现的数据合成</strong>。如果把近两年的主线压缩成一句话，那就是：行业正在从“纯合成题”转向“以真实软件工程活动为种子，再做自动化增强”的 <code>SWE-bench</code> 式范式。</p>
<p>对于 <code>Qwen</code> 这一类希望持续提升复杂编码能力的模型，这条路径的意义尤其直接：它不仅决定模型能否在 benchmark 上刷出更高分，更决定模型是否真正具备在真实仓库里定位问题、搭环境、写补丁和通过测试的能力。</p>]]></description></item></channel></rss>