<rss xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title>Agent - 标签 - lilfry's library</title><link>https://lilfry09.github.io/tags/agent/</link><description>Agent - 标签 - lilfry's library</description><generator>Hugo -- gohugo.io</generator><language>zh-CN</language><managingEditor>lilfry@sjtu.edu.cn (lilfry)</managingEditor><webMaster>lilfry@sjtu.edu.cn (lilfry)</webMaster><copyright>All rights reserved.</copyright><lastBuildDate>Wed, 05 Aug 2026 23:30:00 +0800</lastBuildDate><atom:link href="https://lilfry09.github.io/tags/agent/" rel="self" type="application/rss+xml"/><item><title>AgentENV：为 Agentic RL 规模化运行可分叉的沙箱环境</title><link>https://lilfry09.github.io/ai/agentenv-agentic-rl-environment-infrastructure/</link><pubDate>Wed, 05 Aug 2026 23:30:00 +0800</pubDate><author>fry</author><guid>https://lilfry09.github.io/ai/agentenv-agentic-rl-environment-infrastructure/</guid><description><![CDATA[<h3 id="agentic-rl-的瓶颈不只在模型和-gpu还在环境当成千上万个-agent-同时运行代码调用工具修改文件并探索不同路径时系统需要的不是更多普通容器而是可快速启动强隔离可暂停可恢复可分叉的大规模沙箱agentenv-要解决的正是这个问题"><strong>Agentic RL 的瓶颈不只在模型和 GPU，还在环境：当成千上万个 Agent 同时运行代码、调用工具、修改文件并探索不同路径时，系统需要的不是更多普通容器，而是可快速启动、强隔离、可暂停、可恢复、可分叉的大规模沙箱。AgentENV 要解决的正是这个问题。</strong></h3>
<p>在传统 LLM 训练中，一条样本往往只是一段静态文本。但在 Agentic RL 中，样本变成了一段持续交互的轨迹：Agent 要进入操作系统，读写文件，执行 shell 命令，安装依赖，运行测试，根据反馈继续决策。训练系统因此不仅要“喂数据”，还要为每条轨迹准备一个安全、可重现的运行世界。</p>
<p><a href="https://github.com/kvcache-ai/AgentENV" target="_blank" rel="noopener noreffer ">AgentENV（AENV）</a> 是一个面向这类工作负载的分布式平台，官方定位是“Running agent environments at scale”，并已用于 Kimi K3 的 Agentic RL 训练。它的核心价值可以压缩成一句话：<strong>把单个隔离环境的创建与恢复，扩展成跨机器、可持久化、可弹性调度的环境基础设施。</strong></p>]]></description></item><item><title>Coding Agent 最新论文与工程调研</title><link>https://lilfry09.github.io/ai/coding-agent-latest-research-survey/</link><pubDate>Tue, 14 Jul 2026 03:30:00 +0800</pubDate><author>fry</author><guid>https://lilfry09.github.io/ai/coding-agent-latest-research-survey/</guid><description><![CDATA[<p>这轮调研的核心问题是：<strong>为什么 GPT/Codex、Claude Code 这类 coding agent 突然变得这么能干？</strong></p>
<p>我的结论先放前面：它们不是单靠“模型会写代码”变强的，而是被一整套新的训练与工程范式推上去的：</p>
<ol>
<li><strong>数据从代码片段变成真实软件工程任务</strong>：GitHub issue、PR、测试、依赖、Docker 环境、终端日志、代码审查意见、失败轨迹都成了训练资产。</li>
<li><strong>训练从 next-token code completion 走向可验证交互</strong>：SFT 学轨迹，RL 学“跑测试、看失败、改补丁、再验证”的闭环，critic/verifier 学会挑更可能通过的 patch。</li>
<li><strong>terminal 成了核心训练环境</strong>：真实 agent 不是只输出 diff，而是在 shell 里安装依赖、读日志、运行测试、grep/rg、编辑文件、回滚、调试。</li>
<li><strong>长上下文不只是 1M token，而是 context engineering</strong>：强 agent 会把仓库当文件系统操作，用搜索、摘要、记忆、压缩、多窗口初始化来管理上下文。</li>
<li><strong>harness/runtime 的设计极其关键</strong>：同一个底座模型，换工具接口、权限模型、sandbox、上下文拼装、测试反馈方式，SWE-bench 分数和真实可用性都能差很多。</li>
</ol>
<p>还有一个必须诚实说清楚的点：<strong>OpenAI 和 Anthropic 没有公开完整训练配方</strong>。但它们的官方 blog/system card 已经泄露了足够多的方向信号。OpenAI 明确说 GPT-5-Codex 类模型是针对 agentic coding 优化，并使用真实 coding tasks 的强化学习，让模型学会贴近 human PR preference、遵循指令、迭代跑测试直到通过。Anthropic 则把 Claude Code 的进步拆成 context engineering、工具设计、sandbox、auto mode、long-running harness、多 agent 并行和 eval-aware 开发。把这些和开源论文拼起来，大致能还原“前沿 coding agent 为什么强”的工程轮廓。</p>]]></description></item><item><title>模型更强之后，Agent 框架会怎样退到 runtime</title><link>https://lilfry09.github.io/ai/stronger-agent-models-thinner-frameworks/</link><pubDate>Tue, 05 May 2026 00:00:00 +0800</pubDate><author>fry</author><guid>https://lilfry09.github.io/ai/stronger-agent-models-thinner-frameworks/</guid><description>当模型通过轨迹训练学会规划、工具使用、错误恢复和上下文选择后，Agent 框架最该简化的不是安全和评估，而是替模型思考的调度层。</description></item><item><title>轻一点的 harness，强一点的 runtime：Agent 训练轨迹里的信号问题</title><link>https://lilfry09.github.io/ai/agent-harness-training-trajectory-signal/</link><pubDate>Tue, 05 May 2026 00:00:00 +0800</pubDate><author>fry</author><guid>https://lilfry09.github.io/ai/agent-harness-training-trajectory-signal/</guid><description>Agent 训练真正宝贵的是轨迹里的因果信号。harness 可以保护执行环境，却不应该替模型完成太多认知决策，否则成功轨迹会变成带噪声的训练样本。</description></item></channel></rss>