<rss xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title>RL - 标签 - lilfry's library</title><link>https://lilfry09.github.io/tags/rl/</link><description>RL - 标签 - lilfry's library</description><generator>Hugo -- gohugo.io</generator><language>zh-CN</language><managingEditor>lilfry@sjtu.edu.cn (lilfry)</managingEditor><webMaster>lilfry@sjtu.edu.cn (lilfry)</webMaster><copyright>All rights reserved.</copyright><lastBuildDate>Sun, 09 Aug 2026 21:00:00 +0800</lastBuildDate><atom:link href="https://lilfry09.github.io/tags/rl/" rel="self" type="application/rss+xml"/><item><title>读 SFT、RL 与 On-Policy Distillation：后训练真正的变量是 on-policy data</title><link>https://lilfry09.github.io/ai/sft-rl-opd-on-policy-data/</link><pubDate>Sun, 09 Aug 2026 21:00:00 +0800</pubDate><author>fry</author><guid>https://lilfry09.github.io/ai/sft-rl-opd-on-policy-data/</guid><description><![CDATA[<p>这篇原文最值得带走的一句话，我会改写成：</p>
<p><strong>后训练不是在同一条损失曲线上做微调，而是在改模型会访问到的分布形状。</strong></p>
<p>SFT 把模型往外部示范拉，RL 让模型在自己会走到的状态上追逐奖励，OPD 则让 student 在自己的 prefixes 上对齐 teacher。只要盯住“数据来自哪里”，很多看起来玄学的现象就会变得很朴素：为什么 RL 和 OPD 常常比 SFT 更不容易忘，为什么 student 甚至能超过 teacher。</p>
<p>原文在这里：<a href="https://nrehiew.github.io/blog/sft_rl_opd/" target="_blank" rel="noopener noreffer ">SFT, RL, and On-Policy Distillation Through a Distributional Lens</a>。</p>
<p></p>]]></description></item><item><title>Coding Agent 最新论文与工程调研</title><link>https://lilfry09.github.io/ai/coding-agent-latest-research-survey/</link><pubDate>Tue, 14 Jul 2026 03:30:00 +0800</pubDate><author>fry</author><guid>https://lilfry09.github.io/ai/coding-agent-latest-research-survey/</guid><description><![CDATA[<p>这轮调研的核心问题是：<strong>为什么 GPT/Codex、Claude Code 这类 coding agent 突然变得这么能干？</strong></p>
<p>我的结论先放前面：它们不是单靠“模型会写代码”变强的，而是被一整套新的训练与工程范式推上去的：</p>
<ol>
<li><strong>数据从代码片段变成真实软件工程任务</strong>：GitHub issue、PR、测试、依赖、Docker 环境、终端日志、代码审查意见、失败轨迹都成了训练资产。</li>
<li><strong>训练从 next-token code completion 走向可验证交互</strong>：SFT 学轨迹，RL 学“跑测试、看失败、改补丁、再验证”的闭环，critic/verifier 学会挑更可能通过的 patch。</li>
<li><strong>terminal 成了核心训练环境</strong>：真实 agent 不是只输出 diff，而是在 shell 里安装依赖、读日志、运行测试、grep/rg、编辑文件、回滚、调试。</li>
<li><strong>长上下文不只是 1M token，而是 context engineering</strong>：强 agent 会把仓库当文件系统操作，用搜索、摘要、记忆、压缩、多窗口初始化来管理上下文。</li>
<li><strong>harness/runtime 的设计极其关键</strong>：同一个底座模型，换工具接口、权限模型、sandbox、上下文拼装、测试反馈方式，SWE-bench 分数和真实可用性都能差很多。</li>
</ol>
<p>还有一个必须诚实说清楚的点：<strong>OpenAI 和 Anthropic 没有公开完整训练配方</strong>。但它们的官方 blog/system card 已经泄露了足够多的方向信号。OpenAI 明确说 GPT-5-Codex 类模型是针对 agentic coding 优化，并使用真实 coding tasks 的强化学习，让模型学会贴近 human PR preference、遵循指令、迭代跑测试直到通过。Anthropic 则把 Claude Code 的进步拆成 context engineering、工具设计、sandbox、auto mode、long-running harness、多 agent 并行和 eval-aware 开发。把这些和开源论文拼起来，大致能还原“前沿 coding agent 为什么强”的工程轮廓。</p>]]></description></item><item><title>异步 RL：用 Policy Staleness 换掉全局 Barrier</title><link>https://lilfry09.github.io/ai/async-rl-policy-staleness-global-barrier/</link><pubDate>Mon, 13 Jul 2026 23:30:00 +0800</pubDate><author>fry</author><guid>https://lilfry09.github.io/ai/async-rl-policy-staleness-global-barrier/</guid><description><![CDATA[<h3 id="异步-rl-的核心就是rollout-worker-持续生成样本trainer-收到足够样本就立即更新不再等待同一轮所有请求全部完成它用一定程度的-policy-staleness-换掉同步-barrier因此-gpu-更忙吞吐更高但训练数据也不再严格来自当前-policy"><strong>异步 RL 的核心就是：rollout worker 持续生成样本，trainer 收到足够样本就立即更新，不再等待同一轮所有请求全部完成。它用一定程度的 policy staleness 换掉同步 barrier，因此 GPU 更忙、吞吐更高，但训练数据也不再严格来自当前 policy。</strong></h3>
<p>如果只看系统吞吐，异步 RL 很诱人。长 CoT 请求不再把整轮训练卡住，短请求生成完就可以进入训练队列，trainer 不必陪最后几个超长样本一起发呆。</p>
<p>但这笔交易并不免费。同步 RL 里的等待点很烦，却也维护了一个重要假设：本轮训练数据大体来自同一个 policy snapshot。异步 RL 把这个假设拆掉之后，系统变成一条更高吞吐的流水线，同时也把 off-policy correction、数据分布偏差和样本版本管理都请上了牌桌。</p>]]></description></item><item><title>R3 和异步 RL：强异步 MoE 训练中的 routing replay 问题</title><link>https://lilfry09.github.io/ai/r3-async-rl-moe-routing-replay/</link><pubDate>Mon, 13 Jul 2026 00:00:00 +0800</pubDate><author>fry</author><guid>https://lilfry09.github.io/ai/r3-async-rl-moe-routing-replay/</guid><description><![CDATA[<h3 id="r3-和异步-rl-解决的是两个正交问题异步导致的是用旧-policy-的数据更新新-policyr3-修的是对同一个-token同一组参数训练重算时没有复现-rollout-当时的-moe-routing即便-composer-天生允许-policy-staleness也仍需先保证行为-policy-的-token-probability-能被准确重建否则-off-policy-correctionkl-和-policy-ratio-都会被错误-routing-污染"><strong>R3 和异步 RL 解决的是两个正交问题：异步导致的是“用旧 policy 的数据更新新 policy”，R3 修的是“对同一个 token、同一组参数，训练重算时没有复现 rollout 当时的 MoE routing”。即便 Composer 天生允许 policy staleness，也仍需先保证行为 policy 的 token probability 能被准确重建，否则 off-policy correction、KL 和 policy ratio 都会被错误 routing 污染。</strong></h3>
<p>关于这件事，有两个容易混在一起的判断：一个是“逻辑上不等价”的区分，这个分类基本正确；另一个是“想更新生成 token 时参与计算的 experts”，它也抓到了现象，但最后一句需要更精确一点：R3 的关键未必是<strong>冻结并只更新原 experts</strong>，而是<strong>重放 rollout routing，以便正确重建 behavior-policy forward 或训练所需的概率和梯度路径</strong>。两件事很接近，却不能完全画等号。</p>]]></description></item><item><title>读 Qwen Bebop 与 DeepSeek DSpark：Speculative Decoding 正在从技巧变成系统工程</title><link>https://lilfry09.github.io/ai/qwen-bebop-deepseek-dspark-speculative-decoding/</link><pubDate>Sat, 11 Jul 2026 23:30:00 +0800</pubDate><author>fry</author><guid>https://lilfry09.github.io/ai/qwen-bebop-deepseek-dspark-speculative-decoding/</guid><description><![CDATA[<p>最近两篇关于 <code>speculative decoding</code> 的论文很值得放在一起看。</p>
<p>一篇是 Qwen Team 的 <strong>Bebop</strong>，全名是 <em>Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling</em>。它关心的是：在大规模 RL 后训练里，rollout 太慢，能不能用 <code>MTP</code> 把采样阶段加速起来？</p>
<p>另一篇是 DeepSeek 的 <strong>DSpark</strong>，全名是 <em>Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation</em>。它关心的是：在线上高并发 serving 里，speculative decoding 为什么经常一上负载就不稳，怎样让它真正移动吞吐-延迟前沿？</p>
<p>这两篇看起来一个讲训练，一个讲推理；一个讲 Qwen 的 RL pipeline，一个讲 DeepSeek-V4 的线上服务。但我读完之后觉得，它们其实在回答同一个更大的问题：</p>
<p><strong>speculative decoding 的核心已经不只是“多猜几个 token”，而是怎样让猜测、验证、分布匹配和系统负载一起闭环。</strong></p>]]></description></item><item><title>读 MOPD：后训练正在从单一 RL 走向多教师能力合并</title><link>https://lilfry09.github.io/ai/multi-teacher-on-policy-distillation-post-training-primitive/</link><pubDate>Tue, 05 May 2026 00:00:00 +0800</pubDate><author>fry</author><guid>https://lilfry09.github.io/ai/multi-teacher-on-policy-distillation-post-training-primitive/</guid><description><![CDATA[<p>这篇文章最值得注意的地方，不是它又给后训练加了一个新缩写，而是它指出了一个正在变清晰的趋势：</p>
<p><strong>后训练的主线，可能正在从“用一个奖励函数把模型直接 RL 到更强”，转向“先训练多个能力专家，再用 on-policy distillation 把这些能力合并回一个主模型”。</strong></p>
<p>如果说 SFT 是教模型模仿答案，DPO/RL 是教模型偏向更好的行为，那么 <code>Multi-Teacher On-Policy Distillation</code> 更像是在回答另一个问题：</p>
<p><strong>当我们已经用不同数据、不同奖励、不同阶段训练出了多个强 teacher，怎样把它们稳定地压回一个 student，而不是靠简单模型融合或离线蒸馏丢掉能力？</strong></p>]]></description></item><item><title>读《Reasoning with Sampling》：RL 没让模型变聪明，它只是在重分配推理能力</title><link>https://lilfry09.github.io/ai/reasoning-with-sampling-rl-redistribution/</link><pubDate>Tue, 07 Apr 2026 20:55:00 +0800</pubDate><author>fry</author><guid>https://lilfry09.github.io/ai/reasoning-with-sampling-rl-redistribution/</guid><description><![CDATA[<p>这篇论文真正危险的地方，不是它提出了一个新采样器，而是它在追问一个更深的解释问题：</p>
<p><strong>reasoning model 的进步，到底是模型学会了新能力，还是我们终于学会了怎么从旧能力里采样？</strong></p>
<p>如果这个问题问对了，很多关于 <code>RL for reasoning</code> 的叙事都得重写。</p>]]></description></item><item><title>读 OLMo 3：真正重要的不是新架构，而是训练信号</title><link>https://lilfry09.github.io/ai/olmo3-training-signals/</link><pubDate>Mon, 06 Apr 2026 19:00:00 +0800</pubDate><author>fry</author><guid>https://lilfry09.github.io/ai/olmo3-training-signals/</guid><description><![CDATA[<p>最近读 <code>OLMo 3</code>，我最大的感受不是“开源社区又做出了一个更强的模型”，而是它把一件经常被说得很模糊的事情讲清楚了：</p>
<p><strong>一个大模型最终会长成什么样，核心不是由几处架构微调决定，而是由它在每个阶段反复接收到什么训练信号决定。</strong></p>
<p>这句话听起来很朴素，但如果真把它想透，很多关于 LLM 的问题都会变得更清楚。为什么有些模型底座不差，后训练却拉不上去？为什么有些模型上下文窗口变长了，却还是不会真正利用长上下文？为什么有些 RL recipe 看起来很先进，最后却没有明显收益？答案往往不在“结构又改了什么”，而在“梯度到底从哪里来”。</p>]]></description></item></channel></rss>