<rss xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title>PPO - 标签 - lilfry's library</title><link>https://lilfry09.github.io/tags/ppo/</link><description>PPO - 标签 - lilfry's library</description><generator>Hugo -- gohugo.io</generator><language>zh-CN</language><managingEditor>lilfry@sjtu.edu.cn (lilfry)</managingEditor><webMaster>lilfry@sjtu.edu.cn (lilfry)</webMaster><copyright>All rights reserved.</copyright><lastBuildDate>Mon, 13 Jul 2026 23:30:00 +0800</lastBuildDate><atom:link href="https://lilfry09.github.io/tags/ppo/" rel="self" type="application/rss+xml"/><item><title>异步 RL：用 Policy Staleness 换掉全局 Barrier</title><link>https://lilfry09.github.io/ai/async-rl-policy-staleness-global-barrier/</link><pubDate>Mon, 13 Jul 2026 23:30:00 +0800</pubDate><author>fry</author><guid>https://lilfry09.github.io/ai/async-rl-policy-staleness-global-barrier/</guid><description><![CDATA[<h3 id="异步-rl-的核心就是rollout-worker-持续生成样本trainer-收到足够样本就立即更新不再等待同一轮所有请求全部完成它用一定程度的-policy-staleness-换掉同步-barrier因此-gpu-更忙吞吐更高但训练数据也不再严格来自当前-policy"><strong>异步 RL 的核心就是：rollout worker 持续生成样本，trainer 收到足够样本就立即更新，不再等待同一轮所有请求全部完成。它用一定程度的 policy staleness 换掉同步 barrier，因此 GPU 更忙、吞吐更高，但训练数据也不再严格来自当前 policy。</strong></h3>
<p>如果只看系统吞吐，异步 RL 很诱人。长 CoT 请求不再把整轮训练卡住，短请求生成完就可以进入训练队列，trainer 不必陪最后几个超长样本一起发呆。</p>
<p>但这笔交易并不免费。同步 RL 里的等待点很烦，却也维护了一个重要假设：本轮训练数据大体来自同一个 policy snapshot。异步 RL 把这个假设拆掉之后，系统变成一条更高吞吐的流水线，同时也把 off-policy correction、数据分布偏差和样本版本管理都请上了牌桌。</p>]]></description></item></channel></rss>