<rss xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title>R3 - 标签 - lilfry's library</title><link>https://lilfry09.github.io/tags/r3/</link><description>R3 - 标签 - lilfry's library</description><generator>Hugo -- gohugo.io</generator><language>zh-CN</language><managingEditor>lilfry@sjtu.edu.cn (lilfry)</managingEditor><webMaster>lilfry@sjtu.edu.cn (lilfry)</webMaster><copyright>All rights reserved.</copyright><lastBuildDate>Mon, 13 Jul 2026 00:00:00 +0800</lastBuildDate><atom:link href="https://lilfry09.github.io/tags/r3/" rel="self" type="application/rss+xml"/><item><title>R3 和异步 RL：强异步 MoE 训练中的 routing replay 问题</title><link>https://lilfry09.github.io/ai/r3-async-rl-moe-routing-replay/</link><pubDate>Mon, 13 Jul 2026 00:00:00 +0800</pubDate><author>fry</author><guid>https://lilfry09.github.io/ai/r3-async-rl-moe-routing-replay/</guid><description><![CDATA[<h3 id="r3-和异步-rl-解决的是两个正交问题异步导致的是用旧-policy-的数据更新新-policyr3-修的是对同一个-token同一组参数训练重算时没有复现-rollout-当时的-moe-routing即便-composer-天生允许-policy-staleness也仍需先保证行为-policy-的-token-probability-能被准确重建否则-off-policy-correctionkl-和-policy-ratio-都会被错误-routing-污染"><strong>R3 和异步 RL 解决的是两个正交问题：异步导致的是“用旧 policy 的数据更新新 policy”，R3 修的是“对同一个 token、同一组参数，训练重算时没有复现 rollout 当时的 MoE routing”。即便 Composer 天生允许 policy staleness，也仍需先保证行为 policy 的 token probability 能被准确重建，否则 off-policy correction、KL 和 policy ratio 都会被错误 routing 污染。</strong></h3>
<p>关于这件事，有两个容易混在一起的判断：一个是“逻辑上不等价”的区分，这个分类基本正确；另一个是“想更新生成 token 时参与计算的 experts”，它也抓到了现象，但最后一句需要更精确一点：R3 的关键未必是<strong>冻结并只更新原 experts</strong>，而是<strong>重放 rollout routing，以便正确重建 behavior-policy forward 或训练所需的概率和梯度路径</strong>。两件事很接近，却不能完全画等号。</p>]]></description></item></channel></rss>