lilfry's library
首页
全部文章
AI
未定稿
LeetCode
分类
标签
关于
简体中文
English
lilfry's library
取消
首页
全部文章
AI
未定稿
LeetCode
分类
标签
关于
简体中文
English
RL
2026
读 SFT、RL 与 On-Policy Distillation:后训练真正的变量是 on-policy data
08-09
Coding Agent 最新论文与工程调研
07-14
异步 RL:用 Policy Staleness 换掉全局 Barrier
07-13
R3 和异步 RL:强异步 MoE 训练中的 routing replay 问题
07-13
读 Qwen Bebop 与 DeepSeek DSpark:Speculative Decoding 正在从技巧变成系统工程
07-11
读 MOPD:后训练正在从单一 RL 走向多教师能力合并
05-05
读《Reasoning with Sampling》:RL 没让模型变聪明,它只是在重分配推理能力
04-07
读 OLMo 3:真正重要的不是新架构,而是训练信号
04-06