lilfry's library
首页 全部文章 AI 未定稿 LeetCode 分类 标签 关于
lilfry's library
取消
首页全部文章AI未定稿LeetCode分类标签关于

 RL

2026

读 SFT、RL 与 On-Policy Distillation:后训练真正的变量是 on-policy data 08-09
Coding Agent 最新论文与工程调研 07-14
异步 RL:用 Policy Staleness 换掉全局 Barrier 07-13
R3 和异步 RL:强异步 MoE 训练中的 routing replay 问题 07-13
读 Qwen Bebop 与 DeepSeek DSpark:Speculative Decoding 正在从技巧变成系统工程 07-11
读 MOPD:后训练正在从单一 RL 走向多教师能力合并 05-05
读《Reasoning with Sampling》:RL 没让模型变聪明,它只是在重分配推理能力 04-07
读 OLMo 3:真正重要的不是新架构,而是训练信号 04-06

Hope can set you free.

Powered by Hugo
2025 - 2026 lilfry