lilfry's library
首页
全部文章
AI
未定稿
LeetCode
分类
标签
关于
简体中文
English
lilfry's library
取消
首页
全部文章
AI
未定稿
LeetCode
分类
标签
关于
简体中文
English
LLM
2026
异步 RL:用 Policy Staleness 换掉全局 Barrier
07-13
R3 和异步 RL:强异步 MoE 训练中的 routing replay 问题
07-13
DLLM 方法综述:从掩码扩散到大语言扩散模型
07-13
读 Qwen Bebop 与 DeepSeek DSpark:Speculative Decoding 正在从技巧变成系统工程
07-11
模型更强之后,Agent 框架会怎样退到 runtime
05-05
读 MOPD:后训练正在从单一 RL 走向多教师能力合并
05-05
GroupDPO: Memory efficient Group-wise Direct Preference Optimization
05-05
面试高频:Bradley-Terry vs Plackett-Luce,奖励建模到底差在哪
04-08
读 YaRN:长上下文扩展,核心不是硬拉窗口,而是别把 RoPE 拉坏了
04-07
读《Reasoning with Sampling》:RL 没让模型变聪明,它只是在重分配推理能力
04-07
读 OLMo 3:真正重要的不是新架构,而是训练信号
04-06