lilfry's library
首页 全部文章 AI 未定稿 LeetCode 分类 标签 关于
lilfry's library
取消
首页全部文章AI未定稿LeetCode分类标签关于

 LLM

2026

异步 RL:用 Policy Staleness 换掉全局 Barrier 07-13
R3 和异步 RL:强异步 MoE 训练中的 routing replay 问题 07-13
DLLM 方法综述:从掩码扩散到大语言扩散模型 07-13
读 Qwen Bebop 与 DeepSeek DSpark:Speculative Decoding 正在从技巧变成系统工程 07-11
模型更强之后,Agent 框架会怎样退到 runtime 05-05
读 MOPD:后训练正在从单一 RL 走向多教师能力合并 05-05
GroupDPO: Memory efficient Group-wise Direct Preference Optimization 05-05
面试高频:Bradley-Terry vs Plackett-Luce,奖励建模到底差在哪 04-08
读 YaRN:长上下文扩展,核心不是硬拉窗口,而是别把 RoPE 拉坏了 04-07
读《Reasoning with Sampling》:RL 没让模型变聪明,它只是在重分配推理能力 04-07
读 OLMo 3:真正重要的不是新架构,而是训练信号 04-06

Hope can set you free.

Powered by Hugo
2025 - 2026 lilfry