lilfry's library
首页
全部文章
AI
未定稿
LeetCode
分类
标签
关于
简体中文
English
lilfry's library
取消
首页
全部文章
AI
未定稿
LeetCode
分类
标签
关于
简体中文
English
AI
2026
Looped Transformer 不只是重复计算:从 LoopFormer 到 Elastic-Depth Post-Training
08-18
蒸馏不只是压缩:从 Self-Distillation 到 Search Distillation 的研究地图
08-09
读 SFT、RL 与 On-Policy Distillation:后训练真正的变量是 on-policy data
08-09
FullStack-Agent:全栈 Coding Agent 的训练与评测数据是如何构造的
08-06
AgentENV:为 Agentic RL 规模化运行可分叉的沙箱环境
08-05
线性注意力从头到尾讲清楚:从注意力矩阵到可递推状态
07-28
训练模型的长程软件工程能力:从 SWE-Marathon 到 FrontierSWE 与 SWE-Together
07-20
SWE Agent 数据与评测版图
07-14
Coding Agent 最新论文与工程调研
07-14
异步 RL:用 Policy Staleness 换掉全局 Barrier
07-13
R3 和异步 RL:强异步 MoE 训练中的 routing replay 问题
07-13
DLLM 方法综述:从掩码扩散到大语言扩散模型
07-13
读 Qwen Bebop 与 DeepSeek DSpark:Speculative Decoding 正在从技巧变成系统工程
07-11
Focal Loss 是什么?为什么它能解决类别不平衡问题?
05-07
轻一点的 harness,强一点的 runtime:Agent 训练轨迹里的信号问题
05-05
模型更强之后,Agent 框架会怎样退到 runtime
05-05
告别盲目堆算力:让AI编程智能体从经验中学会“思考”
05-05
读 MOPD:后训练正在从单一 RL 走向多教师能力合并
05-05
GroupDPO: Memory efficient Group-wise Direct Preference Optimization
05-05
coding agent数据合成-qwen调研
04-19
1
2