lilfry's library
首页 全部文章 AI 未定稿 LeetCode 分类 标签 关于
lilfry's library
取消
首页全部文章AI未定稿LeetCode分类标签关于

AI

2026

Looped Transformer 不只是重复计算:从 LoopFormer 到 Elastic-Depth Post-Training 08-18
蒸馏不只是压缩:从 Self-Distillation 到 Search Distillation 的研究地图 08-09
读 SFT、RL 与 On-Policy Distillation:后训练真正的变量是 on-policy data 08-09
FullStack-Agent:全栈 Coding Agent 的训练与评测数据是如何构造的 08-06
AgentENV:为 Agentic RL 规模化运行可分叉的沙箱环境 08-05
线性注意力从头到尾讲清楚:从注意力矩阵到可递推状态 07-28
训练模型的长程软件工程能力:从 SWE-Marathon 到 FrontierSWE 与 SWE-Together 07-20
SWE Agent 数据与评测版图 07-14
Coding Agent 最新论文与工程调研 07-14
异步 RL:用 Policy Staleness 换掉全局 Barrier 07-13
R3 和异步 RL:强异步 MoE 训练中的 routing replay 问题 07-13
DLLM 方法综述:从掩码扩散到大语言扩散模型 07-13
读 Qwen Bebop 与 DeepSeek DSpark:Speculative Decoding 正在从技巧变成系统工程 07-11
Focal Loss 是什么?为什么它能解决类别不平衡问题? 05-07
轻一点的 harness,强一点的 runtime:Agent 训练轨迹里的信号问题 05-05
模型更强之后,Agent 框架会怎样退到 runtime 05-05
告别盲目堆算力:让AI编程智能体从经验中学会“思考” 05-05
读 MOPD:后训练正在从单一 RL 走向多教师能力合并 05-05
GroupDPO: Memory efficient Group-wise Direct Preference Optimization 05-05
coding agent数据合成-qwen调研 04-19
  • 1
  • 2

Hope can set you free.

Powered by Hugo
2025 - 2026 lilfry