读 MOPD:后训练正在从单一 RL 走向多教师能力合并
这篇文章最值得注意的地方,不是它又给后训练加了一个新缩写,而是它指出了一个正在变清晰的趋势:
后训练的主线,可能正在从“用一个奖励函数把模型直接 RL 到更强”,转向“先训练多个能力专家,再用 on-policy distillation 把这些能力合并回一个主模型”。
如果说 SFT 是教模型模仿答案,DPO/RL 是教模型偏向更好的行为,那么 Multi-Teacher On-Policy Distillation 更像是在回答另一个问题:
当我们已经用不同数据、不同奖励、不同阶段训练出了多个强 teacher,怎样把它们稳定地压回一个 student,而不是靠简单模型融合或离线蒸馏丢掉能力?
告别盲目堆算力:让AI编程智能体从经验中学会“思考”
模型更强之后,Agent 框架会怎样退到 runtime
轻一点的 harness,强一点的 runtime:Agent 训练轨迹里的信号问题
coding agent数据合成-qwen调研
这篇调研聚焦 coding agent 训练里最关键的一环:高质量、可验证、可复现的数据合成。如果把近两年的主线压缩成一句话,那就是:行业正在从“纯合成题”转向“以真实软件工程活动为种子,再做自动化增强”的 SWE-bench 式范式。
对于 Qwen 这一类希望持续提升复杂编码能力的模型,这条路径的意义尤其直接:它不仅决定模型能否在 benchmark 上刷出更高分,更决定模型是否真正具备在真实仓库里定位问题、搭环境、写补丁和通过测试的能力。
时代洪流中的锚点:新一轮科技革命下人文与智能的双向赋能
约瑟夫·亨里奇在《The Secret of Our Success》中揭示了一个深刻的道理:人类之所以超越其他生物,“统治”了地球,并非因为我们拥有更强大的个体智力,而是因为我们累积文化的能力,每一代人都站在前人肩膀上,将经验传递下去。然而,作为人工智能专业的学生,亨里奇所赞美的文化进化,如今却让我感到一种“解构后的虚无”:快递员运送包裹,是因为金钱驱动;代码运行,是因为晶体管开关 0 与 1;而我自己,这个碳基生物体,似乎也只是社会这台巨大机器中一个可替换的零件。
fry的香水收集小记1
上一版写得太像说明书,这版按真实使用感重写一下。
重点推荐
- 娇兰 土耳其玫瑰(Guerlain Rose Barbare) 这是我心里“成熟玫瑰”的样子,不是少女糖水玫瑰。刚上皮会有一点辛感和厚度,后面慢慢变成带蜂蜜感的深红玫瑰,比较适合夜晚和安静场合。 香评摘录(整理自用户评论):
- 有人把它形容成“玫瑰蜂蜜茶”,甜润但不齁。
- 也有人觉得粉感偏重,像高档洗护或化妆品气息,评价两极。
- 关于留香和扩散,反馈差异很大,和皮肤状态关系明显。 香评链接:香水时代 - 娇兰 艺术沙龙 土耳其玫瑰
- Hermes 尼罗河花园(Hermes Un Jardin Sur Le Nil) 这支我会在通勤和春夏白天用。开场就是青绿感,像青芒果皮和柚子那种带点微苦的清爽,不甜不闷,闻着很“有风”。 香评摘录(整理自用户评论):
- 高频关键词是“青芒果、柚子皮、莲花”,清新里带一点冷感。
- 不少人把它当夏天的安全牌,复购率很高。
- 也有评论提到后段会变柔,像水边植物的湿润木质感。 香评链接:香水时代 - 爱马仕 尼罗河花园
- Tom Ford 白麝香(White Suede / 暗麝心魄) 这个系列里我最喜欢的是它的“贴肤高级感”:不像传统皮革那么硬,更像白衬衫和麂皮手套贴在皮肤上的温柔质地,干净但不寡淡。 香评摘录(整理自用户评论):
- 主流反馈是“皂感麝香 + 柔软皮革”,像干净体香放大版。
- 有人觉得它很治愈,像晒过太阳的织物和皮肤温度。
- 争议点也明显:少数评论会闻到偏工业、偏塑料的皮革感。 香评链接:香水时代 - 汤姆福特 暗麝心魄(White Suede)
这三支放一起刚好是一个完整梯队:有存在感的玫瑰、清爽通勤、贴肤白麝香。按场景换着用,基本够覆盖大部分日常了。