/images/avatar.jpg

lilfry's library

🤖 记录LLM,agent,算法与leetcode,还有一些随想。

一个小小的互联网自留地

读 MOPD:后训练正在从单一 RL 走向多教师能力合并

这篇文章最值得注意的地方,不是它又给后训练加了一个新缩写,而是它指出了一个正在变清晰的趋势:

后训练的主线,可能正在从“用一个奖励函数把模型直接 RL 到更强”,转向“先训练多个能力专家,再用 on-policy distillation 把这些能力合并回一个主模型”。

如果说 SFT 是教模型模仿答案,DPO/RL 是教模型偏向更好的行为,那么 Multi-Teacher On-Policy Distillation 更像是在回答另一个问题:

当我们已经用不同数据、不同奖励、不同阶段训练出了多个强 teacher,怎样把它们稳定地压回一个 student,而不是靠简单模型融合或离线蒸馏丢掉能力?

coding agent数据合成-qwen调研

这篇调研聚焦 coding agent 训练里最关键的一环:高质量、可验证、可复现的数据合成。如果把近两年的主线压缩成一句话,那就是:行业正在从“纯合成题”转向“以真实软件工程活动为种子,再做自动化增强”的 SWE-bench 式范式。

对于 Qwen 这一类希望持续提升复杂编码能力的模型,这条路径的意义尤其直接:它不仅决定模型能否在 benchmark 上刷出更高分,更决定模型是否真正具备在真实仓库里定位问题、搭环境、写补丁和通过测试的能力。

时代洪流中的锚点:新一轮科技革命下人文与智能的双向赋能

约瑟夫·亨里奇在《The Secret of Our Success》中揭示了一个深刻的道理:人类之所以超越其他生物,“统治”了地球,并非因为我们拥有更强大的个体智力,而是因为我们累积文化的能力,每一代人都站在前人肩膀上,将经验传递下去。然而,作为人工智能专业的学生,亨里奇所赞美的文化进化,如今却让我感到一种“解构后的虚无”:快递员运送包裹,是因为金钱驱动;代码运行,是因为晶体管开关 01;而我自己,这个碳基生物体,似乎也只是社会这台巨大机器中一个可替换的零件。

fry的香水收集小记1

上一版写得太像说明书,这版按真实使用感重写一下。

重点推荐

  1. 娇兰 土耳其玫瑰(Guerlain Rose Barbare) 这是我心里“成熟玫瑰”的样子,不是少女糖水玫瑰。刚上皮会有一点辛感和厚度,后面慢慢变成带蜂蜜感的深红玫瑰,比较适合夜晚和安静场合。 香评摘录(整理自用户评论):
  • 有人把它形容成“玫瑰蜂蜜茶”,甜润但不齁。
  • 也有人觉得粉感偏重,像高档洗护或化妆品气息,评价两极。
  • 关于留香和扩散,反馈差异很大,和皮肤状态关系明显。 香评链接:香水时代 - 娇兰 艺术沙龙 土耳其玫瑰
  1. Hermes 尼罗河花园(Hermes Un Jardin Sur Le Nil) 这支我会在通勤和春夏白天用。开场就是青绿感,像青芒果皮和柚子那种带点微苦的清爽,不甜不闷,闻着很“有风”。 香评摘录(整理自用户评论):
  • 高频关键词是“青芒果、柚子皮、莲花”,清新里带一点冷感。
  • 不少人把它当夏天的安全牌,复购率很高。
  • 也有评论提到后段会变柔,像水边植物的湿润木质感。 香评链接:香水时代 - 爱马仕 尼罗河花园
  1. Tom Ford 白麝香(White Suede / 暗麝心魄) 这个系列里我最喜欢的是它的“贴肤高级感”:不像传统皮革那么硬,更像白衬衫和麂皮手套贴在皮肤上的温柔质地,干净但不寡淡。 香评摘录(整理自用户评论):
  • 主流反馈是“皂感麝香 + 柔软皮革”,像干净体香放大版。
  • 有人觉得它很治愈,像晒过太阳的织物和皮肤温度。
  • 争议点也明显:少数评论会闻到偏工业、偏塑料的皮革感。 香评链接:香水时代 - 汤姆福特 暗麝心魄(White Suede)

这三支放一起刚好是一个完整梯队:有存在感的玫瑰、清爽通勤、贴肤白麝香。按场景换着用,基本够覆盖大部分日常了。