<rss xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title>Ranking - 标签 - lilfry's library</title><link>https://lilfry09.github.io/tags/ranking/</link><description>Ranking - 标签 - lilfry's library</description><generator>Hugo -- gohugo.io</generator><language>zh-CN</language><managingEditor>lilfry@sjtu.edu.cn (lilfry)</managingEditor><webMaster>lilfry@sjtu.edu.cn (lilfry)</webMaster><copyright>All rights reserved.</copyright><lastBuildDate>Wed, 08 Apr 2026 14:20:00 +0800</lastBuildDate><atom:link href="https://lilfry09.github.io/tags/ranking/" rel="self" type="application/rss+xml"/><item><title>面试高频：Bradley-Terry vs Plackett-Luce，奖励建模到底差在哪</title><link>https://lilfry09.github.io/ai/bt-vs-pl-ranking-in-alignment/</link><pubDate>Wed, 08 Apr 2026 14:20:00 +0800</pubDate><author>fry</author><guid>https://lilfry09.github.io/ai/bt-vs-pl-ranking-in-alignment/</guid><description>一句话：BT 是 PL 在候选数 N=2 时的特例。BT 更轻、更稳、更适合现有 RLHF/DPO；PL 信息更全，但标注和训练成本显著更高。</description></item></channel></rss>