<rss xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title>Sampling - 标签 - lilfry's library</title><link>https://lilfry09.github.io/tags/sampling/</link><description>Sampling - 标签 - lilfry's library</description><generator>Hugo -- gohugo.io</generator><language>zh-CN</language><managingEditor>lilfry@sjtu.edu.cn (lilfry)</managingEditor><webMaster>lilfry@sjtu.edu.cn (lilfry)</webMaster><copyright>All rights reserved.</copyright><lastBuildDate>Tue, 07 Apr 2026 20:55:00 +0800</lastBuildDate><atom:link href="https://lilfry09.github.io/tags/sampling/" rel="self" type="application/rss+xml"/><item><title>读《Reasoning with Sampling》：RL 没让模型变聪明，它只是在重分配推理能力</title><link>https://lilfry09.github.io/ai/reasoning-with-sampling-rl-redistribution/</link><pubDate>Tue, 07 Apr 2026 20:55:00 +0800</pubDate><author>fry</author><guid>https://lilfry09.github.io/ai/reasoning-with-sampling-rl-redistribution/</guid><description><![CDATA[<p>这篇论文真正危险的地方，不是它提出了一个新采样器，而是它在追问一个更深的解释问题：</p>
<p><strong>reasoning model 的进步，到底是模型学会了新能力，还是我们终于学会了怎么从旧能力里采样？</strong></p>
<p>如果这个问题问对了，很多关于 <code>RL for reasoning</code> 的叙事都得重写。</p>]]></description></item></channel></rss>