<rss xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title>Looped Transformer - 标签 - lilfry's library</title><link>https://lilfry09.github.io/tags/looped-transformer/</link><description>Looped Transformer - 标签 - lilfry's library</description><generator>Hugo -- gohugo.io</generator><language>zh-CN</language><managingEditor>lilfry@sjtu.edu.cn (lilfry)</managingEditor><webMaster>lilfry@sjtu.edu.cn (lilfry)</webMaster><copyright>All rights reserved.</copyright><lastBuildDate>Tue, 18 Aug 2026 13:38:45 +0800</lastBuildDate><atom:link href="https://lilfry09.github.io/tags/looped-transformer/" rel="self" type="application/rss+xml"/><item><title>Looped Transformer 不只是重复计算：从 LoopFormer 到 Elastic-Depth Post-Training</title><link>https://lilfry09.github.io/ai/looped-transformer-elastic-depth-post-training/</link><pubDate>Tue, 18 Aug 2026 13:38:45 +0800</pubDate><author>fry</author><guid>https://lilfry09.github.io/ai/looped-transformer-elastic-depth-post-training/</guid><description><![CDATA[<p>Looped Transformer 最容易被误解成一句话：把同一组 Transformer block 多跑几遍，用时间换参数。</p>
<p>这句话没有错，但它跳过了真正困难的部分。共享参数只回答了“循环什么”，没有回答另外三个问题：模型如何知道自己处在第几次循环？短预算为什么仍然能给出有用结果？增加循环时，hidden state 为什么不会漂移、坍缩或者干脆变差？</p>
<p>把近期工作放到同一张图里看，我更关心的研究命题不是再从头训练一个固定循环次数的模型，而是：</p>
<blockquote>
<p><strong>Elastic-Depth Post-Training：能否把已有的固定深度或固定循环模型，改造成计算预算可调、迭代过程稳定、并能按样本自动停止的模型？</strong></p></blockquote>
<p>LoopFormer 给出了全局预算和 trajectory consistency；LoopUS 展示了如何改造 pretrained LLM，并用 selective update 与 confidence exit 控制迭代；Relaxed Recursive Transformers 则提供了“共享主参数、保留深度角色”的折中。三条路线尚未被组合验证，但它们拼出了一个比“多循环几次”更完整的研究问题。</p>
<p>本文信息截止到 <strong>2026-08-18</strong>。文中的数值若无特别说明，均为相应论文在其模型、数据和硬件设置下的报告，不能直接外推到其他模型规模或真实部署吞吐。</p>]]></description></item></channel></rss>