Looped Transformer 不只是重复计算:从 LoopFormer 到 Elastic-Depth Post-Training
Looped Transformer 最容易被误解成一句话:把同一组 Transformer block 多跑几遍,用时间换参数。
这句话没有错,但它跳过了真正困难的部分。共享参数只回答了“循环什么”,没有回答另外三个问题:模型如何知道自己处在第几次循环?短预算为什么仍然能给出有用结果?增加循环时,hidden state 为什么不会漂移、坍缩或者干脆变差?
把近期工作放到同一张图里看,我更关心的研究命题不是再从头训练一个固定循环次数的模型,而是:
Elastic-Depth Post-Training:能否把已有的固定深度或固定循环模型,改造成计算预算可调、迭代过程稳定、并能按样本自动停止的模型?
LoopFormer 给出了全局预算和 trajectory consistency;LoopUS 展示了如何改造 pretrained LLM,并用 selective update 与 confidence exit 控制迭代;Relaxed Recursive Transformers 则提供了“共享主参数、保留深度角色”的折中。三条路线尚未被组合验证,但它们拼出了一个比“多循环几次”更完整的研究问题。
本文信息截止到 2026-08-18。文中的数值若无特别说明,均为相应论文在其模型、数据和硬件设置下的报告,不能直接外推到其他模型规模或真实部署吞吐。
