<rss xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title>Attention - 标签 - lilfry's library</title><link>https://lilfry09.github.io/tags/attention/</link><description>Attention - 标签 - lilfry's library</description><generator>Hugo -- gohugo.io</generator><language>zh-CN</language><managingEditor>lilfry@sjtu.edu.cn (lilfry)</managingEditor><webMaster>lilfry@sjtu.edu.cn (lilfry)</webMaster><copyright>All rights reserved.</copyright><lastBuildDate>Tue, 28 Jul 2026 00:00:00 +0800</lastBuildDate><atom:link href="https://lilfry09.github.io/tags/attention/" rel="self" type="application/rss+xml"/><item><title>线性注意力从头到尾讲清楚：从注意力矩阵到可递推状态</title><link>https://lilfry09.github.io/ai/linear-attention-from-scratch/</link><pubDate>Tue, 28 Jul 2026 00:00:00 +0800</pubDate><author>fry</author><guid>https://lilfry09.github.io/ai/linear-attention-from-scratch/</guid><description><![CDATA[<blockquote>
<p><strong>Linear Attention 的目标是避免显式构造 $n\times n$ 的注意力矩阵，而是把“每个 query 与所有 key 的交互”改写成“query 读取一个累积状态”。</strong></p></blockquote>
<p>这句话比“Linear Attention 把复杂度从平方降到线性”更接近本质。复杂度下降只是结果，真正发生的结构变化是：标准 Attention 显式维护 token 与 token 之间的关系，而 Linear Attention 先把所有 key–value 信息写进一个状态，再让 query 从状态中读出结果。</p>
<p>这篇文章从标准 Attention 出发，把这次改写完整推一遍。读完后，你应该能回答四个问题：为什么不能直接先算 $K^\top V$；归一化需要保存什么额外状态；因果 Linear Attention 为什么像 RNN；以及它用固定状态换走 $n\times n$ 矩阵时究竟牺牲了什么。</p>]]></description></item></channel></rss>