「注意力的进化」系列 · 板块一 · 第2篇
当计算成本以平方级爆炸,减法成了唯一的出路。
开篇:一个反直觉的解法
上一篇我们讲了一个令人头疼的事实:
注意力机制的计算复杂度是 O(N²)。 句子越长,算得越慢,贵得越离谱。
面对这个问题,你会怎么办?
大多数人的直觉是:优化算法、提升硬件、压缩模型……总之,想办法算得更快。
但2019年前后,一群研究者提出了一个完全相反的思路:
不让每个词都看所有词。
这个”减法”策略,后来被称为稀疏注意力(Sparse Attention)。
它不仅没有让 AI 变笨,反而开启了一个全新的方向。今天,我们就来聊聊这个”选择性失明”的故事。一、问题的本质:全连接是一种浪费
让我们回到那个图书馆的比喻。
在标准注意力机制里,每个词(每本书)都要和句子里的所有其他词(所有其他书)计算相关性。这就像:
你走进图书馆找”专注力”相关的书,却要把每一本书都拿起来翻一遍,哪怕书名 clearly 写着”园艺入门”。
这显然很蠢。人类不会这么做——我们会先看目录、先看分类、先扫一眼书名,快速排除明显不相关的。
但原始 Transformer 不会。它是个”老实人”,每个词都认认真真地和其他所有词做一遍点积运算。
问题是:很多计算根本没意义。
在一段文本里,真正重要的关联往往只发生在:
相邻的词(局部依赖)
语义相关的词(远距离但同主题)
特殊标记(如标点、关键词)
大部分词对之间,相关性接近于零。但标准注意力机制还是把它们都算了一遍。
这就是浪费的根源。二、稀疏注意力的核心思想:先筛选,再计算
稀疏注意力的思路很简单:
在计算注意力之前,先做一个”预筛选”,只让重要的词参与计算。
用图书馆的例子:
第一步:扫一眼所有书名,只把和”专注力”沾边的书挑出来(可能只有 10%)
第二步:只在这 10% 的书里做精细的注意力计算
结果:计算量从 N² 降到 N×k(k 是筛选后的数量,通常 k << N)
这就是稀疏化——把全连接变成稀疏连接。

三、三种经典的稀疏注意力策略
研究者们想出了各种巧妙的筛选方法。以下是三种最有代表性的:
策略一:局部窗口(Local/Sliding Window)
核心假设:重要的词通常在附近
就像你读一句话时,最关注的往往是前后几个字,而不是开头。
做法: 每个词只和左右各 k 个邻居计算注意力(比如 k=5),而不是和所有词。
效果:
计算复杂度从 O(N²) 降到 O(N×k) = O(N),线性增长!
对大多数 NLP 任务效果几乎不打折,因为语言确实有强烈的局部依赖性
局限: 远距离依赖会丢失。比如”虽然……但是……”这种跨句子的关联可能捕捉不到。策略二:全局锚点(Global Attention)
核心假设:有些特殊位置需要被所有人看到
做法: 选定几个”全局锚点”(如 [CLS] 标记、句首、句尾),让它们和句子里的所有词都有连接;普通词之间只用局部窗口。
效果:
保留了关键信息的全局传播通道
计算量仍然接近线性
特别适合分类任务(如情感分析、文本分类)策略三:随机采样 + 聚类(Random + Clustering)
核心假设:相关性有结构性,可以学习或聚类
做法:
BigBird 模型:每个词连接局部邻居 + 少量随机采样点 + 几个全局锚点
Reformer 模型:用局部敏感哈希(LSH)把相似的词聚到同一桶,只在桶内计算注意力
效果:
理论上可以处理超长序列(如整本书、整个代码库)
计算复杂度接近 O(N log N) 甚至 O(N)

四、一个关键洞察:稀疏化反而让模型更聪明?
这里有一个反直觉的发现:
适当的稀疏化,不仅没让模型变差,有时候反而让它变得更好。
为什么?
原因一:减少了噪声干扰全连接时,模型会被大量弱相关的词分散注意力。稀疏化相当于强制”专注”,屏蔽了干扰。
原因二:引入了结构先验局部窗口、全局锚点这些设计,实际上把人类对语言结构的认知(局部依赖、关键标记)编码进了模型。
原因三:鼓励学习真正的长距离依赖当模型不能”偷懒”地和所有词连接时,它被迫学习如何真正识别和利用远距离的语义关联。五、从稀疏注意力到线性注意力:极限在哪里?
稀疏注意力把复杂度从 O(N²) 降到了 O(N) 或 O(N log N)。但研究者们没有停在这里。
2020年后,一个更激进的方向出现了:线性注意力(Linear Attention)。
它的思路是:
不再显式计算注意力权重,而是用数学技巧直接逼近结果。
具体来说,标准注意力的公式是:
这个公式里,Q·K^T 是 N×N 的矩阵,这就是 O(N²) 的来源。
线性注意力的 trick 是:改变运算顺序,把复杂度降到 O(N)。
代表工作包括:
Performer:用随机特征映射近似 softmax
Linear Transformer:用核函数技巧重写注意力
RWKV:完全抛弃注意力,用循环结构实现类似效果
这些方法的共同点是:彻底摆脱 O(N²) 的诅咒,让模型可以处理任意长度的序列。
代价是:数学更复杂,实现更 tricky,有时候效果会略逊于标准注意力。

六、2024年的新玩家:Mamba 和状态空间模型
就在稀疏注意力和线性注意力打得火热的时候,2023-2024 年,一个”局外人”突然杀入了战场。
它叫 Mamba,基于一种叫做**状态空间模型(State Space Model, SSM)**的架构。
Mamba 的野心更大:
彻底抛弃注意力机制,用一套全新的数学框架实现序列建模。
它的核心优势:
O(N) 复杂度,天然线性
选择性记忆:像注意力一样,可以动态决定记住什么、忘记什么
硬件友好:对现代 GPU 的利用率极高
Mamba 的出现,让人们开始思考一个根本问题:
注意力机制,真的是必需品吗?

这个问题目前还没有答案。但可以确定的是:从稀疏注意力到线性注意力,再到 SSM,AI 的”注意力进化”正在加速。
七、人类版注脚:你的注意力,也可以稀疏化
让我们再次把镜头转向人类。
你有没有发现,稀疏注意力的策略,其实和我们日常处理信息的方式很像?
局部窗口:你读文章时,通常只精读当前段落,不会同时盯着全文
全局锚点:你会特别关注标题、小标题、加粗文字这些”关键标记”
选择性记忆:你不会记住所有细节,只保留最重要的信息
问题是:我们的注意力系统,真的在高效地稀疏化吗?
还是恰恰相反——在信息过载的时代,我们被迫保持一种病态的全连接:
微信、邮件、通知,同时轰炸
每个信息都想获得你的”注意力权重”
结果:计算资源(认知负荷)以平方级爆炸,系统随时可能崩溃
AI 研究者们花了八年时间,终于找到了稀疏化的方法。
**我们,还需要多久?**下一篇预告
《人类的注意力危机——为什么我们比 AI 更需要”稀疏化”》
当机器学会了”选择性失明”,人类却还在强迫自己”全连接”。
这不是技术进步的问题,这是生存策略的问题。
参考资料:
Child et al., “Generating Long Sequences with Sparse Transformers,” 2019
Zaheer et al., “Big Bird: Transformers for Longer Sequences,” 2020
Kitaev et al., “Reformer: The Efficient Transformer,” 2020
Katharopoulos et al., “Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention,” 2020
Gu & Dao, “Mamba: Linear-Time Sequence Modeling with Selective State Spaces,” 2023
字数统计:约 2600 字** **
🧭 认知导航
你刚刚读的是注意力的进化第2篇——稀疏注意力的诞生。AI 从'全量注意'进化到'选择性注意',跟人类注意力的运作方式惊人地相似。下一篇:AI 的记忆进化 vs 人类的遗忘危机。