🧬注意力的进化 注意力的进化 · 第2期

AI 为何开始「选择性失明」——稀疏注意力的诞生

· 阅读约 7 分钟

「注意力的进化」系列 · 板块一 · 第2篇

当计算成本以平方级爆炸,减法成了唯一的出路。

开篇:一个反直觉的解法

上一篇我们讲了一个令人头疼的事实:

注意力机制的计算复杂度是 O(N²)。 句子越长,算得越慢,贵得越离谱。

面对这个问题,你会怎么办?

大多数人的直觉是:优化算法、提升硬件、压缩模型……总之,想办法算得更快

但2019年前后,一群研究者提出了一个完全相反的思路:

不让每个词都看所有词。

这个”减法”策略,后来被称为稀疏注意力(Sparse Attention)

它不仅没有让 AI 变笨,反而开启了一个全新的方向。今天,我们就来聊聊这个”选择性失明”的故事。一、问题的本质:全连接是一种浪费

让我们回到那个图书馆的比喻。

在标准注意力机制里,每个词(每本书)都要和句子里的所有其他词(所有其他书)计算相关性。这就像:

你走进图书馆找”专注力”相关的书,却要把每一本书都拿起来翻一遍,哪怕书名 clearly 写着”园艺入门”。

这显然很蠢。人类不会这么做——我们会先看目录、先看分类、先扫一眼书名,快速排除明显不相关的。

但原始 Transformer 不会。它是个”老实人”,每个词都认认真真地和其他所有词做一遍点积运算。

问题是:很多计算根本没意义。

在一段文本里,真正重要的关联往往只发生在:

相邻的词(局部依赖)

语义相关的词(远距离但同主题)

特殊标记(如标点、关键词)

大部分词对之间,相关性接近于零。但标准注意力机制还是把它们都算了一遍。

这就是浪费的根源。二、稀疏注意力的核心思想:先筛选,再计算

稀疏注意力的思路很简单:

在计算注意力之前,先做一个”预筛选”,只让重要的词参与计算。

用图书馆的例子:

第一步:扫一眼所有书名,只把和”专注力”沾边的书挑出来(可能只有 10%)

第二步:只在这 10% 的书里做精细的注意力计算

结果:计算量从 N² 降到 N×k(k 是筛选后的数量,通常 k << N)

这就是稀疏化——把全连接变成稀疏连接。

稀疏注意力:从全连接到稀疏连接

三、三种经典的稀疏注意力策略

研究者们想出了各种巧妙的筛选方法。以下是三种最有代表性的:

策略一:局部窗口(Local/Sliding Window)

核心假设:重要的词通常在附近

就像你读一句话时,最关注的往往是前后几个字,而不是开头。

做法: 每个词只和左右各 k 个邻居计算注意力(比如 k=5),而不是和所有词。

效果:

计算复杂度从 O(N²) 降到 O(N×k) = O(N),线性增长!

对大多数 NLP 任务效果几乎不打折,因为语言确实有强烈的局部依赖性

局限: 远距离依赖会丢失。比如”虽然……但是……”这种跨句子的关联可能捕捉不到。策略二:全局锚点(Global Attention)

核心假设:有些特殊位置需要被所有人看到

做法: 选定几个”全局锚点”(如 [CLS] 标记、句首、句尾),让它们和句子里的所有词都有连接;普通词之间只用局部窗口。

效果:

保留了关键信息的全局传播通道

计算量仍然接近线性

特别适合分类任务(如情感分析、文本分类)策略三:随机采样 + 聚类(Random + Clustering)

核心假设:相关性有结构性,可以学习或聚类

做法:

BigBird 模型:每个词连接局部邻居 + 少量随机采样点 + 几个全局锚点

Reformer 模型:用局部敏感哈希(LSH)把相似的词聚到同一桶,只在桶内计算注意力

效果:

理论上可以处理超长序列(如整本书、整个代码库)

计算复杂度接近 O(N log N) 甚至 O(N)

三种稀疏注意力策略对比

四、一个关键洞察:稀疏化反而让模型更聪明?

这里有一个反直觉的发现:

适当的稀疏化,不仅没让模型变差,有时候反而让它变得更好。

为什么?

原因一:减少了噪声干扰全连接时,模型会被大量弱相关的词分散注意力。稀疏化相当于强制”专注”,屏蔽了干扰。

原因二:引入了结构先验局部窗口、全局锚点这些设计,实际上把人类对语言结构的认知(局部依赖、关键标记)编码进了模型。

原因三:鼓励学习真正的长距离依赖当模型不能”偷懒”地和所有词连接时,它被迫学习如何真正识别和利用远距离的语义关联。五、从稀疏注意力到线性注意力:极限在哪里?

稀疏注意力把复杂度从 O(N²) 降到了 O(N) 或 O(N log N)。但研究者们没有停在这里。

2020年后,一个更激进的方向出现了:线性注意力(Linear Attention)

它的思路是:

不再显式计算注意力权重,而是用数学技巧直接逼近结果。

具体来说,标准注意力的公式是:

这个公式里,Q·K^T 是 N×N 的矩阵,这就是 O(N²) 的来源。

线性注意力的 trick 是:改变运算顺序,把复杂度降到 O(N)。

代表工作包括:

Performer:用随机特征映射近似 softmax

Linear Transformer:用核函数技巧重写注意力

RWKV:完全抛弃注意力,用循环结构实现类似效果

这些方法的共同点是:彻底摆脱 O(N²) 的诅咒,让模型可以处理任意长度的序列。

代价是:数学更复杂,实现更 tricky,有时候效果会略逊于标准注意力。

从稀疏注意力到线性注意力

六、2024年的新玩家:Mamba 和状态空间模型

就在稀疏注意力和线性注意力打得火热的时候,2023-2024 年,一个”局外人”突然杀入了战场。

它叫 Mamba,基于一种叫做**状态空间模型(State Space Model, SSM)**的架构。

Mamba 的野心更大:

彻底抛弃注意力机制,用一套全新的数学框架实现序列建模。

它的核心优势:

O(N) 复杂度,天然线性

选择性记忆:像注意力一样,可以动态决定记住什么、忘记什么

硬件友好:对现代 GPU 的利用率极高

Mamba 的出现,让人们开始思考一个根本问题:

注意力机制,真的是必需品吗?

Mamba 与状态空间模型

这个问题目前还没有答案。但可以确定的是:从稀疏注意力到线性注意力,再到 SSM,AI 的”注意力进化”正在加速。

七、人类版注脚:你的注意力,也可以稀疏化

让我们再次把镜头转向人类。

你有没有发现,稀疏注意力的策略,其实和我们日常处理信息的方式很像?

局部窗口:你读文章时,通常只精读当前段落,不会同时盯着全文

全局锚点:你会特别关注标题、小标题、加粗文字这些”关键标记”

选择性记忆:你不会记住所有细节,只保留最重要的信息

问题是:我们的注意力系统,真的在高效地稀疏化吗?

还是恰恰相反——在信息过载的时代,我们被迫保持一种病态的全连接

微信、邮件、通知,同时轰炸

每个信息都想获得你的”注意力权重”

结果:计算资源(认知负荷)以平方级爆炸,系统随时可能崩溃

AI 研究者们花了八年时间,终于找到了稀疏化的方法。

**我们,还需要多久?**下一篇预告

《人类的注意力危机——为什么我们比 AI 更需要”稀疏化”》

当机器学会了”选择性失明”,人类却还在强迫自己”全连接”。

这不是技术进步的问题,这是生存策略的问题。

参考资料:

Child et al., “Generating Long Sequences with Sparse Transformers,” 2019

Zaheer et al., “Big Bird: Transformers for Longer Sequences,” 2020

Kitaev et al., “Reformer: The Efficient Transformer,” 2020

Katharopoulos et al., “Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention,” 2020

Gu & Dao, “Mamba: Linear-Time Sequence Modeling with Selective State Spaces,” 2023

字数统计:约 2600 字** **

🧭 认知导航

你刚刚读的是注意力的进化第2篇——稀疏注意力的诞生。AI 从'全量注意'进化到'选择性注意',跟人类注意力的运作方式惊人地相似。下一篇:AI 的记忆进化 vs 人类的遗忘危机。