「注意力的进化」系列 · 板块一 · 第3篇
当稀疏还不够,选择才是关键。
开篇:从“看得少”到“看得对”
前两篇我们讲了AI注意力的两次进化。
第一篇,我们认识了注意力机制本身:每个词都“问”其他所有词,跨越任意距离建立关联——但代价是O(N²)的计算复杂度。
第二篇,我们看到了“减法”的力量:稀疏注意力不再让每个词看所有词,而是通过局部窗口、全局锚点、随机采样等策略大幅削减计算量。
两次进化的核心都是在做一件事:减少计算量。
但这里藏着一个更深层的问题。
稀疏注意力是“预先设定”的——在计算之前,我们就决定好哪些词看、哪些词不看。局部窗口策略规定每个词只看左右5个邻居,不管这5个邻居重不重要;也不管第6个词是不是藏着解开整句话含义的钥匙。
这显然不够聪明。真正的注意力,应该是动态的、按内容决定的——根据当前文本的实际含义来选择关注什么,而不是根据固定的位置规则。
这就是2026年3月一篇新论文提出的核心问题:
为什么每一个词元都要关注所有其他词元?
这篇论文的名字叫做《Why Attend to Everything? Focus is the Key》,它提出的方法叫Focus——AI注意力机制的第三次进化。说在前面:怎么理解“Focus”
写这篇文章的时候,带“Focus”这个关键词的研究方向不止一个——有聚焦注意力(Focal Attention),有上下文聚焦(ContextFocus),还有面向扩散模型的Focus-dLLM。
这里有一个微妙但重要的区分:
这篇《Why Attend to Everything? Focus is the Key》所说的Focus,特指一种通过可学习的“质心”(centroid)来给词元自动分组、只让同组成员互相看的方法。
其他工具有各自要解决的问题,而Focus有它自己独特的实现方式。接下来的内容,我会用容易理解的语言,讲清楚Focus是怎么工作的。一、问题的本质:静态稀疏 vs 动态选择
让我们回到图书馆的比喻。
稀疏注意力的做法,就像:
你走进图书馆,规定自己只看书架左右各5本,不管这10本书是不是关于你想要的题目的。
或者:
你预先选定几个“全局锚点”书架,不管这些书架上的书是否与你今天的查询有关。
这显然很机械。人类的注意力不是这样的——
你会扫一眼所有书名,然后动态决定哪些值得深入阅读。
关键区别:
稀疏注意力:关注哪些位置(position-based)——只看你规定的那些位置上的东西
选择性注意力:关注什么内容(content-based)——由模型自己根据内容来决定该看什么
一直以来,很多高效注意力方法走的是前一条路线——预先设计一些稀疏花样,规定好哪些位置的词元可以互相看到。这确实省下了大量计算,但也留下一个根本缺陷:模式是死的,而文本是活的。一个被固定窗口挡在门外的词,哪怕它是全句最关键的那个词,也永远不会被看到。二、Focus收到的启发:既然模式是死的,不如让模型自己来学
这正是Focus与众不同的地方。
它不再由人工去规定“哪些词元该互相看”。研究人员引入了一组叫做**质心(centroid)**的东西——你可以把它们想象成几个“临时主题代表”,数量远少于原始词元。每一层都会用内积给这批质心和每个词元算出一个相似度分数,再用一种叫Sinkhorn归一化的方法把词元均衡地分到各组里去,这样就不会出现所有词元都挤进同一个组的情况。
随后,长距离注意力就被限制在各组内部:同组词元之间做完整的注意力计算,不同组之间则切断连接。与此同时,局部注意力仍然对每个词元的近邻开放——这样既不牺牲紧邻的上下文精细度,又能对远距离信息做有选择的学习。
这个分组不是人工事先划分好的,而是训练出来的。质心本身也是可学习的参数,随着训练数据和模型一起成长,最终学会自动发掘文本的语言规律。
整个过程可以拆成三步:
快速分配:每个词元与各个质心计算相似度,按分数分配到最适合它的组。
结构感知:同一个组内的词元互相做长距离注意力,局部窗口仍然保留。
优势叠加:分组之后,不同组之间的注意力计算可以独立进行——这些独立的计算块正好能被高效实现(如FlashAttention)并行加速。
用公式简单表达:
选择分数 = σ(内容相关性评估)
注意力输出 = Σ(选择分数 × 注意力权重 × Value)
这里的σ是一个选择函数,在Focus中具体体现为软路由——让每个词元可以跨多个组参与计算;在推理阶段再转化为硬稀疏模式,只保留最高分的几个组,实现实际加速。三、为什么Focus可以做到又快又好
Focus的论文给出了一组很扎实的实验结果,我们逐一看一下。效果一:性能不减反升
在1.24亿参数规模上做改进训练,Focus的困惑度是30.3,而原来全注意力的困惑度是31.4——Focus反而更好了一些。
在70亿参数规模上从头训练20亿词元,Focus的困惑度是13.82,全注意力是13.89——依然略微领先。
这让很多人觉得有点反直觉——少看一些东西,怎么反而更好了?
原因其实不难理解。全注意力时,模型被迫在大量弱相关词之间分配注意力资源,这些弱相关的词实际上构成了噪声。Focus强制模型把注意力集中在真正相关的词上,屏蔽了干扰,反而提高了信息处理的精度。效果二:实实在在的加速
到了推理阶段,用硬稀疏模版去跑:做两倍加速时,困惑度反而更好了(Focus 41.3 vs 全注意力42.8)。
当序列长度拉到100万个词元(tokens)时,通过把注意力计算分解成两个标准的FlashAttention调用,Focus实现了8.6倍的实际推理加速。
这意味着什么?在100万词元的规模下——大概能装下整本《红楼梦》的篇幅——Focus只需不到原来1/8的时间就能完成注意力计算。这对把长上下文模型从论文里带到产品中,有很实际的推动意义。效果三:只训练极少参数
更让人没想到的是:改进一个已经训练好的模型时,Focus不需要动原模型权重。它只需要训练质心和路由相关的参数,最少可以少到只有14.8万个可训练参数。
这个数字小到什么概念?一个标准的70亿参数模型拥有70亿个可训练权重,Focus只需要在这上面叠加不到15万个额外参数——大约是原模型参数量的五万分之一。
在同等改进训练的条件下,只训练质心就能改善领域困惑度,同时在各种下游基准测试上不掉分——从1.24亿到700亿参数、跨越五种不同注意力架构,全部成立。效果四:不丢“对齐”
像LoRA这类低秩微调方法,虽然高效,但常常会让模型在TruthfulQA这类对齐评测上掉分。而Focus的质心路由方式,在改进训练后依然保持了指令调优模型的对齐表现。
这意味着:**Focus可以在提升效率的同时,不牺牲安全性和可靠性。**效果五:自动发现语言规律
因为采用了Sinkhorn归一化作为硬约束,各组词元数量保持均衡。在这个约束下,模型自己学会的分组展现出可解释的语言学类别——不用任何监督信号,就自动把不同语法功能、不同语义角色的词分到了不同组里。
这说明Focus不是在做随机的“乱分配”,而是真正学会了文本的内在结构。四、从Flash Attention到Focus:硬件+选择
我们在第二篇提到过Flash Attention——它通过分块计算和在线softmax技巧,把注意力计算的内存复杂度从O(N²)降到O(N),实现了2—4倍的加速。
但Flash Attention解决的是“怎么算得更快”,没有解决“该算什么”的问题。
Focus解决的是“该算什么”的问题。而且巧妙的是:Focus生成的硬稀疏模版天然适合被Flash Attention加速。一个按组划分的稀疏模式可以拆成两个标准的Flash Attention调用,这解释了为什么Focus能在百万级词元规模上实现8.6倍墙钟加速——用标准注意力内核,不需要定制GPU内核(custom kernel)。
它们是互补的:Flash Attention负责让计算本身更高效;Focus负责决定哪些计算值得做。五、静态稀疏、线性注意力与Focus:三者的分野
回头看这三篇走过的路,“注意力进化”的线索已经很清晰了:
维度
稀疏注意力(Sparse)
线性注意力(Linear)
选择性注意力(Focus)怎么做
固定位置模式
数学近似重写
质心动态路由分组复杂度
O(N) 或 O(N log N)
O(N)
O(N)(分组内计算可并行)选择方式
按位置(死的)
不选,全部近似
按内容(活的)实现方式
稀疏矩阵
核函数等数学技巧
软路由/硬稀疏 + FlashAttention是否轻量
中等
中等
极轻量(不改原权重)
稀疏注意力是“硬规定”——哪些位置可以互看是提前写死的。线性注意力是“全近似”——所有词元都参与计算,但数学上走了一条捷径来逼近标准注意力的效果。Focus走的是第三条路:让模型自己去学谁是值得关注的,然后把算力集中到真正重要的地方。
它们在各自的适用场景中各有优势,但Focus代表了一个重要的方向转变:**不再追求“更快地算所有东西”,而是追求“只算最重要的东西”。**六、人类版注脚:你的选择,真的在选择吗?
让我们再次把镜头转向人类。
回顾AI的注意力进化史:
全连接:看所有,O(N²)爆炸
稀疏:看一部分(按位置),省力但呆板
线性:看得快(数学近似),快速但可能粗糙
Focus:看得对(按内容),高效且聪明
人类的注意力,在信息过载的时代走到了哪一步?
残酷的现实:大多数人处于“伪选择”状态——以为自己选择了,其实是被算法选择了。
推荐算法决定你看什么视频,热搜决定你关注什么话题,通知红点决定你什么时候看手机。
真正的Focus,是反算法的:
主动设定信息摄入的边界
根据目标而非刺激来决定注意力分配
像Focus机制一样:先做“快速评估”,再决定“深入投入”
Focus教给我们的,不仅是一个技术突破,更是一个哲学转向:
真正的注意力,不是“什么都看”,而是“知道什么值得看”。
下一篇预告
《当注意力失败时——AI也会“走神”和“看错”》
注意力机制并非总是可靠。ChatGPT的无意义输出、Gemini的图像生成事故,背后都指向注意力权重的异常分布。
当AI的注意力出错时,它犯了和人类惊人相似的错误——这又能给我们什么启发?
参考资料:
Yao et al., “Why Attend to Everything? Focus is the Key,” arXiv:2604.03260, 2026年3月
“ContextFocus: Dynamic Control of Model Focus,” 2026年
北京航空航天大学等,“Focus-dLLM技术”,2026年2月
字数统计:约 3700 字