注意力机制2026-07-18

Transformer 一眼看懂:Attention 到底在注意什么

Transformer 是当今几乎所有大模型的地基,而它的核心机制叫"注意力(Attention)"。一句话理解:模型读一句话时,不是从左到右死记,而是让每个词都去"看一眼"其他所有词,判断谁和谁关系大。

自注意力算每对词的相关度按相关度加权汇总得到"懂了上下文"的新表示输入句子
每个词都环顾全场再表态

为什么需要它

老模型(RNN)像读书从左到右,读到句尾早把句首忘了,长距离依赖抓不住。"注意力"让首尾词直接对话,"it"到底指猫还是狗,模型靠相关度当场判断,不再受距离限制。这也是为什么现在的长文理解能力,比十年前强出一个时代。

三个角色:Q / K / V

每个词会生成三样东西:Query(我想找啥)、Key(我是什么)、Value(我带的信息)。用 Query 去和所有 Key 比对,得到"该关注谁"的权重,再按权重把 Value 加起来,就是这个词"吸收全场信息后"的新表示。一听玄乎,本质是带权求平均——重要的词多分点注意力,不相关的少分点。

多头与堆叠

"多头"= 同时用好几套 Q/K/V 看不同角度(语法、指代、情感),最后拼起来;把这样的层叠很多层,模型就能从"词"一路抽象到"句法—语义—意图"。你现在聊的 AI,底层就是这东西叠了几十上百层。多头让模型同时关注"谁修饰谁"和"这句话啥情绪",信息利用更立体。

这跟我有啥关系

不用懂矩阵乘法也能用 AI。但知道"注意力=让相关的词互相加权"这一点,你就看懂了为什么大模型能理解长文、不乱接话,也明白为什么"提示词里把关键信息放前面"往往比埋在中间更有效——它影响模型把注意力放在哪。

一句话说清注意力

注意力机制的核心就三个词:查询(Query)、键(Key)、值(Value)。模型读一句话时,对每个词都算一遍"我和谁最相关",按相关度给所有词加权求和,得到这个词"该关注什么"的表示。它让"苹果"在"吃苹果"和"苹果手机"里,自动把注意力放到不同地方。

相比老一代 RNN 必须挨个词顺序处理、长距离信息容易丢,注意力是"全连看一遍",天生并行、长程依赖抓得牢。这也是 Transformer 能堆到千亿参数、吃掉全网数据还不崩的根本原因——没有它,今天的大模型根本不存在。

对普通用户有啥用

最直观的是"上下文窗口"。窗口越大,模型一次能记住你前面说的越多,长文档、长对话才不翻车。你跟 AI 聊到第十轮它突然"失忆",多半是超出了它的窗口。选模型时窗口大小,直接决定它能陪你聊多深。

另一个是"它为什么有时候答非所问"。注意力是软性的、概率的,提示词里关键信息放太靠后、或被长铺垫稀释,模型就可能没"注意"到。所以把重要约束写前面、用分隔符框起来,不是强迫症,是顺着注意力机制办事。

老陈点评:不用懂矩阵乘法也能用 AI。但知道"注意力=让相关的词互相加权"这一点,你就看懂了为什么大模型能理解长文、不乱接话。
老陈打码老陈打码