Transformer 一眼看懂:Attention 到底在注意什么
Transformer 是当今几乎所有大模型的地基,而它的核心机制叫"注意力(Attention)"。一句话理解:模型读一句话时,不是从左到右死记,而是让每个词都去"看一眼"其他所有词,判断谁和谁关系大。
为什么需要它
老模型(RNN)像读书从左到右,读到句尾早把句首忘了,长距离依赖抓不住。"注意力"让首尾词直接对话,"it"到底指猫还是狗,模型靠相关度当场判断,不再受距离限制。这也是为什么现在的长文理解能力,比十年前强出一个时代。
三个角色:Q / K / V
每个词会生成三样东西:Query(我想找啥)、Key(我是什么)、Value(我带的信息)。用 Query 去和所有 Key 比对,得到"该关注谁"的权重,再按权重把 Value 加起来,就是这个词"吸收全场信息后"的新表示。一听玄乎,本质是带权求平均——重要的词多分点注意力,不相关的少分点。
多头与堆叠
"多头"= 同时用好几套 Q/K/V 看不同角度(语法、指代、情感),最后拼起来;把这样的层叠很多层,模型就能从"词"一路抽象到"句法—语义—意图"。你现在聊的 AI,底层就是这东西叠了几十上百层。多头让模型同时关注"谁修饰谁"和"这句话啥情绪",信息利用更立体。
这跟我有啥关系
不用懂矩阵乘法也能用 AI。但知道"注意力=让相关的词互相加权"这一点,你就看懂了为什么大模型能理解长文、不乱接话,也明白为什么"提示词里把关键信息放前面"往往比埋在中间更有效——它影响模型把注意力放在哪。
一句话说清注意力
注意力机制的核心就三个词:查询(Query)、键(Key)、值(Value)。模型读一句话时,对每个词都算一遍"我和谁最相关",按相关度给所有词加权求和,得到这个词"该关注什么"的表示。它让"苹果"在"吃苹果"和"苹果手机"里,自动把注意力放到不同地方。
相比老一代 RNN 必须挨个词顺序处理、长距离信息容易丢,注意力是"全连看一遍",天生并行、长程依赖抓得牢。这也是 Transformer 能堆到千亿参数、吃掉全网数据还不崩的根本原因——没有它,今天的大模型根本不存在。
对普通用户有啥用
最直观的是"上下文窗口"。窗口越大,模型一次能记住你前面说的越多,长文档、长对话才不翻车。你跟 AI 聊到第十轮它突然"失忆",多半是超出了它的窗口。选模型时窗口大小,直接决定它能陪你聊多深。
另一个是"它为什么有时候答非所问"。注意力是软性的、概率的,提示词里关键信息放太靠后、或被长铺垫稀释,模型就可能没"注意"到。所以把重要约束写前面、用分隔符框起来,不是强迫症,是顺着注意力机制办事。
