Transformer 整座大楼:零件怎么拼
文 / 老陈
前面三篇,我们备齐了三块积木:词嵌入(把词变数字)、位置编码(记住先后)、注意力(会看重点)。今天这篇,我们把它们统统装进一栋「Transformer 大楼」里,看清这座楼到底怎么盖,又是怎么一步步把一句话变成答案的。
Transformer 大楼剖面图:输入「我 爱 NLP」→ 词嵌入 → 位置编码 → 多头注意力 → 残差连接 → 前馈网络 → 输出概率
这栋楼的图纸,就是 2017 年那篇震撼 AI 界的论文《Attention Is All You Need》。一句话概括它的伟大之处:只要注意力,不要循环。它把以前处理语言要靠「一个词一个词读」的老办法全部抛弃,改成「一眼看到整句,自己抓重点」。从此大模型时代正式开启。
整栋楼有四个关键零件
除了前面讲的三块,这座楼里还藏着两个「保险丝」级别的零件,很多人忽略,但缺了它们整栋楼会塌:
| 零件 | 干什么的 | 通俗比喻 |
|---|---|---|
| 多头注意力 | 多角度同时抓重点 | 一群学生从不同角度读书 |
| 前馈网络 | 对信息做进一步加工 | 把读到的内容再想一遍 |
| 残差连接 | 把原始信息原样传下去,防止丢失 | 递纸条时顺便把原稿也留着 |
| 层归一化 | 把数值拉回正常范围,防止数值爆炸 | 控制音量,别太大也别太小 |
「残差连接」和「层归一化」看起来不起眼,却是大模型能叠几十层不崩的关键。就像盖高楼,每层都要有承重柱(残差)和加固层(归一化),楼才不会歪。
Encoder 和 Decoder:两种「户型」
Transformer 大楼分成左右两栋,或者叫两种「户型」:Encoder(编码器)和 Decoder(解码器)。
Encoder 负责「理解」:你把一句话输进去,它把这句的意思编码成一份「理解笔记」。像看懂一篇课文。
Decoder 负责「生成」:它拿着这份理解笔记,一个词一个词地往外「吐」答案,每吐一个词,就算一次下一步。
现在的对话大模型(GPT 系、DeepSeek、通义千问)绝大多数都是纯 Decoder——它们不需要专门理解,而是直接训练「读完上面接着往下写」的能力,靠海量数据学会了「自问自答」。这就是「自回归」:一个词接一个词地预测下一个词。
用一张图记住整栋楼
你可以把整栋楼想成这样:一篇文章从一楼进入,先「翻译成数字」(嵌入)、标上「座位号」(位置编码),然后穿过一层层「注意力+前馈」车间,每经过一层都加深理解,最后在楼顶「预测」出下一个该出现的词,并把它写下来。写下一个词后,把它拼到文章末尾,再从头跑一遍,得到下一个词……如此循环,就「长」出了一整句话。
下一篇预告
这座大楼建好了,但它只是「一张白纸的骨架」。要让它学会说话,得先让它读海量的书——这就是「预训练」;再针对任务修炼——这就是「微调」。下一篇《大模型是怎么炼成的:预训练+微调》讲清楚它的一生。
老陈打码