大模型是怎么炼成的:预训练+微调
文 / 老陈
前面我们拼好了 Transformer 这栋楼。但它现在只是一张「什么都不会」的白纸——就像刚出生的婴儿,大脑结构再完美,也得先学说话。这篇讲大模型是怎么「长大成人」的,整个过程大致分三个阶段:预训练、指令微调、人类反馈强化学习。
大模型的一生:语料库工厂 → 预训练 → 基座模型 → 指令微调 SFT + 强化学习 RLHF → 对话助手
用一句话概括:预训练让它「博览群书」,微调让它「学会听话」,强化学习让它「讨人喜欢」。这三步走完,一个能用的大模型就诞生了。
第一阶段:预训练(Pretraining)
这是最烧钱、最漫长的一步。大模型被喂进海量文本——整个互联网、书籍、论文、百科……动辄几万亿字。它反复做一件最简单的事:看到前面一段文字,试着预测下一个词。
比如喂它「今天天气真」,它要猜下一个词是「好」;错了就调整自己,对了就强化。就这么「猜词-纠错」循环几万亿次,模型就学会了语言规律、知识常识、逻辑推理。这一步跑完,得到的是一个「基座模型」——它博学,但还不会「对话」,你问它问题它只会接着往下写。
这个过程消耗的算力和电力极其惊人。训练一个 GPT-3 级别的大模型,要用成千上万块顶级显卡,电费就得上千万。这也是为什么只有大公司才玩得起第一阶段。
第二阶段:指令微调(SFT,Supervised Fine-tuning)
基座模型只会「续写」,不会「回答」。于是第二步来了:拿一批「提问-回答」的示例喂给它。比如「中国的首都是哪?」→「北京」;「帮我写首诗」→「床前明月光……」。让模型学会「当别人用问题问我时,我要给出回答,而不是接着写。」
这一步叫指令微调(SFT)。比例比预训练小得多(可能就几万到几十万条高质量问答),但效果立竿见影——模型一下子从「续写机器」变成了「听指令的助手」。
第三阶段:人类反馈强化学习(RLHF)
模型会回答了,但回答质量参差不齐——有的正确,有的胡扯。最后一步让它「讨人喜欢」:让一群标注员给模型的多个答案打分,谁的回答更好、更符合人类偏好,就给高分。模型再根据这些分数调整自己,慢慢学会「说人话、说好话、说安全的话」。
这一步叫 RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)。很多大模型的「聪明」和「礼貌」,就是从这儿来的。
| 阶段 | 数据 | 学会了什么 | 成本 |
|---|---|---|---|
| 预训练 | 几万亿字互联网语料 | 语言、知识、推理 | 极高(算力+电费) |
| 指令微调 SFT | 几万~几十万条问答 | 听懂指令、按格式回答 | 中 |
| 强化学习 RLHF | 人工打分标注 | 更符合人类喜好 | 中 |
下一篇预告
讲到这里,Transformer 的原理你已经全部掌握了:从注意力、嵌入、位置编码,到整栋大楼,再到怎么炼成。接下来我们进入实战——认识 Hugging Face 的 transformers 工具库,它的出现,让你不需要懂所有数学,也能亲手玩转大模型。下一篇《认识 Transformers 工具库》就是实战篇的开篇。
老陈打码