从零读懂注意力机制:AI 的「看重点」魔法
你有没有想过:你现在用到的 ChatGPT、DeepSeek、通义千问、豆包,它们背后都有一个共同的「大脑」——名字叫做 Transformer。而 Transformer 的心脏,就是今天要讲的 注意力机制(Attention)。它解决一
2026-08-26 编程开发词嵌入:把文词嵌入:把文字变成数字身份证
上一篇我们讲了注意力机制——让 AI 知道该「看重点」。但这里藏着一个前提问题:AI 是台机器,它只认数字,不认文字。你打进去的「猫」这个字,在机器眼里只是一堆像素点,它根本不知道这代表一只毛茸茸的小动物。那 AI 是怎么「懂」中文的?靠的
2026-08-26 编程开发位置编码:让位置编码:让 AI 记住词语先后
先玩个小游戏。看这句话:「猫咬狗」。再看这句:「狗咬猫」。两个字完全一样,只是顺序颠倒,意思就完全反了——一个是猫赢,一个是狗赢。可问题是:Transformer 有个「大毛病」,它天生看不出顺序。
2026-08-26 编程开发TransfTransformer 整座大楼:零件怎么拼
前面三篇,我们备齐了三块积木:词嵌入(把词变数字)、位置编码(记住先后)、注意力(会看重点)。今天这篇,我们把它们统统装进一栋「Transformer 大楼」里,看清这座楼到底怎么盖,又是怎么一步步把一句话变成答案的。
2026-08-26 编程开发大模型是怎么大模型是怎么炼成的:预训练+微调
前面我们拼好了 Transformer 这栋楼。但它现在只是一张「什么都不会」的白纸——就像刚出生的婴儿,大脑结构再完美,也得先学说话。这篇讲大模型是怎么「长大成人」的,整个过程大致分三个阶段:预训练、指令微调、人类反馈强化学习。
2026-08-26 编程开发认识 Tra认识 Transformers 工具库
从这一篇开始,我们正式进入实战。前面五篇讲的数学和架构——注意力、嵌入、位置编码、Transformer 大楼、预训练微调——听起来很吓人。但好消息是:你根本不用手写那些数学。有一家叫 Hugging Face(大家昵称「抱抱脸」)的公司,
2026-08-26 编程开发用 Tran用 Transformers 跑通第一个大模型
上一篇我们认识了这个工具库。今天真刀真枪——把一个大模型下载到电脑上,让它开口和你说话。不用联网 API,就在你本地跑。只要你的电脑有显卡(哪怕普通的游戏显卡也行),下面这段代码就能让你拥有一个自己的 AI 助手。
2026-08-26 编程开发用 Tran用 Transformers 微调专属小模型
上一篇你跑通了一个大模型,但它只会「通用聊天」——你问什么它答什么,全是网上学来的通用知识。如果你想要一个专门懂你业务的模型呢?比如:专门判断电商评论是好评还是差评、专门回答你家产品的售后问题、专门识别贷款申请是否合规……这时候就要轮到微调
2026-08-26 编程开发TransfTransformers 搭建完整大模型:从数据到部署
这是本系列收官篇。前面的篇章,你学会了:注意力、词嵌入、位置编码、Transformer 架构、预训练微调的原理,也动手跑通了模型、微调了专属模型。最后一步,我们把这一切串成一条完整的流水线——从一份原始数据开始,到训练出一个真正能对外服务
2026-08-26