第I部分 · 基础:理解大语言模型之前的人工智能
Transformer 革命:“注意力就是你所需要的一切”
第3章9 分钟阅读更新于:2026年9月
3.1序列式架构撞上的那堵墙
要翻过这堵墙,需要一种能同时做到两件事的架构:一次性处理整个序列(为了快),并把任意一个词与任意另一个词直接联系起来,无论它们相隔多远(为了什么都不忘)。这正是注意力机制所带来的。
3.2注意力的直觉
再打个比方:设想在一场会议上,为了理解某句发言,你会自动根据相关程度,对每位与会者此前说过的话加以权衡。注意力就是这样一套加权系统,只不过它被大规模应用,并且是自动学出来的。
3.3Transformer 架构(2017)
有两个要素值得记住:
- 多头注意力(multi-head attention)。Transformer 不是只用一套加权系统,而是让多套系统并行运转,如同投向句子的多道不同“目光”。一个头可以追踪语法(主谓一致),另一个追踪语义,还有一个追踪指代关系(“它”指向“动物”)。把这些目光组合起来,模型就能捕捉到极为丰富的关系。
- 位置编码(positional encoding)。注意力本身对词序是视而不见的:在它看来,“狗咬人”和“人咬狗”毫无区别。因此,要在每个词的表示中注入它在句中位置的信息,以保留词序。
3.4缩放定律(scaling laws)
研究者理查德·萨顿(Richard Sutton)把其中的哲学教训概括为“苦涩的教训”(bitter lesson):从长远看,能够利用不断增长的算力的通用方法,最终总会胜过专家们费尽心思手工拼凑出来的巧妙方法。这对人类的聪明才智来说令人沮丧,却出奇地有效。
3.5预训练、微调与 RLHF
- 预训练(pre-training)。让模型吞下现有文本中极其庞大的一部分(网页、书籍、代码、文章)。它仅仅通过尝试预测后续内容,就从中学到了语法、事实、推理和文风。这是成本最高的一步:在成千上万个处理器上计算数周,耗资数千万乃至数亿美元。
- 监督微调(supervised fine-tuning,SFT),也称指令微调。向模型展示成千上万个“用户的问题,助手的理想回答”这种形式的示例。它由此学会像助手那样行事:作答、遵循指示、采用恰当的语气。
- RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)。由人来比较模型的多个回答,并指出自己更喜欢哪些。第二个模型,即所谓的“奖励模型”,学习这些偏好,然后用来训练主模型,使其给出被认为更好的回答:更有用、更诚实、毒性更低。正是这一步让助手变得好用且相对安全。
本章要点(第3章)
- Transformer(2017 年,论文《Attention Is All You Need》)用注意力机制取代了顺序阅读,该机制把所有词直接相互联系起来,并可在 GPU 上并行。
- 注意力为每个词学习还有哪些词重要、各有多重要。多头注意力让这些“目光”成倍增加;位置编码保留了词序。
- 仅解码器这条支系(GPT 系列)在文本生成中胜出。
- 缩放定律表明,性能随规模、数据和算力可预测地增长,资源竞赛由此而来。但其回报可能会见顶。
- 助手的制造分三步:预训练、监督微调,然后是 RLHF。最后这一步也是对齐问题的摇篮。
下一章,我们将彻底掀开这个新时代明星产物的引擎盖:大语言模型本身。