第I部分 · 基础:理解大语言模型之前的人工智能

Transformer 革命:“注意力就是你所需要的一切”

第3章9 分钟阅读更新于:2026年9月

3.1序列式架构撞上的那堵墙

要翻过这堵墙,需要一种能同时做到两件事的架构:一次性处理整个序列(为了快),并把任意一个词与任意另一个词直接联系起来,无论它们相隔多远(为了什么都不忘)。这正是注意力机制所带来的。

3.2注意力的直觉

再打个比方:设想在一场会议上,为了理解某句发言,你会自动根据相关程度,对每位与会者此前说过的话加以权衡。注意力就是这样一套加权系统,只不过它被大规模应用,并且是自动学出来的。

图3.1. 图解注意力机制。为了理解“它”这个词,模型给“动物”分配较高的权重,给“马路”分配较低的权重。这些权重不是由人写下的:它们是从数十亿个句子中学出来的。

3.3Transformer 架构(2017)

有两个要素值得记住:

  • 多头注意力(multi-head attention)。Transformer 不是只用一套加权系统,而是让多套系统并行运转,如同投向句子的多道不同“目光”。一个头可以追踪语法(主谓一致),另一个追踪语义,还有一个追踪指代关系(“它”指向“动物”)。把这些目光组合起来,模型就能捕捉到极为丰富的关系。
  • 位置编码(positional encoding)。注意力本身对词序是视而不见的:在它看来,“狗咬人”和“人咬狗”毫无区别。因此,要在每个词的表示中注入它在句中位置的信息,以保留词序。
图3.2. 极度简化的 Transformer 示意图。一个块由一层多头注意力和一层计算层组成;人们把几十个乃至几百个这样的块堆叠起来。模型的能力正来自这种堆叠的深度与规模。

3.4缩放定律(scaling laws)

研究者理查德·萨顿(Richard Sutton)把其中的哲学教训概括为“苦涩的教训”(bitter lesson):从长远看,能够利用不断增长的算力的通用方法,最终总会胜过专家们费尽心思手工拼凑出来的巧妙方法。这对人类的聪明才智来说令人沮丧,却出奇地有效。

3.5预训练、微调与 RLHF

图3.3. 制造助手的流程。2022 年底把 GPT-3 变成 ChatGPT 的,基本上就是这套工艺。
  1. 预训练(pre-training)。让模型吞下现有文本中极其庞大的一部分(网页、书籍、代码、文章)。它仅仅通过尝试预测后续内容,就从中学到了语法、事实、推理和文风。这是成本最高的一步:在成千上万个处理器上计算数周,耗资数千万乃至数亿美元。
  2. 监督微调(supervised fine-tuning,SFT),也称指令微调。向模型展示成千上万个“用户的问题,助手的理想回答”这种形式的示例。它由此学会像助手那样行事:作答、遵循指示、采用恰当的语气。
  3. RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)。由人来比较模型的多个回答,并指出自己更喜欢哪些。第二个模型,即所谓的“奖励模型”,学习这些偏好,然后用来训练主模型,使其给出被认为更好的回答:更有用、更诚实、毒性更低。正是这一步让助手变得好用且相对安全。

本章要点(第3章)

  • Transformer(2017 年,论文《Attention Is All You Need》)用注意力机制取代了顺序阅读,该机制把所有词直接相互联系起来,并可在 GPU 上并行。
  • 注意力为每个词学习还有哪些词重要、各有多重要。多头注意力让这些“目光”成倍增加;位置编码保留了词序。
  • 仅解码器这条支系(GPT 系列)在文本生成中胜出。
  • 缩放定律表明,性能随规模、数据和算力可预测地增长,资源竞赛由此而来。但其回报可能会见顶。
  • 助手的制造分三步:预训练、监督微调,然后是 RLHF。最后这一步也是对齐问题的摇篮。

下一章,我们将彻底掀开这个新时代明星产物的引擎盖:大语言模型本身。