第I部分 · 基础:理解大语言模型之前的人工智能
从数据中学习:机器学习与深度学习
2.1范式转变:编程还是学习
机器学习(英文 machine learning)把这套逻辑倒了过来。我们不再提供规则,而是提供示例(成千上万封已标注为“垃圾邮件”或“非垃圾邮件”的邮件),由机器自己去发现能够区分二者的规则。我们不再编写“做什么”,而是编写“怎么学”。
2.2三种学习方式
机器学习分为三大类,必须分辨清楚,因为它们在后文中会反复出现。
2.3人工神经元与神经网络
2.4机器如何学习:代价函数与反向传播
如此反复,误差不断减小,网络也就变得胜任起来。最形象的比喻是在浓雾中徒步下到谷底:我们看不见谷底,却能感觉到脚下的坡度,于是朝低处迈出一步。一步一步走下去,最终会到达一个低点。这个“坡度”,在数学上称为梯度,而这种方法就叫梯度下降。
2.52012年:深度学习的大爆炸
为什么是 2012 年,而不是更早?因为此前缺失的三种燃料(第1章)终于齐备:
- 数据:ImageNet 提供了此前一直缺少的庞大标注图像集。
- 算力:AlexNet 是在 NVIDIA 公司的 GPU 上训练的。这些芯片原本是为并行计算电子游戏的像素而设计的,结果却非常适合神经网络中的海量乘法运算。这一技术细节将带来巨大的地缘政治后果:它将使 NVIDIA 成为全球市值最高的公司之一(第8章)。
- 算法:一些改进(ReLU 激活函数、dropout 正则化技术)使人们得以训练更深的网络而不致失控。
2.6看与读:CNN 与 RNN
2.7表示意义:嵌入(embeddings)
绝妙之处在于:这些数字是学出来的,并且要使意义相近的词在空间中占据相近的位置。“猫”和“狗”彼此为邻;“国王”和“香蕉”则相距遥远。意义变成了几何。
更妙的是:空间中的方向捕捉到了词与词之间的关系。那个广为人知的例子(出自 2013 年的 word2vec 模型)近乎魔术:
国王 − 男人 + 女人 ≈ 王后
换言之,从“男人”指向“国王”的向量,与从“女人”指向“王后”的向量大致相同。机器完全靠自己、无人告知,仅仅通过观察词语在数十亿个句子中的用法,就发现了“王权”这一抽象概念,以及“性别”这一概念。
这是知识的符号表示(第1章)的现代形态,许多搜索引擎在幕后正是靠它来组织内容的(即它们的答案框)。它的长处在于精确和可追溯(每条事实的出处一清二楚);短处则是必须靠人工去构建和维护。因此,神经符号方法日益受到关注,它把神经网络的灵活与图谱的严谨结合起来:LLM 可以查询知识图谱,使自己的回答扎根于经过核实的事实(这是检索增强生成的一种结构化变体,见第6章),从而减少幻觉。
2.8现代 AI 的三要素
这三要素为课程的后续内容提供了线索:
- 对数据的追逐,引出了知识产权与隐私问题(第21章和第25章)。
- 对算力的追逐,解释了 NVIDIA 的市值、芯片之战和能源账单(第8章和第10章)。
- 对算法的追逐,是各实验室之间激烈竞争的焦点(第7章);而它的下一次大飞跃,即 Transformer,正是下一章的主题。
2.9大脑与机器:一个富有启发又容易误导的类比
本章要点(第2章)
- 机器学习颠倒了传统编程:我们不再提供规则,而是提供示例,由机器把规则学出来。学习的结果称为模型。
- 三大类别:监督学习(有标准答案)、无监督学习(没有标准答案)、强化学习(试错)。
- 神经网络把人工神经元逐层堆叠起来;“深度”的意思是“层数众多”(deep learning)。
- 学习通过梯度下降和反向传播来实现:先度量误差,再把每个权重修正一小步以减小误差。
- 2012年(AlexNet/ImageNet) 标志着深度学习的大爆炸,它得益于数据 + GPU + 算法三者的汇合。
- 嵌入(embeddings) 把意义转化为几何:这是通往大语言模型的概念桥梁。
- 一切现代 AI 都建立在三要素之上:数据、算力、算法。
至此,我们已准备好跨过门槛。在第3章,我们将讲述 2017 年的那项创新,它打破了语言的枷锁,开启了大模型时代:Transformer。