第II部分 · 大模型时代
大语言模型(LLM)
4.1LLM 究竟是什么?
有一种令人印象深刻的说法:LLM 是这样一个函数,它读过的文本量,任何人活上一千辈子也读不完,并把语言中的大量规律,以及透过语言所反映的世界的规律,压缩进了自己的参数里。
4.2词元(token):AI 的“货币”
这为什么如此重要?有两个非常具体的原因:
- 上下文窗口(context window)是模型能够同时“记在脑中”的最大词元数。不同模型的窗口大小差别很大:2026 年,许多模型处于 128,000 到 256,000 个词元之间(相当于一本厚书),而不少前沿模型如今已达到一百万个词元,甚至更多。超出窗口之后,模型就“看”不到对话或文档的开头了;而在实践中,它利用超长上下文的能力往往远在达到这一上限之前就已下降。
- 价格按词元计算。通过应用程序编程接口(API)使用模型时,费用按消耗的每百万词元计收,分为输入(发送给它的内容)和输出(它生成的内容)。芯片制造商 NVIDIA 甚至把词元称为“AI 的语言和货币”:优化每个词元的成本已成为一项重大的产业课题(第8章和第9章)。
4.3一次训练的构造
4.4涌现能力与幻觉
但这些模型有一个广为人知的缺陷:幻觉。模型会用陈述事实时那种同样从容笃定的口吻,说出错误的信息:一句杜撰的引文、一条并不存在的法律依据、一个错误的事实。原因是结构性的:LLM 的优化目标是生成看似合理的文本,而不是真实的文本。从构造上说,它内部并没有“我不知道”这一概念;遇到知识空白时,它会用最像合理答案的内容来填补。
后果可能十分严重(医疗差错、在法庭上援引虚假判例)。目前已有多种应对手段,并且在不断进步:
- 检索增强生成(RAG,见第2章):向模型提供即时检索到的可靠文档,要求它以这些文档为依据。
- 工具使用:把计算交给计算器,把最新事实交给搜索引擎(第6章)。
- 可核查的引用,以及对训练的持续改进。
- 显式的推理(见下一节),它能减少某些错误。
4.5推理:思维链与“thinking”模型
于是各实验室训练出了推理模型(或称“thinking”模型):这类模型在给出答案之前会先进行一段很长的内部思考,把更多的计算投入到回答的时刻(称为 test-time compute,即推理时计算)。模型不再脱口而出,而是“花时间思考”,探索不同的思路,并自我纠正。
这一变化移动了性能的前沿:提升不再只靠扩大预训练规模,也靠让模型思考得更久。这一代最早的模型是 OpenAI 的 o1 及其后的 o3 系列(2024 年底和 2025 年),以及开放模型 DeepSeek-R1(2025 年初),后者以极低的成本达到了出色的推理水平,给人留下了深刻印象。到 2026 年,各大模型家族(Claude、Gemini、GPT、Grok)都提供了推理模式。
4.6评估模型:基准测试
2026 年 9 月底的格局。 最高水平的争夺异常激烈,排名几乎每个月都在变化;以下内容只是一张快照。美国方面,Anthropic 的 Claude 家族、OpenAI 的 GPT 系列(已于 2026 年 9 月进入 GPT-6 代)、Google DeepMind 的 Gemini 3 和 SpaceXAI(原 xAI,SpaceX 的子公司,见第7章)的 Grok 展开了胶着的竞争。中国方面,DeepSeek 和阿里巴巴(Alibaba)的 Qwen 等模型往往采用开放权重且成本极低,水平已接近前沿。欧洲方面,法国的 Mistral 高举主权的旗帜。在 2026 年年中,也就是此处所引用的最近一次榜单统计之时,已经出现了几条清晰的趋势:在人类偏好竞技场上,Claude 的各个版本在这一年的大部分时间里一直占据前列;在代码(SWE-bench)方面,榜首当时在 Claude、Grok 和 GPT 之间争夺;Gemini 在多项推理测试和多模态方面表现亮眼;而开放权重模型当时就已能以一小部分价格提供几乎同等的质量,这冲击了整个行业的经济格局。
2026 年最重要的一课,我们将在第7章再作讨论,可以用一句话概括:已经不存在绝对意义上的“最佳模型”,只有针对每项任务的最佳模型。最先进的组织都在实行“路由”(routing):把每个请求交给在质量、速度和成本上最合适的模型。任何排名都应当被看作一张照片,只在某一时刻有效。
本章要点(第4章)
- LLM 是一种经过大规模训练、用于预测下一个词元的 Transformer;对话、翻译、代码和推理都从这一目标中涌现出来。
- 模型以词元(词的片段)为单位进行处理,这决定了上下文窗口和价格(按每百万词元计费)。
- 训练(一次性的巨额投入)有别于推理(每次请求都会发生的经常性成本);蒸馏可以产出轻量而便宜的版本。
- 原材料,即高质量的人类文本,可能在 2026 至 2032 年前后耗尽(“数据墙”),因此人们转向授权协议、多模态和合成数据。
- 幻觉是结构性的(模型追求的是看似合理,而不是真实);可以通过 RAG、工具使用和推理来缓解,但无法根除。
- 推理模型在回答时“思考”得更久,把性能前沿推向了推理时计算。
- 基准测试能衡量进步,但受饱和、污染和古德哈特效应的困扰。2026 年,前沿由美国、中国和欧洲的参与者共同争夺,没有唯一的赢家。
至此,我们对“它是如何运作的”已有了完整的认识。第II部分将继续拓宽视野:在文本之外,探讨世界模型与多模态(第5章),然后是借助智能体走向行动(第6章),最后绘制各方参与者的版图(第7章)。