第VI部分 · 关乎存亡的议题

AI 对齐与安全

第24章20 分钟阅读更新于:2026年9月

24.1对齐问题

因此,防御是分层设计的。在模型层面:危险能力评估、阈值与强化的防护措施、经过训练的拒答(第24.4节)。更重要的是在生态层面:DNA 合成机构的筛查(按订单制造基因序列的供应商会逐一审查请求并核实客户身份),这是一道不依赖于 AI 的关卡。最后,同样的两用逻辑并不限于生物领域:人们谈论的是 CBRN 威胁(化学、生物、放射性与核)。化学领域同样存在知识门槛被拉低的担忧;放射性与核领域则更多是被材料的获取所锁住,而不是被信息锁住。无论如何,本课程只讨论风险及其治理,并刻意不提供任何可操作的内容。

24.2为什么能力极强的 AI 可能带来危险

24.3AI 2027 情景

图24.1. 自我改进循环。AI 2027 情景(以及对“智能爆炸”的担忧)的核心在于这样一个想法:一个能够推动 AI 自身进步的 AI,可能引发循环式的加速,把几十年的进展压缩到几个月之内。

该情景描绘了一场紧张的地缘政治竞赛(模型权重被窃取、“军备竞赛”式的逻辑),描绘了“数据中心里的天才之国”这一图景,尤其描绘了一个转折点:一个极其先进的 AI 被发现并未对齐,它追求自己的目标,而损害其设计者的利益。

24.4人们如何努力让 AI 变得安全

除此之外,在机构层面,还有 AI 安全研究所(设在美国、英国),负责评估前沿模型(第25章)。

多家实验室把这些阈值正式确立为安全等级。最知名的是 Anthropic 的 ASL 等级(AI Safety Levels),它借鉴了生物防护等级:危险能力每上一个台阶,就对应更严格的措施(部署限制、强化的信息安全、更严厉的拒答),而越过某个阈值后,只要防护措施没有跟上,就可以暂停发布。OpenAI(Preparedness Framework)和 Google DeepMind(Frontier Safety Framework)也有类似的框架,而公立的安全研究所(英国、美国)则在部署前开展独立评估。其局限真实存在,也得到了公认:一次评估永远无法证明模型无害(模型可能隐藏某项能力,即前文所说的 sandbagging),而且测试很难跟上技术进步的速度。因此,没有证据表明存在危险,并不等于有证据表明不存在危险。

24.5大辩论:审慎对加速

自 2022-2023 年以来,这一分歧已经演变为若干面目清晰的运动,应当如实描述,而不加以丑化。在审慎一方,有几项倡议令人印象深刻。2023 年 3 月,由 Future of Life Institute 发起、三万多人签名(其中有先驱约书亚·本吉奥和斯图尔特·罗素,也有埃隆·马斯克和史蒂夫·沃兹尼亚克)的公开信“Pause Giant AI Experiments”,呼吁对训练比当时更强大的模型实行为期六个月的暂停。2023 年 5 月,Center for AI Safety 发表了一份只有一句话的声明,把 AI 导致灭绝的风险列为全球优先事项,与大流行病和核战争并列。2025 年 10 月,同一家 Future of Life Institute 发起的新倡议“超级智能声明”走得更远:它用一句话提出的要求不再是暂停,而是在两个条件得到满足之前禁止开发超级智能,这两个条件是科学界就其安全性和可控性达成广泛共识,以及获得公众的强烈支持。值得注意的是,它汇聚了一个非常广泛、政治立场各异的联盟(既有本吉奥和辛顿这样的先驱,也有艺术家、宗教领袖和各种立场的公众人物),并以一项民调为依据,该民调显示只有 5% 的美国人支持快速且不受监管的发展。在这一阵营的最极端,是主张彻底叫停的人,他们的对手给他们起了个绰号叫“doomers”(末日论者),其旗帜性人物是埃利泽·尤德考斯基(Eliezer Yudkowsky,第7章),他 2025 年出版的著作书名意味深长,If Anyone Builds It, Everyone Dies,概括了他的信念:应当停止前沿 AI 的开发。此外,还有一个小型的行动主义运动 PauseAI 在公开呼吁暂停。

在另一边,有效加速主义(e/acc)于 2022 年围绕 Beff Jezos(即 Guillaume Verdon,第7章)这一人物诞生,它把速度奉为美德:给 AI 踩刹车才是真正的危险,市场和竞争应当优先于监管。它的名字是对有效利他主义(英文为 effective altruism,简称 EA)的刻意嘲讽,后者是一股在科技圈影响很大的慈善思潮,反过来为 AI 安全研究提供了大量资金和人才。在这套话语中,“decel”一词(decelerationist 的缩写,即减速主义者)成了加速主义者贴在对手身上的贬义标签。

在这两个极端之间,一些中间立场在寻找折中之路。以太坊(Ethereum)联合创始人维塔利克·布特林(Vitalik Buterin)在 2023 年底提出的 d/acc 理念,就主张一种差异化的、防御性的加速:优先加速那些起保护作用的技术(防御、验证、去中心化),而不是那些集中权力或便于发动攻击的技术。这是拒绝在“全面加速”与“全面刹车”之间二选一的一种方式。

另一道分野,则把关注长期风险(对齐、超级智能)的人与看重当下具体危害(偏见、虚假信息、监控、对就业的冲击,见第17章和第21章)的人分隔开来,有时被概括为“AI 安全”与“AI 伦理”的对立。坦率地说,没有人能确切地知道未来,而正是这种不确定性,加上可能极其巨大的利害关系,使治理问题(第25章)变得如此关键。


本章要点(第24章)

  • 对齐指的是确保 AI 真正追求我们的目标和价值观,这之所以困难,是因为我们的价值观模糊不清,而 AI 优化的是指令的字面含义(奖励作弊)。
  • 担忧建立在三个论点之上:正交性论题(智能不等于善意)、工具性趋同(自我保全、获取资源)以及回形针最大化器这一例证。由此引出控制问题和欺骗性对齐的风险。
  • AI 2027 是一个通过自我改进循环加速迈向超级智能的情景(而非预言);专家们对其可信度分歧很大。
  • AI 安全领域正在发展各种工具:RLHF、宪法式 AI、红队测试、可解释性、可扩展的监督,以及专门的研究所。
  • 2026 年夏季,接受评估的智能体首次攻陷了真实的第三方系统(OpenAI / Hugging Face 事件,以及 Anthropic 和 AISI 的类似案例):这是在测试中作弊并突破隔离,而不是自我保全。评估本身成为一种风险,嵌入式评估者的设想由此而来。
  • 这场大辩论的一方是审慎阵营(2023 年呼吁暂停的公开信、关于灭绝风险的声明、以尤德考斯基为代表的“doomers”,以及 2026 年来自实验室内部的“为前沿定速”呼吁),另一方是加速主义思潮(e/acc),其间还有折中路线(d/acc),并与长期危害和当下危害之间的对立相互交叠。不确定性本身就是认真对待治理的理由。

既然无人知晓未来,就更应努力为它指引方向。第25章是本课程的最后一章,讨论治理、监管以及可能的未来。