当 AI 比人类更擅长发现漏洞(2026年的转折点)2026年跨过了一道门槛:最优秀的前沿模型已经能够以顶尖人类专家的水平发现并利用软件漏洞,而且规模前所未有。Anthropic 的 Mythos 模型就在所有主流操作系统和浏览器中挖出了数千个此前未知的漏洞(即“零日漏洞”,zero-days),其中一些已潜伏数十年而无人察觉(OpenBSD 中一个存在了27年的漏洞,视频组件 FFmpeg 中另一个存在了16年、任何自动化测试都未曾发现的漏洞)。这是一把典型的双刃剑:同一种能力,落入坏人之手会使模型变得危险,用来在漏洞被利用之前将其堵上则弥足珍贵。于是在2026年4月诞生了 Glasswing 项目,这是一个由 Anthropic 与科技和金融界的大型机构(Amazon、Apple、Broadcom、Cisco、CrowdStrike、Google、JPMorganChase、Linux 基金会、Microsoft、NVIDIA、Palo Alto Networks 等)组成的防御联盟,旨在让这些能力服务于安全,其中也包括为开源软件的维护者服务;其他实验室也在同步开发各自的工具(例如 Google 的 Big Sleep 和 CodeMender)。硬币的另一面出现在 2026年6月:美国政府以出口管制和国家安全为由,一夜之间中止了所有外国公民对 Fable 和 Mythos 模型的访问,担心其网络能力被滥用。此事引发了激烈的争论:在政府看来,这事关国家安全;在 Anthropic 看来,这一措施与实际风险并不相称,而且所依据的只是一个其他公开模型同样存在的轻微绕过问题;在一些观察人士看来,一款被宣传得近乎“武器”的产品,最终就会被国家当作武器来对待。这是出口管制针对 AI 模型而不再仅仅针对芯片的最早案例之一(第22章和第25章)。限制持续的时间很短:美国商务部于2026年6月30日解除了这些管制,Anthropic 自7月1日起在全球重新部署 Fable 5,并配备了强化的安全分类器,如今能在超过99%的情况下拦截此前被指出的绕过手法(Mythos 5 则恢复提供给一批美国机构)。值得注意的是,危机期间进行的测试印证了 Anthropic 的立场:能力较弱的模型(包括 Opus 4.8、GPT-5.5 和 Kimi K2.7)也能找出同样的漏洞,可见这一绕过手法并未暴露任何 Mythos 独有的网络能力。尽管如此,这一事件仍促使 Anthropic 及其合作伙伴(Amazon、Microsoft、Google)着手建立衡量越狱严重程度的共同框架,并在部署前测试方面加强与政府的合作。这一框架此后有了名称和定位:“Cyber Jailbreak Severity”分级(从 CJS-0 到 CJS-4)借鉴了 CVSS 评分的思路,由 Anthropic 于2026年7月2日作为初步版本发布;它目前还不是业界采纳的标准。此后产品线又完成了更新:2026年9月1日,Anthropic 发布了 Claude Fable 5.1(全面可用,每百万输入词元10美元、每百万输出词元50美元)和 Claude Mythos 5.1(限制访问),并称二者是同一个模型,只是配备了不同的防护措施。Fable 5.1 如今可以识别源代码中的漏洞,但遇到渗透测试、漏洞利用程序生成和二进制分析,仍会将请求转交给其他模型。Mythos 5.1 仅面向经过验证的专业人员,通过两个项目(Cyber Verification Program 和 Life Sciences Verification Program)提供,目前只有美国机构可以使用,Anthropic 表示正与美国政府协调以扩大这一访问范围。在欧洲方面,欧盟委员会于2026年9月10日证实,网络安全机构 ENISA 已获得 Mythos 5(而非 5.1 版本)的访问权限,用于防御目的,此前双方自5月底起进行了三个月的谈判。