第II部分 · 大模型时代

世界模型(World Models)与多模态

第5章10 分钟阅读更新于:2026年9月

5.1预测文本还不够:理解世界

由此产生了一个自2025年以来搅动研究界的想法:要达到更通用的智能,系统必须拥有真正的世界模型,也就是关于现实如何运作、如何演变的内部表征。从这个角度看,文本不过是现实贫乏而残缺的影子。研究者杨立昆(Yann LeCun)把这一点当作自己的核心主张:在他看来,靠吞下越来越多的文本无法抵达智能,必须从更丰富的信号中学习,比如视频以及与世界的交互。

5.2多模态:文本、图像、声音、视频

5.3世界模型:定义与意义

注意不要把它与单纯的视频生成器混为一谈。两者的区别很微妙,却至关重要:

图5.1. 视频生成器与世界模型的对比。前者产出一段固定的片段。后者是可交互的:你可以在其中采取行动,它会逐帧给出连贯的回应。正是这种“先动作、后结果”的循环,使它成为智能体和机器人的训练场。

5.4相互竞争的路线(2026年年中全景)

表 5.1. 2026年“世界模型”的四大阵营。

2025至2026年间的几个具体里程碑:

  • 视频生成“作为世界模拟”。 OpenAI 早在2024年就借 Sora 提出这样的论点:一个在足够多视频上训练的模型最终会隐式地学会物理,剩下的差距将由规模来填补。此后 OpenAI 已将该产品撤出市场:停止服务的决定于2026年3月宣布,分两步进行,应用于2026年4月关闭,API 则定于2026年9月停用。Google(Veo)、中国的快手(Kuaishou,Kling)和字节跳动(ByteDance,Seedance,2025年在多个视频生成榜单上居首),以及 Runway,走的都是相近的路线。这场争论仍无定论:Sora 当时对某些交互的建模很差(玻璃杯破碎、食物被咬下),多项研究曾得出结论,它展现了“世界模型的雏形”,却还算不上真正的世界模型。
  • 空间智能。 由李飞飞(AI“教母”,ImageNet 的发起人)创立的 World Labs,于2025年底推出产品 Marble,能够根据一段文本或一幅图像生成持久、可修改、可导出的 3D 世界。2026年9月1日,World Labs 公布了 Atlas,这是一个多模态世界模型,能够生成、重建并模拟 3D 场景(仅凭一幅图像即可生成长达一分钟的视频,并可输出点云和高斯“泼溅”),其目标之一是为机器人技术实现从真实到仿真的转换。截至2026年9月底,Atlas 以抢先体验的方式向合作伙伴提供,尚未全面开放。在李飞飞看来,“空间智能是 AI 的下一个前沿”。
  • 交互式生成模型。 Google DeepMind 发布了 Genie 3(2025年8月),该模型能以每秒24帧的速度实时生成可探索的 3D 世界,自2026年起通过“Project Genie”向部分订阅用户开放。NVIDIA 则凭借其 Cosmos 平台(截至2026年初下载量超过两百万次),提供“具备物理感知”的世界,用于在仿真中训练机器人和自动驾驶车辆。
  • 潜在空间路线(JEPA)。 这是杨立昆押下的赌注:与其预测像素,不如在一个抽象空间里预测接下来会发生什么,这样效率要高得多,也更接近认知。杨立昆确信大语言模型已经“触顶”,于2025年底离开 Meta,在巴黎创立 AMI Labs(Advanced Machine Intelligence),并围绕这一理念融资超过十亿美元。AMI Labs 这样概括自己的信念:真正的智能并非始于语言,而是始于世界。它的世界模型从传感器数据中学习抽象表征,并在这个空间里进行预测;以动作为条件后,这些模型能让智能体预判自身行为的后果,并在防护机制之下进行规划。其公开目标是:打造具备持久记忆、能够推理、可控且安全的系统,服务于可靠性至上的领域(工业控制、机器人技术、物联网设备、医疗健康)。这是一家前沿实验室,从创立之初就分布在巴黎、纽约、蒙特利尔和新加坡。Meta 方面则继续推进其 V-JEPA 系列模型。

它的价值与下一节所讲的相通,只是移植到了软件领域:真实环境缓慢、稀缺、昂贵而且有风险,也无法随意注入那些智能体终究必须学会应对的极端情况。相反,一个保真、可控、可重放的模拟器可以生成无限数量的训练轨迹(这是合成数据的一种形式,见第4章),可以低成本、无危险地应用强化学习,还可以在把智能体放到真实系统上之前先行测试。Qwen 甚至报告称,这样在仿真中训练出来的智能体可以超过在真实条件下训练的智能体,而且这种对环境的认识无需专门重新训练就能迁移到各类智能体任务上。

不过,有两点保留意见不能不提。衡量这些结果的基准测试(AgentWorldBench)是由该团队自己设计并发布的:其领先幅度应当审慎看待。此外,这与后文将讨论的仿真与现实之间的鸿沟是同一道难关:在模拟器里表现出色的智能体,面对真实世界的杂乱无章时可能会失败,因为世界模型的水平永远不会高于喂养它的数据。

5.5为什么这是2026年的重大赌注之一

背景知识:从虚拟到现实(sim-to-real)。 世界模型最主要的实际用途已经出现:在仿真中训练智能体和机器人。好处显而易见:在虚拟世界里,机器人可以加速进行数百万次尝试,没有风险、没有磨损、没有危险,而在真实世界中学习则又慢又贵。剩下的核心挑战是仿真与现实之间的鸿沟(reality gap):在过于完美的模拟器中学到的行为,面对真实世界的杂乱无章(摩擦、变化的光照、不完美的传感器)时往往会失败。主要的对策叫作域随机化:人们刻意让仿真中的大量参数(纹理、光照、质量、摩擦)不断变化,迫使学到的策略变得稳健,这样一来,真实世界对它而言不过是已经见过的众多变体之外的又一个变体。此外还有合成数据(生成出来而非采集而来的样本)的生产,在真实数据不足时,它越来越多地被用来训练模型。这是本章与机器人技术(第13章)之间最实在的一座桥梁。


本章要点(第5章)

  • 前沿模型是多模态的:文本、图像、声音和视频在同一个表征空间中处理(一切都变成词元)。
  • 世界模型是一个内部模拟器,根据动作预测下一个状态;它是可交互的,不同于只产出固定片段的视频生成器。
  • 2026年有四大阵营相互角力:视频生成(Veo、Kling、Seedance)、空间/3D(World Labs、Marble)、交互式生成(Genie 3、Cosmos)和潜在空间/JEPA(V-JEPA、杨立昆的 AMI Labs)。
  • 2026年出现的一个变体,即语言型世界模型(如 Qwen-AgentWorld),模拟的不再是物理世界,而是智能体的数字环境(终端、网页、操作系统等),以便无风险地训练和测试智能体(第6章)。
  • 许多人把它视为通往具身智能的桥梁(机器人技术),以及迈向通用智能的可能一步。
  • 根本的争论在于:仅靠规模是否足够,还是需要扎根于物理的全新架构?

下一章,我们将从感知与模拟转向行动:AI 智能体,这类系统不再满足于回答,而是付诸行动。