第IV部分 · 重大融合

机器人技术与具身智能

第13章9 分钟阅读更新于:2026年9月

13.1简史:从工业机械臂到会学习的机器人

13.2具身智能与视觉-语言-动作(VLA)模型

图13.1. VLA 模型的原理。机器人感知周围环境(视觉),接收一条自然语言指令,再由模型把这一切转化为动作。大语言模型为语言做到的事,它为身体做到了。

13.3人形机器人竞赛(2026年6月全景)

13.4人形机器人之外

13.5利害所在:安全、就业、可接受性


本章要点(第13章)

  • 机器人技术长期依赖被编程的、僵化的机器。2024至2026年的转折,源于大模型进入了机器人的身体。
  • 视觉-语言-动作(VLA)模型(Figure 的 Helix、Physical Intelligence 的“pi”、Google 的 Gemini Robotics、NVIDIA 的 GR00T、Unitree 的 UnifoLM)把感知和指令转化为动作,通常要先经过仿真训练。
  • 人形机器人竞赛在美国参与者(Figure、Tesla、Boston Dynamics、1X、Apptronik)与中国参与者(Unitree、AgiBot、UBTECH、XPeng)之间展开,各家战略不同(能力、模型、整合或价格)。
  • 关键在于跨过临界点(2 万至 2.5 万美元左右),其中起作用的是数据良性循环和供应链(对中国零部件高度依赖)。
  • “物理 AI”不限于人形机器人:协作机器人、仓储机器人、四足机器人、无人机、自动驾驶汽车。
  • 安全(如何认证一台会学习的机器人)、就业、可接受性和监管方面的问题都十分重大(第24、21和25章)。

第IV部分到此结束。我们探讨了 AI 与区块链、量子计算和机器人技术的融合。现在该离开技术本身,去观察它们对世界的实际影响了:科学与健康、劳动与经济、法律与社会。这正是第V部分的主题。