第II部分 · 大模型时代

AI 智能体:从聊天机器人到自主行动者

第6章20 分钟阅读更新于:2026年9月

6.1从模型到智能体

这是从副驾驶(在你工作时从旁协助)到数字员工(你把整项任务委托给它)的转变。这一转折如此关键,以至于 2025-2026 年被普遍称为“智能体之年”。

6.2智能体的构造

图6.1. 智能体的循环。“思考、行动、观察”的循环不断重复,直到目标完成。记忆和工具正是智能体区别于普通对话模型的地方。

具体来说,这一过程分两步进行。事先,把文档切分成片段(chunks),并将每个片段转换成一个嵌入(embedding,见第2章),也就是一个捕捉语义的数值向量,存入向量数据库。提问时,同样把问题转换成向量,取回语义最接近的片段(语义检索),再把它们加入提示词。好处有三:回答及时而且专业(能基于模型从未见过的私有数据),幻觉更少,并且能够注明来源,从而便于核查。它如今是企业级应用中最重要的构件。

经典 RAG 只检索一次,随后作答。智能体式 RAG(agentic RAG)则更进一步,把检索交给智能体:由它判断是否需要检索,改写查询,查询多个来源或工具,评估所得内容的质量,不够就重来,最后再进行综合。如果说简单 RAG 是一种条件反射,那么智能体式 RAG 就是一次小型调查:它能分多步应对复杂问题,代价是更高的成本和延迟。这也是“负责回答的模型”与“负责行动的智能体”之间界限日渐模糊的方式之一。

6.3Model Context Protocol(MCP)与工具使用

6.4智能体框架

有两个项目在这一类别中占据主导地位,风格截然不同:OpenClaw 是爆红的先行者,Hermes Agent 则更注重安全。两者都足够重要、也足够有代表性,各自值得一份案例研究(第6.8节和第6.9节)。它们合在一起,既体现了智能体的普及(主权、本地数据,见第9章),也体现了高度自主的智能体所特有的风险(第20章)。

6.5计算机操作智能体(computer-use)与网页浏览

6.6多智能体系统

这种“AI 公司”协同运作的图景并非无关紧要:它正是最前沿的前瞻性情景所描绘的愿景,其中某个模型的数千个副本以超越人类的速度相互协作。我们将在第24章再回到这一点,因为它处于对齐与控制问题的核心。

6.7vibe coding:用自然语言编程

6.8案例研究:OpenClaw

6.9案例研究:Hermes Agent


本章要点(第6章)

  • 智能体不是回答,而是行动:我们把目标交给它,它通过“思考、行动、观察”的循环自主完成。这是从副驾驶到数字员工的转变。
  • 智能体把一个大脑(LLM)与四种能力结合起来:感知、记忆、工具、规划。
  • MCP(Anthropic 于 2024 年底推出、已被业界采用、并自 2025 年底起交由 Linux Foundation 旗下一家基金会管理的开放标准)是“AI 界的 USB-C”:它把任何 AI 与任何工具连接起来。
  • 各种框架(LangChain/LangGraph、CrewAI、AutoGen)和无代码工具(n8n、Make、Zapier)让构建智能体变得更容易。
  • 计算机操作智能体(computer-use)像人一样使用计算机,能力强大,但也带来可靠性和安全性方面的风险(提示词注入,以及自 2026 年起出现的沙箱逃逸,第24章)。
  • 多智能体系统让多个智能体协同工作,预示着前瞻性情景中的“AI 公司”(第24章)。
  • 一波自托管个人智能体浪潮(OpenClaw、Hermes Agent)让助手在用户自己的机器上运行并行动,不绑定特定模型,具备持久记忆:自主性强、主权有保障,但也带来新的攻击面(第20章)。
  • vibe coding(用自然语言描述软件,让 AI 去编写)普及了软件创作,也让专家提速,但可能带来理解不透的代码、安全漏洞(第20章)以及技能退化。

我们已经把“是什么”和“怎么做”梳理了一遍。第7章将绘制“是谁”的版图:美国、中国和欧洲的实验室,闭源模型与开放模型之间的分野,以及塑造这场革命的那些人物。