Appearance
智能体到底是什么
"智能体"这三个字,第一次听到可能会让人摸不着头脑。它既不像"程序"那样让人觉得冷冰冰,也不像"机器人"那样有具体的形象。在动手钻研技术之前,值得先把它到底是什么、它的"骨架"长什么样,想得通透一些。
它不是聊天机器人
这两年大家已经很熟悉 ChatGPT 这类东西了。你在框里打一句话,它回你一段话,一来一回,仅此而已。有人把这种形态也叫"智能体",但这其实是一种过窄、甚至有点误导的理解。
两者的差别,不在"会不会回答",而在会不会自己往前走。
聊天机器人是被动的:你问,它答,卡住了就停下来,等你再抛下一个问题。它的一生,就是被你的提问牵着走。
智能体是主动的:你交给它一个目标("帮我把这个月的数据整理成报告发出去"),它把这个目标拆成一步步,自己决定什么时候查资料、什么时候算、什么时候结束,中途遇到岔路自己判断,最后把结果而不是"一句话"交回给你。
这里的关键词,是自主(autonomy)。智能体能在一个没有你不断插手的环境里,独立地朝目标推进。
它的骨架:一个循环
很多把智能体讲复杂的地方,恰恰是把简单的骨架藏起来了。看穿了,它就是一个不停转圈的循环:
┌─────────────────────────────────────────────┐
│ │
▼ │
思考 ——这一步该干什么?要不要查点什么?用谁? │
│ │
▼ │
行动 ——动手去做(翻资料 / 调接口 / 算 / 写) │
│ │
▼ │
观察 ——结果对吗?够了吗?有没有出岔子? │
│ │
│ (没完 → 回到"思考",带着结果继续)─────┘
│
▼完成,整理成结果交给用户这个"思考 → 行动 → 观察 → 再思考"的闭环,是智能体的命脉。它每转一圈,就离目标近一点。所谓"智能",很大程度藏在这个循环能不能自己转得顺、转得远上。
理解了这一点,下面几篇就顺理成章:思考靠什么? 靠 LLM。想查不知道的东西怎么办? RAG。想去操作外部世界? 工具。怎么记住前面说的话? 记忆。它们都是这个循环里,某一个环节装上的零件。
和"工作流 / Workflow"的区别
做后端、做流程的人可能熟悉 Workflow(工作流 / 流程编排)。它俩很容易被搞混,但要分清:
Workflow 是一条写死的流水线。 第一步做什么、第二步做什么、遇到什么分支往哪走,在出厂之前就固定死了。你只要按剧本去走,走得快且稳。它像一个铺设好的铁轨,火车一定按轨道走。
智能体是"活的"决策者。 每一步是自己判断出来的,没有剧本。它能偷懒、能绕路、能在情况变了以后临时改主意。它像一个司机,面对路况自己拿主意。
区别可以概括成一句话:Workflow 把"怎么走"定死了,智能体把"怎么走"留给每一步去决定。
(这不是说谁好谁坏。现实里,凡是能写死的流程,用 Workflow 又快又稳;凡是没法预判、要靠判断的事,才上智能体。聪明的架构,往往是"套路的用流水线,判断的给它自主"——这正好呼应后面讲到的技能固化。)
它由什么构成
把循环拆开,一个典型的智能体大概长这样:
- 一颗大脑:负责思考、判断、组织语言。这是后面模型篇的主角。
- 一套知库:当大脑遇到训没见过的知识,能去翻的资料。对应 RAG。
- 一双手:让大脑能真的去操作外界的工具。
- 一个记事本:跨对话记得住事、记得准人。对应记忆。
- 一些套路:反复调教出来的、可复用的技能。
而人的角色,不是站在旁边看,而是把握边界和方向——这也是人机协同那一篇要展开的。
如果要在脑子里留一个图景,最贴切的是一个词:员工。
智能体像一个有脑子、能查资料、会动手、记得住事、还有一技之长的新员工。你把一件事交代给它,它在没人催的情况下自己把活排下去干完。它不一定样样都强,但能在不被打断的情况下,朝一个目标持续推进——这就是"智能体"三个字背后,最本质的东西。
当然,"员工"也有脾气和短板,那颗大脑尤其如此。下一篇,我们就把它请到台前看一看:LLM:那颗大脑。