第 5 课 · 那 Agent 到底是什么?
给会接话的人装上手和眼睛,让他不光会说,还能自己动手把事办了
前四课讲完,你应该已经明白大模型是什么、边界在哪了。现在最关键的问题来了:天天听到的 AI Agent,到底比大模型多了什么?
如果说大模型是一个特别会接话、脑子里知识很多的人,那 Agent 就是给这个人装上了手和眼睛,让他不光会说,还能自己动手把事情办了。
观察 → 思考 → 行动的循环
一个 Agent 会不停地做一件事:
- 观察:先看看现在是什么情况,比如这封邮件写了什么、表格里现在有什么数据
- 思考:想一想接下来该干什么,比如这封邮件需要回复,而且要先查一下订单号
- 行动:真的去做,比如打开表格查订单号、写一封回复邮件、点击发送
- 再观察:做完看看结果对不对,如果不对,回到第 1 步重新来
这个循环像什么
像你在家里找钥匙。
你不会站在原地一直想钥匙在哪,你会:看一眼门口鞋柜(观察)→ 猜可能在外套口袋(思考)→ 伸手掏一下(行动)→ 没有?(观察)→ 那猜猜包里(思考)→ 翻一下(行动),直到找到为止。
你是在边做边纠错,不是提前规划好每一步。Agent 干活也是这个逻辑:它不需要一开始就知道完整的解决方案,它只需要每一步都看一眼、想一下、动一下,走错了也能纠正。
一句话总结区别
普通 AI 聊天
AI Agent
Agent 的「手」具体是什么
就是我们说的工具。查数据库这个动作、发邮件这个动作、搜索网页这个动作,都被打包成了一个个 Agent 可以调用的工具。
Agent 的思考环节,本质上就是在判断:我现在应该用哪个工具、传什么参数。
这也是为什么设计一个好用的 Agent,很大一部分工作是给它准备合适的工具,并且规定好每个工具能不能用、什么时候用。第 8 课会详细讲这个。
常见问题
可以这么粗略理解:
Agent = 大模型(负责想)+ 一套能反复循环调用的机制(负责看、动、再看)+ 一堆工具(负责动手的具体手段)
三者缺一不可。少了循环它就只能答一次;少了工具它就只能说不能做。
不一定。就像你找钥匙也可能翻错地方,Agent 也可能走弯路。
好的 Agent 系统会设计检查和纠错机制,让它能发现自己错了并重新来,而不是一条路走到黑。也会设上限,防止它无限循环下去。
好问题,这正是 Agent 的价值之一。通过工具,它可以去查。
给它一个「查订单」的工具,它就能拿到你们真实的订单数据。所以第 3 课那五条边界里,第一条和第二条在 Agent 场景下能被大幅缓解,剩下三条依然成立。
本课自测
参考:普通 AI 是你问它「钥匙一般会在哪」,它告诉你「一般在玄关或口袋」。Agent 是它自己去玄关看一眼、去口袋掏一下,找到了拿给你。
如果你能不看这页讲出来,这一课就通了。
A. 你说「帮我写封请假邮件」,它给你一段邮件正文,你自己复制去发 B. 你说「帮我跟老板请下周三的假」,它查了你的日历确认没冲突、写好邮件、发出去、然后告诉你已发送
A 是聊天工具,B 是 Agent。分界线不在于回答得好不好,而在于它有没有真的动手把事办完。
小结:Agent 的核心不是更聪明,而是多了观察思考行动的循环,加一套可调用的工具,能自己纠错、自己把事情办到底,而不是只回答一次就结束。