311. Agent:什么是智能体?

2026.07.22

·教程智能体

参考:

总结

  • 它会真正做事情,不只是说话。
    • 当前的环境、会如何,然后真的会执行(做),然后做完以后的结果,然后再,不行就继续循环。
    • 看看现在啥情况,想想下一步,动手做一下,再看结果,不行就重来,
    • 所以,你会发现我们现在常用的 Code Agent 底层实现时,都会有循环的逻辑
  • 和 ChatBot 的差别,就一句:会不会真的动手办事。
    • ChatBot 停在文字里,可能猜,也可能提醒你自己去查。
    • Agent 会调工具、拿到真实观察,再把结果带进下一轮。
  • 和 Workflow 的差别,也一句:步骤是不是写死。
    • Workflow 像按菜谱,稳,但说明书没写到的情况容易卡住。
    • Agent 像请人办事,奔着目标自己拆步骤;太远了、超预算了,能重新想、重新查、重新推荐。
  • 今天常说的 LLM Agent,最关键的“循环”;多出来的是一个更通用的「大脑」,加上工具箱。
    • 规划:大目标拆小。
    • 用工具:缺信息就去查,不硬编。
    • 动态修正:你改口,它改计划。
      那你怎么判断一个系统算不算 Agent」,就落到四样:
  • 有没有目标。
  • 有没有对环境的观察。
  • 有没有能改变环境的行动。
  • 行动结果会不会回到下一轮决策。

四样齐了,才像 Agent;少一样,多半只是脚本、聊天,或固定流程。

一个疑问:行动怎么就改变环境了?

不是玄学,就是行动前后,环境状态真的不一样了:

311. Agent:什么是智能体? 图表 1

流程:先有状态 A,行动发生,变成状态 B;A ≠ B,且这个变化是行动导致的,才叫「改变环境」。

几个例子:

  • 空调:行动是「开制冷」。环境从「28°C」变成「26°C」。温度这个状态变了。
  • 导航:行动是「改走另一条路」。面前的路线、预计到达时间变了。

311. Agent:什么是智能体? 图表 2

流程:左边空调把温度改了;右边导航把路线改了。两边都是:做完之后,能指出环境里哪一点不一样了。

旅行助手调 get_weather("北京"):这一步容易混,其实分两截。

311. Agent:什么是智能体? 图表 3

流程:先是对外部系统的真实交互(不是脑内空想);返回后智能体多了一条观察,可观测任务状态变了。再往下若订酒店、改文件、跑代码,环境变化会更明显。

  • 调用工具本身:程序真的发出了 HTTP 请求,天气服务被请求了一次。对外部系统来说,这是真实交互,不是脑内空想。
  • 更关键的是返回之后:智能体手里多了一条观察——「晴,26度」。下一轮决策用的「当前世界图像」变了。对 Agent 来说,可观测到的任务状态变了。
  • 再往下,如果真去订酒店、改行程文件、执行代码:酒店系统多了一笔订单、本地文件内容变了、终端里跑出了新进程。这些都是能核对的「环境变了」。

对比一下就不绕了:

311. Agent:什么是智能体? 图表 4

流程:分叉点是会不会动手。只聊天多半只改了对话框;有执行器的行动才会让任务环境里出现可核对的变化。

一句话:不是「说了改变」就算改变,而是做完之后,环境里能指出哪一点不一样了。

用零件说:

  • 传感器:往里看
  • 执行器:往外做
  • 「有没有能改变环境的行动」≈ 有没有执行器,以及它是不是真的在用

重点

  • 用自己的话讲清:智能体到底在干什么。
  • 贯穿案例:帮你安排「今天去哪儿玩」。
  • 分清三件事:聊天机器人、固定流程、真正的智能体。

什么是智能体

开场:一个助手

311. Agent:什么是智能体? 图表 5

流程:你提出目标 → 助手先查天气 → 再按天气找景点 → 给你推荐;如果你说太远了或太贵了,它回到「找景点」重来,满意才交最终建议。这张图先让人看见智能体最朴素的闭环:边做边改。

大白话

一句话:一个会自己看,自己做决定自己动手做,并努力把目标办成的东西。

  • 看 = 感知环境
  • 想 = 自主决策
  • 做 = 通过执行器行动
  • 再看 = 观察结果,进入下一轮

311. Agent:什么是智能体? 图表 6

流程:看 → 想 → 做 → 再看
智能体靠这个循环把事推进完。

四个生活零件:环境、传感器、执行器、自主性

场景 1:空调

  • 环境:房间温度。
  • 传感器:温度探头。
  • 执行器:压缩机、风扇。
  • 自主性:温度高了自己开制冷,不用你每次手动按。

这是最简单的智能体味道:它在持续看世界,并采取行动

场景 2:导航 App

  • 环境:城市道路、拥堵、红绿灯。
  • 传感器:GPS、路况接口。
  • 执行器:给你路线、语音提示、重新规划。
  • 自主性:
    • 前方堵了,它会自己改道,不是只会念最初那条路。
    • 会改变现状

场景 3:今天的 AI 旅行助手

  • 环境:天气网站、搜索引擎、票务和酒店信息、你的偏好。
  • 传感器:天气 API、搜索 API、你的聊天输入。
  • 执行器:调用工具、改行程、给你最终建议。
  • 自主性:你说「酒店超预算」,它会当成新约束,自己重搜,不是只道歉。

311. Agent:什么是智能体? 图表 7

流程:环境经传感器被「看见」→ 智能体自己判断 → 经执行器去「做」→ 行动改变现实,再回到环境。
看:传感器是眼睛耳朵
做:执行器是手脚
想:中间那一格才是自主决策,这其实就对应这 LLM

案例:帮你安排今天去哪儿玩

用户原话:

text
你好,请帮我查询一下今天北京的天气,然后根据天气推荐一个合适的旅游景点。

一个合格的智能体,不会一上来直接瞎推荐。它大致会跑成这样:

第一轮:先把天气看清楚

bash
# 它心里在想
Thought: 先得知道北京今天天气,不然没法推荐。
# 它决定动手
Action: get_weather(city="北京")
# 世界返回结果
Observation: 北京当前天气:Sunny,气温26摄氏度

第二轮:再按天气找景点

bash
Thought: 已经知道晴天且温度适中,可以据此推荐景点。
Action: get_attraction(city="北京", weather="Sunny")
Observation: 晴天可去颐和园或长城。

第三轮:把结果说给人听

bash
Thought: 信息够了,可以收工。
Action: Finish[今天北京晴,26度,适合出门。推荐颐和园或长城。]

311. Agent:什么是智能体? 图表 8

流程:你提需求 → 智能体先想再调天气工具 → 拿到观察后继续想 → 再调景点工具 → 最后把结果说给你。
横向看清楚:每一轮都是「想 → 行动 → 观察」,不是一口气瞎答。

他的四项本事:

  • 任务分解:先天气,后景点。
  • 工具调用:不会的去查,不硬编。
  • 上下文理解:第二轮用到了第一轮的天气结果。
  • 结果合成:最后用人话交卷。

两个关键边界

ChatBot 和 Agent 的区别

311. Agent:什么是智能体? 图表 9

区别就是:「会不会真的动手办事」

Agent 和 Workflow 的区别

20260722_1.webp|600

一个报销审核举例子。很多公司报销是 Workflow:

  • 金额小于 100,自动过。
  • 100 到 500,客服审。
  • 大于 500,主管审。
  • 定制品,直接拒绝。

如果天气推荐也写成 Workflow,大概会变成:

  • 如果晴天,推荐颐和园。
  • 如果雨天,推荐博物馆。

问题来了:

  • 颐和园今天门票售罄怎么办?
  • 用户说「带小孩,不要爬山」怎么办?
  • 用户说「太远了」怎么办?

智能体则可以重新想、重新查、重新推荐

311. Agent:什么是智能体? 图表 10

两张子图对照的是「按菜谱」和「请人办事」两种自动化。

  • Workflow:按说明书执行
  • Agent:奔着目标想办法

从空调到今天的 LLM Agent

智能体很早就有:从空调到 Code Agent

  • 其实空调的自动模式 就是最简单的智能体,它只会 条件反射
  • Code Agent: Codex、Claude Code
  • 空调:
    • 感受(看)到什么就立刻做什么
  • Code Agent:
    • 会记状态、定目标、做权衡、甚至自我改进

帮我规划厦门之旅

  • 传统智能体:
    • 他的很多能力,靠工程师提前写规则、写模型、写效用函数
  • 今天:你丢一句「帮我规划厦门之旅」,助手自己拆任务、自己找工具、自己根据你的反馈改方案。
    • 规划:把大目标拆小。
    • 用工具:缺信息就去查,不硬编。
    • 动态修正:你改口,它改计划。

311. Agent:什么是智能体? 图表 11

流程:模糊大目标先拆成小任务;查信息时发现缺口就调工具;用户改口后把新约束加回去再重搜。这张图讲的是 LLM 智能体的三板斧:拆目标、用工具、动态修正。

落地时还要看见的几件事

快反应和慢规划,现实里通常要一起用

用两个极端场景:

  • 车子即将碰撞:必须毫秒级刹车。这时不能慢慢开会讨论。
  • 规划五天旅行:应该先想清楚再行动。这时不能只凭第一眼冲动。

311. Agent:什么是智能体? 图表 12

流程:左边是毫秒级快反应,右边是深思熟虑的慢规划,中间是常见现实:边想边做边看。不是二选一,而是按场景落在这个光谱上的不同位置。

它工作的世界,往往又吵又不全

订票场景

  • 部分可观察:一次查询看不到所有航司全部座位。
  • 随机性:你刚查完,票价下一秒就变了。
  • 还有别人:别人可能抢走最后一张特价票。
  • 动态变化:你还在思考,环境自己已经变了。

所以智能体必须会:

  • 记住自己查过什么。
  • 不够就再探一步。
  • 结果变了就重做决定。

311. Agent:什么是智能体? 图表 13

  • 流程:世界永远只看见一部分 → 先查一查 → 得到观察 → 继续决策;
  • 决策时环境又变了,于是重新回到「只看见一部分」。这是订票、抢票一类场景里智能体必须循环探索的原因。
    • 编程智能体,同理,也需要持续循环探索

两种合作方式:工具 vs 同事

1. 智能体当工具

  • 你还是主驾。
  • 它帮你补全代码、改 bug、搜资料。
  • 像副驾驶,不替你把方向盘彻底拿走。

例子:Copilot、Cursor、Claude Code。

2. 智能体当同事

  • 你给一个高层目标。
  • 它自己拆活、自己推进、中间可能找你确认。
  • 像把事情委托给一个项目成员。

例子:让一个 Agent 自己做研究报告,或让多个 Agent 扮演产品经理、工程师一起协作。

311. Agent:什么是智能体? 图表 14

流程:人可以走两条合作关系。当工具:人主导,AI 辅助补代码、查资料、改文档。当同事:人定目标,AI 自己规划推进到交付。差别在谁握方向盘。

最后

  1. 智能体是会办事的助手,不是只会聊天的窗口。
  2. 它的基本动作是:看、想、做、再看。
  3. 它靠工具接触真实世界,不靠凭空编。
  4. 固定流程稳但死;智能体活但更难控。
  5. 它会幻觉,也会空转,所以要有边界和停止条件。

311. Agent:什么是智能体? 图表 15

流程:先立住「什么是智能体」→ 落到看想做再看 → 强调用工具接触真实世界 → 和 Workflow 划清「奔着目标想办法」→ 最后收在能力与风险并存。

考一考

  • 超级计算机,算不算智能体?
    • 不感知环境通常不算
    • 强算力不等于会自主办事。
  • 高速公路上检测到障碍物、毫秒级决定刹车或变道的自动驾驶,算不算?
    • 算。而且偏快反应。
  • AlphaGo 评估当前局面并规划很多步,算不算?
    • 算。而且偏规划、也带学习。
  • 只会在对话框里安慰你、却从不查订单的“客服话术模型”,算不算完整智能体?
    • 更像聊天;一旦它能查订单、改状态、跟进行动,才更像智能体。