312. AgentX:智能体发展史

2026.07.22

·教程agentx

先说结论

这里的“三代”只是为了让我自己容易理解和复述,不是行业统一的正式分代。三种方法今天仍然都在使用。

这篇只需要记住三句话:

  • ① 第一代:人先把规矩写好,机器照着做。
  • ② 第二代:人给数据和反馈,让机器自己练。
  • ③ 第三代:大模型先听懂人话,再接上工具去做事。

312. AgentX:智能体发展史 图表 1

第一代:人先把规矩写好,机器照着做

早期 AI 可以直接理解成一个很大的 if / else 系统。

人先把自己知道的知识、判断和办事步骤,一条一条写成规则;机器负责找到符合当前情况的规则,然后照着执行。

312. AgentX:智能体发展史 图表 2

  • 知识库:保存专家写下来的事实和规则。
  • 推理机:根据输入匹配规则,推出结论。

比如医生把“出现哪些症状时,可能是什么病”写进知识库,系统再根据病人的情况去匹配。系统不是自己学会了看病,而是快速执行了人提前写好的判断。

  • 优点:稳定、可解释
  • 缺点:现实世界里的说法、状态和例外太多,人不可能全部写完。规则之外的情况一出现,系统就容易卡住或做错。

第一代的核心:人会什么,就得先明明白白地写给机器。

这种方法今天仍然有用。比如 skill 里步骤固定、结果可以明确验证的 script,本来就应该用普通代码实现,不需要为了“智能”强行交给模型判断。
再者,一个关键的问题是,人类的知识不可能完完全全能通过文本来表达出来

第二代:人给数据和反馈,让机器自己练

既然人写不完所有规则,那就换一种办法:不再把每一条判断都写进代码,而是给机器大量数据、练习机会和结果反馈,让它自己找到规律

可以把它理解成两种“练法”:

  • 给它看大量例子
    • 比如看很多标好答案的图片,慢慢学会识别图片里有什么。
  • 让它反复尝试
    • 比如下棋时不断落子,再根据输赢调整下一次的选择。这就是强化学习最直白的理解。

312. AgentX:智能体发展史 图表 3

AlphaGo 是这一代很好的代表。它通过棋谱和自我对弈学会判断局面和选择落子,能把围棋这一件事做得非常强。

但离开围棋,它并不能听懂我随口说的一个新任务,更不能直接换去写文章、查资料或修代码。

第二代的核心:不用人把每条规则都写出来,但机器通常只是把训练过的那一件事做得很强。

第三代:大模型先听懂人话,再接上工具去做事

第二代的模型更像专项选手:一个模型练一项任务。大语言模型的变化,是它先从海量文字中学会了语言、知识和很多任务里的共同规律

人终于可以直接用自然语言告诉模型想做什么。同一个模型可以回答问题、总结文章、解释代码,也可以根据当前情况判断下一步。

这里的“通用”不是说它什么都会,而是相比以前“一个模型只练一项任务”,它能通过语言处理更多不同的任务。ChatGPT 代表了“模型开始能和人自然对话”的转折,但只会对话还不等于会自己把事办完。

因为 LLM 单独运行时,主要还是在生成文字,或者生成一个 Tool Call。Tool Call 只是“我想调用这个工具”,不代表工具已经真的执行。

要让它真正做事,还得把模型放进 Runtime / Harness,给它接上 Context、状态和工具:

先看系统组成

312. AgentX:智能体发展史 图表 4

再看一轮怎样运行

312. AgentX:智能体发展史 图表 5

这就是最小 Agent Loop:

  1. 读取目标和当前情况。
  2. 决定下一步。
  3. 调用工具执行。
  4. 读取真实结果。
  5. 没完成就继续,完成了才停止。

先记住:

Agent = Model + Context + Tools + Runtime / Harness。

生产系统还要补上:

State + 权限 + 错误处理 + Trace + Eval + 人工兜底。

第三代的核心:LLM 负责听懂目标和现场判断,工具负责真正动手,Runtime / Harness 负责让整个过程继续跑下去,并在事情完成时停下。

代表系统记住这段历史

不用先背流派和年份

312. AgentX:智能体发展史 图表 6

ELIZA:说得像,不等于真的理解

ELIZA 根据关键词和句式模板生成回答。它没有理解人的意思,却能让人产生“它懂我”的感觉。

记忆点:

输出像人,只能证明它生成得像人。

今天看 Agent 也一样。模型说“完成了”,不等于真实环境已经改变。

MYCIN:把专家经验写进规则

MYCIN 把医学专家的经验写成规则,再根据病人的情况给出诊断和用药建议。

记忆点:

规则可以在狭窄领域做得很好,但知识要靠人一条条写进去。

Deep Blue:把搜索空间算得足够深

1997 年,IBM Deep Blue 以 3.5 : 2.5 战胜国际象棋世界冠军 Garry Kasparov。

它的核心是专用算力、大规模搜索、棋局评估函数和人类提供的国际象棋知识。IBM 记录它每秒可以评估约 2 亿个棋局位置。

记忆点:

Deep Blue 主要证明了:规则明确时,强大搜索和算力可以超过顶尖人类。

AlphaGo:从数据和对弈中学会怎样搜索

2016 年,AlphaGo 以 4 : 1 战胜围棋冠军李世石。

围棋的搜索空间远大于国际象棋,不能只靠把所有可能性算一遍。AlphaGo 用神经网络判断哪些落子更值得尝试、当前局面谁更可能获胜,再结合蒙特卡洛树搜索和强化学习做决策。

记忆点:

AlphaGo 不只算得快,它还学会了把算力用在哪里。

Deep Blue 和 AlphaGo 最容易混,可以这样记:

系统代表方法战胜谁我应该记住什么
Deep Blue大规模搜索 + 评估函数 + 专用算力1997 年,卡斯帕罗夫在规则明确的封闭世界里搜索得更深
AlphaGo神经网络 + 树搜索 + 强化学习2016 年,李世石从数据和对弈中学习怎样判断与搜索

ChatGPT:通用语言能力进入产品

2022 年发布的 ChatGPT,让普通人可以直接用自然语言与 LLM 连续对话。

它把 AI 从“针对一个问题训练一个系统”,推进到“一个模型可以处理很多语言任务”。但只会对话的 ChatGPT,仍然不等于会在真实环境里办事的 Agent。

Auto-GPT:早期 LLM Agent 原型

Auto-GPT 把 LLM、目标拆解、工具和循环放在一起,展示了模型自主推进多步任务的可能。

它也暴露了早期 Agent 的典型问题:容易跑偏、重复循环、成本失控,并且会把“生成了答案”误当成“完成了任务”。

Codex / Claude Code:Agent 进入真实工程环境

Codex、Claude Code 这类 Coding Agent 不只生成代码。它们可以读取项目、修改文件、运行命令和测试,再把真实结果放回下一轮 Context。

记忆点:

现代 Agent 的进步,不只是模型更聪明,而是模型终于被放进了一个有工具、环境、权限和验收的运行系统。

今天的 Agent 是混合系统

真正能工作的 Agent,会把不同问题交给不同部分:

312. AgentX:智能体发展史 图表 7

  • LLM:处理模糊语言和开放问题。
  • Workflow / 代码:处理能够提前确定的步骤和规则。
  • Runtime / Harness:管理 Context、State、循环、重试和停止。
  • Tools:读取或改变真实环境。
  • 权限与 Eval:限制动作并验收结果。

最重要的判断是:

固定步骤优先用 Workflow;只有下一步必须根据现场结果决定时,才值得使用 Agent。
Agent 更灵活,也更不稳定、更贵、更难排错。它不是默认比 Workflow 高级。

L1-L5:Copilot 到 Agent:谁在推动任务

我在 2024 年用过一套个人记忆法:

text
Tool → Chatbot → Copilot → Agent → AGI

20260510122352049.webp|936

它可以帮助理解自动化程度,但 L1、L2、L3、L4、L5 不是行业统一标准,不要把它当正式分级。

312. AgentX:智能体发展史 图表 8

  • Copilot:人一直握着方向盘。
  • Agent:人给目标、资源和边界,系统根据结果自主推进一部分步骤。
  • AGI:关于通用智能能力的长期目标

多 Agent 不是必然的下一代

312. AgentX:智能体发展史 图表 9

多 Agent 是架构选择,不是能力等级。

用自己的话来回答:智能体是怎样发展到今天的?

  • 第一代:就像让机器照说明书办事。
    • 人先把自己知道的知识和规矩一条条写好,机器照着做。
    • 好处:是稳定、出错了也容易查;
    • 问题:是现实世界的情况太多,说明书永远写不完。
  • 第二代:不再什么都手把手教。
    • 人给机器看很多例子,让它反复练,做对了或做错了都给反馈。
    • 优点:
      • 它可以把一件事练得特别强,比如下围棋,2016 年的 AlphaGo。
    • 缺点:
      • 但换一件事,通常又得重新练。
  • 第三代:先有了能听懂人话的大模型。
    • 我可以直接用自然语言告诉它想做什么,并且大模型本身它也能听得懂自然语言。
    • 它再根据眼前的情况决定下一步。
    • 但光会想和说还不够,还得给它接上真正能干活的工具,让它做一步、看一眼结果、再决定下一步,直到完成或者需要停下。

用一句话概括:第一代照说明书办事,第二代自己练成专项选手,第三代听懂任务后使用工具,边做边看结果。

考考你

智能体为什么会从规则系统发展到 LLM Agent?

  • 人手写规则时,现实世界里的情况和例外太多,写不完。
  • 机器学习改成从数据和反馈中学,但早期学习型智能体通常只擅长训练过的专门任务。
  • LLM 让模型可以通过自然语言理解更多不同的任务,Tools 负责动手,Runtime / Harness 负责把判断、执行和结果连成循环。

LLM 为什么不等于 Agent?

  • LLM 负责理解、判断和生成;Agent 还需要 Context、Tools、State 和循环。Tool Call 也不代表已经执行或完成。

Workflow 和 Agent 应该怎样选择?

  • 步骤能提前确定就用 Workflow;下一步必须根据环境结果动态决定时才用 Agent。没有工具、停止条件和验收标准时,先不要做 Agent。

Copilot 和 Agent 的核心区别是什么?

  • Copilot 主要由人推动每一步;
  • Agent 接收目标后,可以根据行动结果自主推进多轮。两者不是行业统一的 L3、L4 职级。

多 Agent 为什么不一定比单 Agent 更好?

  • 任务不能独立拆分时,多 Agent 不会增加有效能力,只会增加通信、状态同步、成本和排错难度。

Deep Blue 和 AlphaGo 的核心区别是什么?

  • Deep Blue 主要靠搜索、评估函数和专用算力;
  • AlphaGo 用神经网络和强化学习学会判断哪些方向更值得搜索。

ChatGPT 和 Coding Agent 的核心区别是什么?

  • ChatGPT 代表 LLM 的通用语言和对话能力;Coding Agent 还把模型接入项目、文件、终端、测试、权限和执行循环。

参考