先说结论
这里的“三代”只是为了让我自己容易理解和复述,不是行业统一的正式分代。三种方法今天仍然都在使用。
这篇只需要记住三句话:
- ① 第一代:人先把规矩写好,机器照着做。
- ② 第二代:人给数据和反馈,让机器自己练。
- ③ 第三代:大模型先听懂人话,再接上工具去做事。
第一代:人先把规矩写好,机器照着做
早期 AI 可以直接理解成一个很大的 if / else 系统。
人先把自己知道的知识、判断和办事步骤,一条一条写成规则;机器负责找到符合当前情况的规则,然后照着执行。
- 知识库:保存专家写下来的事实和规则。
- 推理机:根据输入匹配规则,推出结论。
比如医生把“出现哪些症状时,可能是什么病”写进知识库,系统再根据病人的情况去匹配。系统不是自己学会了看病,而是快速执行了人提前写好的判断。
- 优点:稳定、可解释
- 缺点:现实世界里的说法、状态和例外太多,人不可能全部写完。规则之外的情况一出现,系统就容易卡住或做错。
第一代的核心:人会什么,就得先明明白白地写给机器。
这种方法今天仍然有用。比如 skill 里步骤固定、结果可以明确验证的 script,本来就应该用普通代码实现,不需要为了“智能”强行交给模型判断。
再者,一个关键的问题是,人类的知识不可能完完全全能通过文本来表达出来
第二代:人给数据和反馈,让机器自己练
既然人写不完所有规则,那就换一种办法:不再把每一条判断都写进代码,而是给机器大量数据、练习机会和结果反馈,让它自己找到规律。
可以把它理解成两种“练法”:
- 给它看大量例子:
- 比如看很多标好答案的图片,慢慢学会识别图片里有什么。
- 让它反复尝试:
- 比如下棋时不断落子,再根据输赢调整下一次的选择。这就是强化学习最直白的理解。
AlphaGo 是这一代很好的代表。它通过棋谱和自我对弈学会判断局面和选择落子,能把围棋这一件事做得非常强。
但离开围棋,它并不能听懂我随口说的一个新任务,更不能直接换去写文章、查资料或修代码。
第二代的核心:不用人把每条规则都写出来,但机器通常只是把训练过的那一件事做得很强。
第三代:大模型先听懂人话,再接上工具去做事
第二代的模型更像专项选手:一个模型练一项任务。大语言模型的变化,是它先从海量文字中学会了语言、知识和很多任务里的共同规律。
人终于可以直接用自然语言告诉模型想做什么。同一个模型可以回答问题、总结文章、解释代码,也可以根据当前情况判断下一步。
这里的“通用”不是说它什么都会,而是相比以前“一个模型只练一项任务”,它能通过语言处理更多不同的任务。ChatGPT 代表了“模型开始能和人自然对话”的转折,但只会对话还不等于会自己把事办完。
因为 LLM 单独运行时,主要还是在生成文字,或者生成一个 Tool Call。Tool Call 只是“我想调用这个工具”,不代表工具已经真的执行。
要让它真正做事,还得把模型放进 Runtime / Harness,给它接上 Context、状态和工具:
先看系统组成
再看一轮怎样运行
这就是最小 Agent Loop:
- 读取目标和当前情况。
- 决定下一步。
- 调用工具执行。
- 读取真实结果。
- 没完成就继续,完成了才停止。
先记住:
Agent = Model + Context + Tools + Runtime / Harness。
生产系统还要补上:
State + 权限 + 错误处理 + Trace + Eval + 人工兜底。
第三代的核心:LLM 负责听懂目标和现场判断,工具负责真正动手,Runtime / Harness 负责让整个过程继续跑下去,并在事情完成时停下。
用代表系统记住这段历史
不用先背流派和年份
ELIZA:说得像,不等于真的理解
ELIZA 根据关键词和句式模板生成回答。它没有理解人的意思,却能让人产生“它懂我”的感觉。
记忆点:
输出像人,只能证明它生成得像人。
今天看 Agent 也一样。模型说“完成了”,不等于真实环境已经改变。
MYCIN:把专家经验写进规则
MYCIN 把医学专家的经验写成规则,再根据病人的情况给出诊断和用药建议。
记忆点:
规则可以在狭窄领域做得很好,但知识要靠人一条条写进去。
Deep Blue:把搜索空间算得足够深
1997 年,IBM Deep Blue 以 3.5 : 2.5 战胜国际象棋世界冠军 Garry Kasparov。
它的核心是专用算力、大规模搜索、棋局评估函数和人类提供的国际象棋知识。IBM 记录它每秒可以评估约 2 亿个棋局位置。
记忆点:
Deep Blue 主要证明了:规则明确时,强大搜索和算力可以超过顶尖人类。
AlphaGo:从数据和对弈中学会怎样搜索
INFO
强烈推荐这期播客: 播客:🎯亲历AlphaGo奇点后,我成了"人奸"
2016 年,AlphaGo 以 4 : 1 战胜围棋冠军李世石。
围棋的搜索空间远大于国际象棋,不能只靠把所有可能性算一遍。AlphaGo 用神经网络判断哪些落子更值得尝试、当前局面谁更可能获胜,再结合蒙特卡洛树搜索和强化学习做决策。
记忆点:
AlphaGo 不只算得快,它还学会了把算力用在哪里。
Deep Blue 和 AlphaGo 最容易混,可以这样记:
| 系统 | 代表方法 | 战胜谁 | 我应该记住什么 |
|---|---|---|---|
| Deep Blue | 大规模搜索 + 评估函数 + 专用算力 | 1997 年,卡斯帕罗夫 | 在规则明确的封闭世界里搜索得更深 |
| AlphaGo | 神经网络 + 树搜索 + 强化学习 | 2016 年,李世石 | 从数据和对弈中学习怎样判断与搜索 |
ChatGPT:通用语言能力进入产品
2022 年发布的 ChatGPT,让普通人可以直接用自然语言与 LLM 连续对话。
它把 AI 从“针对一个问题训练一个系统”,推进到“一个模型可以处理很多语言任务”。但只会对话的 ChatGPT,仍然不等于会在真实环境里办事的 Agent。
Auto-GPT:早期 LLM Agent 原型
Auto-GPT 把 LLM、目标拆解、工具和循环放在一起,展示了模型自主推进多步任务的可能。
它也暴露了早期 Agent 的典型问题:容易跑偏、重复循环、成本失控,并且会把“生成了答案”误当成“完成了任务”。
Codex / Claude Code:Agent 进入真实工程环境
Codex、Claude Code 这类 Coding Agent 不只生成代码。它们可以读取项目、修改文件、运行命令和测试,再把真实结果放回下一轮 Context。
记忆点:
现代 Agent 的进步,不只是模型更聪明,而是模型终于被放进了一个有工具、环境、权限和验收的运行系统。
今天的 Agent 是混合系统
真正能工作的 Agent,会把不同问题交给不同部分:
- LLM:处理模糊语言和开放问题。
- Workflow / 代码:处理能够提前确定的步骤和规则。
- Runtime / Harness:管理 Context、State、循环、重试和停止。
- Tools:读取或改变真实环境。
- 权限与 Eval:限制动作并验收结果。
最重要的判断是:
固定步骤优先用 Workflow;只有下一步必须根据现场结果决定时,才值得使用 Agent。
Agent 更灵活,也更不稳定、更贵、更难排错。它不是默认比 Workflow 高级。
L1-L5:Copilot 到 Agent:谁在推动任务
我在 2024 年用过一套个人记忆法:
Tool → Chatbot → Copilot → Agent → AGI
它可以帮助理解自动化程度,但 L1、L2、L3、L4、L5 不是行业统一标准,不要把它当正式分级。
- Copilot:人一直握着方向盘。
- Agent:人给目标、资源和边界,系统根据结果自主推进一部分步骤。
- AGI:关于通用智能能力的长期目标
多 Agent 不是必然的下一代
多 Agent 是架构选择,不是能力等级。
用自己的话来回答:智能体是怎样发展到今天的?
- 第一代:就像让机器照说明书办事。
- 人先把自己知道的知识和规矩一条条写好,机器照着做。
- 好处:是稳定、出错了也容易查;
- 问题:是现实世界的情况太多,说明书永远写不完。
- 第二代:不再什么都手把手教。
- 人给机器看很多例子,让它反复练,做对了或做错了都给反馈。
- 优点:
- 它可以把一件事练得特别强,比如下围棋,2016 年的 AlphaGo。
- 缺点:
- 但换一件事,通常又得重新练。
- 第三代:先有了能听懂人话的大模型。
- 我可以直接用自然语言告诉它想做什么,并且大模型本身它也能听得懂自然语言。
- 它再根据眼前的情况决定下一步。
- 但光会想和说还不够,还得给它接上真正能干活的工具,让它做一步、看一眼结果、再决定下一步,直到完成或者需要停下。
用一句话概括:第一代照说明书办事,第二代自己练成专项选手,第三代听懂任务后使用工具,边做边看结果。
考考你
智能体为什么会从规则系统发展到 LLM Agent?
- 人手写规则时,现实世界里的情况和例外太多,写不完。
- 机器学习改成从数据和反馈中学,但早期学习型智能体通常只擅长训练过的专门任务。
- LLM 让模型可以通过自然语言理解更多不同的任务,Tools 负责动手,Runtime / Harness 负责把判断、执行和结果连成循环。
LLM 为什么不等于 Agent?
- LLM 负责理解、判断和生成;Agent 还需要 Context、Tools、State 和循环。Tool Call 也不代表已经执行或完成。
Workflow 和 Agent 应该怎样选择?
- 步骤能提前确定就用 Workflow;下一步必须根据环境结果动态决定时才用 Agent。没有工具、停止条件和验收标准时,先不要做 Agent。
Copilot 和 Agent 的核心区别是什么?
- Copilot 主要由人推动每一步;
- Agent 接收目标后,可以根据行动结果自主推进多轮。两者不是行业统一的 L3、L4 职级。
多 Agent 为什么不一定比单 Agent 更好?
- 任务不能独立拆分时,多 Agent 不会增加有效能力,只会增加通信、状态同步、成本和排错难度。
Deep Blue 和 AlphaGo 的核心区别是什么?
- Deep Blue 主要靠搜索、评估函数和专用算力;
- AlphaGo 用神经网络和强化学习学会判断哪些方向更值得搜索。
ChatGPT 和 Coding Agent 的核心区别是什么?
- ChatGPT 代表 LLM 的通用语言和对话能力;Coding Agent 还把模型接入项目、文件、终端、测试、权限和执行循环。
参考
- AgentX:什么是智能体(篇一:概念篇)
- AgentX:什么是智能体(篇二:案例篇)
- Hello-Agents:第二章 智能体发展史
- Hello-Agents:Extra01 面试问题总结,Agent 部分。
- 2026-07-22 的 AI Agent 开发工程师岗位画像:100 个有效岗位的职责、技能和面试重点。
- Agent 的进化之路:2024 年的个人版本
- IBM:Deep Blue
- Google DeepMind:AlphaGo 对战李世石
- OpenAI:Introducing ChatGPT
- Auto-GPT
- OpenAI:Introducing Codex
- Anthropic:Claude 4 与 Claude Code