一句话定义
Agent 不是 2023 年的发明:从 1960 年代符号主义的"微世界"Agent,到 1990 年代 BDI 理性 Agent,再到 2022 年后以 LLM 为大脑的第三次浪潮——前两浪留下的"感知-规划-行动"框架,正是今天 LLM Agent 直接继承的骨架。
为什么重要
知道来路才能看清去路。三个实际问题会因此有答案:为什么今天这波 Agent 与 2016 年那波"对话式 AI"不同?为什么强化学习出身的团队(OpenAI/Anthropic/DeepMind)做 Agent 有先天优势?"Agent 泡沫"的论据与反论据各是什么?历史也是术语疫苗——ReAct、ToT、Generative Agents 这些词都锚定在具体论文上。
前置知识
kp-001 的经典 Agent 定义。
核心概念:三次浪潮
浪潮一:符号主义 Agent(1956-1990s)
- 1956 达特茅斯会议:AI 得名;早期程序已能规划(Logic Theorist 证明定理)
- SHRDLU(1970):在"积木世界"里听懂指令并执行——受限环境的 Agent 已可工作,但换个世界就失效:知识靠人写,无法规模化
- 1970s-80s 专家系统:MYCIN 诊血感染,规则库上千条——再次证明手写知识的天花板与脆弱性
浪潮二:理性 Agent 与机器学习 Agent(1990s-2015)
- BDI 模型(Belief-Desire-Intention,1990s):Agent = 信念+愿望+意图的理性架构,至今影响多 Agent 规范(FIPA)
- 强化学习成熟(2013-2017):DQN 玩 Atari、AlphaGo(2016)击败李世石——"感知状态→选择动作→环境反馈"的闭环被完美示范,但每个任务都要专门训练,策略不可迁移
- 2017 Transformer:浪潮三的引擎点火
浪潮三:LLM Agent(2020s-)
按时间线走一遍关键节点:
| 年份 | 事件 | 意义 |
|---|---|---|
| 2020 | GPT-3 少样本学习 | 通用语言能力即插即用 |
| 2022.6 | ChatGPT | 对话即产品,全民认知拐点 |
| 2022.10 | ReAct(Yao et al.) | 推理+行动交织,今日 Agent 循环的原型(kp-012) |
| 2023.3 | Toolformer / 函数调用 API | 模型学会"何时调用什么工具" |
| 2023 | AutoGPT 爆红又冷却 | 第一波"自主 Agent"热:愿景超前于可靠性 |
| 2023.4 | Generative Agents(Stanford 小镇) | 25 个 LLM 角色形成涌现社会行为(记忆/反思架构的源头之一) |
| 2023.10 | AutoGen / MetaGPT 等多 Agent 框架 | 多 Agent 协作研究热潮 |
| 2024 | Anthropic MCP 发布 | 工具接入从"每应用单独集成"走向开放协议(kp-011) |
| 2024-25 | Claude Code / Cursor / OpenHands;SWE-bench 分数飙升 | 编程 Agent 成第一个杀手级场景(kp-028) |
| 2025 | Computer Use、Deep Research 类产品 | Agent 通用操作界面(kp-029/030) |
| 2025-26 | Agent RL 训练成为主流方向 | 从"提示工程造 Agent"到"训练模型本身会当 Agent"(kp-031) |
原理与机制:为什么第三次浪潮成了
前两浪各自卡死的原因,恰好被 LLM 同时解开:
- 知识获取:符号 Agent 靠人写规则(不可扩展)→ LLM 从海量语料预训练,知识与语言能力免费附赠
- 泛化:RL Agent 一个任务训一个策略 → LLM 零样本跨任务,工具调用也是通用能力(一次后训练,处处可用)
- 接口:以往 Agent 要为每个环境定制感知/动作编码 → LLM 的输入输出就是自然语言 + 结构化文本,人类世界的基础设施(文档、网页、API 文档)直接就是它的接口
但旧问题换了个形式全部还在:知识不能更新(→工具/RAG)、会自信地犯错(→幻觉)、不可复现(→采样)。历史没有终结,只是换了战场——这正是 kp-010~027 全部工程话题的由来。
直观类比
三次浪潮像三代工人:第一代背下全厂设备手册(手写知识),换台设备就懵;第二代在模拟器里苦练成某个工位的世界冠军(RL),调去隔壁工位从零再练;第三代(LLM)读完了互联网这个"人类操作总手册",上岗第一天就能看懂任何工位的说明书,但偶尔凭印象瞎编参数——所以工厂给它配了仪表盘(工具)与质检员(评测)。
实例与案例
AutoGPT 的兴衰是最有教育意义的案例:2023 年 3 月开源即登顶 GitHub,愿景是"给目标自己跑"的完全自主 Agent;数月后热度崩塌——用户发现它循环打转、烧 API 费、任务完成率低。它输在可靠性而非愿景:当时的模型函数调用不稳、上下文管理粗糙、没有评测兜底。2024-25 年 Claude Code 等产品成功,用的其实是同一个愿景——差别在模型能力(工具调用可靠)+ 工程成熟(上下文管理、权限、评测)到位。教训:愿景可以超前,产品不能。
常见误区
- 误区一:"Agent 是 ChatGPT 之后才有的概念"。感知-行动循环来自六十年积累,BDI 等思想仍在多 Agent 设计里。
- 误区二:"AutoGPT 失败证明自主 Agent 是伪需求"。它证明的是"可靠性必须先于自主性",这正是后来产品化的路径。
- 误区三:把 2023 年的多 Agent 框架热当成终局。2025 后趋势反而是"少 Agent、强单体 + 子任务隔离"(kp-019)。
自测题
- 前两次浪潮分别卡在哪里?LLM 如何同时解开?
- ReAct(2022)贡献了什么思想?
- AutoGPT 与 Claude Code 愿景相似,成败差异的根因是什么?
(参考答案:1. 知识手写不可扩展 / 策略不迁移;LLM 预训练带来通用知识与零样本泛化,语言即接口;2. 推理与行动交替进行、用观察修正推理的循环模式;3. 模型工具调用可靠性与工程成熟度——可靠性先于自主性。)
与其他知识点的关系
- ReAct 细节 → kp-012;训练浪潮 → kp-031;未来争论 → kp-032
- Generative Agents 的记忆/反思 → kp-014/015
延伸阅读
- Yao et al., ReAct: Synergizing Reasoning and Acting in Language Models(2022)
- Park et al., Generative Agents: Interactive Simulacra of Human Behavior(2023)
- Anthropic, Model Context Protocol 公告(2024.11)