这个领域研究什么
Agent 开发研究的是:如何让大语言模型(LLM)不止"回答一次",而是持续地感知、决策、调用工具、观察结果、修正行为,直到完成一个完整目标。一次问答是函数调用;一个 Agent 是while 循环。
while not goal_reached:
think # 推理:我现在在哪,下一步做什么
act # 行动:调工具 / 写代码 / 搜索
observe # 观察:工具返回了什么,世界变成什么样
这三行伪代码就是全领域的骨架。其余一切——工具设计、记忆、规划、多 Agent、评测、安全——都是围绕这个循环的工程化。
领域边界
本知识库聚焦 2026 年主流的 LLM Agent 开发,具体包括:
- 输入:具备函数调用能力的 LLM(GPT、Claude、Gemini、GLM、DeepSeek、Qwen 等)
- 核心:Agent 循环、工具使用(Tool Use / MCP)、规划、记忆、RAG、代码执行
- 工程:框架(LangGraph、OpenAI Agents SDK、Claude Agent SDK)、评测、可观测性、安全、成本
- 前沿:编程 Agent、Computer Use、Deep Research、Agent 训练(RL)、A2A 互操作
不在范围内(只在历史与延伸中提及):强化学习经典 Agent(Q-learning 等符号/值函数方法,见 kp-008)、具身机器人控制(另一个项目 embodied-ai 已覆盖)、多智能体仿真社会学。
核心问题(这个领域的五个终极追问)
- 能力问题:什么样的任务分解与推理结构,能让 LLM 稳定完成长链路任务?
- 接口问题:如何设计工具与协议(MCP),让模型"看得懂、用得对、错了能修"?
- 记忆问题:上下文窗口有限,Agent 如何在几百轮交互后仍然"记得自己是谁、在干什么"?
- 可靠性问题:Agent 会犯错——如何评测、监控、兜底,让它达到生产级可用?
- 安全问题:一个能读网页、执行代码、发邮件的程序,如何防止被提示注入劫持?
学习产出目标
完成本知识库后,你应当能够:
- 手写一个约 100 行的最小可用 Agent(kp-017),不依赖任何框架
- 为真实业务设计工具 schema 与 MCP 服务(kp-010、kp-011)
- 诊断"Agent 跑偏"的常见病因:上下文腐烂、工具误用、规划坍缩(kp-022)
- 为 Agent 建立评测集与追踪体系(kp-024、kp-025)
- 读懂 Claude Code、Deep Research 这类顶级 Agent 的架构设计(kp-028、kp-030)
模块地图
| 模块 | 篇数 | 回答的问题 |
|---|---|---|
| 01 基础 | 8 | Agent 是什么?和 Chatbot/Workflow 有何不同?LLM 的哪些特性使它成为可能? |
| 02 核心 | 12 | Agent 循环的四大支柱——工具、推理、记忆、检索——如何工作? |
| 03 进阶 | 7 | 框架怎么选?如何评测、监控、加固、降本,把它做成产品? |
| 04 前沿与实践 | 5 | 顶级 Agent(编程/操控 GUI/深度研究)怎么造?训练路线与未来在哪? |
给自学者的三句话
- 先手写再上框架:框架(LangGraph 等)封装的正是 kp-017 那个循环,顺序不能反。
- 上下文是第一性资源:Agent 工程师一半的工作是管理"模型每一步能看到什么"(上下文工程)。
- 没有评测就没有 Agent:demo 靠运气,产品靠 evals——这是 2024-2026 年行业最大共识。