Agent 开发学习站
Agent 开发›总览›入门

领域总览:Agent 开发

入门总览

这个领域研究什么

Agent 开发研究的是:如何让大语言模型(LLM)不止"回答一次",而是持续地感知、决策、调用工具、观察结果、修正行为,直到完成一个完整目标。一次问答是函数调用;一个 Agent 是while 循环。

while not goal_reached:
    think      # 推理:我现在在哪,下一步做什么
    act        # 行动:调工具 / 写代码 / 搜索
    observe    # 观察:工具返回了什么,世界变成什么样

这三行伪代码就是全领域的骨架。其余一切——工具设计、记忆、规划、多 Agent、评测、安全——都是围绕这个循环的工程化。

领域边界

本知识库聚焦 2026 年主流的 LLM Agent 开发,具体包括:

  • 输入:具备函数调用能力的 LLM(GPT、Claude、Gemini、GLM、DeepSeek、Qwen 等)
  • 核心:Agent 循环、工具使用(Tool Use / MCP)、规划、记忆、RAG、代码执行
  • 工程:框架(LangGraph、OpenAI Agents SDK、Claude Agent SDK)、评测、可观测性、安全、成本
  • 前沿:编程 Agent、Computer Use、Deep Research、Agent 训练(RL)、A2A 互操作

不在范围内(只在历史与延伸中提及):强化学习经典 Agent(Q-learning 等符号/值函数方法,见 kp-008)、具身机器人控制(另一个项目 embodied-ai 已覆盖)、多智能体仿真社会学。

核心问题(这个领域的五个终极追问)

  1. 能力问题:什么样的任务分解与推理结构,能让 LLM 稳定完成长链路任务?
  2. 接口问题:如何设计工具与协议(MCP),让模型"看得懂、用得对、错了能修"?
  3. 记忆问题:上下文窗口有限,Agent 如何在几百轮交互后仍然"记得自己是谁、在干什么"?
  4. 可靠性问题:Agent 会犯错——如何评测、监控、兜底,让它达到生产级可用?
  5. 安全问题:一个能读网页、执行代码、发邮件的程序,如何防止被提示注入劫持?

学习产出目标

完成本知识库后,你应当能够:

  • 手写一个约 100 行的最小可用 Agent(kp-017),不依赖任何框架
  • 为真实业务设计工具 schema 与 MCP 服务(kp-010、kp-011)
  • 诊断"Agent 跑偏"的常见病因:上下文腐烂、工具误用、规划坍缩(kp-022)
  • 为 Agent 建立评测集与追踪体系(kp-024、kp-025)
  • 读懂 Claude Code、Deep Research 这类顶级 Agent 的架构设计(kp-028、kp-030)

模块地图

模块篇数回答的问题
01 基础8Agent 是什么?和 Chatbot/Workflow 有何不同?LLM 的哪些特性使它成为可能?
02 核心12Agent 循环的四大支柱——工具、推理、记忆、检索——如何工作?
03 进阶7框架怎么选?如何评测、监控、加固、降本,把它做成产品?
04 前沿与实践5顶级 Agent(编程/操控 GUI/深度研究)怎么造?训练路线与未来在哪?

给自学者的三句话

  1. 先手写再上框架:框架(LangGraph 等)封装的正是 kp-017 那个循环,顺序不能反。
  2. 上下文是第一性资源:Agent 工程师一半的工作是管理"模型每一步能看到什么"(上下文工程)。
  3. 没有评测就没有 Agent:demo 靠运气,产品靠 evals——这是 2024-2026 年行业最大共识。