Agent 开发学习站
Agent 开发›基础›入门

什么是 AI Agent

入门基础

一句话定义

Agent 是一个以 LLM 为大脑、能自主决定"下一步做什么"、通过调用工具作用于外部世界、并根据反馈迭代行动直到达成目标的软件系统。

为什么重要

"Agent"是 2024-2026 年 AI 行业的核心叙事,但它也是最被滥用的词——加了轮次的聊天机器人、按固定流程调用模型的流水线、甚至一个带按钮的对话框都自称 Agent。分不清定义,你就无法判断:什么任务该用 Agent 做、什么任务用 Workflow 更稳、市面上的"Agent 产品"到底含金量多少。定义是这个领域的第一块地基。

前置知识

无硬性前置。知道 LLM 能对话即可,更深机制见 kp-002。

核心概念

判断一个系统是不是 Agent,看四个要件:

  1. 目标(Goal):用户给一个结果而非一组步骤。"帮我把这批订单里的差价算出来",而不是"先打开 A,再复制 B"。
  2. 自主决策(Autonomy):模型自己决定下一步调用哪个工具、传什么参数、要不要重来。这是 Agent 与 Workflow 的分水岭——流程的控制权在模型手里,还是在代码里。
  3. 工具(Tools):Agent 的手脚——搜索、读文件、执行代码、调 API。没有工具的 LLM 只能说话,不能改变世界。
  4. 循环与反馈(Loop & Feedback):行动之后观察结果,结果影响下一步决策。一次问答没有反馈回路,不构成 Agent。
        ┌──────────── 反馈 ────────────┐
        │                              │
  目标 → 思考 → 选择工具 → 执行 → 观察结果 → … → 达成目标 / 触发兜底
        │                              │
        └──── 未达成则继续循环 ─────────┘

原理与机制

在 AI 教科书(Russell & Norvig)里,Agent 的定义更普适:通过传感器感知环境、通过执行器作用于环境的任何实体,用理性(rationality)衡量——即在给定感知序列下选择期望效用最大化的行动。扫地机器人、下棋程序、恒温器都是 Agent。

LLM Agent 是这个经典框架的新实例,特殊之处在于:它的"策略"不是人手写的规则,而是从海量数据中学来的语言模型,并且策略以自然语言表达("我应该先搜索再总结"),使它拥有了跨任务的通用性——这是符号主义 Agent 六十年没能做到的(见 kp-008)。

形式化一点:Agent 在每一步 t 接收观察 o_t(用户消息 + 工具返回),输出行动 a_t(文本回复或工具调用),环境执行 a_t 返回 o_t+1。Agent 的全部工程,就是设计这个交互协议与它的护栏。

直观类比

  • Chatbot 是百科全书:你问它答,合上书世界没有任何变化。
  • Workflow 是火车:轨道(流程图)铺好了,按站停,高效但不会改道。
  • Agent 是雇来的实习生:你给目标("把这周的报销整理好"),他自己决定先收邮件还是先对账单,遇到问题(发票缺一张)会来问你,做完汇报。他会犯错,所以要给权限边界和检查点——这正是 kp-023 人机协同要做的事。

实例与案例

同一需求"每周一汇总竞品价格变动并发邮件"的三种实现:

方案做法控制权适合
脚本定时爬虫 + 规则比对 + 邮件全在代码竞品与格式永远不变
WorkflowLLM 做每步的"理解/摘要",流程由代码编排在代码步骤固定、要可预测
Agent给 LLM 工具(浏览、读表、发邮件)与目标在模型竞品会增减、格式会漂移、需要临场判断

注意行业共识(Anthropic 2024):能用 Workflow 解决就不要用 Agent——Agent 的灵活性以可预测性、成本、延迟为代价。

常见误区

  • 误区一:"Agent = 带记忆的聊天机器人"。记忆只是要件之一;没有工具与循环的自主决策,再多轮对话也只是 Chatbot。
  • 误区二:"Agent 一定比 Workflow 高级"。它们是谱系上的不同点,不是进化关系。生产系统中 80% 的"Agent 需求"其实 Workflow 就能稳定满足(kp-007)。
  • 误区三:"越多 Agent 协作越强"。多 Agent 引入通信损耗与错误放大,Claude Code 这类顶级系统反而在减少 Agent 数量(kp-019/028)。
  • 误区四:把"能聊天 + 能调一个 API"就叫 Agent。关键看是否由模型动态决定控制流。

自测题

  1. 判断:一个系统按固定顺序调用"意图识别 LLM → 翻译 LLM → 润色 LLM",是 Agent 吗?
  2. Agent 与 Workflow 的分水岭是什么?
  3. 说出四个要件,并解释"反馈"为什么不可省略。

(参考答案:1. 不是,控制流在代码里,模型只是被调用的函数;2. 控制流在模型手里还是代码里;3. 目标、自主决策、工具、循环反馈——没有反馈,模型无法修正行动,长任务必然崩塌。)

与其他知识点的关系

  • 循环的工程实现 → kp-006、kp-017
  • LLM 为什么配得上"大脑" → kp-002
  • 形态光谱与产品选型 → kp-007
  • 自主性的刹车 → kp-023

延伸阅读

  • Anthropic, Building Effective Agents(2024)——"workflows vs agents" 一节的定义被业界广泛引用
  • Russell & Norvig, Artificial Intelligence: A Modern Approach ch.2 —— 经典 Agent 定义