一句话定义
多 Agent 系统是多个独立 Agent 通过消息传递协同完成任务的架构——包括角色分工的流水线(MetaGPT 式)、辩论对抗(debate)、对等谈判(AutoGen 式对话)等形态;2025 年后的工程主流是"少量 Agent + 明确分工 + 结构化通信",而非大数量自由对话。
为什么重要
单 Agent 的天花板是单一上下文与单一视角。有些能力只能从"多个独立视角的对抗/协作"中涌现:辩论能显著降低幻觉(一个 Agent 编的内容被另一个独立质疑);角色分工能模拟真实软件团队(产品→架构→开发→测试各司其职);并行探索能覆盖更大的方案空间。但多 Agent 也是复杂度与成本放大器——2023 年框架热退潮后行业学到的教训全部浓缩在本篇的"误区"里。
前置知识
kp-019(编排——本篇的对照形态)、kp-012(消息即条件)。
核心概念
四种协作拓扑
| 拓扑 | 结构 | 典型用法 | 风险 |
|---|---|---|---|
| 流水线(角色分工) | A→B→C 顺序传递工件 | MetaGPT 模拟软件团队 | 角色间信息丢失 |
| 辩论(对抗) | 多 Agent 就同一问题独立作答后互评 N 轮 | 事实核查、方案评审 | 随大流(趋同而无增益) |
| 对话(对等谈判) | 两 Agent 带各自目标自由对话直至"达成一致" | AutoGen 的 user-proxy 模式 | 死循环、跑题 |
| 中心编排 | orchestrator + workers(树形) | kp-019,生产首选 | 单点依赖编排质量 |
通信的三种介质
- 自然语言消息(最常见):灵活但信息有损——A 说"数据我处理好了",B 不知道具体 schema
- 共享工件(更工程化):通过文件/数据库传 JSON、代码、文档——用工件代替对话是多 Agent 质量跃升的关键(编程 Agent 之间传代码与测试,不传废话)
- 标准化协议(kp-032 的 A2A):跨厂商 Agent 互操作的目标形态,含能力发现、任务委托、状态回传
辩论为什么有效(以及何时失效)
机制:每个 Agent 独立生成时错误各不相同(采样的独立性),互评时别人的错误在你的视角里显而易见(kp-014 的"审阅比生成容易"跨界版)。失效场景:共享同一个基础模型且提示相似时,错误高度相关——三个"同一个模型的分身"辩论,常常是集体强化同一个偏见。改进:换不同模型/不同角色立场/不同检索来源参与。
原理与机制
多 Agent 的信息论视角:每个 Agent 是一个独立的采样与条件化路径。组合的收益 = 视角多样性 − 通信损耗 − 协调误差。三项都可量化干预:
- 视角多样性:不同系统提示、不同工具集、不同检索源、甚至不同模型(kp-024 里也是评委多样性的来源)
- 通信损耗:每轮消息传递都是有损压缩——减少"传话",多用共享工件(事实数据放文件,消息只传指针与结论)
- 协调误差:谁先谁后、谁仲裁——明确终止条件与仲裁者(通常是一个 judge Agent 或人类,kp-023)
AutoGen 的核心抽象(可对话 Agent + 可对话人类 + 群聊管理器)证明了灵活性的价值,也暴露了自由对话的失控面;MetaGPT 用"SOP 编码进提示 + 工件流转"(装配线而不是圆桌会议)换来了结构的稳定——这两条路线的分野贯穿 2023-2025,最终生产侧收敛到"结构化协作 + 少量 Agent"。
直观类比
四种拓扑对应四种人类组织:流水线 = 工厂装配线(每人一道工序,交接靠标准件不靠聊天);辩论 = 评审会(独立审稿人各自打分再合议——独立性是质量之源);对话 = 商务谈判(灵活但可能谈崩或谈不完);编排 = 项目制(PM 分活,顾问回报)。2023 年大家痴迷"AI 圆桌会议",2025 年的赢家是"AI 项目制"——组织学的百年教训在 Agent 世界重演了一遍。
实例与案例
一个双 Agent 评审管线(写手 + 评审,避免单 Agent 自评偏置):
pythondraft = writer_agent(task) # 写手:只管产出
for round in range(2):
critique = reviewer_agent(task, draft, # 评审:独立上下文+评分量表
rubric="准确性/完整性/格式 各 1-5 分,指出最严重的 3 个问题")
if critique.score >= 4.5:
break
draft = writer_agent(task, draft, critique.suggestions) # 带批评重写
要点:评审带量表(rubric,防"感觉良好")、独立上下文(防自我偏好)、有限轮数(防无限扯皮)。这个 generator-critic 结构是最常用的多 Agent 原子模式(kp-024 的 LLM-as-judge 同构)。
常见误区
- 误区一:"Agent 越多越智能"。通信损耗随数量超线性增长;Anthropic 复盘与行业实践一致指向:多数场景 2-5 个 Agent 封顶,上百个 Agent 的"Agent 村庄"属于研究演示。
- 误区二:让 Agent 无限轮对话"讨论出真理"。没有终止条件与仲裁者的自由对话终将以死循环或趋同结束。
- 误区三:全用同一个模型+相似提示搞"多 Agent"。相关性错误使辩论退化为复读(伪多样性)。
- 误区四:消息传话代替共享工件。自然语言传三次,数字就变样了——数据走文件,消息走结论。
- 误区五:忽视成本量级。token ×5~15 是常态(kp-019/027),上线前必须算账。
自测题
- 辩论降低幻觉的机制前提是什么?何时失效?
- 为什么"用共享工件代替传话"是多 Agent 质量的关键改进?
- 多 Agent 收益公式三项分别如何干预?
(参考答案:1. 独立采样的错误不相关、审阅比生成容易;共享模型与相似提示使错误相关而失效;2. 自然语言消息是有损压缩,数据经文件传递无损且可审计;3. 多样性(换模型/提示/工具/检索源)、通信(工件化)、协调(终止条件+仲裁者)。)
与其他知识点的关系
- 树形编排(生产首选)→ kp-019;框架实现 → kp-021
- 跨厂商协议 A2A → kp-032;评审模式与评测同构 → kp-024
延伸阅读
- Wu et al., AutoGen(2023);Hong et al., MetaGPT(2023)
- Google, Agent2Agent (A2A) Protocol(2025);Du et al., Improving Factuality by Multi-Agent Debate(2023)