Agent 开发学习站
Agent 开发›核心›核心

多 Agent 系统:协作、辩论与通信

核心核心

一句话定义

多 Agent 系统是多个独立 Agent 通过消息传递协同完成任务的架构——包括角色分工的流水线(MetaGPT 式)、辩论对抗(debate)、对等谈判(AutoGen 式对话)等形态;2025 年后的工程主流是"少量 Agent + 明确分工 + 结构化通信",而非大数量自由对话。

为什么重要

单 Agent 的天花板是单一上下文与单一视角。有些能力只能从"多个独立视角的对抗/协作"中涌现:辩论能显著降低幻觉(一个 Agent 编的内容被另一个独立质疑);角色分工能模拟真实软件团队(产品→架构→开发→测试各司其职);并行探索能覆盖更大的方案空间。但多 Agent 也是复杂度与成本放大器——2023 年框架热退潮后行业学到的教训全部浓缩在本篇的"误区"里。

前置知识

kp-019(编排——本篇的对照形态)、kp-012(消息即条件)。

核心概念

四种协作拓扑

拓扑结构典型用法风险
流水线(角色分工)A→B→C 顺序传递工件MetaGPT 模拟软件团队角色间信息丢失
辩论(对抗)多 Agent 就同一问题独立作答后互评 N 轮事实核查、方案评审随大流(趋同而无增益)
对话(对等谈判)两 Agent 带各自目标自由对话直至"达成一致"AutoGen 的 user-proxy 模式死循环、跑题
中心编排orchestrator + workers(树形)kp-019,生产首选单点依赖编排质量

通信的三种介质

  1. 自然语言消息(最常见):灵活但信息有损——A 说"数据我处理好了",B 不知道具体 schema
  2. 共享工件(更工程化):通过文件/数据库传 JSON、代码、文档——用工件代替对话是多 Agent 质量跃升的关键(编程 Agent 之间传代码与测试,不传废话)
  3. 标准化协议(kp-032 的 A2A):跨厂商 Agent 互操作的目标形态,含能力发现、任务委托、状态回传

辩论为什么有效(以及何时失效)

机制:每个 Agent 独立生成时错误各不相同(采样的独立性),互评时别人的错误在你的视角里显而易见(kp-014 的"审阅比生成容易"跨界版)。失效场景:共享同一个基础模型且提示相似时,错误高度相关——三个"同一个模型的分身"辩论,常常是集体强化同一个偏见。改进:换不同模型/不同角色立场/不同检索来源参与。

原理与机制

多 Agent 的信息论视角:每个 Agent 是一个独立的采样与条件化路径。组合的收益 = 视角多样性 − 通信损耗 − 协调误差。三项都可量化干预:

  • 视角多样性:不同系统提示、不同工具集、不同检索源、甚至不同模型(kp-024 里也是评委多样性的来源)
  • 通信损耗:每轮消息传递都是有损压缩——减少"传话",多用共享工件(事实数据放文件,消息只传指针与结论)
  • 协调误差:谁先谁后、谁仲裁——明确终止条件与仲裁者(通常是一个 judge Agent 或人类,kp-023)

AutoGen 的核心抽象(可对话 Agent + 可对话人类 + 群聊管理器)证明了灵活性的价值,也暴露了自由对话的失控面;MetaGPT 用"SOP 编码进提示 + 工件流转"(装配线而不是圆桌会议)换来了结构的稳定——这两条路线的分野贯穿 2023-2025,最终生产侧收敛到"结构化协作 + 少量 Agent"。

直观类比

四种拓扑对应四种人类组织:流水线 = 工厂装配线(每人一道工序,交接靠标准件不靠聊天);辩论 = 评审会(独立审稿人各自打分再合议——独立性是质量之源);对话 = 商务谈判(灵活但可能谈崩或谈不完);编排 = 项目制(PM 分活,顾问回报)。2023 年大家痴迷"AI 圆桌会议",2025 年的赢家是"AI 项目制"——组织学的百年教训在 Agent 世界重演了一遍。

实例与案例

一个双 Agent 评审管线(写手 + 评审,避免单 Agent 自评偏置):

pythondraft = writer_agent(task)                      # 写手:只管产出
for round in range(2):
    critique = reviewer_agent(task, draft,      # 评审:独立上下文+评分量表
        rubric="准确性/完整性/格式 各 1-5 分,指出最严重的 3 个问题")
    if critique.score >= 4.5:
        break
    draft = writer_agent(task, draft, critique.suggestions)  # 带批评重写

要点:评审带量表(rubric,防"感觉良好")、独立上下文(防自我偏好)、有限轮数(防无限扯皮)。这个 generator-critic 结构是最常用的多 Agent 原子模式(kp-024 的 LLM-as-judge 同构)。

常见误区

  • 误区一:"Agent 越多越智能"。通信损耗随数量超线性增长;Anthropic 复盘与行业实践一致指向:多数场景 2-5 个 Agent 封顶,上百个 Agent 的"Agent 村庄"属于研究演示。
  • 误区二:让 Agent 无限轮对话"讨论出真理"。没有终止条件与仲裁者的自由对话终将以死循环或趋同结束。
  • 误区三:全用同一个模型+相似提示搞"多 Agent"。相关性错误使辩论退化为复读(伪多样性)。
  • 误区四:消息传话代替共享工件。自然语言传三次,数字就变样了——数据走文件,消息走结论。
  • 误区五:忽视成本量级。token ×5~15 是常态(kp-019/027),上线前必须算账。

自测题

  1. 辩论降低幻觉的机制前提是什么?何时失效?
  2. 为什么"用共享工件代替传话"是多 Agent 质量的关键改进?
  3. 多 Agent 收益公式三项分别如何干预?

(参考答案:1. 独立采样的错误不相关、审阅比生成容易;共享模型与相似提示使错误相关而失效;2. 自然语言消息是有损压缩,数据经文件传递无损且可审计;3. 多样性(换模型/提示/工具/检索源)、通信(工件化)、协调(终止条件+仲裁者)。)

与其他知识点的关系

  • 树形编排(生产首选)→ kp-019;框架实现 → kp-021
  • 跨厂商协议 A2A → kp-032;评审模式与评测同构 → kp-024

延伸阅读

  • Wu et al., AutoGen(2023);Hong et al., MetaGPT(2023)
  • Google, Agent2Agent (A2A) Protocol(2025);Du et al., Improving Factuality by Multi-Agent Debate(2023)