跳转至

Agent 集群 Scaling:理论、工业实现、与 TTS 的关系

更新日期:2026-04-15

本文彻底重写,覆盖:Agent Scaling Law 数学形式、Agent 集群与 Test-Time Scaling 的谱系关系、多 Agent Debate 的真实 benchmark(何时有效何时崩坏)、Anthropic 多 Agent 研究系统深度剖析、Manus/AutoGen/Swarm 工业实现、失败模式与客观指标。

六、客观指标和评估

6.1 Multi-Agent 系统的评估维度

6.2 Anthropic 的 LLM-as-Judge Rubric

每个维度 0.0-1.0 + pass/fail: 1. Factual accuracy — 声明是否与源一致 2. Citation accuracy — 引用源是否真实支持声明 3. Completeness — 所有要求方面是否覆盖 4. Source quality — primary vs secondary 源 5. Tool efficiency — 工具使用合理性

经验:单次 LLM 调用 + 统一 rubric 的 judge 多个专门 judge 更一致,也更贴合人类判断。

6.3 Agent 系统的效率-质量权衡曲线

配置 相对 token 相对质量 备注
A. Single CoT 1.0 baseline
B. Self-Consistency (k=5) ~5× 1.10-1.15 数学/推理任务最划算
C. Long CoT(推理模型) ~10× 1.20-1.30 深度推理收益最大
D. Long CoT + BoN ~30× 1.30-1.40 选最优答案
E. MAD (3 agents × 2 rounds) ~15× 1.15-1.25 跨视角任务有效,简单任务可能反伤
F. Orchestrator + 并行 worker ~50× 1.30-1.50 研究 / SWE-bench 类最强

实际收益曲线是 S 形——从 B 到 E 边际收益明显,E 到 F 饱和。


七、Agent 集群的工程问题全景

7.1 编排层面

7.2 上下文管理

7.3 可观测性

7.4 部署策略


八、Agent 集群和 TTS 的对比

经验:Long CoT(推理模型)+ BoN > MAD > Self-Consistency > Single CoT

对于 SWE-bench / 研究类任务:Orchestrator + 并行 worker > 所有单 agent 方案


九、选型决策框架

flowchart LR
    start["开始"]
    q1{"任务可<br/>分解?"}
    q2{"预算允许<br/>15× tokens?"}
    q3{"需要多视角<br/>or 工具?"}
    single["Single CoT<br/>+ Self-Consistency"]
    long["推理模型<br/>+ BoN"]
    mad["Multi-Agent Debate"]
    orch["Orchestrator + Workers"]

    start --> q1
    q1 -- 否 --> single
    q1 -- 是 --> q2
    q2 -- 否 --> long
    q2 -- 是 --> q3
    q3 -- 否 --> long
    q3 -- 是 --> orch

    classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
    class start,single,long,mad,orch stage

经验法则:先用 single + self-consistency 跑 baseline,再判断 multi-agent 是否真的能 >10% 超过 baseline,否则不值得 15× 成本。


十、前沿方向

方向 目标 代表工作
Async Multi-Agent 打破同步瓶颈 Anthropic 内部路线
Heterogeneous Models 异构模型混搭 AutoGen, Manus
Persistent Memory 跨会话 agent 记忆 Agent OS 方向
Agent 社会仿真 大规模涌现研究 Generative Agents, Agent Hospital
Agent Marketplace Agent 间交易任务 研究阶段
RL for Orchestration 学习最佳 Lead 策略 前沿 RL 方向
可验证 Agent 形式化保证行为 AI 安全方向

十一、实战 Playbook

当你准备上 Multi-Agent 时的 checklist: 1. 验证任务真的需要多 agent(不是跟风)

  1. 估算 token 预算是否能承担 15x

  2. 任务可分解为独立子任务(否则单 agent)

  3. 先用 single-agent + self-consistency 做 baseline

  4. 对比 multi-agent 是否显著超 baseline(>10%)

  5. 设计清晰的 orchestrator prompt(目标/格式/工具/边界/停止条件)

  6. 实现 checkpoint + resume + rainbow deployment

  7. 加入 production tracing(不记录内容)

  8. 定义 LLM-as-Judge 评估 rubric

  9. 监控 token 消耗和失败率


参考文献

  • [1] Qian et al. Scaling LLM-based Multi-Agent Collaboration (MacNet). ICLR 2025. 论文

  • [2] Smit et al. Revisiting MAD as Test-Time Scaling. 2025. 论文

  • [3] Scaling Test-time Compute for LLM Agents. 2025. 论文

  • [4] Towards a Science of Scaling Agent Systems. 2025. 论文

  • [5] Multi-LLM-Agents Debate Challenges (ICLR 2025 Blog). 博客

  • [6] The Art of Scaling Test-Time Compute. 2025. 论文

  • [7] Voting or Consensus in MAD. 2025. 论文

  • [8] Inference Scaling Laws. 2024. 论文

  • [9] Anthropic. How we built our multi-agent research system. 2025. 博客

  • [10] Park et al. Generative Agents. UIST 2023. 论文

  • [11] Wu et al. AutoGen. 2023. 论文

  • [12] Hong et al. MetaGPT. ICLR 2024. 论文

  • [13] Li et al. CAMEL. NeurIPS 2023. 论文

  • [14] LLM Multi-Agents Survey (IJCAI 2024)

  • [15] OpenAI Swarm

  • [16] Manus. 介绍


上级 · H3. Agent 集群 Scaling 与多 Agent 协作