指挥Agent军队不用学PMP,但要偷它的五个视角
前阵子我把一个活拆成两路,派给两个 agent 并行干。
一路写新工具,一路写版本号工具。两个独立工作区,互不打扰,理论上一晚上能出两倍的活。
结果:一个 agent 在后台静默——日志里一个字都抓不到;另一个干到第 11 轮被 max-turns 拦下,活没干完。
代码没合并,我先花时间当调度员。
那一刻我意识到:指挥 agent 干活,卡住我的从来不是模型不够强,是管理。
所以当有人问我"指挥一支 Agent 军队之前,你得学学 PMP?"的时候,我没有笑,而是真的去翻了一遍 PMBOK。
● ● ●
一、Agent 军队不是比喻,是生产现实
先说清楚"军队"这个词的分量。
Anthropic 把 Claude Research 做成 orchestrator-worker 架构:一个 lead agent 当指挥官,拆解任务,派出多个子代理并行探索。官方数据:lead 用 Opus 4、子代理用 Sonnet 4,内部评测比单 agent 系统高出 90.2%。
代价是 token。单 agent 的 token 消耗大约是普通聊天的 4 倍,多 agent 系统是 15 倍。
15 倍是什么概念?一个任务价值不够高,组队就是不经济的。
Anthropic 还给了一个"兵力法则":简单查证派 1 个 agent(3-10 次工具调用),直接对比派 2-4 个,复杂研究才上 10 个以上。
早期版本里,agent 会为一句简单的查询 spawn 出 50 个子代理,或者漫无目的地搜一个根本不存在的来源。不是模型笨,是指挥官没教好。
中文社区这边,Claude Code 的 Agent Team 把"消息系统、任务依赖、文件锁、计划审批"全搬进了多 agent 协作;OpenClaw 的教程标题直接就叫"实现自己的 Agents 大军"。OpenCrew 项目更夸张——把频道当岗位,CoS 幕僚长、CTO、Builder 各管一摊,还有自主等级 L0-L3:可逆操作直接做,有影响但可回滚的做完汇报,不可逆操作必须人确认。
军队是真的。问题是指挥官不行。
● ● ●
二、指挥 agent 的第一课:写任务契约,不是写 prompt
Anthropic 在复盘里总结了一个血泪教训:每个子代理都需要四样东西——目标、输出格式、工具指引、任务边界。
缺任何一样,agent 就"漂移":两个子代理做一模一样的搜索,或者一个留了缺口没人补。
他们早期让 lead agent 给子代理的指令是"调研一下半导体短缺"。结果一个子代理去查 2021 年的汽车芯片危机,另外两个在重复调查 2025 年的供应链——没有有效的分工。
这四样东西,本质上是项目管理里"范围管理"的现代形态。WBS(工作分解结构)把项目拆成可交付的块,任务契约把目标拆成 agent 能执行的指令。
差别在于:给人类写范围说明书,写个大概就行,人会自己问;给 agent 写,写不清楚它不会问,它会自己猜,猜错就漂移。
所以指挥 agent 的第一课不是学什么 prompt 技巧,是学会把"做什么、什么算完成、用什么工具、边界在哪"一次写清楚。
● ● ●
三、PMP 的五个视角,值得偷
PMP 的全称是项目管理专业人士认证,考的是 PMBOK 知识体系——五大过程组、十大知识领域。我翻完的最大感受是:它教的东西有一半已经过时,但另一半恰好是 Agent 时代最稀缺的能力。
五个要偷的视角
挑五个最值得偷的视角:
第一,验收标准先于开工。 PMBOK 的质量管理讲"质量是规划出来的,不是检查出来的"。放到 agent 编排里就是:派活之前先定义"什么算完成"。OpenCrew 的实践是执行和质检必须分离——同一个 AI 既执行又自检,会倾向于宽容自己。Claude Code 的 Agent Team 用 TaskCompletedHook 做自动化验收,exit code 2 直接拦截不合格的结果。我自己踩过的坑是:让同一个 agent 写代码又自测,它对自己的 bug 视而不见,交给另一个 agent review 才抓出来。
第二,依赖比并行重要。 项目管理的核心概念是"关键路径":整个项目里那条最长的依赖链决定了交付时间,不是干活最多的人。agent 编排同理——多个子任务并行很爽,但真正卡住全局的往往是某个"必须等上游输出"的环节。我的编排系统里,任务依赖用 parent 链接显式声明,子任务在父任务完成前不会启动。这条规则救过我很多次,比任何并行优化都值钱。
第三,token 是硬预算。 15 倍成本决定了"要不要组队"本身就是一个管理决策。Anthropic 的实践是模型分级:lead 用最强模型,子代理用性价比模型;OpenClaw 的指南建议委托深度不超过两层,并在提示词里显式写"不要进一步委托"。花钱的地方想清楚,省钱的地方别抠错。
第四,交接即丢失。 Anthropic 明确指出:按工作类型分工(一个写功能、一个写测试、一个做审查)会产生持续协调开销,每次交接都丢上下文。更有效的做法是按上下文边界分工——谁做功能,谁连测试一起做。这个结论反直觉但极其重要:人类团队的分工逻辑(专人专岗)搬到 agent 上常常是负优化。
第五,风险靠恢复,不靠防错。 Agent 系统有个特点:错误会复合。一个小失败可能让 agent 走上完全不同的轨迹。PMP 的风险管理教人识别、分析、应对;agent 时代的应对手段是 checkpoint、重试、彩虹部署——以及最实用的一条:worker 卡死了,直接 reclaim 换人重跑,别和它较劲。
● ● ●
四、该扔的也别客气
说完了偷的,说该扔的。
该扔的三件套
甘特图。 agent 是非确定性的——同样一个起点,它可能走出完全不同的有效路径。计划画得越细,越是幻觉。依赖图要,甘特图不要。
全流程审批。 每一步都等人类确认,等于亲手放弃并行收益。OpenCrew 的分级授权(L0-L3)才是对的:可逆的自己干,不可逆的才问人。
团队激励。 这可能是 PMP 里最没用的一块。agent 不摸鱼、不甩锅、不加薪,只要规则明确,它比人好管得多。管人和管 agent 的根本区别就在这:人的管理靠沟通,agent 的管理靠契约。
● ● ●
五、证书不用考,视角要偷
回到开头那两路 agent。
后来它们都交付了。但不是因为我换了个更强的模型,而是因为我把任务拆对了、验收标准定在了开工前、依赖链锁死了、预算提前算好了。
PMP 证书我没考。但它的五个视角——验收先于开工、依赖比并行重要、token 是硬预算、交接即丢失、风险靠恢复——我全偷了。
指挥 agent 军队这件事,难的从来不是模型,是指挥本身。
而指挥的底层逻辑,人类已经研究了几十年。PMP 的遗产不是那本指南,是它把"指挥"拆成了十个可管理的维度。Agent 时代把其中"管人"的部分全部蒸发,剩下的"管事"的部分,全部放大。
参考来源:
How we built our multi-agent research system — https://www.anthropic.com/engineering/multi-agent-research-system When to use multi-agent systems (and when not to) — https://claude.com/blog/building-multi-agent-systems-when-and-how-to-use-them OpenCrew: OpenClaw 多智能体协同系统 — https://github.com/AlexAnys/opencrew Claude Code 多 Agent 组队开发:从原理到踩坑全指南 — https://zhuanlan.zhihu.com/p/2004486603343671752 多智能体系统的核心设计:从任务分解到依赖图驱动的编排循环 — https://cloud.tencent.com/developer/article/2648550 多智能体协作 | Agentic Design Patterns — https://jimmysong.io/zh/book/agentic-design-patterns/07-multi-agent-collaboration/