手里有个老项目,五百个代码文件,你想让 AI 挨个查一遍有没有安全漏洞。
单靠一个 AI 干这活并不现实:文件太多,看到后面就忘了前面。很自然地,你会想:能不能一口气开几十个 AI 分身,一人分几十个文件一起查?
听上去很快,但真做起来最先卡壳的是调度:这几十个分身到底谁来指挥?
谁分配文件、谁盯进度、谁汇总结果、查出可疑点由谁去复核。这套“调度”的活,一直是多智能体协作里最别扭的一环。Claude Code 上线的动态工作流(Dynamic Workflows),就是冲着这个痛点去的。
一、老办法的天花板:指挥全靠一个大脑硬记
以前那个“总指挥”,就是 AI 自己。你派个大活,它一边想一边往外派分身,分身干完把结果全塞回主上下文。
AI 的上下文窗口就像一张工作台,当下能摊开看的东西容量有限。所有分身的结果往上面一堆,台子很快被塞爆。

一个 AI 既当指挥又当仓库,几十个分身的结果全堆回工作台,台子很快撑爆。
堆满之后,前置细节开始往外掉,模型开始忘事。边记边派、边派边忘,最后自己都乱了阵脚。最要命的是,整套调度全在这一轮对话的脑子里,会话一关,打法跟着蒸发。
这是用“单个大脑硬记”去管多人团队必然遇到的天花板。
二、新办法:把“怎么干”写成施工图纸
动态工作流的思路很干脆:别让总指挥拿脑子硬记,先画一张可执行的代码图纸。
你描述任务,AI 先生成一份结构化计划:哪些活并行开干、哪些活排队等前置、如何验收、何时收工。这份计划是一段明确的代码,也是一张施工图纸。
图纸画好,交给后台常驻调度器跑。

你一句话 → AI 写出图纸 → 后台调度台按图纸开几十上百个分身 → 中间结果在图纸流程里流转 → 最终只把验过的答案交还。
分身的中间结果在流程管道里流转,不再往主脑里硬塞。主工作台从头到尾只接收最终结果。
Anthropic 官方给过一个样板:把整个 Bun 项目从 Zig 语言重写成 Rust。75 万行代码,测试通过率 99.8%,11 天搞定。数百个分身并行写代码,每个文件配两个分身挑错,原本按季度排期的工程被压缩到了几天。
三、第一条智慧:错峰流动,别让快的等慢的
光能开几百个分身不稀奇,图纸里真正值钱的是怎么排工序。
假设每个文件走两步:先“通读圈出疑点”,再“挨个核实确认”。
如果全批等齐才走下一步,长的文件读得慢,先读完的分身只能干坐着等最慢的那个,形成瓶颈。
聪明的做法是流水线:哪个文件先读完,立刻送去核实,绝不等大部队。

上半截全批等齐(parallel),总时间被最慢者拖长;下半截流水线(pipeline),读完立刻核实,错峰流动。
动态工作流里把“全批等齐”叫做 parallel(),把“错峰流动”叫做 pipeline()。官方默认推荐 pipeline(),能流水线就绝不等大部队。
这一刀切掉了多任务协作中最隐蔽的等待浪费。
四、第二条智慧:对抗性验证,不让单兵说了算
分身一多,看走眼的概率也跟着放大。
动态工作流的做法是:一条结论报上来,默认先不采信,而是派几个分身专门去证伪。扛得住交叉挑刺的结论才准放行。

一个分身给结论,几个分身专门证伪;推翻了当场丢弃,扛住了才放行。
Claude Code 自带的 /deep-research 也是这套逻辑:每条结论过交叉投票,扛不住的直接过滤。
稳定的是这套对抗流程本身。工程上先承认每个单兵都可能犯错,再用流程结构去兜底。
五、现实成本
几点清醒的现实:
- 目前是研究预览特性,支持的并发分身有硬上限。
- 算力账单呈倍数上升:几百个分身同时跑,Token 消耗远超普通会话。
- 流程确定不等于每个单兵结论都对,依然需要人工抽检关键节点。
六、收束
几百个 AI 一起干活,以前靠单个脑子硬扛,现在靠确定的代码图纸去调度。
这次的突破在于把任务编排从不可控的当场发挥,固化成了可版本管理、可重复执行的工程资产。
当“怎么干”变成了可以存进 Git 的代码,团队真正的护城河,就变成了谁手里沉淀出了更成熟的工程图纸。