ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

多智能体编排的三个点

多智能体编排的三个点 多智能体编排的三个点写在前面同一个模型放在不同的系统结构里产出质量差异很大。Harness engineering 的实测数据控制模型不变系统结构可将每任务成本降低 41%、墙钟时间降低 44%、Token 消耗降低 38%质量持平。这篇文章讨论一套 AI 自动化工作流在三个点上的设计——通信拓扑、完成信号闭环、多角色验证——以及这些设计为什么有效。四项研究SDE提示词中语义负载 Token 占比是输出质量的强预测因子。SDE 0.80 比稀释提示平均提升 8.4 个百分点零额外 Token。低语义 Token 参与 softmax 归一化稀释高语义 Token 的注意力权重。CAVEWOMAN压缩的后果取决于通道且非对称。输出压缩降低成本 1.4–2.4 倍输入压缩适得其反净成本增加约 1.15 倍最差 2.7 倍。模型会用更长响应补偿被压缩的输入。Sample More Reflect Less等 Token 成本下自我检查不优于重复采样。36 组比较中 10 组可靠更差全是模型检查自身输出。7B 上 Self-Refine/Reflexion 低于基线 3.6–10.1 个百分点。但模型越大自我检查的损失越小。MAXTOKEN提出七层框架实现无界输出生成。关键限定计算无界已证明可达信息无界未证明。压缩必然有损问题在于如何在有损前提下保持任务相关的语义锚点。一、通信拓扑怎么做的子代理之间直接relay不经过主代理。主代理禁止转发小组内部消息两类硬拒消息以发送方身份前缀开头 → 判定为主代理粘贴转发 → 拒绝主代理去掉前缀后逐字粘贴子代理报告 → 命中已知签名 → 拒绝消息携带发送方身份前缀子→父[来自子会话 ID]子↔子[来自会话 ID]父→子不携带。为什么三个理由。信息保真。子代理的产出经主代理上下文后可能被压缩、改写、丢失。主代理的上下文窗口有限被迫承载所有子代理的完整输出会挤占其调度决策所需的工作记忆。错误相关性。主代理与子代理共享训练语料、模型家族。经主代理中转的错误可能被其确认而非质疑。独立验证的前提是验证者与生成者的错误分布不相关——主代理中转破坏了这一前提。延迟与 Token 成本。中转引入额外的生成-消费循环。送达语义relay的 delivery 分级级别含义received对端已入账签收accepted平台受理未确认accepted_busy受理时目标忙queued压缩排队rejected确定未达timeout超时不确定received是唯一可声称送达的证据。relayed仅表平台受理不等于对端已读。当前 Agent 通信协议在传输、流式、Schema 定义和生命周期管理方面已成熟但在澄清、上下文对齐和验证方面提供的协议级机制有限。送达语义是对这一空白的填补。与研究对照与 SDE 一致消息不含礼貌用语、过渡句合规提示行仅一行。与 CAVEWOMAN 一致输出侧主动压缩输入侧不压缩。二、完成信号闭环三路保障子代理完成信号到达父代理有三条路径平台注入原生 task 完成回传子代理主动 relay插件搬运搬运的触发条件busy→idle 跃迁时本窗口无 relay 回执、无平台回复、有非空摘要且同内容未搬运过按尾部消息 ID 判重。为什么三路单路有单点失败风险。平台注入可能因版本差异丢失子代理可能因异常中止未发 relay主代理可能因 busy 未及时处理。三路是冗余设计——任一路径成功完成信号即到达。双通道去重平台注入与插件搬运可能同时到达。判重子级回执在本等待周期内 → 平台注入是重复信号否则回退父级窗口判定。task 子有精确单通道V2 宿主平台原生 task 回复可用时task 子不参与插件搬运。这消除了 task 场景下的双通道重复注入。子错误上报与空闲巡检非用户中止错误且有父 → 向父一次性上报。同签名只报一次跨实例 CAS 抢占子 relay 回复后清零。派发后超窗零回复 → 巡检向父上报已挂并复活唤醒一次。三态状态处理true已投递 → 无响应则续做经prompt直发新任务经task新开parked受理排队压缩中→ 不判终结rejected确定未达 → 上报用户false超时未确认 → 下轮复核核心是区分确定未达与超时未确认。后者可能是迟到送达立即判死会误杀前者是确定失败必须上报。这与分布式系统的 at-least-once 语义一致——消息可能重复但不会静默丢失。与研究对照MAXTOKEN 提出压缩必然有损问题在于保持语义锚点。工作流用context_limit默认 400k有界策略达限触发压缩保留目标状态objective/status/budget/turns但不保留代码结构信息。一个可实验方向压缩时额外保留代码骨架摘要——每个源文件的导出函数/类型签名清单。这是高信息密度、低 Token 成本的表示与 SDE 的取向一致。三、多角色工作流角色矩阵角色职责禁止主代理分发、收口、承接、标记完成代做方案/审计/执行转发组内消息介入小组过程两审计 AI独立审计产出方案/缺陷清单证据路径:行—执行 AI按定案 TDD 实现报审计 AI—审计与执行必须两两不同 AI。流程① 两审计独立审计 → ② 磋商互相审计盲区多方案碰撞择优 → ③ 报主代理定案经task新开执行 AI → ④ 执行 TDD报审计 → ⑤ 两审计验证 → ⑥ 两名审计一致盖章 → 主代理报告有问题重新定稿回①。审计→修复成对往复无次数上限直至方案能完成目标。验证标准禁止仅以测试通过判定。方案须命中根因、最小改动、无副作用、与既有契约一致。组间隔离每个缺陷/方案自成一组组间禁止共享会话。为什么两审计而非一。单一审计可能漏判。模型错误存在显著相关性——两个模型都出错时对同一错误答案存在高度一致。当配对错误相关性为正时增加 Agent 数量不会将多数错误概率降至零。一致盖章要求两者都认可降低相关错误被采纳的概率。审计与执行不同 AI。生成者与检查者是同一上下文时倾向于确认已有结论。独立 AI 的错误分布不相关交叉验证有效。组间隔离。防止跨组上下文污染。与研究对照Sample More Reflect Less 的实验范围是 1.5B–7B 小模型结论是否外推到前沿模型需要验证。但论文提供了一个可实验方向在执行 AI 产出方案后先让执行 AI 对同一任务多次独立采样Best-of-N然后由审计 AI 从多个方案中选取最优。这比审计指出问题 → 执行改写 → 再审计的循环更符合等 Token 成本下的最优策略。四、控制论对应钱学森《工程控制论》的核心概念可以对应到这套工作流控制论工作流受控对象执行 AI 产出控制器两审计独立验证 一致盖章设定点定案方案反馈回路有问题重新定稿确定性控制层主代理调度闭环人类边界熔断后用户决定恢复控制器与被控对象分离。反馈控制的基本前提。控制器参与被控对象的生成则观测会被自身参与污染。工作流中主代理不参与执行观测是独立的。人类在回路中。连续 5 次零输出 → 熔断。恢复必须由用户决定。系统反复进入不稳定状态时将恢复决策交给系统外部的决策者。反馈回路的完整性环节机制状态观测get_goal是子代理状态唯一事实依据偏差检测空闲巡检、子错误上报修正动作唤醒上报或熔断收敛条件一致盖章每回路有明确终止与循环条件。终止条件防止无限循环循环条件确保有问题时必须修正。结论三个设计点是为了解决通信冗余、完成信号丢失、验证不足。通信拓扑子-子直连消除中转节点送达语义建立确认规则。完成信号三路保障确保至少一条到达双通道去重防重复注入。多角色工作流审计与执行分离一致盖章收敛。Agent 质量的来源不在单点能力而在通信拓扑、完成信号完整性、验证结构。参考Semantic Density Effect (SDE)CAVEWOMAN (2026)Sample More, Reflect Less (arXiv:2607.28576)MAXTOKEN钱学森. 工程控制论. 1954.
返回列表