ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

每个智能体都答对了,团队为什么还是错了

每个智能体都答对了,团队为什么还是错了 每个智能体都答对了团队为什么还是错了每个智能体都答对了团队为什么还是错了**一句话版本**把任务拆给多个智能体分头做、每步各自都合规合起来照样能崩——论文证明这不是模型不够聪明的问题而是「状态」问题关键区别不在任何人的上下文里时再强的推理也变不出来解法是让机械 harness 掌管全局状态而不是再加一个管理者智能体。一句话版本先给结论论文《Global Coherence》首次把「每个智能体都对、团队仍然错」形式化成一类独立故障局部有效 ⇏ 全局连贯。核心结论是一个不可能定理——两个情境对所有参与者看起来完全相同、却需要不同动作时任何推理/投票/换角色/随机化都救不了最优成功率就是瞎猜1/k而把缺失的那一句话补进上下文立刻回到满分。处方模型提议、机械支架裁决。封面拼图都对整体有裂缝一个反直觉的定理先看最锋利的那个结果观测混叠不可能定理一个策略能从它的观测对 LLM 智能体就是上下文中保证选出正确动作当且仅当「与该观测一致的所有世界」允许一个共同动作。当存在 k 个长得一样但合法动作集两两不相交的世界时任何策略的最坏情形成功率恰为 **1/k**——没有下界更高的办法没有。翻译成人话如果两条工作史产生同一份日志因为有一个事件被隐藏了而它们对应的正确动作不同——那么无论你换更强的模型、加长思考、拆角色分工、引入投票、还是多次采样期望表现就是抽签。更强的模型只是在自己的上下文里搜得更勤它看不见上下文之外的东西。论文的实证非常配合这个冷酷结论一个前沿模型在某修订基准上全见状态时 40 题全对把决定性事件藏起来后在测试的各种推理策略/角色/投票/工具条件下观测准确率与三选一瞎猜1/3统计上无法区分往上下文里补一句陈述缺失事实的话恢复 40/40。这一段值得每个做智能体的人抄在工位上上下文工程有用的位置恰好是「它把缺失的区别放进了窗口」对同一个窗口加长推理没用。这把智力和可识别性干净地分开了——对人类团队、AI 团队、人机混合团队一视同仁。第二种失败拼得起来吗第二种失败更隐蔽信息大家都有局部也都自洽但局部一致的碎片拼不成任何一个全局状态。三个两两翻译各自格式良好、互逆一致、局部合理但绕一圈回来回不到起点三个角色各自花销合法总账爆了预算。论文用数学里现成的精确结构把这类问题统一建模成一个五元组拓扑谁和谁共享什么、坐标系谁用什么单位编码——设计智能体记毫米、加工智能体记米、成本智能体记英尺同在一根梁上、复合局部如何拼、约束语义、加一个判别代数 D 管「哪些区别必须保留」。冷知识级别但极实用的结论跨表示的一致性可以线性时间验证但找最小代价的修复是 NP 难共享预算根本不可能靠独立局部检查保护——要么提交时统一裁决要么切分成配额。处方管理者智能体为什么不够直觉方案是「加一个 manager 智能体统筹」。论文明确反对管理者只是又一个多一个视图的参与者同样被定理约束。正确形态是**模型提议机械 harness 裁决。** harness 是纯机械的无模型职责由框架推导出来哪些区别它必须掌管、哪些重叠可能藏全局不一致、哪些翻译环路必须闭合、哪些变更必须等到提交。它像数据库事务引擎不像同事。机械守门人模型提议harness 裁决四个实证预注册面板1. 预算超支60 轮 TeamBench普通智能体团队 5/5 全部超支 20 次调用的共享预算给它们看实时计数仍 4/5 超支看见了也不管用——又是「信息在窗口里没用上」的变体提交时强制执行预算 0/5 超支且任务进度无下降。固定按角色托管配额同样 0/5。信息展示救不了结构裁决才救得了。2. 本体对齐碰撞2018-2024 的 45 个公开本体对齐网络中23 个含有两两不可见的同本体身份冲突。拿到分裂视图的智能体在 40 次合并中复现了 9 次这类冲突网络级检查 9/9 全检出全移除代价广播式修复让平均 F1 从 0.796 降到 0.774——修复有成本但确定性移除。3. τ²-bench 电信面板222 集注入的变更破坏规则时常规策略检查与连贯性 harness 打平常规工具本来管着那块状态已提交变更被静默撤销时带常规检查的智能体得分 0.07带 harness 的 1.00——0 到 1 的差距正好落在「决定性状态无人掌管」的格子里。4. 全部九项研究汇总的模式正是定理画的像harness 在决定性状态缺失或无人掌管处赢在常规工具已掌管该状态处平。环路闭合绕一圈回得到起点吗工程落地清单论文直接给的- 陈旧读原子提交每条提议记录它依赖过的全部状态版本不只是最后那笔工具调用碰到的——五轮前读过的一条引文也算现在这笔订单的读集提交时原子校验版本没变再写入。这给智能体系统一个「逐条串行」的语义保证。- 配额/托管替代共享预算把共享资源切成每角色独立配额让角色彼此独立全局约束自动成立。- 环路闭合检查任何跨表示翻译链机械地验证绕环回来是否回到原点。- 失效归档优于静默过时下游依赖被设计变更波及时让旧派生物显式失效而不是悄悄烂掉。结语这篇论文的真正贡献是把一类大家各自挨过打、但没叫过名字的故障命名并钉死在理论墙上多智能体系统的可靠性问题里有一大块根本不是智力问题是状态归属问题。模型负责提议机械支架掌管「哪些区别不能丢、哪些账必须全局算」——分权给纯机械的守门人恰恰是对抗「人人都对、合起来错」的唯一解。*论文Global Coherence: When Every Agent Is Right and the Team Is Still WrongarXiv 2610.02036**BuddyMe 每日免费 4500 万 Token。*
返回列表