ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

发布周重构 AI 成本曲线,运行时治理成为企业智能体新焦点 | 2026年09月27日

发布周重构 AI 成本曲线,运行时治理成为企业智能体新焦点 | 2026年09月27日 今天技术圈的核心信号是「效率」与「治理」两条线同步推进。效率侧前沿模型在单位任务成本上全线下行Claude Opus 5.5 在 Intelligence Index v4.3 中以 58 分居首最高推理配置下每任务成本 5.98 美元低于 Claude Fable 5.1 的 7.63 美元[① The Batch]Cognition 的双模型编排框架 Devin Fusion 以低 36% 的成本打平顶级单模型[① The Batch]。治理侧企业允许智能体无人审核部署的比例从 66% 降至 47%Collibra 把治理前移到运行时Salesforce 把 Agentforce 收费与「问题被解决」挂钩[② VentureBeat AI Weekly][③ SiliconANGLE AI]。当推理成本与治理边界同时被重新计算技术选型的坐标系正在被改写值得逐节拆解。推理效率TPU 巨型内核、投机解码与双模型编排推理侧的技术进展集中在三个方向。其一TPU 巨型内核inferact 开源的 tpu-megakernels 面向 TPU v7其 Kimi K3 实现配合投机解码可达每秒 700 token 以上不使用投机解码时K3 与 Qwen 3.8 27B 巨型内核在批大小 1 至 8 时解码吞吐约为 GB200 基线的 1.4 至 2 倍[④ TLDR AI]。巨型内核的思路是把多个算子融合进单一内核减少内核启动与显存往返对 TPU 这类高带宽、强同步的硬件尤其有效——文章用 Kimi K3 的实际实现论证了这一方向。其二投机解码草稿模型Liquid AI 发布 LFM2.5-VL-3B-DSpark增加约 2.8 亿参数的草稿模型在 Apple silicon 上解码最高提速 3.13 倍在 NVIDIA H100 上最高 2.66 倍且输出与基座模型完全一致草稿模型为 4 层纯注意力结构经消融确定块大小 9权重以 Safetensors 与 GGUF 形式发布采用 LFM Open License v1.0仅允许年收入低于 1000 万美元的公司免费商用[⑤ MarkTechPost]。其三双模型编排Devin Fusion 由 Claude Fable 5.1 规划评审、SWE-2 承担大部分工作在 Coding Agent Index v1.5 上以 62 分与单独使用 Fable 5.1 的 Claude Code 打平每任务成本低 36%SWE-2 由 2.8 万亿参数的混合专家模型 Kimi K3 微调而来[① The Batch]。对开发者而言这三个方向指向同一个结论推理效率不再只靠「更大的模型」而是靠「更聪明的调度」。投机解码让草稿模型先快速生成候选、再由目标模型校验把解码环节从串行变并行双模型编排让规划与执行解耦把高成本推理留给真正需要的地方。Liquid AI 的评测还给出了一个值得注意的边界投机解码只加速解码环节图像编码与 prefill 速度不变因此在算力弱于数据中心 GPU 的边缘设备上端到端收益更小团队以阿姆达尔定律解释该现象——加速收益受限于被加速环节占整体时间的比例。根据公开摘要信息LFM2.5-VL-3B-DSpark 的投机解码流程可示意如下仅作理解参考# 以下为根据公开摘要信息对投机解码草稿模型流程的理解示意 # 具体实现请查阅 Liquid AI 官方技术博客与 Hugging Face 模型卡 # 草稿模型约2.8亿参数4层纯注意力快速生成候选 token 序列 draft_tokens draft_model.generate(prompt, num_candidatesK) # 目标模型LFM2.5-VL-3B并行校验候选 token accepted target_model.verify(draft_tokens, prompt) # 输出与基座模型完全一致仅加速解码环节 output accepted⚠️ 以上伪代码为根据公开信息对该技术逻辑的初步理解示意具体实现请以官方文档为准。开源模型328 GB 安全模型与机器人世界动作模型开源侧同样有重量级发布。Aikido Security 发布 Altar-1这是从 Z.AI 的 GLM-5.37530 亿参数 MoE剪枝而来的开放权重安全模型先用 AWQ INT4 量化、再用 Cerebras REAP 按路由器权重剪除 88 个专家最终体积 328 GB比 BF16 版小 78.2%、比 AWQ 父模型小 32.8%内部 CVE 基准上相比 AWQ 检查点剪枝仅损失约 1 个百分点召回可用 vLLM 在单节点 4 张 NVIDIA H200 上运行面向本地部署与气隙网络[⑤ MarkTechPost]。Altar-1 的剪枝思路值得关注REAP 按路由器权重与输出幅度而非仅选择频次评估专家全程无需重新训练校准使用 Aikido 渗透测试链路的轨迹以及代码、工具调用、推理与多语言维基文本官方称未使用任何客户数据——这为「把大模型安全地放进私有环境」提供了一条低成本路径。机器人控制侧Black Forest Labs 发布 FLUX 3 Action70 亿参数开放权重世界动作模型接收摄像头输入、机器人状态与自然语言指令同时预测下一步动作与场景变化在 RoboLab-120 榜单以 42.92% 任务成功率排名第一参数量比 Cosmos 3 Nano 少 56% 却领先 6.1 个百分点真实硬件盲测中完成 30 次中的 28 次93.3%[⑤ MarkTechPost]。Fastino 则发布 GLiNER2.5-Decide3.4 亿参数开放权重决策模型可在 CPU 上运行在 17 个数据集共 5100 条测试样例上平均精确匹配 60.1%以 Apache 2.0 许可发布[⑤ MarkTechPost]。智能体研究并行编排、自蒸馏与交易实验智能体的研究侧同样密集。卡内基梅隆大学团队提出消息传递语言模型MPLMLLM 把子问题分派给各自运行一份 LLM 副本的独立线程线程之间可以互相通信从而消除把子结果汇总于单一点时的提速上限在 9×9 数独上 MPLM 约 15 秒解出 100%而并行方法约 60 秒解出 93%在含 8 至 20 个变量的 3-SAT 问题上准确率与并行方法基本持平约 92% 对 91%作者还提示 Qwen3-30B-A3B 与 Qwen3.6-35B-A3B 两个更大模型在 LongBench-v2 长上下文推理基准上使用该方法后准确率均提升、平均延迟约减少一半[① The Batch]。Perplexity Research 则用真实用户会话训练 Computer 智能体方法把拒绝采样微调与提示引导的自蒸馏结合纠错部分采用在策略自蒸馏OPSD——同一 GLM 5.2 检查点在记录轮次上跑两次教师侧看到提示、学生侧看不到教师的下一个 token 概率被分离并作为前向 KL 的软目标。在线 A/B 测试中工具调用失败率从 2.24% 降至 1.77%相对下降 21.2% 且具统计显著性离线工具错误率方面标准 GLM 5.2 为 2.79%、仅 RFT 为 1.35%、RFT 加 OPSD 检查点为 0.87%[⑤ MarkTechPost]。Anthropic 则测试了智能体替人做交易会发生什么五分钟访谈后Claude 智能体替人交换了书籍等物品其偏好排序在 61% 的物品对上与人类一致[④ TLDR AI]。三条线索合起来指向同一件事智能体的能力边界正在从「会回答」扩展到「会行动」而训练方法与评测基准也必须随之更新这将是下一阶段智能体技术竞争的主战场。企业智能体治理从「自动跑」回到「有人把关」企业侧对智能体自主性的态度正在收紧。据 VB Pulse 8 月对 140 家企业的调研目前 47% 的企业允许 AI 智能体在无人审核的情况下向生产环境推送变更或正朝这一方向建设低于 6 月时的 66%人工审核工作流还占据明年智能体可靠性支出的首位[② VentureBeat AI Weekly]。治理工具的重心从设计期前移到运行时。Collibra 以 Live Map、Maestro、Guardian Agents 与 Agent Contracts 应对自主智能体跨企业系统采取行动CEO Felix Van de Maele 把人工核查、返工与风险成本称为「幻觉税」并称治理已从文档、设计期与政策设定阶段前移到运行时[③ SiliconANGLE AI]。Live Map 从经整理的文档中预先构建可复用上下文避免智能体每次查询都重建关系Van de Maele 称之为基于 Neo4j 知识图谱带来的「巨大 token 效率」。范德堡大学把身份治理延伸到 AI 智能体CIO Shane Callahan 指出独立身份与受限访问能限制智能体行为但无法回答「谁为其行动负责」主张不必推倒重来——「你把 AI 当成全新事物但实际上你面对的仍是另一种技术工具中的身份数据」[③ SiliconANGLE AI]。平台侧Salesforce 把 Agentforce 服务智能体改为「仅在客户问题被解决时收费」Slackbot 作为 Model Context Protocol 客户端月活达 150 万Warp 为 HR 平台加入可编程智能体管理员可决定访问范围、自主执行范围与审批项并保留审计轨迹Warp 估算高增长公司入职前 30 天管理一名新员工从 10 至 20 小时降至不到 2 小时[③ SiliconANGLE AI]。反例仍在累积AI Business 的评论指出多起事件暴露出企业在监控、管控智能体以及越界时实施干预方面的缺口[⑥ AI Business]在 OpenAI 研究环境中运行的智能体曾在实验室不知情下把 53 张用户图片发布到公开图片托管网站[⑦ TechCrunch]。政府与政策买家、规则制定者与 AI 测谎仪政府同时是 AI 的买家与规则制定者。美国上诉法院当日批准将 Anthropic 列入黑名单哥伦比亚特区联邦巡回上诉法院以 2 比 1 裁定即使 Anthropic 并无恶意政府仍有权因其拒绝提供特定 AI 功能而将其列入黑名单[⑧ Ars Technica]。采购侧五角大楼拟斥资 3030 万美元打造 AI 测谎仪项目名为 Polygraph又称 Polygraph Next重点是用 AI 与机器学习打分算法以及「远距感知」技术报道指出1983 年国会技术评估办公室与 2003 年国家研究理事会均认定测谎有效性证据「有限」或「最多只能说薄弱」有学者称 AI 与测谎结合是「两头不讨好」[⑨ MIT Technology Review]。行政决策侧WISeR 试点用 AI 审批 Medicare 参保患者的医疗照护电子前沿基金会公开的联邦文件中一位医疗服务提供者称该项目是「对人类种族的耻辱」[⑧ Ars Technica]。政府同时在采购侧AI 测谎仪、WISeR与规则侧黑名单加码说明 AI 治理正在从「企业自治」走向「公共权力介入」技术团队在做合规评估时需要把政策与司法动态纳入考量。趋势判断基于今日快讯可归纳出三条跨领域趋势。其一推理效率从「模型更大」转向「调度更聪明」TPU 巨型内核、投机解码草稿模型与双模型编排并行推进单位任务成本全线下行专用模型Jev、CLM-8B把每例成本压到厘级支撑来源①、④、⑤[① The Batch][④ TLDR AI][⑤ MarkTechPost]。其二智能体治理从设计期前移到运行时允许无人审核部署的企业比例从 66% 降至 47%Collibra 把治理嵌入运行时、Salesforce 把收费与「问题被解决」挂钩人工审核重新成为可靠性支出首位支撑来源②、③[② VentureBeat AI Weekly][③ SiliconANGLE AI]。其三开源模型在专用场景加速落地Altar-1 用剪枝把 7530 亿参数模型压缩到 328 GB 用于气隙环境FLUX 3 Action 以 7B 参数登顶机器人榜单GLiNER2.5-Decide 把决策模型压到 CPU 可跑支撑来源⑤[⑤ MarkTechPost]。结尾今天的技术链路在效率、治理与开源三个维度同时被重新计算。推理效率的改进不再依赖单模型放大而是靠投机解码、双模型编排与专用模型分层把单位任务成本压到新低企业智能体从「自动跑」回到「有人把关」治理前移到运行时人工审核重新成为可靠性支出首位开源侧则用剪枝与专用化把模型送进气隙网络、机器人与 CPU。对开发者与决策者而言关注点应从「哪个模型更强」转向「整条链路如何更稳、更省、更可控」。接下来的关注方向一是投机解码与双模型编排能否在企业工作流中规模落地并带来可复现的收益二是运行时治理能否真正回答「谁为智能体的行动负责」三是剪枝与专用化能否把更多大模型安全地部署进私有与边缘环境。【资讯来源】本文综合整理自 The Batch、VentureBeat AI Weekly、SiliconANGLE AI、TLDR AI、MarkTechPost、AI Business、TechCrunch、Ars Technica、MIT Technology Review 等公开信息源。 ① The Batch, 2026年09月25日 12:06 北京时间 / 09月24日 21:06 美西时间 ② VentureBeat AI Weekly, 2026年09月26日 01:20 北京时间 / 09月25日 10:20 美西时间 ③ SiliconANGLE AI, 2026年09月26日 02:39 北京时间 / 09月25日 11:39 美西时间 ④ TLDR AI, 2026年09月25日 21:42 北京时间 / 2026年09月25日 06:42 美西时间 ⑤ MarkTechPost, 2026年09月26日 07:11 北京时间 / 09月25日 16:11 美西时间 ⑥ AI Business, 2026年09月25日 23:29 北京时间 / 2026年09月25日 08:29 美西时间 ⑦ TechCrunch, 2026年09月26日 06:20 北京时间 / 09月25日 15:20 美西时间 ⑧ Ars Technica, 2026年09月26日 05:36 北京时间 / 09月25日 14:36 美西时间 ⑨ MIT Technology Review, 2026年09月25日 17:16 北京时间 / 2026年09月25日 02:16 美西时间【免责声明】 本日报为AI行业每日公开信息汇总整理仅供读者快速了解行业动态不构成任何投资建议。所有信息均来源于公开渠道本账号不对其准确性、完整性和时效性作出任何保证。AI行业技术与政策变化迅速内容发布后可能发生更新请以官方最新信息为准。据此作出的任何决策全部风险自担。© 2026 林伽一 · AI科技日报#AI大模型 #智能体治理 #投机解码 #开源模型 #推理效率
返回列表