ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

9.30 大语言模型研究简报: GUI、代码、MCP 与 AP统一的Computer-Use Agent

9.30 大语言模型研究简报: GUI、代码、MCP 与 AP统一的Computer-Use Agent Holo4把 GUI、代码、MCP 与 API 统一进一个 Computer-Use Agent机构 / 团队H Company发布时间北京时间2026 年 9 月 28 日 17:44H Company 发布了新一代Holo4Computer-Use Agent包括Holo4-27B、Holo4-35B-A3B以及基于 NVIDIA Nemotron 3 Nano Omni 后训练得到的Holotron4 Nano。Holo4 最核心的变化并不是单独强化 GUI 操作而是让同一个模型可以在一次长任务中自由切换 GUI、代码执行、MCP 与 API 工具调用。模型可以在桌面、网页、Android、代码沙箱以及业务 API 环境中使用统一的 Agent 交互方式。模型概览模型架构参数规模上下文主要定位Holo4-27BQwen3.8 Dense27B256K长程、多步骤 Computer Use偏最高准确率Holo4-35B-A3BQwen3.5 MoE35B 总参数 / 3B 激活256K更低成本、更快推理Holotron4 NanoNemotron 3 Nano Omni H Company 后训练——验证同一 Agent 后训练方案可迁移到不同基础模型其中Holo4-27B 是视觉语言模型VLM能够直接接收截图与工具返回结果并输出点击、输入、代码执行或结构化工具调用等动作。真正重要的变化统一多种交互接口很多现有 Agent 都偏向某一种接口GUI Agent 主要依赖截图、鼠标和键盘Coding Agent 主要依赖 shell 与代码执行Tool Agent 更依赖 API 或 MCP。但真实任务通常会混合这些接口。Holo4 的设计目标是让模型自己判断当前最合适的执行方式。例如一个任务可以先通过 GUI 登录系统再调用 MCP 获取结构化数据随后运行 Python 处理数据最后回到桌面应用完成操作。这意味着 Holo4 更接近一种Generalist Interface Agent通用界面智能体而不是单一的 GUI 自动化模型。Agentic Task Factory自动生成可验证的训练任务H Company 为 Holo4 构建了Agentic Task Factory从产品文档、真实网站截图和开源软件中自动生成交互环境Agent 任务自动验证器verifier。目前该系统已经生成约10,000 个任务任务类型规模Web 应用约 4,000MCP Server约 3,000Desktop / OS约 3,000其中还包括Hybrid Environment同一个环境状态可以同时通过 GUI 与 MCP 暴露给模型用来训练 Agent 在不同操作接口之间选择更有效的路径。这套任务工厂的研究价值很高因为 Computer-Use Agent 的主要瓶颈之一正是如何获得大量具有真实交互、长时间跨度并且能够自动验证成功与否的训练任务。训练方法SFT 两个 RL Expert 模型合并Holo4 的后训练流程也比较值得关注。1. Supervised Fine-TuningH Company 使用约127B tokens进行监督微调其中约四分之三来自成功的 Agent trajectory。Agent 数据大致包括Desktop45%Web14%MCP / API12%Mobile3%其余数据用于多模态推理、GUI grounding、纯文本工具调用和代码能力。2. 两个强化学习专家在 SFT 模型之上H Company 使用异步在线强化学习训练两个 LoRA ExpertDesktop / Web ExpertTerminal / MCP / API Expert二者分别学习不同类型的长程 Agent 行为。3. 合并回一个模型最后两个 RL Expert 以相同权重合并回 SFT 模型并且不再进行额外训练。因此最终得到的仍然是一个统一模型而不是运行时根据任务类型切换多个模型。这一点很关键Holo4 的目标不是搭建一个“专家模型路由系统”而是通过后训练把多种 Agent interface policy 压回同一个模型中。长轨迹 Agent Harness 同样是核心H Company 还重新设计了执行 Agent 的 harness。主要变化包括支持跨数百个 Action Step 的长期 memorymemory compaction 时保留必要上下文给 Agent 提供运行在目标桌面机器本身的 shell最大任务步数从 200 提升到 300再提升到 500最长任务执行时间从 2 小时扩展到 6 小时最终把代码执行与 GUI 控制进一步统一。这说明 H Company 对 Computer Use 的判断很明确Agent 的能力并不只由模型权重决定memory、context management、工具接口与 action execution loop 同样属于模型能力的一部分。对于长程任务而言一个更好的 harness 有时可以产生与模型升级同等级别的收益。Benchmark开放模型已经接近 Frontier Agent 的部分能力H Company 报告的部分结果如下评测Holo4-27BHolo4-35B-A3BQwen3.8-27B BaseOSWorld85.2%80.8%84.3%OSWorld 2.061.7%30.9%48.0%ALE-CLI44.1%30.9%43.5%AutomationBench45.4%34.5%40.3%AndroidWorld85.1%77.6%81.9%其中 Holo4-27B 在OSWorld 2.0上达到 61.7%相比基础 Qwen3.8-27B 的 48.0% 提升13.7 个百分点。不过这些结果不能直接用于严格的跨模型排名。H Company 自己也明确说明不同模型可能使用不同 benchmark release、task subset、harness 和 effort level。因此更合理的关注点不是“谁排第一”而是观察Holo4 相对于自己的基础模型提升了多少以及这种提升是否能够跨 GUI、API、MCP 和代码任务迁移。相比主要测试 GUI 与桌面操作能力的 OSWorldAutomationBench 更直接对应 Holo4 “统一 GUI、代码、MCP 与 API”这一设计目标。AutomationBench 是面向真实企业工作流的 Agent benchmark。它构建了 CRM、邮箱、日历、即时通讯、项目管理等 47 个模拟 SaaS 工具要求 Agent 完成跨应用业务流程覆盖销售、营销、运营、客服、财务和人力资源六个领域。这里测试的并不是模型能否简单调用一个 API而是模型能否理解业务要求 → 找到正确工具/API → 跨多个应用执行操作 → 遵守业务规则 → 最终把整个系统修改到正确状态。最终评分采用严格的 end-state verification只有任务要求的所有 assertion 都满足任务才算完整成功。因此AutomationBench 实际测试的是 长程工具调用、跨应用任务规划、API discovery、状态维护和业务规则遵循能力这与企业级 Agent 的真实部署场景非常接近。从绝对成绩看Holo4-27B 的 45.4% 已经非常接近 GPT-5.6 Sol 的 45.8% 和 Kimi K3 的 46.7%与 Opus 5 的 50.3% 仍有约 4.9 个百分点的差距。但这里真正值得关注的是 能力与成本同时变化。Holo4-27B 相比基础模型 Qwen3.8-27BAutomationBench 40.3% → 45.4% 绝对提升 5.1 个百分点 相对提升 (45.4 - 40.3) / 40.3 ≈ 12.7%开放完整 Agent Trajectory比单纯开放权重更重要H Company 同时开放了用于公开 benchmark 的完整 Agent trajectories。公开数据中包含reasoningactiontool resultscreenshottoken usageverifier result。这对于 Agent 研究非常有价值。传统语言模型开源通常只有“模型权重 benchmark 分数”但 Agent 的性能高度依赖完整执行轨迹。公开 trajectory 后可以进一步研究Agent failure mode长时 memoryaction abstractionGUI 与 API 的接口选择tool-call policyimitation learningtrajectory-level reinforcement learningverifier 与 reward design。因此从研究价值来看公开执行轨迹可能比单纯公布 leaderboard 分数更重要。为什么 Holo4 值得关注Holo4 最值得关注的不是某一个 benchmark 数字而是它展示了一条相对完整的 Computer-Use Agent 技术路线强基础 VLM ↓ 大规模可验证 Agent 环境 ↓ Agent trajectory SFT ↓ 长程在线 RL ↓ 多接口 RL Expert ↓ Expert Merge ↓ Memory Shell Long-Horizon Harness ↓ Generalist Computer-Use Agent而且这套方案并不绑定某一个基础模型。H Company 把相同的后训练流程迁移到NVIDIA Nemotron 3 Nano Omni后得到 Holotron4 Nano在 GUI、MCP、API 与 Terminal benchmark 上同样取得明显提升。这意味着 Holo4 真正值得持续观察的问题是是否可以把“通用 Computer-Use Agent”主要视为一个可迁移的 post-training environment harness 问题而不必重新训练一个专用 foundation model如果这个方向继续成立那么未来 Agent 模型之间的竞争重点可能不会只集中在基础模型参数规模而会越来越取决于训练环境生成、长轨迹强化学习、工具接口设计以及 Agent runtime/harness。参考资料H CompanyHolo4 官方发布Hugging FaceHolo4 技术发布Holo4-27B 模型卡与权重Holo4 模型集合Holo4 Agent Trajectories 数据集
返回列表