ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

AIRI computer-use-mcp 的 Mimic 基线训练边界:从刻意保守到可验证的候选排序实验

AIRI computer-use-mcp 的 Mimic 基线训练边界:从刻意保守到可验证的候选排序实验 AIRI computer-use-mcp 的 Mimic 基线训练边界从刻意保守到可验证的候选排序实验【免费下载链接】airi Self hosted, you-owned Grok Companion, a container of souls of waifu, cyber livings to bring them into our worlds, wishing to achieve Neuro-samas altitude. Capable of realtime voice chat, Minecraft, Factorio playing. Web / macOS / Windows supported.项目地址: https://gitcode.com/GitHub_Trending/ai/airi导读本文聚焦 AIRI 开源仓库中computer-use-mcp服务的 mimic-baseline-training-boundary.md 文档系统梳理 AIRI 对计算机使用computer use学习模型训练路线的边界设计。核心观点是当前阶段刻意不启动 VLA视觉-语言-动作或具身模型训练不把任何学习模型接入运行时执行而是先搭建一条有界bounded的 mimic 基线实验线——从 trace schema、确定性采集器、候选映射、数据集构建到离线评估的完整基座。读完本文你将掌握该实验线的架构职责划分、权威authority排序、V1 trace 数据模型、离线评估指标与晋升门槛并能结合computer-use-mcp现有源码理解这条训练线未来如何以咨询式候选排序器的身份融入运行时。背景为什么需要一份训练边界文档AIRI 的computer-use-mcp是一个面向 macOS 的桌面编排 MCP 服务承担观察桌面/浏览器状态 → 选择执行面 → 通过工具与终端命令执行确定性动作 → 把审批、trace、审计产物挂在运行上的本地执行基座职责具体定位可参见 services/computer-use-mcp/README.md。它强调价值在编排而非光标移动本身偏好确定性执行路径terminal_exec、workflow、browser_dom_*优先于原始坐标动作。正因为该服务已有真实可用的确定性执行面何时、以何种方式引入学习出来的模型才需要一份明确的边界文档来约束。mimic-baseline-training-boundary.md正是这份未来训练线的路线图现在不启动完整的 VLA 或具身模型训练现在不把任何学习模型接入运行时执行不与 chafa、CLI、桌面 UI 宠物或终端编码工作流混线从一个有界的 mimic 基线 / 学习型候选评分器实验开始。这份文档刻意保守deliberately conservative。学习组件未来的职责是给底层 UI 候选或动作排序它不能理解用户语言、不能执行工具、不能绕过审批、不能判定任务完成。架构边界谁观察、谁规划、谁执行、谁批准文档明确了各组件之间的职责切分角色职责LLM / planner理解用户语言把目标分解为结构化的当前子目标current subgoalObserver提供截图、DOM / AX 树、候选元素、当前 URL/标题/状态以及先前动作轨迹Mimic policy只做observation - candidate/action ranking观察 → 候选/动作排序Runtime gate、审批纪律、动作执行器、验证门决定任何动作是否真正被执行也就是说mimic 评分器可以影响选择但不能授权执行。这份职责划分与仓库中已落地的 planning-orchestration 契约高度同构src/planning-orchestration/contract.ts 中定义了PLANNING_AUTHORITY_ORDER权威序列表——runtime/system rules 为最高优先级precedence 0之后依次是 active user instruction、approval/safety policy、verification gate decision、trusted current-run tool evidence、plan state reconciler decision 等计划plan被明确标注为runtime guidance, not authority。mimic 文档给出的权威排序可以看作这一思想的模型侧延伸runtime/system rules active user instruction approval and safety policy verification gate trusted current-run tool evidence planner subgoal / plan state observer candidate set mimic scorer ranking model guess排位越低权威越弱model guess处于最底层而mimic scorer ranking仅高于它。这种低权威信息只做参考、不授权执行的原则与 action-executor 中approval_required → 审批队列 → approve/reject的执行链路见 src/server/action-executor.ts保持一致任何变更性动作都必须先通过策略评估src/policy.ts与审批门学习模型未来若接入也只能在候选排序环节贡献咨询信息。状态实验边界尚无训练模型文档明确当前状态为仅实验边界experiment boundary only。computer-use-mcp包内目前不包含训练好的 computer-use 模型任何未来的 mimic 评分器在以下条件成立前都只是咨询性数据advisory data显式的运行时集成契约runtime integration contract审批契约approval contract验证契约verification contract三者未被编写并测试之前评分器不得进入运行时。这一立场与仓库现状一致services/computer-use-mcp/目录下仅有设计文档mimic-baseline-training-boundary.md、planning-orchestration-contract.md、FEASIBILITY.md、airi-cli-architecture.md等与src/实现尚不存在experiments/mimic-baseline/目录。V1 实验形态先搭基座再谈训练文档给出的实验目录约定为services/computer-use-mcp/experiments/mimic-baseline/可能的文件布局trace-schema.ts collect-trace.ts build-dataset.ts eval-candidate-scorer.ts README.mdV1 范围共 7 步强调在基座存在之前不得实现训练定义 trace schema定义 observation、candidate、action 数据结构为确定性的浏览器 / macOS UI 任务构建 trace 采集器保存任务目标、当前子目标、截图、DOM / AX 候选、先前动作、人类选择的下一动作以及可获得的预期效果 / 验证结果把人类的 click / type / scroll 动作映射回候选 ID构建数据集构建器dataset builder构建离线评估脚本。这套先数据、后评估、最后才训练的顺序是保证未来任何 learned scorer 都可解释、可审计的前提。Trace Schema V1可追加、确定性的数据契约文档给出的第一个 schema 设计目标是append-only friendly and deterministic便于追加、确定性。核心结构MimicTraceRecordV1完整定义了每一步记录的字段interface MimicTraceRecordV1 { schema: computer-use-mcp.mimic-trace.v1 traceId: string stepId: string createdAt: string taskGoal: string currentSubgoal: string observation: { screenshotPath?: string screenshotSha256?: string url?: string title?: string app?: string windowTitle?: string candidates: MimicCandidateV1[] } previousActions: MimicActionV1[] chosenAction: MimicActionV1 chosenCandidateId?: string mapping: { status: matched_candidate | no_target | ambiguous | outside_observed_bounds candidateId?: string distancePx?: number reason?: string } expectedEffect?: string verification?: { status: passed | failed | unknown summary?: string } source: { collector: manual | deterministic_demo | human_replay platform: macos browser?: chrome } }候选与动作结构刻意保持底层low-levelinterface MimicCandidateV1 { id: string source: chrome_dom | ax | vision | manual role?: string label?: string text?: string bounds: { x: number, y: number, width: number, height: number } enabled?: boolean visible?: boolean metadata?: Recordstring, unknown } type MimicActionType click | type_text | scroll | press_key | wait | no_target interface MimicActionV1 { type: MimicActionType candidateId?: string point?: { x: number, y: number } text?: string direction?: up | down | left | right key?: string }需要注意几个设计要点mapping.status提供matched_candidate命中候选、no_target无目标、ambiguous歧义、outside_observed_bounds超出观察边界四种状态并可选记录distancePx与候选的距离像素和reason。这保证了人类动作到候选 ID 的映射过程可解释、可审计是后续低 unmapped 率考核的原始依据。verification把预期效果与验证结果passed / failed / unknown一起保存为未来学习期望效果 → 验证关联预留了字段。source.collector区分manual、deterministic_demo、human_replay三种采集来源平台限定为 macOS、浏览器限定为 Chrome与computer-use-mcp当前 macOS-only 的 v1 主线一致。这些候选/动作字段可以在仓库现有实现中找到对应原型。例如 src/desktop-grounding-types.ts 中的TargetSource chrome_dom | ax | vision | raw与MimicCandidateV1.source几乎一一对应DesktopTargetCandidate同样包含id、role、label、bounds、enabled、selector等字段且按TARGET_SOURCE_PRIORITYchrome_dom ax vision raw进行排序与 IoU 去重src/accessibility/types.ts 的AXNoderole、title、value、bounds、enabled则对应 AX 候选的来源结构。也就是说mimic 的 V1 schema 与 grounding 层已经共享同一套多源候选心智模型未来采集器可以直接复用 grounding 快照DesktopGroundingSnapshot作为 observation 的实体来源。安全红线不得把原始密钥、Cookie、API Key 或完整浏览器存储写入 trace。这与仓库中secret_read_env_value/clipboard_read_text的掩码预览设计如 src/server/action-executor.ts 中的maskClipboardPreview、maskEnvValuePreview一脉相承观测与审计数据只保留必要信息不落敏感明文。Dataset Builder 契约有界样本转换数据集构建器把 trace 记录转换为有界bounded的训练样本input: task goal current subgoal screenshot reference candidate list previous actions label: chosen action type chosen candidate id when mapped no-target / unmapped status when not mapped注意两个关键约束输入是截图引用而非截图本体首个数据集格式可以是 JSONL截图以引用文件形式保留除非后续训练后端明确需要打包否则不内联为 base64。这既控制数据集体积也便于审计与差分。标签必须诚实反映未映射状态当动作无法映射到候选no-target/ unmapped时同样要作为标签样本记录下来而不是静默丢弃——这是保证模型学会何时不点的基础。离线评估指标先于任何训练的验收线首个离线评估脚本必须报告以下指标Top-1 candidate match候选匹配 Top-1Top-3 candidate match候选匹配 Top-3action type accuracy动作类型准确率no-target / unmapped-action rate无目标 / 未映射动作占比unsafe / invalid candidate rate不安全 / 无效候选率如适用评估输出要求确定性、基于文件deterministic and file-based不调用运行时工具、不改变桌面状态、首个 schema 契约阶段不需要模型提供方 API Key。这保证了评估结果可复现、可提交到 CI、可被后续实验对比——与仓库中vitest等确定性测试资产如 src/policy.test.ts、src/accessibility/ax-tree.test.ts保持同一套确定性验证哲学。晋升门槛Promotion Gates何时才允许讨论运行时集成文档明确规定在以下条件全部满足之前不要讨论运行时集成至少存在 50100 条干净clean的 trace候选提取在目标演示任务上保持稳定人类动作映射具备可解释的低 unmapped 率离线 top-k 指标可重复unsafe / invalid 候选案例被度量而非敷衍带过measured, not hand-waved审批与验证边界保持不变。即便门槛全部通过学习型评分器进入运行时也只能作为咨询性排序advisory ranking绝不能直接执行工具。这一条与文档开头mimic scorer can inform selection. It cannot authorize execution.首尾呼应也再次对应 src/planning-orchestration/contract.ts 中计划不构成可执行指令或系统权威的信任边界声明。所有权边界Chika 可以拥有什么文档用Chika指代该实验线的主要执行角色并明确划分了第一切片内的职责归属第一切片内 Chika 可拥有collector采集器schemadeterministic browser demo task确定性浏览器演示任务candidate mapping候选映射dataset builderoffline eval离线评估第一切片内 Chika 不应拥有完整的 VLA 训练运行时执行集成Windows 支持终端编码工作流集成模型部署AIRI 拥有训练好的 computer-use 模型这类产品声明Non-Goals明确的不做清单文档以显式清单收束边界任何越过这些红线的工作都超出本实验线范围不进行完整的 VLA 训练不做运行时自动执行不接入终端编码工作流不支持 Windows不部署模型除非 trace 序列化严格需要否则不改 MCP schema不做桌面 / chafa / CLI 宠物集成不做AIRI 拥有训练好的 computer-use 模型的产品声明。这与仓库 README 的 Known LimitsmacOS only 主线、尚无 accessibility tree grounding、全局坐标下安全边界靠审批 审计相互印证共同勾勒出computer-use-mcp当前确定性优先、学习模型后置的务实姿态。复盘触发语Reminder Trigger给未来重新打开这条线的人文档最后留下了一段唤醒提示供未来重新打开该实验线时提醒决策者保持克制Do not train or deploy yet. First prove the mimic trace schema, deterministic collector, candidate mapping, dataset builder, and offline eval.只有在上述晋升门槛全部达成之后才应重新审视训练决策。这本质上是一条先证明数据与评估基座再谈训练与部署的工程纪律——也是本仓库在 AI 驱动 UI 自动化领域最值得借鉴的设计取舍把学习组件降级为可替换的咨询性评分器把确定性执行、审批与验证牢牢握在运行时手中。实践建议如何在当前仓库里跟进这条线阅读设计文档全文services/computer-use-mcp/mimic-baseline-training-boundary.md对照服务定位services/computer-use-mcp/README.md研究候选数据来源DesktopTargetCandidate与TargetSource定义于 src/desktop-grounding-types.tsAX 树类型见 src/accessibility/types.ts研究权威序与信任边界planning-orchestration 契约位于 src/planning-orchestration/contract.ts其设计说明见 services/computer-use-mcp/planning-orchestration-contract.md研究执行与审批链路src/server/action-executor.ts 与 src/policy.ts运行验证命令pnpm -F proj-airi/computer-use-mcp typecheck与pnpm -F proj-airi/computer-use-mcp test。当 V1 基座trace schema、确定性采集器、候选映射、数据集构建器、离线评估在experiments/mimic-baseline/目录落地并通过晋升门槛后一个以MimicTraceRecordV1为数据契约、以 Top-1/Top-3 与 unmapped 率为验收指标的咨询式候选评分器才具备进入computer-use-mcp运行时讨论的资格——而在此之前它始终只是一条被刻意约束、可验证、不越权的实验线。【免费下载链接】airi Self hosted, you-owned Grok Companion, a container of souls of waifu, cyber livings to bring them into our worlds, wishing to achieve Neuro-samas altitude. Capable of realtime voice chat, Minecraft, Factorio playing. Web / macOS / Windows supported.项目地址: https://gitcode.com/GitHub_Trending/ai/airi创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表