
PrecogUI:基于预认知仿真与经验检索的主动式GUI智能体arXiv编号:arXiv:2609.36923v1摘要现有的反应式图形用户界面(GUI)智能体在长视界、动态场景中极易失效;弹窗、黑屏等意外扰动会分散智能体注意力,引发连锁式故障。针对该问题,本文提出PrecogUI预认知架构,将执行范式从被动反应转变为主动决策。本系统包含三大核心组件:1)PEP主动经验池,双记忆存储库缓存反复出现的异常与成功模式,以「状态(D_{layout}(L,L’)=1‑S_{layout}(L,L’))动作(D_{layout}(L,L’)=1‑S_{layout}(L,L’))结果」元组形式保存;2)PSE主动仿真执行器,学习根据候选动作预测符号化UI布局,实现早期异常规避,并依据预测可靠性对候选动作排序;3)PEC预认知执行控制器,融合经验先验与仿真预测,优先处理预见到的异常,通过闭环纠错机制保障执行鲁棒性。为开展可靠评测,本文开发AutoTraj自动数据生成引擎,构建InterfereBench评测基准;该基准面向强扰动下的长视界GUI任务,包含1160组任务轨迹,覆盖34款不同应用。实验结果表明:PrecogUI在InterfereBench基准上显著超越SOTA方法;同时在公开基准上保持有竞争力性能。本项目代码将开源。关键词GUI智能体;长视界;主动式智能体;UI世界模型;异常鲁棒;移动端自动化目录引言方法2.1 整体架构总览2.2 AutoTraj数据流水线与InterfereBench基准2.3 PEP主动经验池(双记忆存储)2.4 PSE主动仿真执行器2.5 PEC预认知执行控制器(闭环控制)实验3.1 实现细节3.2 评测基准集合3.3 主实验结果3.4 消融实验相关工作结论参考文献附录简要说明1 引言基于多模态大模型的GUI智能体,能够理解用户指令,解析界面上下文,完成点击、滑动等操作,实现手机端任务自动化。尽管多模态模型能力持续提升,但动态环境中的各类扰动(弹窗通知、黑屏、界面卡顿)依旧是巨大障碍,容易分散智能体注意力,触发连锁失效。当前主流GUI智能体均属于反应式范式:只能依据当前观测做出决策。该范式在短视界、无干扰任务表现良好;面对长视界动态场景,一旦出现弹窗、加载延迟等非目标类刺激,性能会显著衰减。本文在AndroidControl上对主流反应式智能体开展注入扰动评测,得到关键观测结论:覆盖层类扰动(弹窗、通知)平均使任务成功率下降超20个百分点;环境级扰动(黑屏、卡顿)约下降10个百分点。性能退化随任务步数单调加剧:短视界(5步)全部模型鲁棒性尚可,成功率≥91%;中等长度(6(D_{layout}(L,L’)=1‑S_{layout}(L,L’))15步)性能明显下滑;长视界任务(15步)反应式智能体成功率仅约50%。核心问题:如何赋予智能体预认知规划与显式异常处理能力,提升长视界动态GUI环境下鲁棒性?本文提出PrecogUI,融合经验检索与前向仿真的GUI智能体框架。PEP主动经验池:双记忆库缓存成功、异常交互模式,基于布局相似度检索历史案例,复用过往处理经验。PSE主动仿真执行器:条件隐式扩散模型,在执行动作前预测下一步符号化UI布局;识别潜在异常,对候选动作做可靠性打分排序。仅输出UI元素(类型+包围盒),不生成真实渲染图片,计算开销更低。PEC预认知执行控制器:融合经验池先验、仿真预测结果,闭环执行;包含状态监控、重试、回滚恢复机制。配套构建:AutoTraj自动轨迹生成引擎:大规模生成带可控扰动的GUI交互轨迹。InterfereBench:长视界扰动评测基准,1160组任务轨迹,覆盖34款应用,每组包含干净原始轨迹+2种受控扰动回放版本,标注截图约27000张。本文主要贡献提出PrecogUI统一框架:结合离线经验复用、预认知布局仿真、感知异常的执行恢复闭环,提升长视界GUI交互鲁棒性。构建InterfereBench扰动鲁棒评测基准与AutoTraj自动化轨迹生成流水线,专门用于评估持续扰动下长视界GUI智能体性能。在自建基准与多个公开GUI基准开展大量实验;PrecogUI在强扰动场景相比最优基线提升22.4个百分点,同时保留通用GUI任务能力。2 方法2.1 整体架构总览PrecogUI整套系统四大模块:AutoTraj:数据生成,产出InterfereBench扰动基准;PEP主动经验池:基于UI布局结构索引,记忆异常与成功模式,检索相似历史案例;PSE主动仿真执行器:预测候选动作执行之后的符号化UI布局,估计异常风险,输出候选动作可靠性排序;PEC预认知执行控制器:融合PEP先验与PSE仿真预测,在线状态监控,提供重试、回滚闭环恢复控制。完整伪代码见附录G。2.2 AutoTraj数据流水线与InterfereBench基准AutoTraj包含三大组件:自主探索器、轨迹解析器、扰动注入器,同时配套PolyTouch多手势宏执行层,支持多指手势、捏合缩放、带守卫条件的回放宏、重试与回滚。自主探索器 Explorer混合感知策略:优先使用UI视图层级获取可交互控件;结构信号缺失时,回退至目标检测+OCR视觉流水线,输出统一候选控件集合。使用预训练智能体执行原子动作(点击、滑动),记录前后截图、动作元信息,生成可回放轨迹。状态探索价值公式:[V\left(s_{t}\right)=\alpha \cdot \frac{\left|E_{t} \backslash\left(\bigcup_{it} E_{i}\right)\right|}{\left|E_{t}\right|+\varepsilon}+(1-\alpha) \cdot \frac{1}{\sqrt{n\left(s_{t}\right)+1}}]E t E_tEt当前状态控件集合;n ( s t ) n(s_t)n(st)状态访问次数;第一项鼓励发现未见过的控件布局;第二项鼓励访问稀有状态;α \alphaα平衡两者。轨迹解析器 Parser阶段1:基于布局变化统计,过滤过长、自循环、空操作冗余轨迹。阶段2:大模型筛选,评估主题一致性、因果合理性、任务复杂度,筛选高质量轨迹。输出结构化JSON:高层目标、分步描述、动作类型、UI包围盒、屏幕变化、执行结果。扰动注入器 Perturbation Injector对干净轨迹注入真实场景扰动:覆盖层干扰:系统通知、弹窗对话框;环境扰动:黑屏/重复帧模拟加载卡顿、布局自发变化。经过专家人工校验,生成成对样本:原始干净版本 + 扰动回放版本。InterfereBench统计信息34款不同应用;1160组任务轨迹;原始干净轨迹截图约27000张;每组包含一条14(D_{layout}(L,L’)=1‑S_{layout}(L,L’))37步干净轨迹 + 2种不同类型扰动回放;支持Low/High两种指令粒度评测设置。PolyTouch多手势执