ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

浏览器 Agent 提速 10 倍的秘密:Browser Use 开源 jev-ultrafast,让决策模型接管“点哪里“

浏览器 Agent 提速 10 倍的秘密:Browser Use 开源 jev-ultrafast,让决策模型接管“点哪里“ JeecgBoot AI专题研究| 从 Jev 决策模型到 jev-ultrafast把 Agent 的判断和生成拆开之后浏览器自动化发生了什么浏览器 Agent 为什么总是慢半拍用过 AI 浏览器 Agent 的人大概都有同感页面早就加载完了按钮就摆在那儿它却迟迟不动——因为每一步都要等大模型想清楚再返回下一条指令。一个普通任务比如查一趟航班往往要经历十几次操作切换单程、填出发地、填目的地、选日期、点搜索……每一次都走一遍完整的大模型推理延迟就这样一层层叠了上去。问题是下一步点哪个按钮这种事真的需要一个能写长文的大模型来深思熟虑吗Browser Use 团队给出的答案是否定的。他们把专门做判断的Jev模型接进浏览器 Agent开源了jev-ultrafast项目上线 4 天就拿到了 13.6k Star。先认识 Jev一个只做选择题的模型如果你还没接触过 Jev可以先把它理解为**“专门回答选择题的模型”**。它由 TypeSafe 推出创始人 Diogo Almeida 是一位连续创业者此前在 OpenAI 参与过指令遵循与对话训练方法的构建。和常见的大语言模型不同Jev 不生成大段文本它的输出只有两样东西选了什么以及对应的概率。举个例子A、B 两人参加比赛让 Jev 根据给定信息判断谁会赢它返回的就是A 胜概率 80%这样的结构化结果注意看返回里的usage输入 246 个 token输出只有 28 个。正因为只做判断、不做生成Jev 在这类任务上的成本据称可以比通用大模型低上百倍响应速度也快得多。它更像人的直觉判断——了解情况之后立刻给出倾向。把这个特性放到浏览器里就很好理解了页面上的输入框、按钮都已经在那里Agent 需要不停地回答下一步填哪个、点哪个、是否结束——这恰恰是一连串的选择题。jev-ultrafast 是什么jev-ultrafast 是 Browser Use 开源的一个浏览器 Agent分工非常明确Jev 负责决策下一步做什么操作、作用在哪个元素上文本模型负责补充内容只有当需要往输入框里填文字时才调用生成式模型程序负责执行把决策落实为真实的点击和输入。它的运行循环可以拆成这样几步读取当前页面整理出可操作的元素列表把操作类型 目标元素交给 Jev 判断如果需要输入文字调用文本模型生成内容程序执行操作然后重新读取页面循环往复直到 Jev 判断任务完成或遇到无法继续的阻碍。这种判断交给小而快的决策模型生成交给大模型的拆分思路其实不只适用于浏览器对任何需要高频决策的 Agent 都有借鉴意义。实测7 秒完成一次航班搜索官方 Demo 的任务是查找 2026 年 9 月 20 日从苏黎世飞往伦敦、单程、一位成人、经济舱的航班。Agent 需要依次修改行程类型、填写出发和到达城市、处理下拉候选项、选择日期再发起搜索并等待结果。整个流程耗时约7 秒对于习惯了浏览器 Agent一步一停顿的人来说这个速度确实是一个明显的跨越。快在哪里四个关键设计一次请求把两个问题一起答完网页操作每一步其实都要回答两个问题做什么点击还是输入和对谁做哪个元素。jev-ultrafast 把这两个问题合并进同一次 Jev 请求拿到结果后由程序直接执行。对于动辄十几步的任务每一步省掉一次模型往返累计下来就是数倍的时间差。读控件而不是看截图默认模式下它读取的是网页中的控件结构元素名称、当前值、可见文字等而不是逐步截图交给视觉模型理解。这样 Jev 可以直接围绕目的地输入框搜索按钮这些语义信息做判断。项目同时优化了页面读取、操作后等待等环节——最终的提速是模型选型与执行流程共同优化的结果而不只是换了一个更快的模型。每一步决策都可追溯项目提供了本地检查界面可以看到元素编号、操作概率、目标概率以及已经执行过的动作。你既可以让它全自动跑也可以设置为每一步执行前暂停。出错时顺着页面状态 → 模型选择 → 执行结果逐步排查即可。概率输出在这里很有价值当某一步的最高概率明显偏低时往往意味着页面状态和预期不一致是排查问题的好线索。执行前再确认一次页面模型做决定的那一瞬间页面可能已经变了按钮挪了位置、弹窗冒了出来、输入框被重新渲染……这些都会让刚才的判断失效。jev-ultrafast 会在执行前再次校验目标元素和页面状态并检查点击位置是否被遮挡避免点了个寂寞。冷静看待它不是万能的关于 Jev 这类决策模型目前社区里既有热捧也有降温的声音有几点值得客观看待适合封闭判断不适合开放生成Jev 擅长从已知选项中挑一个需要创作、推理链很长或涉及精确计算的任务仍然要交给通用大模型对延迟极敏感的场景未必够用比如有人尝试用它做量化交易高频场景的延迟要求它达不到低频场景又未必比现有方案更有优势页面结构质量影响很大读控件的方式依赖网页的可访问性信息遇到大量 Canvas 绘制或结构混乱的页面效果可能打折扣届时仍需截图 视觉模型兜底。但让 AI 更快、更便宜地做出一个小判断这件事本身就有清晰的价值。浏览器自动化只是第一个被验证的场景表单填写、RPA 流程、工单分流、测试用例执行等需要大量小决策的环节都可能从这种判断与生成分离的架构中受益。项目地址https://github.com/browser-use/jev-ultrafast总结浏览器 Agent 慢根源在于每一步小判断都在调用完整的大模型推理Jev 是只输出选项 概率的决策模型成本低、响应快天然适合高频选择题jev-ultrafast 把操作决策交给 Jev、文本填写交给生成模型并通过合并请求、读取控件、可追溯检查界面、执行前校验等设计把航班搜索压缩到约 7 秒它不能替代通用大模型但判断与生成分离的思路值得所有做 Agent 的团队参考。本文为 JeecgBoot AI 专题研究系列文章。
返回列表