ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

UI-TARS Desktop实战:三步用自然语言跑通第一个GUI自动化任务

UI-TARS Desktop实战:三步用自然语言跑通第一个GUI自动化任务 UI-TARS Desktop实战三步用自然语言跑通第一个GUI自动化任务【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop你要把 VS Code 的自动保存打开并设置 500 毫秒延迟。手动要做的是开设置、搜关键词、改选项、设数值四步鼠标键盘来回。UI-TARS Desktop 是一个跑在本机的原生 GUI 代理你用自然语言把任务说一遍它靠截图识别加动作执行替你点完全部步骤。它省掉的是找按钮—点—等响应的重复循环而且不用写一行脚本。一分钟看懂 UI-TARS DesktopUI-TARS Desktop 是基于 UI-TARS 多模态模型的桌面应用Windows 和 macOS 都有。它的原理不复杂每一轮把当前屏幕截图发给视觉语言模型VLM分析模型预测出类似点击坐标、输入文本这样的动作再由内置的操作器Operator真实执行循环直到任务完成。整个过程不依赖网页 DOM所以只要是画面上能看到的按钮理论上都能操作。适合不想写脚本、想把跨应用的重复 GUI 操作甩出去的人适合已经能部署或调用 UI-TARS-1.5-7B、Doubao-1.5-UI-TARS 模型端点的人不适合多显示器用户快速开始明确提示多屏可能导致任务失败不适合期待开箱即离线使用的人应用不内置模型必须先配好 VLM 的 API 端点跑通最小闭环获取应用macOS 上装了 Homebrew 的话直接执行brew install --cask ui-tars其他情况按 快速开始 里Download一节从官方发布页下载对应系统的安装包即可。安装并授予两个权限macOS 用户把 UI TARS 图标拖进 Applications 文件夹你会看到拖拽安装的窗口UI-TARS 出现在应用程序列表里然后在系统设置 → 隐私与安全性里为它同时打开辅助功能Accessibility和屏幕录制Screen Recording一个负责控制鼠标键盘一个负责截屏。两个都缺会让任务直接跑不起来。两个权限开关都要打开Windows 用户双击安装包按向导走完即可配置模型端点打开左下角齿轮进入设置核心参数就四个VLM Provider、VLM Base URL、VLM API KEY、VLM Model Name。用火山引擎的 Doubao-1.5-UI-TARS 可以直接填Language: cn VLM Provider: VolcEngine Ark for Doubao-1.5-UI-TARS VLM Base URL: https://ark.cn-beijing.volces.com/api/v3 VLM API KEY: YOUR_API_KEY VLM Model Name: doubao-1.5-ui-tars-250328走 Hugging Face 的则选 Provider 为 Hugging Face for UI-TARS-1.5Base URL 和 Model Name 在部署后的 endpoint 页面查看注意 Base URL 必须以/v1/结尾。填完点一下 Check Model Availability提示可用才算配好。设置页四个参数填齐后点按钮验证模型连通性第一次运行输入什么主界面是两张卡片先选本地操作方式左卡是 Computer Operator右卡是 Browser Operator在左侧底部的对话框里输入并发送Please help me open the autosave feature of VS Code and delay AutoSave operations for 500 milliseconds in the VS Code setting.运行期间右侧 Screenshot 面板会随每一步刷新屏幕画面你看它自己打开 VS Code、在设置里搜索关键词、切换自动保存选项、修改延迟数值全程不接管你的鼠标。任务结束后这一轮完整的截图、预测和动作记录可以导出成 HTML 报告逐条回看。想换任务只需换一句话让它在 GitHub 上查某个项目最新的 issue在访达里新建一个名为项目文档的文件夹打开天气网站查一下北京本周天气输入指令回车后右侧开始逐轮展示执行截图选 Browser Operator 时同理但前提是本地已装好 Chrome、Edge 或 Firefox 三者之一否则浏览器模式起不来。进阶玩法用预设一键切换整套配置它能做什么预设是一份打包的全部设置支持从本地 YAML 文件或远程 URL 导入远程预设会在每次启动时自动拉取更新。怎么打开设置页里选 Import Preset指定文件或粘贴 URL。什么时候你会用到它团队里几个人共用同一套模型参数把预设放在远程仓库大家启动应用就是同一份配置不用逐台手填。导入成功会直接刷新设置项内容非法会给出明确报错导出执行报告回看每一步它能做什么记录每轮的截图、模型预测与执行结果生成完整 HTML 报告。怎么打开任务结束后点 Export as HTML不配 Report Storage Base URL 就本地下载配了则上传并把链接复制到剪贴板。什么时候你会用到它任务跑歪了你需要判断是哪一步的判断开始出错而不是重跑一遍碰运气。调执行节奏避免抢拍它能做什么Max Loop 控制单轮最多走多少步25~200默认 100Loop Wait Time 是每次截屏前的等待时间0~3000 毫秒默认 1000。怎么打开设置页 Chat Settings 区域两个数字框。什么时候你会用到它操作加载慢的网页应用时把 Loop Wait Time 调大防止页面还没渲染完它就动手点击。避坑指南现象原因解法发任务后立刻报错模型不可用Base URL 没以/v1/结尾或 Key 抄错回 endpoint 页面核对两个值再点 Check Model Availability动作解析错点的位置和行为都不对VLM Provider 与模型来源不匹配Provider 按模型来源选Hugging Face 配 UI-TARS-1.5火山引擎配 Doubao-1.5-UI-TARS多显示器下部分任务莫名失败官方仅支持单显示器环境收成单屏使用quick start 已明确警告多屏会出问题Browser Operator 无法启动本机没装 Chrome / Edge / Firefox装任意一个重启应用找不到可用的远程 Operator 入口官方 Remote Operator 服务已于 2025-08-20 停用改用 Local Computer / Local Browser Operator把 Language 改成 zh 后界面还是英文该参数只影响 VLM 的输出语言不影响应用界面应用界面语言另行处理别指望这个开关想继续深入快速开始 有完整的模型获取与配置流程设置文档 逐字段解释了每个选项想把 Agent 嵌进自己的程序则看 SDK 文档 和 packages/ui-tars/operators/ 下的操作器实现examples/presets/default.yaml 是一份可直接改造的预设样例。收尾接下来可以做的三件事先跑一个浏览器任务选 Local Browser Operator让它在你常用的站点上完成一次查询再打开 HTML 报告看它实际走了几轮。然后写一份自己的预设照 examples/presets/default.yaml 的结构改掉模型参数从设置页导入验证切换是否生效。最后如果你不想依赖桌面应用用 SDK 文档里的npx ui-tars/cli start从终端控制电脑同一个模型端点直接复用。能说一句自然语言就交出去一个完整任务这就是 UI-TARS Desktop 给你的东西——省下的不是一次点击而是那整段攥着鼠标等页面响应的时间。【免费下载链接】UI-TARS-desktopThe Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS-desktop创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表