ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

如何三分钟让 AI 替你操作浏览器:browser-use 浏览器自动化实操指南

如何三分钟让 AI 替你操作浏览器:browser-use 浏览器自动化实操指南 如何三分钟让 AI 替你操作浏览器browser-use 浏览器自动化实操指南【免费下载链接】browser-use Make websites accessible for AI agents. Automate tasks online with ease.项目地址: https://gitcode.com/GitHub_Trending/br/browser-usebrowser-use 是一个开源的浏览器自动化框架你用一句自然语言描述任务AI 就自己打开浏览器找页面、点按钮、填表单、下载文件最后把结果交回来。它适合需要处理重复网页操作的人——运营查数据、HR 填表格、测试跑回归。下面从一个真实的重复劳动讲起再带你用三分钟跑通第一个任务最后把提示词写法、模型选择和常见坑一次讲清。从一个真实场景说起小林是电商运营每天 9 点半做同一件事登录三个竞品页面把 iPhone 15 的售价抄进 Excel。四十分钟雷打不动还偶尔抄错价格被领导问个清楚。她把这事写成一段任务描述交给 browser-use浏览器自己打开、逐个站点搜索、读取价格、生成一张 CSV 表格全程不到两分钟她只负责核对。这就是这个项目最典型的用法——把手动点击换成一句任务描述。它能替你做什么像人一样点击、输入、滚动、下载比如用这份简历填写求职申请并勾选必填项它会自己定位每个输入框填完再点提交把网页内容变成结构化数据说抓取前 10 条商品名称和价格导出 CSV得到的文件可以直接用 Excel 打开长时间重复执行比如每小时检查一次官网是否 404异常就发邮件通知脚本挂上去就能一直跑自己扩展工具写一个 Python 函数注册成 AI 可调用的动作例如上传简历文件仓库 examples/apps/ 里有一个完整示例应用让 AI 生成广告素材和落地页下图就是其中一次生成结果自定义工具的写法也很直白from browser_use import Tools tools Tools() tools.action(description上传简历文件) def upload_resume(path: str) - str: # 把文件传到你自己的服务器 return f已上传 {path}把toolstools传进Agent(...)之后AI 会在任务需要时自己决定什么时候调用它。三分钟跑通第一个任务第一步安装需要 Python 3.11并设置模型 API Keypip install browser-use # 或者 uv add browser-use export BROWSER_USE_API_KEYyour-key这个 Key 用于官方bu-*模型如果你已有 OpenAI、Anthropic 或 Google 的密钥导出对应的变量即可。然后写第一个脚本import asyncio from browser_use import Agent, ChatBrowserUse async def main(): agent Agent( taskSearch Google for what is browser automation and tell me the top 3 results, llmChatBrowserUse(modelbu-2-0-mini-preview), ) await agent.run() asyncio.run(main())运行后会弹出一个浏览器窗口自己完成搜索、读取页面并打印出前三条结果。想看源码或跑仓库里的示例可以执行git clone https://gitcode.com/GitHub_Trending/br/browser-use拉取后再本地安装。任务提示词写法价格采集任务拆解任务描述的质量决定成败的一半。拿开头那个比价任务拆开看。需求怎么写访问京东、天猫、拼多多搜索 iPhone 15 收集每个站点第一条商品的商品名称、价格、评价数量 整理成 CSV文件里只留这三列。三个要素缺一不可具体目标哪几个站点、哪个型号、明确动作搜索后读第一条、输出格式CSV 加列名。避免帮我看看几款手机的价格这种含糊说法AI 只能靠猜猜错就是来回试。AI 实际做了什么依次打开三个站点 → 在搜索框输入型号 → 搜索 → 读取第一条商品的字段 → 逐行填表 → 写出 CSV。某个站点搜不到时它会按你的规则如实说明无结果而不是编一个数字。你拿到什么一个本地 CSV 文件直接进 Excel 就是规整的三列表格不用再手动复制粘贴。另一个值得学的细节是写失败标准。官方 examples/use-cases/ 里有个签证预约查询的例子如果本月没有可预约日期就看下个月两个月都没有就明确告诉我没有日期。加一句兜底规则AI 就不会在死胡同里反复打转。browser-use 是怎么工作的你不需要教它点哪个坐标。整体思路是每一轮先看当前页面和任务进度让模型决定下一步动作执行后观察新页面如此循环直到任务完成。分工大致是四层browser_use/agent/大脑负责任务规划和逐步决策browser_use/browser/手控制真实 Chromium处理点击、输入、多标签页和下载browser_use/dom/眼睛把页面结构转成模型能读的描述browser_use/tools/工具箱AI 可调用的标准动作加上你自定义的工具模型与成本怎么挑按预算三档开源代码本身遵循 MIT 协议免费你的成本主要是模型 API 调用。官方团队用 100 个真实网页任务对不同模型做了基准测试成功率对比如下追求效果选专为浏览器自动化优化的bu-*系列通过ChatBrowserUse接入官方数据显示它比通用模型快 3~5 倍且成功率更高性价比Gemini 或 GPT-mini 这类小模型应付日常任务够用且支持多供应商切换本地部署通过 Ollama 接入本地模型零 API 费用适合数据不能出内网的场景browser_use/llm/ 目录下为各家供应商都备好了现成适配器切换时只改model参数即可。避坑指南任务描述太模糊 → 按目标 站点 输出格式三要素重写越具体越少走错路长任务超时 → 拆成两段任务分别执行或给 Agent 设置最大步数站点需要登录 → 复用你现有的 Chrome 配置或先人工登录一次保存会话状态遇到验证码 → 先人工过一遍验证再交给 AI风控严格的站点改用官方远程浏览器方案并发开得太大 → Chromium 很吃内存先单跑确认稳定再逐步加并发常见问题它完全免费吗开源库本身免费MIT 协议你只为所用的模型 API 付费。支持哪些浏览器基于 Chromium 内核Chrome、Edge 等都可以也可以接上你已打开的浏览器实例。中文网站能用吗能它不挑语言任务描述直接用中文写也没有问题。需要编程经验吗Python 库需要一点基础如果只是偶尔跑一次任务也可以把它接给现成的 AI 助手用一句话交代即可。会被网站检测到吗内置随机延迟等拟人化行为如果目标站点风控严格建议走官方的远程浏览器方案。看到这里可以直接pip install browser-use装起来先跑一遍前面三分钟那节里的搜索任务感受浏览器自己动起来的节奏。跑顺之后翻一翻 examples/ 里的各种现成脚本挑一个改成你自己的任务就是最快的上手路径。【免费下载链接】browser-use Make websites accessible for AI agents. Automate tasks online with ease.项目地址: https://gitcode.com/GitHub_Trending/br/browser-use创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表