
Browser-Use 入门指南让 AI 替你完成重复网页操作的教程【免费下载链接】browser-use Make websites accessible for AI agents. Automate tasks online with ease.项目地址: https://gitcode.com/GitHub_Trending/br/browser-useBrowser-Use 是一个开源的 AI 浏览器自动化框架你用一句自然语言描述任务它就在真实浏览器里替你打开页面、点击、填表、下载。今天你写下的那句任务描述就是明天可以无人值守跑起来的脚本。它替你省掉哪几件重复劳动先看三个每天都在消耗时间的场景每周一下午打开 4 个竞品官网逐个记下旗舰款价格誊进 Excel再算环比每月发薪日前从 3 个后台系统各导一份报表逐个改名、归档新员工入职几十份结构相同的申请单只改名字和部门就重复填一遍。这些事单件都不难难在多、碎、重复还容易在第三次复制粘贴时手滑出错。定位一句话Browser-Use 让你用中文或英文写一句话它负责把这句话变成浏览器里真实发生的点击和输入。可信度方面的几个事实均来自 README.mdMIT 协议开源框架本身免费官方基准 BU Bench V1 在 100 个真实浏览器任务上测得 85.0% 的成功率用自家托管模型见下文图表在 Odysseys 公开榜200 个长程网页任务上以 87.4% 的平均分排名第一跑赢 OpenAI、Anthropic、Google、Microsoft 的 computer-use agent仓库 star 数已达 6.9 万意味着这套方案被大量真实场景验证过。5 分钟装好环境并跑通第一个任务环境要求Python 3.11 及以上本机装有 Chrome 或 Chromium。安装一共 3 条命令其中 clone 是可选的——克隆仓库主要是为了浏览examples/里的现成脚本# 克隆仓库含 examples/ 示例脚本方便对照抄改 git clone https://gitcode.com/GitHub_Trending/br/browser-use cd browser-use # 安装框架本体Python 3.11 pip install browser-use然后把大模型密钥写进项目根目录的.env文件例如BROWSER_USE_API_KEY你的密钥也可以换成OPENAI_API_KEY、GOOGLE_API_KEY这类自带密钥的方式。最小可运行示例任务改成去 PyPI 查 requests 库的版本import asyncio from browser_use import Agent, ChatBrowserUse # Agent 是大脑手ChatBrowserUse 接大模型 async def main(): agent Agent( task打开 PyPI 的 requests 库页面记录最近 3 个版本号和发布日期, llmChatBrowserUse(modelopenai/gpt-5.5), # 也可换其他模型见后文 ) history await agent.run() # 返回完整执行历史可用于事后审计 print(history) asyncio.run(main())运行后你会看到真实浏览器窗口自动打开导航到页面逐行读出数字最后把执行历史打印出来。整个过程 1-2 分钟比手动查还快。3 个可以直接复制改用的真实用例它吃的是任务描述不是代码。下面三件输入和预期输出都写清楚了改个对象名就能用。用例 1依赖版本巡检对应 examples/ 里的提取类脚本输入打开 PyPI 上 requests 和 httpx 两个库的下载页导出 CSV列是库名、最新版本、发布日期预期输出工作目录下生成一个 2 行 3 列的 CSV 文件文件名带当天日期用例 2批量会议预订对应表单填写类场景输入登录公司内部会议系统为 8 月 25 日至 29 日的 15:00-16:00 各订一间 8 人会议室标题分别写周会全部订完后截图留档预期输出日历上出现 5 条预订记录 一张截图文件用例 3竞品价格周报对应监控巡检类场景输入访问 3 个竞品官网记录旗舰款价格写入 CSV任何一家价格较上次记录变动超过 5% 时在该行加⚠变动标记预期输出按日期追加的 CSV变动行带标记配合系统定时任务每周自动跑一次再重一点的活也有现成演示仓库里有一个广告生成应用AI 先抓官网信息再产出广告图和落地页成品长这样完整代码在 examples/apps/ad-use/ 目录改个目标网站地址就能复用。模型怎么选先看官方基准数据再定同一个任务换不同模型成功率差距接近 3 倍。下图是官方 BU Bench V1 基准100 个真实浏览器任务的结果数据直接读图即可选型各给一句理由性能优先用托管模型图里橙色两根85.0% / 78.0%且官方称其完成任务的速度比其他模型快 3-5 倍成本优先gpt-5.566.0%或 gemini-3.5-flash65.0%这类通用模型差距不大时省下 API 费用安全优先用 examples/models/ollama.py 的方式接本地 Ollama数据不出内网适合敏感业务代价是成功率会更低。切换模型只改一行代码ChatBrowserUse支持带厂商前缀的模型 id一个BROWSER_USE_API_KEY就能同时访问多家模型也可以换成ChatOpenAI、ChatAnthropic等各自的客户端。进阶加自定义工具和调浏览器行为加自定义工具给 Agent 注册一个普通 Python 函数AI 会在需要时主动调用它而不是自己心算from browser_use import Agent, Tools tools Tools() tools.action(description把字符串按逗号拆成列表) # description 决定 AI 何时调用 def split_csv(s: str) - list[str]: return [x.strip() for x in s.split(,)] agent Agent(task解析表格第一列并去重, llmyour_llm, toolstools)调浏览器行为所有配置集中在 browser_use/browser/profile.py 的BrowserProfile里常用项有allowed_domains/prohibited_domains域名白名单收窄 Agent 能访问的范围headless无窗口模式适合服务器定时跑user_data_dir复用你已有的 Chrome 配置和登录态下载路径、代理、页面加载超时等也都能在这里调。挂回调框架内置事件系统实现在 browser_use/browser/ 下的各 watchdog 模块页面加载、下载完成、弹窗出现等时机都可以挂自己的逻辑。避坑清单稳定性、安全、性能稳定性任务描述写清可验证的完成标准导出 CSV不如导出 CSV 且列名固定为 a/b/c稳给Agent(max_steps...)设步数上限兜底防死循环主模型挂掉时配一个fallback_llm顶上而不是让整个任务失败重试逻辑在 browser_use/agent/service.py 里可以看到。安全API 密钥只放.env不写进代码需要登录的站点优先用 examples/browser/save_cookies.py 保存登录状态或复用真实浏览器配置别把明文密码写进任务描述传给模型。性能并发 Agent 先跑 1-2 个每个都会占一份浏览器内存跑顺了再加长任务用headlessTrue大站点页面加载慢时可考虑禁用图片加载提速。高频问题快答它免费吗框架本身 MIT 开源免费你只为所用大模型的 API 调用付费接本地 Ollama 连这部分也省了。不会写代码能用吗能。最小示例十几行照抄后只改task里的任务描述即可复杂场景去 examples/ 挑现成脚本改。需要登录的网站怎么办支持保存 Cookie 与会话状态也支持复用你已登录的 Chrome 配置目录首次登录后状态会保留。会被网站检测出来吗它基于真实 Chromium 内核操作带随机延迟降低明显机器的特征高安全级别站点建议先小规模试跑别一上来就放量。支持中文网站吗支持中英文页面都能处理任务描述直接用中文写即可。Python 版本有要求吗3.11 及以上装之前用python --version确认一下。现在就能做的三步今晚10 分钟按上文 3 条命令装好环境跑通查 PyPI 版本的最小任务明天30 分钟在 examples/ 目录里挑一个最像你日常工作的脚本改掉任务描述跑起来本周内给高频任务加一个自定义工具或者把模型换成 Ollama 本地模型。常用资源都在这完整文档入口README.md各场景示例examples/Agent 参数速查skills/open-source/references/agent.md边界情况测试可当行为参考tests/把重复的网页操作交给 Browser-Use把整块时间留给自己——打开终端从今晚的第一条命令开始。【免费下载链接】browser-use Make websites accessible for AI agents. Automate tasks online with ease.项目地址: https://gitcode.com/GitHub_Trending/br/browser-use创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考