
Browser-Use 入门指南用自然语言驱动浏览器完成网页任务【免费下载链接】browser-use Make websites accessible for AI agents. Automate tasks online with ease.项目地址: https://gitcode.com/GitHub_Trending/br/browser-useBrowser-Use 是开源的 AI 浏览器自动化框架你写一句任务描述它驱动真实浏览器完成登录、填表、抓取、下载这类重复网页操作。跑通全文的最小任务后你可以把任意一句工作描述交给它执行并拿到结构化的执行记录。能力速览它能替你做什么打开页面、点击、输入、滚动、下载操作路径和人一致任务描述用自然语言即可。大脑可换统一接口接 OpenAI、Google、Anthropic 等各家模型也支持 Ollama 本地模型。框架 MIT 开源免费成本只在模型 API 调用本地模型连这部分也省掉。边界说清楚它处理的是浏览器里看得见的操作不替代服务端 API 集成高并发生产负载建议用官方云端浏览器托管。环境配置从克隆到 API Key安装要求 Python 3.11 及以上共 3 步。第一条命令克隆仓库到本地git clone https://gitcode.com/GitHub_Trending/br/browser-use cd browser-use pip install -e .[cli]第二条命令把项目装进当前 Python 环境依赖随之拉齐。最后在仓库根目录建一个.env文件写入模型密钥二选一即可# .env BROWSER_USE_API_KEY你的密钥 # 或 GOOGLE_API_KEY / ANTHROPIC_API_KEY第一个任务查一个真实的 GitHub 星标数把下面脚本存成任意名字运行后浏览器窗口会自己打开、找到项目主页、读出色星标数字最后把执行记录打印出来——看到真实数字就算跑通了import asyncio from browser_use import Agent, ChatBrowserUse async def main(): agent Agent( task查找 browser-use 项目在 GitHub 上的星标数, llmChatBrowserUse(modelopenai/gpt-5.5), ) history await agent.run() print(history) asyncio.run(main())输入只有task一句话换掉这句描述它就是你自己的自动化脚本。场景实战任务描述怎么写电商比价——任务描述“访问京东、天猫、拼多多记录 iPhone 15 的当前售价和评价数量整理成 CSV列包含商品名、价格、评价数。”适合运营和市场研究。批量入职申请——任务描述“登录公司招聘系统为张三前端、李四后端填写入职申请表必填项核对无误后提交并截图留档。”适合人事和招聘团队。站点巡检——任务描述“每小时检查官网首页一次若 404、加载超过 10 秒或出现报错页给运维群发通知并把时间戳与结果写入日志。”适合运维和客服值班。复杂流程也有现成参照examples/apps/ad-use/ 让 AI 抓取官网信息后生成广告素材和落地页。进阶方向工具注册与浏览器配置注册自定义工具给 AI 加一个它会主动调用的能力。运行后你在执行记录里能看到它在需要求和的步骤直接调了工具而不是心算from browser_use import Agent, Tools tools Tools() tools.action(description计算两个数字的和) def add_numbers(a: int, b: int) - int: return a b agent Agent(task计算 17 和 25 的和, llmllm, toolstools)调浏览器行为无头模式、下载目录等参数都集中在 BrowserProfile 上改一处全局生效from browser_use import Agent from browser_use.browser import BrowserProfile, BrowserSession profile BrowserProfile(headlessTrue, downloads_path./downloads) agent Agent(task下载本月账单 PDF, llmllm, browser_sessionBrowserSession(browser_profileprofile))页面加载、弹窗、下载完成这类时机还想挂自己的回调可以去看 browser_use/browser/watchdogs/ 里的各 watchdog 实现照着加一个即可。模型选型基准图怎么看官方在 100 个真实浏览器任务上做了基准测试各模型成功率对比如下追成功率用官方优化模型 ChatBrowserUse图上居首官方口径完成任务比其他模型快 3-5 倍。控成本GPT-5.5、Gemini Flash 这类通用模型成本更低成功率仍在六成上下。数据不出内网接 Ollama 跑本地模型配置只换 llm 这一行参见 examples/models/ollama.py。稳定运行清单稳定性 / 安全 / 性能稳定性任务里写明可验证的完成标准例如“提交后出现成功提示”用max_steps参数给步数兜底防止死循环。安全密钥只放.env环境变量敏感网站的账号密码交给 2FA 集成examples/custom-functions/2fa.py不要明文传给模型。性能并发 Agent 先控制在 3 个以内每个都占一份浏览器内存大站点任务用 BrowserProfile 关掉无谓加载、指定下载路径提速。常见问题框架收费吗开源免费MIT 协议。只为模型 API 付费跑本地模型则不产生调用费。不会写代码能用吗最小任务十几行照抄示例改任务描述即可复杂场景直接翻 examples/ 目录的现成脚本。需要登录的网站怎么办支持保存登录态和真实浏览器配置首次登录后后续任务保持登录参考 examples/browser/save_cookies.py。能用哪些大模型见 llm/ 目录OpenAI、Google、Anthropic、Ollama 等都有封装ChatBrowserUse 还能用一个密钥访问多家供应商的模型。会被网站检测到吗基于 Chromium 内核内置拟人化操作和随机延迟。高安全站点先小规模试跑再决定是否放量。下一步行动跑通上文的最小任务确认你的密钥和浏览器配置可用。到 examples/ 挑一个最像你日常工作的示例改掉任务描述再跑一次。给高频任务注册一个自定义工具或把 llm 换成 Ollama 本地模型。常用资源总览 README.md、能力速查 skills/、边界情况测试 tests/。【免费下载链接】browser-use Make websites accessible for AI agents. Automate tasks online with ease.项目地址: https://gitcode.com/GitHub_Trending/br/browser-use创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考