100,539· 11,187 forks· Python· MIT开源替代

Browser Use - AI驅動的瀏覽器自動化框架

browser-use/browser-use

讓大模型像人類一樣操作瀏覽器,自動完成填表、購物、資料提取等複雜網頁任務的開源Python框架

成熟度維護極活躍,4天前最新提交,10萬+ stars,283個open issues顯示需求旺盛,YC W25孵化專案

GitHub 仓库 → HN 讨论 · 259 点 · 100 评论对标:Browserbase Stagehand、Selenium IDE

项目体检

部署 · Docker一键部署(docker run -v "$PWD/data":/data browseruse),或pip安装后通过CLI/Python脚本启动,默认无固定端口(Playwright动态分配),支持headless模式

成本 · 必需LLM API Key(OPENAI_API_KEY/ANTHROPIC_API_KEY/GOOGLE_API_KEY等,支持国产DeepSeek/Grok),可选BROWSER_USE_API_KEY使用官方云端浏览器(含反爬虫/代理轮换),无Key可用本地Ollama,开箱需配置至少一个模型接口

技术 · Python 3.11+ + Playwright(浏览器自动化) + Rust核心引擎(0.13版本) + CDP协议 + LangChain兼容接口,支持OpenAI/Anthropic/Google/AWS Bedrock等多模型

许可 · MIT协议,可自由商用(包括闭源商业产品),无需开源衍生代码

活跃 · 4天前最新提交,334位贡献者,最新release 0.13.2(2026-06-12),月均多次版本迭代,社区极活跃

解決什麼

傳統瀏覽器自動化工具(如Selenium)需要開發者編寫大量選擇器程式碼,每次網頁改版就要重寫指令碼。Browser Use讓大模型直接"看"網頁、"思考"操作步驟,自動完成填表、購物、資料提取等任務。它把瀏覽器變成AI的"手",開發者只需用自然語言描述目標,模型會自己規劃點選、輸入、滾動等操作序列。典型場景包括:批次填寫求職申請、自動化採購清單、提取競品資料、自動化測試複雜互動流程。

為何火

10萬+ stars背後是三個核心優勢:1) 端到端任務執行 - 不同於Stagehand的單步操作,Browser Use能完成"找到商品→加入購物車→結賬"這樣的完整流程;2) 多模型相容 - 支援OpenAI/Claude/Gemini/DeepSeek等15+模型,國內使用者可用通義千問/DeepSeek降低成本;3) YC背書+活躍迭代 - 作為YC W25專案,4天前還在更新,0.13版本引入Rust核心大幅提升效能。HN社群熱議其在多倫多駭客松被"抄襲"獲獎的事件,反證專案成熟度已達到可直接demo的程度。

核心功能

  • 視覺理解 - 基於Playwright截圖+DOM樹,讓模型"看懂"頁面結構(包括Shadow DOM、iframe)
  • 自定義工具 - 可注入Python函式作為模型可呼叫工具,例如對接內部API、讀取資料庫
  • 持久化會話 - 支援連線已登入的瀏覽器Profile,繞過LinkedIn等平臺的自動化檢測
  • 恢復機制 - 參考程式碼Agent設計,操作失敗時自動重試或調整策略
  • 雲端託管 - 官方Cloud服務提供反爬蟲瀏覽器、代理輪換、驗證碼求解(基準測試顯示雲端Agent成功率比開源高30%)

安裝

方式一:Python本地安裝

pip install "browser-use[core]"  # [core]額外安裝Rust執行時
browser  # 啟動互動式CLI

方式二:Docker部署(推薦生產環境)

docker run -v "$PWD/data":/data \
  -e OPENAI_API_KEY=sk-xxx \
  browseruse/browseruse

方式三:原始碼開發

git clone https://github.com/browser-use/browser-use.git
cd browser-use && pip install -e ".[dev]"

首次執行會自動下載Chromium(約300MB),國內網路建議配置映象或手動指定Chrome路徑(BROWSER_USE_EXECUTABLE_PATH)。

適合誰

  • RPA開發者 - 替代UiPath/Automation Anywhere處理非結構化網頁
  • 資料工程師 - 抓取需要登入/互動的動態內容(電商價格、社交媒體)
  • QA測試 - 用自然語言編寫端到端測試用例,無需維護脆弱的XPath
  • 創業團隊 - 快速驗證需要網頁自動化的MVP(如AI助理、聚合服務)

不適合:純靜態頁面爬取(用requests更快)、需要毫秒級響應的場景(LLM推理延遲2-5秒)。

社群評價

HN討論(259點/100評論)熱度集中在三個爭議點:

正面觀點 - 多位開發者確認週末用Gemini模型快速搭建原型,"比Stagehand星標多得多且相容更多模型";YC創始人稱"很多同期專案基於browser-use構建產品,這正是開源的價值"。

安全質疑 - 有安全研究者警告:專案使用CDP除錯協議、停用Playwright沙箱、引導使用者連線主瀏覽器,存在提權漏洞風險。官方回應稱已在文件標註風險,建議生產環境用隔離Profile。

LinkedIn反爬 - 多個使用者反饋LinkedIn會封禁自動化賬號。社群給出方案:連線本地已登入瀏覽器(BrowserProfile(user_data_dir="..."))可繞過部分檢測,但巢狀UI和多滾動容器仍是難點,需自定義buildDomTree.js

抄襲事件 - 多倫多駭客松有團隊用browser-use冒充自研獲獎,評委質疑時對方聲稱"週末從零開發"。事件引發對開源專案署名規範的討論,但創始人表態"不強制引用,能催生更多創業想法就夠了"。

選型對比

維度Browser UseBrowserbase StagehandSelenium/Playwright
操作粒度端到端任務鏈單步原子操作手動編寫每一步
模型支援15+模型主要OpenAI無(純程式碼)
反爬蟲雲端版強(需付費)內建指紋管理需自行配置
學習成本低(自然語言)中(需理解Prompt工程)高(CSS選擇器+非同步程式設計)
成本LLM呼叫費($0.01-0.1/任務)按瀏覽器時長計費僅伺服器成本

取捨建議 - 簡單重複任務用Selenium更經濟;需要推理的複雜流程(如"找最便宜的符合條件的商品")用Browser Use;企業級合規需求選Browserbase的託管方案。

已知坑

  1. CDP安全風險 - 開啟Chrome除錯模式(--remote-debugging-port)會暴露瀏覽器完全控制權,切勿在公網環境使用或連線含敏感資訊的Profile
  2. LinkedIn等平臺限制 - 巢狀iframe和動態載入內容識別率低,社群建議修改allowed_domains白名單+自定義extract_content函式
  3. 模型幻覺 - GPT-4o等模型可能"臆想"不存在的按鈕,建議在BrowserProfile中啟用save_recording=True錄屏排查
  4. 中國網路 - Playwright首次啟動需從Google下載Chromium,可設定PLAYWRIGHT_SKIP_BROWSER_DOWNLOAD=1後手動安裝,或用Docker映象
  5. 成本控制 - 複雜頁面單次操作可消耗10K+ tokens,建議設定max_actions_per_step限制和allowed_domains減少無關內容

官方文件建議生產環境優先使用Cloud版本(內建代理池和CAPTCHA solver),開源版本更適合開發測試和深度定製場景。

安装方式:pip install "browser-use[core]" 或 Docker