Browser Use - AI驅動的瀏覽器自動化框架
browser-use/browser-use
讓大模型像人類一樣操作瀏覽器,自動完成填表、購物、資料提取等複雜網頁任務的開源Python框架
成熟度:維護極活躍,4天前最新提交,10萬+ stars,283個open issues顯示需求旺盛,YC W25孵化專案
项目体检
部署 · Docker一键部署(docker run -v "$PWD/data":/data browseruse),或pip安装后通过CLI/Python脚本启动,默认无固定端口(Playwright动态分配),支持headless模式
成本 · 必需LLM API Key(OPENAI_API_KEY/ANTHROPIC_API_KEY/GOOGLE_API_KEY等,支持国产DeepSeek/Grok),可选BROWSER_USE_API_KEY使用官方云端浏览器(含反爬虫/代理轮换),无Key可用本地Ollama,开箱需配置至少一个模型接口
技术 · Python 3.11+ + Playwright(浏览器自动化) + Rust核心引擎(0.13版本) + CDP协议 + LangChain兼容接口,支持OpenAI/Anthropic/Google/AWS Bedrock等多模型
许可 · MIT协议,可自由商用(包括闭源商业产品),无需开源衍生代码
活跃 · 4天前最新提交,334位贡献者,最新release 0.13.2(2026-06-12),月均多次版本迭代,社区极活跃
解決什麼
傳統瀏覽器自動化工具(如Selenium)需要開發者編寫大量選擇器程式碼,每次網頁改版就要重寫指令碼。Browser Use讓大模型直接"看"網頁、"思考"操作步驟,自動完成填表、購物、資料提取等任務。它把瀏覽器變成AI的"手",開發者只需用自然語言描述目標,模型會自己規劃點選、輸入、滾動等操作序列。典型場景包括:批次填寫求職申請、自動化採購清單、提取競品資料、自動化測試複雜互動流程。
為何火
10萬+ stars背後是三個核心優勢:1) 端到端任務執行 - 不同於Stagehand的單步操作,Browser Use能完成"找到商品→加入購物車→結賬"這樣的完整流程;2) 多模型相容 - 支援OpenAI/Claude/Gemini/DeepSeek等15+模型,國內使用者可用通義千問/DeepSeek降低成本;3) YC背書+活躍迭代 - 作為YC W25專案,4天前還在更新,0.13版本引入Rust核心大幅提升效能。HN社群熱議其在多倫多駭客松被"抄襲"獲獎的事件,反證專案成熟度已達到可直接demo的程度。
核心功能
- 視覺理解 - 基於Playwright截圖+DOM樹,讓模型"看懂"頁面結構(包括Shadow DOM、iframe)
- 自定義工具 - 可注入Python函式作為模型可呼叫工具,例如對接內部API、讀取資料庫
- 持久化會話 - 支援連線已登入的瀏覽器Profile,繞過LinkedIn等平臺的自動化檢測
- 恢復機制 - 參考程式碼Agent設計,操作失敗時自動重試或調整策略
- 雲端託管 - 官方Cloud服務提供反爬蟲瀏覽器、代理輪換、驗證碼求解(基準測試顯示雲端Agent成功率比開源高30%)
安裝
方式一:Python本地安裝
pip install "browser-use[core]" # [core]額外安裝Rust執行時
browser # 啟動互動式CLI
方式二:Docker部署(推薦生產環境)
docker run -v "$PWD/data":/data \
-e OPENAI_API_KEY=sk-xxx \
browseruse/browseruse
方式三:原始碼開發
git clone https://github.com/browser-use/browser-use.git
cd browser-use && pip install -e ".[dev]"
首次執行會自動下載Chromium(約300MB),國內網路建議配置映象或手動指定Chrome路徑(BROWSER_USE_EXECUTABLE_PATH)。
適合誰
- RPA開發者 - 替代UiPath/Automation Anywhere處理非結構化網頁
- 資料工程師 - 抓取需要登入/互動的動態內容(電商價格、社交媒體)
- QA測試 - 用自然語言編寫端到端測試用例,無需維護脆弱的XPath
- 創業團隊 - 快速驗證需要網頁自動化的MVP(如AI助理、聚合服務)
不適合:純靜態頁面爬取(用requests更快)、需要毫秒級響應的場景(LLM推理延遲2-5秒)。
社群評價
HN討論(259點/100評論)熱度集中在三個爭議點:
正面觀點 - 多位開發者確認週末用Gemini模型快速搭建原型,"比Stagehand星標多得多且相容更多模型";YC創始人稱"很多同期專案基於browser-use構建產品,這正是開源的價值"。
安全質疑 - 有安全研究者警告:專案使用CDP除錯協議、停用Playwright沙箱、引導使用者連線主瀏覽器,存在提權漏洞風險。官方回應稱已在文件標註風險,建議生產環境用隔離Profile。
LinkedIn反爬 - 多個使用者反饋LinkedIn會封禁自動化賬號。社群給出方案:連線本地已登入瀏覽器(BrowserProfile(user_data_dir="..."))可繞過部分檢測,但巢狀UI和多滾動容器仍是難點,需自定義buildDomTree.js。
抄襲事件 - 多倫多駭客松有團隊用browser-use冒充自研獲獎,評委質疑時對方聲稱"週末從零開發"。事件引發對開源專案署名規範的討論,但創始人表態"不強制引用,能催生更多創業想法就夠了"。
選型對比
| 維度 | Browser Use | Browserbase Stagehand | Selenium/Playwright |
|---|---|---|---|
| 操作粒度 | 端到端任務鏈 | 單步原子操作 | 手動編寫每一步 |
| 模型支援 | 15+模型 | 主要OpenAI | 無(純程式碼) |
| 反爬蟲 | 雲端版強(需付費) | 內建指紋管理 | 需自行配置 |
| 學習成本 | 低(自然語言) | 中(需理解Prompt工程) | 高(CSS選擇器+非同步程式設計) |
| 成本 | LLM呼叫費($0.01-0.1/任務) | 按瀏覽器時長計費 | 僅伺服器成本 |
取捨建議 - 簡單重複任務用Selenium更經濟;需要推理的複雜流程(如"找最便宜的符合條件的商品")用Browser Use;企業級合規需求選Browserbase的託管方案。
已知坑
- CDP安全風險 - 開啟Chrome除錯模式(
--remote-debugging-port)會暴露瀏覽器完全控制權,切勿在公網環境使用或連線含敏感資訊的Profile - LinkedIn等平臺限制 - 巢狀iframe和動態載入內容識別率低,社群建議修改
allowed_domains白名單+自定義extract_content函式 - 模型幻覺 - GPT-4o等模型可能"臆想"不存在的按鈕,建議在
BrowserProfile中啟用save_recording=True錄屏排查 - 中國網路 - Playwright首次啟動需從Google下載Chromium,可設定
PLAYWRIGHT_SKIP_BROWSER_DOWNLOAD=1後手動安裝,或用Docker映象 - 成本控制 - 複雜頁面單次操作可消耗10K+ tokens,建議設定
max_actions_per_step限制和allowed_domains減少無關內容
官方文件建議生產環境優先使用Cloud版本(內建代理池和CAPTCHA solver),開源版本更適合開發測試和深度定製場景。
安装方式:pip install "browser-use[core]" 或 Docker