2,013· 178 forks· Python· Apache-2.0开发工具

PixelRAG:畫素級網頁截圖檢索系統

StarTrail-org/PixelRAG

用網頁截圖代替HTML解析做檢索增強生成,保留表格圖表等視覺結構,讓AI直接"看"頁面回答問題

成熟度維護活躍,最近提交1天前,open issues 13個

项目体检

部署 · 无Docker配置,通过pip分阶段安装(基础/嵌入/服务),需从HuggingFace下载预构建索引(217GB起)后本地启动FastAPI服务

成本 · 基础功能开箱即用(公开API无需Key),自建索引需Playwright/FAISS/GPU推荐,训练模块需独立uv环境+CUDA 12.9+cuDNN 9.20

技术 · Python + Playwright(截图) + Qwen3-VL-Embedding(LoRA微调) + FAISS(向量检索) + FastAPI(服务)

许可 · Apache-2.0,允许商用修改,需保留版权声明

活跃 · 1天前最新提交,3位核心贡献者,最新release 2026年6月(Chrome 150驱动),活跃开发中

解決什麼

傳統RAG系統將網頁解析為純文本後檢索,會丟失表格、圖表、資訊圖等視覺結構。當用戶問"表格第三行資料是多少"時,文本塊無法保留原始佈局,導致大模型答非所問。PixelRAG通過將文件渲染為截圖瓦片(screenshot tiles),讓檢索直接在影像層面進行,視覺模型可以像人一樣"看"頁面回答問題。

為何火

該專案來自Berkeley SkyLab/BAIR/NLP三大實驗室聯合研究,用LoRA微調的Qwen3-VL-Embedding模型實現了視覺內容可檢索的突破。核心亮點是提供了810萬維基百科頁面的公開API端點(api.pixelrag.ai),無需註冊即可呼叫,甚至支援圖片作為查詢輸入。HackerNews雖討論量不大,但專案在GitHub獲得2000+星標,說明開發者對"用截圖代替HTML"這一思路的認可。

核心功能

截圖渲染: pixelshot命令基於Playwright CDP協議,將網頁、PDF、圖片渲染為固定尺寸的瓦片影像,保留原始視覺佈局。

視覺檢索: 微調後的Qwen3-VL模型將截圖嵌入向量空間,FAISS索引支援文本或圖片查詢,檢索出最相關的頁面瓦片。

Claude外掛: 作為pixelbrowse技能安裝後,Claude可直接截圖網頁並讀取影像內容,無需MCP伺服器。

託管API: 公開端點提供810萬維基百科頁面檢索,單次請求返回Top-K文件,響應包含截圖URL和後設資料。

安裝

基礎截圖功能只需pip install pixelrag,提供pixelshot命令。完整流程分階段安裝:

  • 嵌入與索引構建: pip install 'pixelrag[embed]'
  • 啟動搜尋服務: pip install 'pixelrag[serve]'
  • 訓練模組需進入train/目錄單獨用uv安裝,依賴PyTorch 2.9.1+CUDA 12.9

預構建索引從HuggingFace下載(StarTrail-org/pixelrag-fai),基礎維基百科索引約217GB。

適合誰

RAG開發者需要處理表格密集型文件(財報、學術論文、技術文件)的場景,視覺檢索比文本解析更準確。

AI Agent構建者希望讓大模型"看"網頁而非讀HTML原始碼,Claude外掛提供即插即用方案。

研究人員想復現論文或基於視覺嵌入模型做二次開發,程式碼包含完整訓練流程(LoRA微調Qwen3-VL)。

中文使用者注意:公開API無需梯子,但自建索引需GPU資源(推薦),訓練環境對CUDA版本要求嚴格。

社群評價

暫無足量社群公開討論,以下為基於專案本身的中立評估:技術路線新穎,用截圖繞過HTML解析的複雜性,但217GB索引體積對個人開發者不友好。公開API降低試用門檻,Claude外掛整合是實用亮點。專案活躍度高(1天前提交),但僅3位核心貢獻者,長期維護存在不確定性。適合有GPU資源和大規模文件處理需求的團隊。

選型對比

vs 傳統RAG(LangChain+文本解析): PixelRAG保留視覺結構,但索引體積是文本方案的10倍以上,檢索速度取決於GPU效能。

vs Jina Reader/Firecrawl: 這些工具最佳化HTML轉Markdown,PixelRAG直接跳過解析,適合視覺內容佔比高的場景,但通用性較弱(純文本文件用截圖是浪費)。

vs 商業多模態搜尋: Google Lens等閉源方案功能更全,PixelRAG優勢在可自建索引、Apache-2.0可商用,且論文公開了訓練方法。

已知坑

儲存成本高: 單個維基百科索引217GB,全量四個索引(不同模型/資料集)需近1TB空間。

訓練環境嚴格: train/模組需獨立uv環境,PyTorch 2.9.1+CUDA 12.9+cuDNN 9.20版本必須精確匹配,否則LoRA微調會報錯。

截圖時效性: 動態網頁(JavaScript渲染內容)可能截圖不全,Playwright需配置等待時間,README未詳細說明最佳實踐。

API限流: 公開端點未標註QPS限制,生產環境建議自建服務,但需自行解決索引更新和多副本部署問題。

安装方式:pip