57,342· 7,600 forks· Python· Apache-2.0开源替代

PrivateGPT - 本地模型的生產級 AI 應用 API 層

zylon-ai/private-gpt

將本地大模型封裝成生產可用的 API 層,支援 RAG、工具呼叫、MCP 聯結器等企業級功能,相容任何 OpenAI 格式推理服務

成熟度維護活躍,2天前有提交,僅6個開放issue,已有企業級產品 Zylon 基於此構建

GitHub 仓库 →对标:Claude API

项目体检

部署 · Docker 一键部署(docker compose),需配置 OPENAI_API_BASE 指向本地推理服务,默认端口 8080,内置 Web UI 位于 /ui 路径

成本 · 需要外部 OpenAI 兼容推理服务(Ollama/llama.cpp/vLLM),需配置 OPENAI_API_BASE 和 OPENAI_EMBEDDING_API_BASE 环境变量,文档处理需 LibreOffice/Pandoc,数据库工具需对应驱动

技术 · Python 3.11 + FastAPI + LlamaIndex 0.14 + Injector(依赖注入) + arq(异步任务队列),支持多种 LLM SDK(OpenAI/Anthropic/Mistral)

许可 · Apache-2.0,允许商用且无需开源衍生代码,企业友好

活跃 · 最新版本 v1.0.1 发布于 2026年6月,99位贡献者参与,2天前仍有代码提交,活跃度高

解決什麼

本地執行大模型只是第一步,要構建真正可用的 AI 應用還需要文件檢索、工具呼叫、資料庫查詢、多模態處理等一系列高層能力。PrivateGPT 提供這個中間層:它不執行模型本身,而是連線到任何 OpenAI 相容的推理服務(Ollama、llama.cpp、vLLM 等),將其封裝成符合 Claude API 規範的生產級介面。開發者無需從零搭建 RAG 管道、工具編排、向量儲存等基礎設施,直接獲得開箱即用的企業級 AI 後端。

該專案由 Zylon 公司維護,其商業產品 Zylon 已在全球企業中部署,開源版本經過生產環境驗證。

為何火

5.7 萬+ stars 的熱度來自三個核心優勢:一是真正的私有化部署,資料完全不出本地,滿足金融、醫療等強監管行業需求;二是標準化 API 設計,參照 Claude API 規範,現有工具(Claude Desktop、n8n、VS Code 外掛)可直接切換後端到本地模型;三是功能完整度,不是簡單的模型封裝,而是包含 RAG 檢索引用、MCP 聯結器、程式碼執行沙箱、Web 搜尋等企業場景必需的元件。

對比其他本地 AI 方案,PrivateGPT 定位是"API 層"而非"推理引擎",這種架構讓它能相容任何推理後端,使用者可根據硬體條件自由選擇 Ollama(易用)、vLLM(高效能)或 llama.cpp(低資源)。

核心功能

  • 標準訊息 API:流式響應、非同步處理、token 計數,完全相容 OpenAI/Claude 客戶端
  • RAG 檢索系統:文件攝取(支援 PDF/Word/Markdown 等)、向量儲存、帶引用的檢索增強生成
  • 工具呼叫:內建 Web 搜尋、網頁抓取、程式碼執行沙箱,支援自定義工具和 MCP(Model Context Protocol)聯結器
  • 結構化資料訪問:直接查詢 PostgreSQL/MySQL/MSSQL/DB2 資料庫,自然語言轉 SQL
  • 多模態處理:影像/音訊/影片分析(需安裝 FFmpeg 等依賴)
  • 整合生態:原生支援 Claude Desktop、Microsoft 365 外掛、n8n 工作流、VS Code Cline 等工具

內建 Workbench UI(/ui)可用於測試和演示,但 API 才是核心產品,開發者應基於 API 構建自己的應用。

安裝

前置條件:需先啟動本地推理服務,推薦 Ollama(最簡單)。

# 1. 安裝 Ollama 並拉取模型
ollama pull qwen3.5:35b          # 主模型約 24GB
ollama pull mxbai-embed-large    # 嵌入模型約 670MB
ollama serve

# 2. 安裝 PrivateGPT(macOS)
brew tap zylon-ai/tap
brew install private-gpt

# Linux/Windows 用 uv 工具安裝
curl -LsSf https://astral.sh/uv/install.sh | sh
uv tool install --python 3.11 \
  --find-links https://wheels.privategpt.dev/packages/ \
  "private-gpt[core]"

# 3. 啟動服務
OPENAI_API_BASE=http://localhost:11434/v1 \
OPENAI_EMBEDDING_API_BASE=http://localhost:11434/v1 \
private-gpt serve

Docker 部署更簡單,通過環境變數配置推理服務地址即可。訪問 http://localhost:8080/ui 檢視 UI,API 端點在 http://localhost:8080

適合誰

  • 企業 IT 團隊:需要在內網部署 AI 能力,資料不能上雲
  • AI 應用開發者:想快速構建 RAG 應用或 Agent,不想從零搭建向量資料庫、工具編排等基礎設施
  • 隱私敏感場景:醫療、法律、金融等行業,需要完全本地化的 AI 方案
  • 成本最佳化者:避免按 token 付費的雲 API 成本,用自有硬體執行模型

不適合純模型推理需求(直接用 Ollama 即可),也不適合需要最新閉源模型能力的場景(本地模型效能仍有差距)。

社群評價

暫無足量社群公開討論,以下為基於專案本身的中立評估:

從技術指標看,該專案維護質量高:99 位貢獻者、2 天前仍有提交、僅 6 個開放 issue,且有商業公司 Zylon 背書。架構設計合理,將推理層和應用層解耦,避免重複造輪子。文件完善,提供多種推理後端的配置指南。

潛在顧慮是對外部依賴較重:文件處理需要 LibreOffice/Pandoc,多模態需要 FFmpeg,資料庫工具需要各自驅動,完整部署的複雜度不低。另外 Python 3.11 的版本鎖定可能與某些環境衝突。

選型對比

vs Claude API(商業):PrivateGPT 提供相似的 API 規範,但執行在本地模型上。優勢是資料隱私和零邊際成本,劣勢是模型能力差距(本地 70B 模型約等於 GPT-3.5 水平)和需要自維護基礎設施。

vs LangChain/LlamaIndex(開源框架):這些是開發框架,需要開發者自己組裝各個元件;PrivateGPT 是開箱即用的 API 服務,內建了向量儲存、工具編排、UI 等完整方案,更接近產品而非庫。

vs Ollama(推理引擎):Ollama 只負責模型推理,PrivateGPT 在其之上提供 RAG、工具呼叫、多模態等應用層能力。兩者是互補關係,通常一起使用。

已知坑

  1. 資源需求高:執行 35B 引數模型需要至少 24GB 視訊記憶體,嵌入模型另需約 1GB,普通消費級顯示卡難以滿足
  2. 文件處理依賴多:完整安裝需要 LibreOffice(約 500MB)、Pandoc、Poppler 等,Docker 映象體積較大
  3. 中文支援:底層模型的中文能力取決於選擇的推理模型,需自行測試 Qwen、ChatGLM 等中文模型的相容性
  4. 網路依賴:首次安裝需從 PyPI 和 Hugging Face 下載依賴,國內環境建議配置映象源
  5. MCP 聯結器:這是較新的協議,生態工具支援尚不完善,自定義聯結器需要一定開發工作

據 README,UI 僅用於演示和測試,生產環境應直接呼叫 API 並構建自己的前端。

安装方式:brew/uv tool install