57,342· 7,600 forks· Python· Apache-2.0开源替代

PrivateGPT - 本地模型的生产级 AI 应用 API 层

zylon-ai/private-gpt

将本地大模型封装成生产可用的 API 层,支持 RAG、工具调用、MCP 连接器等企业级功能,兼容任何 OpenAI 格式推理服务

成熟度维护活跃,2天前有提交,仅6个开放issue,已有企业级产品 Zylon 基于此构建

GitHub 仓库 →对标:Claude API

项目体检

部署 · Docker 一键部署(docker compose),需配置 OPENAI_API_BASE 指向本地推理服务,默认端口 8080,内置 Web UI 位于 /ui 路径

成本 · 需要外部 OpenAI 兼容推理服务(Ollama/llama.cpp/vLLM),需配置 OPENAI_API_BASE 和 OPENAI_EMBEDDING_API_BASE 环境变量,文档处理需 LibreOffice/Pandoc,数据库工具需对应驱动

技术 · Python 3.11 + FastAPI + LlamaIndex 0.14 + Injector(依赖注入) + arq(异步任务队列),支持多种 LLM SDK(OpenAI/Anthropic/Mistral)

许可 · Apache-2.0,允许商用且无需开源衍生代码,企业友好

活跃 · 最新版本 v1.0.1 发布于 2026年6月,99位贡献者参与,2天前仍有代码提交,活跃度高

解决什么

本地运行大模型只是第一步,要构建真正可用的 AI 应用还需要文档检索、工具调用、数据库查询、多模态处理等一系列高层能力。PrivateGPT 提供这个中间层:它不运行模型本身,而是连接到任何 OpenAI 兼容的推理服务(Ollama、llama.cpp、vLLM 等),将其封装成符合 Claude API 规范的生产级接口。开发者无需从零搭建 RAG 管道、工具编排、向量存储等基础设施,直接获得开箱即用的企业级 AI 后端。

该项目由 Zylon 公司维护,其商业产品 Zylon 已在全球企业中部署,开源版本经过生产环境验证。

为何火

5.7 万+ stars 的热度来自三个核心优势:一是真正的私有化部署,数据完全不出本地,满足金融、医疗等强监管行业需求;二是标准化 API 设计,参照 Claude API 规范,现有工具(Claude Desktop、n8n、VS Code 插件)可直接切换后端到本地模型;三是功能完整度,不是简单的模型封装,而是包含 RAG 检索引用、MCP 连接器、代码执行沙箱、Web 搜索等企业场景必需的组件。

对比其他本地 AI 方案,PrivateGPT 定位是"API 层"而非"推理引擎",这种架构让它能兼容任何推理后端,用户可根据硬件条件自由选择 Ollama(易用)、vLLM(高性能)或 llama.cpp(低资源)。

核心功能

  • 标准消息 API:流式响应、异步处理、token 计数,完全兼容 OpenAI/Claude 客户端
  • RAG 检索系统:文档摄取(支持 PDF/Word/Markdown 等)、向量存储、带引用的检索增强生成
  • 工具调用:内置 Web 搜索、网页抓取、代码执行沙箱,支持自定义工具和 MCP(Model Context Protocol)连接器
  • 结构化数据访问:直接查询 PostgreSQL/MySQL/MSSQL/DB2 数据库,自然语言转 SQL
  • 多模态处理:图像/音频/视频分析(需安装 FFmpeg 等依赖)
  • 集成生态:原生支持 Claude Desktop、Microsoft 365 插件、n8n 工作流、VS Code Cline 等工具

内置 Workbench UI(/ui)可用于测试和演示,但 API 才是核心产品,开发者应基于 API 构建自己的应用。

安装

前置条件:需先启动本地推理服务,推荐 Ollama(最简单)。

# 1. 安装 Ollama 并拉取模型
ollama pull qwen3.5:35b          # 主模型约 24GB
ollama pull mxbai-embed-large    # 嵌入模型约 670MB
ollama serve

# 2. 安装 PrivateGPT(macOS)
brew tap zylon-ai/tap
brew install private-gpt

# Linux/Windows 用 uv 工具安装
curl -LsSf https://astral.sh/uv/install.sh | sh
uv tool install --python 3.11 \
  --find-links https://wheels.privategpt.dev/packages/ \
  "private-gpt[core]"

# 3. 启动服务
OPENAI_API_BASE=http://localhost:11434/v1 \
OPENAI_EMBEDDING_API_BASE=http://localhost:11434/v1 \
private-gpt serve

Docker 部署更简单,通过环境变量配置推理服务地址即可。访问 http://localhost:8080/ui 查看 UI,API 端点在 http://localhost:8080

适合谁

  • 企业 IT 团队:需要在内网部署 AI 能力,数据不能上云
  • AI 应用开发者:想快速构建 RAG 应用或 Agent,不想从零搭建向量数据库、工具编排等基础设施
  • 隐私敏感场景:医疗、法律、金融等行业,需要完全本地化的 AI 方案
  • 成本优化者:避免按 token 付费的云 API 成本,用自有硬件运行模型

不适合纯模型推理需求(直接用 Ollama 即可),也不适合需要最新闭源模型能力的场景(本地模型性能仍有差距)。

社区评价

暂无足量社区公开讨论,以下为基于项目本身的中立评估:

从技术指标看,该项目维护质量高:99 位贡献者、2 天前仍有提交、仅 6 个开放 issue,且有商业公司 Zylon 背书。架构设计合理,将推理层和应用层解耦,避免重复造轮子。文档完善,提供多种推理后端的配置指南。

潜在顾虑是对外部依赖较重:文档处理需要 LibreOffice/Pandoc,多模态需要 FFmpeg,数据库工具需要各自驱动,完整部署的复杂度不低。另外 Python 3.11 的版本锁定可能与某些环境冲突。

选型对比

vs Claude API(商业):PrivateGPT 提供相似的 API 规范,但运行在本地模型上。优势是数据隐私和零边际成本,劣势是模型能力差距(本地 70B 模型约等于 GPT-3.5 水平)和需要自维护基础设施。

vs LangChain/LlamaIndex(开源框架):这些是开发框架,需要开发者自己组装各个组件;PrivateGPT 是开箱即用的 API 服务,内置了向量存储、工具编排、UI 等完整方案,更接近产品而非库。

vs Ollama(推理引擎):Ollama 只负责模型推理,PrivateGPT 在其之上提供 RAG、工具调用、多模态等应用层能力。两者是互补关系,通常一起使用。

已知坑

  1. 资源需求高:运行 35B 参数模型需要至少 24GB 显存,嵌入模型另需约 1GB,普通消费级显卡难以满足
  2. 文档处理依赖多:完整安装需要 LibreOffice(约 500MB)、Pandoc、Poppler 等,Docker 镜像体积较大
  3. 中文支持:底层模型的中文能力取决于选择的推理模型,需自行测试 Qwen、ChatGLM 等中文模型的兼容性
  4. 网络依赖:首次安装需从 PyPI 和 Hugging Face 下载依赖,国内环境建议配置镜像源
  5. MCP 连接器:这是较新的协议,生态工具支持尚不完善,自定义连接器需要一定开发工作

据 README,UI 仅用于演示和测试,生产环境应直接调用 API 并构建自己的前端。

安装方式:brew/uv tool install