Dograh - 开源语音 AI 平台
dograh-hq/dograh
可自部署的 Vapi/Retell 开源替代品,提供可视化工作流构建器、电话集成和 MCP 原生支持,一键搭建生产级语音 AI 助手
成熟度:维护活跃,3天前最新提交,29个开放 issue,56位贡献者,版本迭代至 v1.44.0
项目体检
部署 · docker compose 一键启动(start_docker.sh 脚本),包含 PostgreSQL/Redis/MinIO 等多服务栈,本地默认 3010 端口,远程部署需额外配置 nginx/coturn
成本 · 内置 LLM/TTS/STT 栈和自动生成密钥开箱即用,可选接入 Twilio/Vonage 等电话服务商、自有 LLM/语音模型,需 PostgreSQL/Redis/MinIO 依赖
技术 · Python 主体,基于 Pipecat 和 ReactFlow 构建,集成 pgvector/Redis/MinIO,支持 Asterisk ARI 电话协议
许可 · BSD-2-Clause 协议,允许商用且无需开源衍生代码,可自由修改和分发
活跃 · 3天前最新提交,v1.44.0 版本于 8 天前发布,56 位贡献者参与,29 个开放 issue,活跃度高
解决什么
Dograh 针对语音 AI 平台的两大痛点:一是 Vapi/Retell 等 SaaS 平台费用占总成本 60-70%,实际 LLM/语音服务费用仅占 30-40%;二是开源方案(如 Pipecat、LiveKit)虽免费但缺乏标准化工具链,从对话中提取变量、处理电话转接、管理工作流等"管道工作"仍需大量手动开发。Dograh 提供完整的自部署语音 AI 平台,内置可视化工作流编辑器、电话集成和测试工具,让团队在保留开源灵活性的同时避免重复造轮子。
为何火
在 HN 讨论中,开发者普遍认同"平台费用吃掉大部分预算"的痛点。Dograh 的 BSD-2 协议(比 AGPL 更宽松)、YC 校友背书和快速迭代(56 位贡献者、3 天前最新提交)形成信任基础。项目提供 MCP(Model Context Protocol)原生支持,允许 Claude Code、Cursor 等 AI 编程助手直接操作工作流,这种"用 AI 构建 AI"的元能力吸引了大量开发者。5000+ Stars 和 1200+ Forks 显示社区已形成规模,Better Stack 的视频推荐进一步提升曝光。
核心功能
- 可视化工作流构建器:基于 ReactFlow 的拖拽式节点编辑器,包含起始节点、Agent 节点、全局指令、工具调用、条件转移和结束节点,支持 QA 节点、知识库、Webhook 和嵌入式工具
- 双模式测试:Test Audio 在浏览器内语音测试,Test Chat 文本模式快速迭代 Prompt 并支持回放/编辑用户轮次后重新生成响应
- 电话集成:原生支持 Twilio、Vonage、Telnyx、Plivo、Asterisk ARI 等,包含人工转接功能
- MCP 服务器:允许 Codex/Claude Code 等 AI 助手检查现有 Agent、搜索文档、创建工作流和保存草稿
- BYOK 架构:可替换任意 LLM/TTS/STT 提供商,存储支持 MinIO 或 S3 兼容服务
安装
本地部署(60 秒):
curl -o docker-compose.yaml https://raw.githubusercontent.com/dograh-hq/dograh/main/docker-compose.yaml && \
curl -o start_docker.sh https://raw.githubusercontent.com/dograh-hq/dograh/main/scripts/start_docker.sh && \
chmod +x start_docker.sh && ./start_docker.sh
首次启动需 2-3 分钟下载镜像,完成后访问 http://localhost:3010。
AI 助手安装(可选):
在 Claude Code 中运行 /plugin marketplace add dograh-hq/dograh-plugins 安装官方插件,然后让 AI 自动检测系统、执行脚本并验证部署。
远程服务器:先运行 sudo ./setup_remote.sh 生成配置,再执行 ./remote_up.sh 启动,需额外配置 nginx 和 TURN 服务器。
适合谁
- 成本敏感的创业团队:平台费用占比过高(60-70%)的 Vapi/Retell 用户,通过自部署将成本降至实际 LLM/语音服务费用
- 需要数据主权的企业:金融、医疗等行业要求本地化部署和完全控制对话数据
- 定制化需求强的开发者:需要修改底层逻辑、接入特殊电话协议或私有模型的团队
- AI 工具链重度用户:使用 Claude Code/Cursor 的团队可通过 MCP 让 AI 助手直接操作工作流,提升开发效率
中国用户注意:内置语音栈可直接使用,但对接国内电话运营商(如阿里云、腾讯云)需自行适配 SIP 协议;访问 OpenAI 等海外模型可能需要网络代理。
社区评价
HN 讨论(16 点、10 评论)中,用户高度认可成本优势和开源透明度。一位开发者分享从 Vapi 迁移后成本结构从"70% 平台费 + 30% 服务费"逆转为"100% 服务费",但坦言开源方案的"管道工作"仍痛苦,Dograh 通过标准化工具链解决了这一问题。早期测试者反馈响应延迟问题,团队回应可能源于系统资源或 LLM 推理延迟,正在优化每毫秒级性能。有用户请求增加类似 Vapi 的语音角色选择器,已列入开发计划。整体氛围积极,多位用户表示已加星并计划在公司内试用,YC 校友背景和 BSD-2 协议增强了信任感。
选型对比
vs Vapi/Retell:
- 成本:Dograh 自部署免平台费,仅付 LLM/语音服务成本;Vapi/Retell 按分钟收费且平台费占大头
- 控制:Dograh 可修改源码、本地部署;商业方案闭源且数据存储在其云端
- 易用性:Vapi/Retell 开箱即用,Dograh 需自行维护 Docker 栈和依赖服务
- 生态:商业方案集成更丰富,Dograh 需自行对接部分服务商
vs Pipecat/LiveKit:
- 开箱程度:Dograh 提供完整工作流编辑器和测试工具,Pipecat 仅为底层框架需自行搭建 UI
- 学习曲线:Dograh 可视化操作降低门槛,Pipecat 需编写代码
- 灵活性:两者都开源可定制,但 Pipecat 更底层适合深度改造
已知坑
- 首次部署复杂度:虽号称 60 秒启动,但实际需等待 2-3 分钟下载镜像,且远程部署需手动配置 nginx/coturn,文档中明确警告直接运行
docker compose up会因缺少.env失败 - 响应延迟:社区反馈语音交互存在延迟,团队承认与系统资源和 LLM 推理速度相关,小模型延迟低但指令遵循能力弱,需在延迟与推理能力间权衡
- 电话集成限制:人工转接仅支持部分电话服务商,国内运营商需自行适配 SIP 协议
- 数据库密码变更:README 警告修改
POSTGRES_PASSWORD不会重新加密已有数据库,需手动进入容器用 psql 修改 - 遥测数据:默认收集匿名使用数据,需在启动前设置
ENABLE_TELEMETRY=false禁用
安装方式:docker