Qwen Audio Agent - 实时语音 AI Agent 运行时
QwenAudio/qwen-audio-agent
让 AI Agent 边聊边干活的实时语音运行时,支持全双工对话、后台任务并行执行,对接多种编程 Agent(OpenCode/Kimi Code/Claude Code 等)
成熟度:维护活跃,最近提交今日,13个open issues,快速迭代中(两周内8个版本)
项目体检
部署 · 基于 npm 全局安装后通过命令行启动,提供 WebUI/TUI/桌面应用三种形态,桌面端支持浮窗常驻,默认端口未在配置中明确
成本 · 必需 DashScope API Key(阿里云百炼服务),可选对接 speech-to-speech 本地服务实现完全离线,后台 Agent 需额外配置对应工具的认证(如 Kimi/Qoder 等各自的登录凭据)
技术 · JavaScript/Node.js 22.22.2+,前端实时语音基于 Qwen Audio Realtime,后台 Agent 通过 ACP 协议统一接入
许可 · Apache-2.0,可商用且无额外限制
活跃 · 极活跃,最新版本 v1.8.0 发布于今日,17位贡献者,两周内连续发布8个版本
解决什么
传统 AI 助手在执行复杂任务时会让对话陷入等待:用户说完一句话,助手要么沉默处理,要么直接中断对话去调用工具。Qwen Audio Agent 打破这种僵局,让 AI Agent 像真人助理一样边聊边干活——你可以继续提问、查询进度甚至取消任务,而后台的编程 Agent 同时在执行代码生成、文件操作或工具调用,完成后自然回到对话中告诉你"搞定了"。这种"Agent 始终在场"的体验,让语音交互从单轮问答升级为持续协作。
为何火
项目上线两周即获 2000+ stars,核心吸引力在于填补了实时语音与 Agentic AI 的工程化空白:市面上要么是纯聊天的语音助手(无法执行复杂任务),要么是纯文本的编程 Agent(缺乏语音交互)。该项目通过 ACP 协议统一对接国内外主流编程 Agent(OpenCode/Kimi Code/Claude Code 等),让开发者用一套语音前端就能切换不同后端能力。加上桌面浮窗、语音唤醒("你好千问")、跨会话记忆等产品化细节,直接可用性远超同类实验性项目。
核心功能
- 全双工实时对话:支持自然打断、多轮连续交流,基于阿里云 DashScope 的 Qwen Audio Realtime 服务
- 前后台任务并行:前台语音对话的同时,后台 Agent 可异步执行代码生成、文件操作、MCP 工具调用,用户随时询问进度或取消
- 一键对接多种 Agent:通过配置文件切换后端(OpenCode/OpenClaw/Qoder/Kimi Code/Hermes/CodeBuddy/Codex/Claude Code 等),复用各工具原生的 MCP、Skill 和认证体系
- 桌面端三平台支持:提供 macOS/Windows/Linux 桌面应用,浮窗常驻、自动休眠、快捷键唤醒、语音唤醒词
- 个性化记忆:每次会话后自动提取隐式记忆,支持用户自定义规则和检查清单,跨会话保持上下文
- 定时提醒与进度汇报:Agent 可主动报告长任务进度或按时提醒用户
安装
要求 Node.js 22.22.2+ 或 24.15.0+,npm 10+。推荐全局安装:
npm install -g qwen-audio-agent
首次运行需创建配置文件并填入 DashScope API Key(在阿里云百炼控制台获取):
qwen-audio-agent init # 生成配置模板
# 编辑 ~/.qwen-audio-agent/config 填入 DASHSCOPE_API_KEY
qwen-audio-agent start # 启动服务
桌面应用可从 Releases 下载对应平台的安装包,内置 Gateway 无需单独配置 Node 环境。
适合谁
- 需要语音编程助手的开发者:用自然语言描述需求,Agent 后台生成代码并自动执行,你可以继续提问或改需求
- 多任务并行场景:同时创建多个独立任务(如"重构模块 A"+"写单元测试"+"查文档"),语音随时切换关注点
- 国内 AI 工具用户:原生支持 OpenCode/Qoder/Kimi Code 等国内主流编程 Agent,无需科学上网即可使用核心功能
- 追求产品化体验的尝鲜者:桌面浮窗、语音唤醒、自动更新等细节已打磨,不只是 Demo 级别
社区评价
暂无足量社区公开讨论,以下为基于项目本身的中立评估:
项目在 GitHub 上展现出极高的开发活跃度,两周内连续发布 8 个版本,从 v0.9.0 的开源首发快速迭代至 v1.8.0,功能完善速度惊人。17 位贡献者参与,issues 响应及时(13 个 open issues 多为功能建议而非严重 bug)。从 Changelog 看,团队在快速补齐工程化短板:Windows 支持、自动更新、后台 Agent 一键安装、语音唤醒等都是近期新增。技术选型务实,前端语音依赖阿里云服务(降低自建门槛),后端通过 ACP 协议解耦(避免绑定单一 Agent),架构清晰度高。不过项目仍处早期,部分 Agent 集成标注为四星(如 Qwen Code/Hermes)表示"开发中或未充分验证",生产环境使用需评估稳定性。
选型对比
vs 纯语音助手(如 Siri/小爱):后者只能单轮问答或调用简单 API,无法执行复杂编程任务或保持后台工作状态。Qwen Audio Agent 的后台 Agent 可持续运行几分钟甚至更久的任务,前台对话不中断。
vs 纯文本编程 Agent(如 Cursor/Copilot):后者需要手动输入指令,无法语音交互,也不支持"边聊边干活"的并行模式。该项目让你用语音自然描述需求,Agent 后台执行时你可以继续提问或切换话题。
vs speech-to-speech 等本地方案:项目支持对接 Hugging Face 的 speech-to-speech 实现完全本地化(VAD/STT/LLM/TTS 全离线),但默认方案依赖 DashScope 云服务,部署更简单但有网络和 API 成本。本地方案适合隐私敏感场景,云方案适合快速上手。
取舍:如果只需语音聊天不需编程能力,纯语音助手更轻量;如果只需文本编程不需语音,传统 IDE 插件更成熟;如果要语音+编程+并行任务,这是目前工程化程度最高的开源选择,代价是需配置多个服务(DashScope + 后端 Agent)。
已知坑
- DashScope API Key 必需:默认前端依赖阿里云百炼服务,无 Key 无法启动(除非自建 speech-to-speech 服务,但配置复杂度高)
- 后端 Agent 需额外认证:选择 Kimi Code/Qoder 等后端时,需单独配置各工具的登录凭据(如 Kimi 的 API Key、Qoder 的 CLI 登录),文档虽详细但首次配置门槛不低
- Windows 支持较新:v1.6.0 才正式支持 Windows,部分边缘场景(如后台 Agent 启动检测)可能不如 macOS 稳定
- 部分 Agent 集成未完全验证:Qwen Code/Hermes/CodeBuddy 等标注为四星,表示功能可用但可能存在兼容性问题或文档不全
- 桌面端与 CLI 数据隔离:v1.5.0 起桌面应用使用独立数据目录,之前 CLI 配置的记忆和规则不会自动迁移
- 语音唤醒词仅支持中文:"你好千问"是硬编码唤醒词,暂不支持自定义或英文唤醒
- 网络要求:DashScope 服务在国内访问稳定,但后端 Agent 如 Claude Code 可能需要科学上网(取决于所选 Agent 的模型服务商)
安装方式:npm