Qwen Audio Agent - 即時語音 AI Agent 執行時
QwenAudio/qwen-audio-agent
讓 AI Agent 邊聊邊幹活的即時語音執行時,支援全雙工對話、後臺任務並行執行,對接多種程式設計 Agent(OpenCode/Kimi Code/Claude Code 等)
成熟度:維護活躍,最近提交今日,13個open issues,快速迭代中(兩週內8個版本)
项目体检
部署 · 基于 npm 全局安装后通过命令行启动,提供 WebUI/TUI/桌面应用三种形态,桌面端支持浮窗常驻,默认端口未在配置中明确
成本 · 必需 DashScope API Key(阿里云百炼服务),可选对接 speech-to-speech 本地服务实现完全离线,后台 Agent 需额外配置对应工具的认证(如 Kimi/Qoder 等各自的登录凭据)
技术 · JavaScript/Node.js 22.22.2+,前端实时语音基于 Qwen Audio Realtime,后台 Agent 通过 ACP 协议统一接入
许可 · Apache-2.0,可商用且无额外限制
活跃 · 极活跃,最新版本 v1.8.0 发布于今日,17位贡献者,两周内连续发布8个版本
解決什麼
傳統 AI 助手在執行復雜任務時會讓對話陷入等待:使用者說完一句話,助手要麼沉默處理,要麼直接中斷對話去呼叫工具。Qwen Audio Agent 打破這種僵局,讓 AI Agent 像真人助理一樣邊聊邊幹活——你可以繼續提問、查詢進度甚至取消任務,而後臺的程式設計 Agent 同時在執行程式碼生成、檔案操作或工具呼叫,完成後自然回到對話中告訴你"搞定了"。這種"Agent 始終在場"的體驗,讓語音互動從單輪問答升級為持續協作。
為何火
專案上線兩週即獲 2000+ stars,核心吸引力在於填補了即時語音與 Agentic AI 的工程化空白:市面上要麼是純聊天的語音助手(無法執行復雜任務),要麼是純文本的程式設計 Agent(缺乏語音互動)。該專案通過 ACP 協議統一對接國內外主流程式設計 Agent(OpenCode/Kimi Code/Claude Code 等),讓開發者用一套語音前端就能切換不同後端能力。加上桌面浮窗、語音喚醒("你好千問")、跨會話記憶等產品化細節,直接可用性遠超同類實驗性專案。
核心功能
- 全雙工即時對話:支援自然打斷、多輪連續交流,基於阿里雲 DashScope 的 Qwen Audio Realtime 服務
- 前後臺任務並行:前臺語音對話的同時,後臺 Agent 可非同步執行程式碼生成、檔案操作、MCP 工具呼叫,使用者隨時詢問進度或取消
- 一鍵對接多種 Agent:通過配置檔案切換後端(OpenCode/OpenClaw/Qoder/Kimi Code/Hermes/CodeBuddy/Codex/Claude Code 等),複用各工具原生的 MCP、Skill 和認證體系
- 桌面端三平臺支援:提供 macOS/Windows/Linux 桌面應用,浮窗常駐、自動休眠、快捷鍵喚醒、語音喚醒詞
- 個性化記憶:每次會話後自動提取隱式記憶,支援使用者自定義規則和檢查清單,跨會話保持上下文
- 定時提醒與進度彙報:Agent 可主動報告長任務進度或按時提醒使用者
安裝
要求 Node.js 22.22.2+ 或 24.15.0+,npm 10+。推薦全域性安裝:
npm install -g qwen-audio-agent
首次執行需建立配置檔案並填入 DashScope API Key(在阿里雲百鍊控制台獲取):
qwen-audio-agent init # 生成配置模板
# 編輯 ~/.qwen-audio-agent/config 填入 DASHSCOPE_API_KEY
qwen-audio-agent start # 啟動服務
桌面應用可從 Releases 下載對應平臺的安裝包,內建 Gateway 無需單獨配置 Node 環境。
適合誰
- 需要語音程式設計助手的開發者:用自然語言描述需求,Agent 後臺生成程式碼並自動執行,你可以繼續提問或改需求
- 多工並行場景:同時建立多個獨立任務(如"重構模組 A"+"寫單元測試"+"查文件"),語音隨時切換關注點
- 國內 AI 工具使用者:原生支援 OpenCode/Qoder/Kimi Code 等國內主流程式設計 Agent,無需科學上網即可使用核心功能
- 追求產品化體驗的嚐鮮者:桌面浮窗、語音喚醒、自動更新等細節已打磨,不只是 Demo 級別
社群評價
暫無足量社群公開討論,以下為基於專案本身的中立評估:
專案在 GitHub 上展現出極高的開發活躍度,兩週內連續釋出 8 個版本,從 v0.9.0 的開源首發快速迭代至 v1.8.0,功能完善速度驚人。17 位貢獻者參與,issues 響應及時(13 個 open issues 多為功能建議而非嚴重 bug)。從 Changelog 看,團隊在快速補齊工程化短板:Windows 支援、自動更新、後臺 Agent 一鍵安裝、語音喚醒等都是近期新增。技術選型務實,前端語音依賴阿里雲服務(降低自建門檻),後端通過 ACP 協議解耦(避免繫結單一 Agent),架構清晰度高。不過專案仍處早期,部分 Agent 整合標註為四星(如 Qwen Code/Hermes)表示"開發中或未充分驗證",生產環境使用需評估穩定性。
選型對比
vs 純語音助手(如 Siri/小愛):後者只能單輪問答或呼叫簡單 API,無法執行復雜程式設計任務或保持後臺工作狀態。Qwen Audio Agent 的後臺 Agent 可持續執行幾分鐘甚至更久的任務,前臺對話不中斷。
vs 純文本程式設計 Agent(如 Cursor/Copilot):後者需要手動輸入指令,無法語音互動,也不支援"邊聊邊幹活"的並行模式。該專案讓你用語音自然描述需求,Agent 後臺執行時你可以繼續提問或切換話題。
vs speech-to-speech 等本地方案:專案支援對接 Hugging Face 的 speech-to-speech 實現完全本地化(VAD/STT/LLM/TTS 全離線),但預設方案依賴 DashScope 雲服務,部署更簡單但有網路和 API 成本。本地方案適合隱私敏感場景,雲方案適合快速上手。
取捨:如果只需語音聊天不需程式設計能力,純語音助手更輕量;如果只需文本程式設計不需語音,傳統 IDE 外掛更成熟;如果要語音+程式設計+並行任務,這是目前工程化程度最高的開源選擇,代價是需配置多個服務(DashScope + 後端 Agent)。
已知坑
- DashScope API Key 必需:預設前端依賴阿里雲百鍊服務,無 Key 無法啟動(除非自建 speech-to-speech 服務,但配置複雜度高)
- 後端 Agent 需額外認證:選擇 Kimi Code/Qoder 等後端時,需單獨配置各工具的登入憑據(如 Kimi 的 API Key、Qoder 的 CLI 登入),文件雖詳細但首次配置門檻不低
- Windows 支援較新:v1.6.0 才正式支援 Windows,部分邊緣場景(如後臺 Agent 啟動檢測)可能不如 macOS 穩定
- 部分 Agent 整合未完全驗證:Qwen Code/Hermes/CodeBuddy 等標註為四星,表示功能可用但可能存在相容性問題或文件不全
- 桌面端與 CLI 資料隔離:v1.5.0 起桌面應用使用獨立資料目錄,之前 CLI 配置的記憶和規則不會自動遷移
- 語音喚醒詞僅支援中文:"你好千問"是硬編碼喚醒詞,暫不支援自定義或英文喚醒
- 網路要求:DashScope 服務在國內訪問穩定,但後端 Agent 如 Claude Code 可能需要科學上網(取決於所選 Agent 的模型服務商)
安装方式:npm