22,547· 2,603 forks· Python· Apache-2.0开源替代

CosyVoice - 多语言大规模语音生成模型

QwenAudio/CosyVoice

阿里开源的多语言TTS系统,支持9种语言+18种中文方言零样本语音克隆,提供训练推理全栈能力

成熟度维护活跃,最近提交69天前,open issues 736个,社区反馈需求旺盛

GitHub 仓库 →对标:讯飞语音、Azure TTS、ElevenLabs

项目体检

技术 · Python + PyTorch 2.3 + Transformers 4.51,依赖CUDA 12.1及TensorRT加速

许可 · Apache-2.0 协议,允许商业使用、修改和分发,需保留版权声明

活跃 · 最近提交69天前,51位贡献者参与,无正式release版本但持续迭代至3.0版本

解决什么

CosyVoice 解决多语言场景下的高质量语音合成需求。传统 TTS 系统通常需要大量特定说话人的录音数据才能训练出自然的语音,且跨语言、跨方言能力弱。该项目基于大语言模型架构,实现零样本语音克隆——仅需 3-10 秒参考音频即可复刻说话人音色,同时支持 9 种主流语言(中英日韩德西法意俄)和 18+ 种中文方言(粤语、闽南话、川话、东北话等),还能处理数字、符号等文本归一化问题,无需传统前端模块。

为何火

2.25 万 stars 背后是国内 TTS 领域的稀缺性:同时满足多语言覆盖(尤其中文方言)、零样本克隆可商用开源协议三大刚需。3.0 版本在内容一致性(CER 0.81%)和说话人相似度(SS 78%)上达到 SOTA 水平,超越闭源的 Seed-TTS 和 MiniMax-Speech。项目提供完整训练/推理/部署代码,支持流式推理(延迟低至 150ms)和强化学习优化,填补了国内可自主部署的高质量 TTS 方案空白。阿里通过 ModelScope 和 HuggingFace 双渠道发布预训练模型,降低使用门槛。

核心功能

  1. 零样本多语言克隆:输入任意语言 3 秒音频 + 目标文本,生成保持原音色的语音,支持跨语言合成(如用中文音色说英语)
  2. 方言/口音支持:覆盖广东、闽南、四川、东北、陕西、山西、上海、天津等 18+ 种中文方言
  3. 可控合成:支持中文拼音和英文 CMU 音素的发音修正,可控制语速、音量、情感等指令
  4. 流式推理:文本输入流和音频输出流双向流式,首字延迟 150ms,适合实时对话场景
  5. 训练能力:提供 Flow Matching 训练脚本和强化学习(GRPO)优化方案,支持 DeepSpeed 分布式训练

安装

需 Conda 环境 + CUDA 12.1 支持:

git clone --recursive https://github.com/FunAudioLLM/CosyVoice.git
conda create -n cosyvoice python=3.10
conda activate cosyvoice
pip install -r requirements.txt

模型下载(国内推荐 ModelScope,海外用 HuggingFace):

from modelscope import snapshot_download
snapshot_download('FunAudioLLM/Fun-CosyVoice3-0.5B-2512', 
                  local_dir='pretrained_models/Fun-CosyVoice3-0.5B')

提供 FastAPI 服务端和 Gradio WebUI,可通过 webui.py 快速启动演示界面。

适合谁

  • 内容创作者:需要多角色配音、方言内容制作的视频/有声书作者
  • 企业开发者:构建客服语音、智能助手等需要自然 TTS 的产品团队,尤其需要私有化部署避免数据外传
  • 研究人员:探索语音合成前沿技术,项目开放训练代码和评估数据集(CV3-Eval)
  • 出海团队:需要同时支持中文方言和多国语言的国际化产品

不适合:显存受限场景(0.5B 模型推理需约 8GB),对实时性要求极高的边缘设备(虽支持流式但仍需 GPU 加速)。

社区评价

暂无足量社区公开讨论,以下为基于项目本身的中立评估:从技术指标看,3.0 版本在中文场景的字错误率(0.81%)优于多数开源方案,说话人相似度(78%)接近人类水平(75.5%)。736 个未关闭 issue 反映用户活跃但也暴露稳定性问题,主要集中在特定方言效果、长文本合成和环境依赖冲突。项目持续迭代(69 天前仍有提交),但缺少正式 release 版本管理,生产使用需自行验证稳定性。51 位贡献者参与表明有一定社区协作基础。

选型对比

vs 商业方案(讯飞/Azure TTS):

  • 优势:可私有部署保护数据隐私,支持更多中文方言,无按量计费成本
  • 劣势:需自备 GPU 资源,稳定性和易用性不如商业 API,缺少官方技术支持

vs 开源竞品(F5-TTS/FireRedTTS):

  • CosyVoice 在中文场景表现更优(CER 0.81% vs F5-TTS 1.52%),方言覆盖最全
  • 模型体积相当(0.5B),但 CosyVoice 提供完整训练代码和强化学习优化
  • F5-TTS 部署更轻量,CosyVoice 依赖 TensorRT 等重型库

vs 闭源 SOTA(Seed-TTS):

  • 内容一致性已超越(0.81% vs 1.12%),但说话人相似度略低(77.4% vs 79.6%)
  • 开源可审计代码,适合需要定制化的场景

已知坑

  1. 显存需求高:0.5B 模型推理需约 8-10GB 显存,训练需多卡环境,个人开发者硬件门槛较高
  2. 依赖复杂:需 CUDA 12.1 + TensorRT + onnxruntime-gpu,Windows/macOS 支持受限(部分库仅 Linux 可用)
  3. 方言质量不均:README 未明确各方言的训练数据量,用户反馈部分小语种方言效果一般
  4. 文档滞后:736 个 open issues 中不少是使用问题,官方文档对生产部署的最佳实践说明不足
  5. 无版本管理:缺少 release tag,直接用 main 分支可能遇到不稳定代码,建议锁定特定 commit
  6. 中文文本归一化:虽支持数字/符号处理,但复杂格式(如公式、表格)仍需预处理
  7. 流式推理限制:150ms 延迟需 GPU 加速,CPU 环境下实时性大幅下降

安装方式:conda + pip