2026 免费开源 TTS 方案完全对比:从本地到云端
目录
摘要:本文整理当前主流可本地部署开源TTS,区分轻量CPU可运行、GPU高质量声音克隆、国内中文开源、在线封装工具;包含许可证、硬件需求、优缺点、可直接访问的官方GitHub/HuggingFace链接,方便选型、二次开发、本地配音、有声书、视频旁白场景。
⚠️法律提示:声音克隆技术请勿在未获得本人授权下复刻他人语音;商用务必仔细核对项目License协议。
1. 轻量CPU可运行(低配笔记本/NAS,无需GPU)
1.1 Kokoro‑82M
- 简介:hexgrad开源轻量级TTS,仅82M参数,模型150‑320MB,输出24kHz音频;支持中英混读,50+音色;支持PyTorch/ONNX/WebGPU,CPU接近实时推理,Docker一键WebUI。
- 许可证:Apache‑2.0,允许商用
- 硬件:普通x86‑CPU即可,Apple Silicon优化优秀
- 优点:体积极小、速度快、离线完全本地、生态成熟,适合旁白、有声书、批量配音
- 缺点:无声音克隆;中文多音字、生僻字偶有误读;情绪表现力有限
- 官方开源&下载地址
- GitHub: https://github.com/hexgrad/kokoro
- HuggingFace原版: https://huggingface.co/hexgrad/Kokoro-82M
- 中文版本: https://huggingface.co/hexgrad/Kokoro-82M-v1.1-zh
- Community ONNX实现: https://github.com/thewh1teagle/kokoro-onnx
1.2 Piper‑TTS(Rhasspy)
- 简介:VITS架构,高度CPU优化,嵌入式友好,树莓派/NAS可运行;多语言预训练模型。
- 许可证:MIT,允许商用
- 硬件:CPU,内存1‑2GB
- 优点:极致轻量化,资源占用低,适合嵌入式设备
- 缺点:音色数量少,自然度一般,几乎无情绪
- 官方开源&下载地址
1.3 MeloTTS
- 简介:基于VITS2+BERT,几百MB模型,CPU实时推理;10国语言,中英混合朗读表现优秀。
- 许可证:MIT,允许商用
- 硬件:CPU
- 优点:中英混读强,部署简单
- 缺点:中文内置音色少,韵律普通,不支持声音克隆
- 官方开源&下载地址
- GitHub: https://github.com/myshell-ai/MeloTTS
- HuggingFace: https://huggingface.co/myshell-ai/melotts
2. 高质量支持声音克隆(N卡GPU,4‑8G显存起步)
这类项目支持零样本声音克隆,需要NVIDIA显卡,CPU推理速度极慢不推荐。
2.1 Coqui‑TTS XTTS‑v2
- 简介:开源TTS标杆,6‑15秒参考音频即可克隆;支持17种语言含中文;大量社区WebUI。
- 许可证:CPL‑2.0;大企业商用需要单独授权,小微企业/个人可免费使用
- 硬件:最低4GB显存,推荐8GB+
- 优点:生态完善,多语言混合朗读成熟
- 缺点:中文效果弱于英文;长文本断句偶发异常;克隆容易产生AI杂音
- 官方开源&下载地址
- GitHub: https://github.com/coqui-ai/TTS
- HuggingFace: https://huggingface.co/coqui/XTTS-v2
2.2 Fish‑Speech(Fish‑TTS)
- 简介:LLM架构TTS,中文质量优秀;长文本有声书效果好;零样本克隆,支持参考音频控制情绪。
- 许可证:Fish Audio Research License;商业使用需要联系官方授权
- 硬件:6‑8GB显存起步,mini版本可降低显存需求
- 优点:中文韵律自然,长文本表现好,社区活跃
- 缺点:CPU速度极慢;模型体积大,显存压力高
- 官方开源&下载地址
2.3 CosyVoice 3.0(阿里FunAudioLLM)
- 简介:国内开源标杆,支持普通话、粤语、多方言;支持音色复刻、局部读音修改,流式输出。
- 许可证:Apache‑2.0,部分权重仅限非商业,商用务必阅读协议
- 硬件:0.5B版本需要约8GB显存
- 优点:方言能力强,中文合成质量高
- 缺点:低配机器无法运行
- 官方开源&下载地址
3. 国内开源中文TTS项目
3.1 Qwen3‑TTS(阿里千问)
- 简介:支持声音克隆、音色设计;多角色对话,中文稳定性好,错读少。
- 许可证:Apache‑2.0
- 硬件:0.6B版本最低4GB显存
- 优点:中文稳定性好,支持vLLM加速、WebUI
- 缺点:大模型,无法CPU流畅运行
- 官方开源&下载地址
3.2 VoxCPM2(OpenBMB)
- 简介:输出48kHz高音质音频;支持参考音频克隆,文字描述生成全新音色;支持30种语言。
- 许可证:Apache‑2.0,允许商用
- 硬件:2B参数,推荐RTX3090/4090,显存≥16GB
- 优点:音质高,支持文本生成全新音色
- 缺点:显存占用高
- 官方开源&下载地址
- GitHub: https://github.com/OpenBMB/VoxCPM
- HuggingFace: https://huggingface.co/OpenBMB/VoxCPM2
3.3 MOSS‑TTS(复旦OpenMOSS)
- 简介:原生48kHz立体声输出;支持最长10分钟长文本一次性生成,零样本克隆;31种语言。
- 许可证:Apache‑2.0,允许商用
- 硬件:高显存显卡
- 优点:长文本友好,立体声输出
- 缺点:显存占用较高
- 官方开源&下载地址
4. 在线封装TTS(非本地,联网调用)
Edge‑TTS(微软Edge语音封装)
- 简介:Python封装调用微软云端TTS,大量高质量中文音色晓晓、云希等。没有本地模型,必须联网,文本上传微软服务器。
- 许可证:MIT(封装代码),底层语音能力遵循微软服务条款
- 硬件:仅Python环境,不需要GPU
- 优点:音质优秀,开箱即用,无需下载大模型
- 缺点:不能离线;受微软接口限制;不适合大规模商用
- 开源地址: https://github.com/rany2/edge-tts
5. 选型速查表
| 使用场景 | 优先推荐项目 |
|---|---|
| 笔记本CPU本地、视频旁白、批量配音,无GPU | Kokoro‑82M、Piper‑TTS、MeloTTS |
| 中文,需要声音克隆,有N卡GPU | Fish‑Speech、CosyVoice3.0、XTTS‑v2 |
| 嵌入式/NAS/树莓派低资源设备 | Piper‑TTS |
| 临时少量配音,不想部署本地环境 | Edge‑TTS |
| 商业私有化部署(确认License) | Kokoro‑82M、MeloTTS、VoxCPM2 |
6. 部署踩坑说明
- License优先:部署商用前,阅读仓库LICENSE文件,部分模型代码开源,但权重有商业限制。
- 声音克隆合规:只克隆本人拥有授权的语音;未经许可复刻他人声音会侵犯人格权。
- 系统依赖:Kokoro、Piper需要系统安装
espeak‑ng;Windows需要手动安装msi包;Linux通过apt安装。 - 推理加速:CPU优先选择ONNX量化版本;N卡GPU优先开启CUDA;Apple Silicon使用MPS加速。
- 长文本处理:长稿件建议做文本分段,避免内存溢出;优先使用支持流式输出的模型。
补充:大部分项目社区都有第三方Gradio WebUI、Docker镜像,新手优先使用Docker方式快速体验,避免复杂环境配置。
📖 延伸阅读
- 📰 本刊杂志 — 每日 AI 科技与自由生活指南
- 🔧 Genspark GenOffice 上手 — 同刊免费办公套件
- 🔧 freellmapi:16 家免费 API 聚合 — 月省 17 亿 Token
- 🔧 Gemini 免费 API 上手指南 — 1M 上下文免费
🔗 这个工具今天就能用:
pip install edge-tts,5 分钟生成你的第一段 AI 配音。
最后更新:2026-08-05
原文链接:
https://www.17you.com/freeresources/free-open-source-tts-2026/
已复制!
寻找合作和资源
如果你也对文章内容或者分享的资源和机会有兴趣,欢迎联系我。
相关内容
- Genspark GenOffice:免费开源的 AI 原生办公套件上手
- GLM-5.2 零成本部署指南:从 Cloudflare Workers AI 到本地 RTX 4090
- freellmapi:16 家免费 API 一个端点全聚合,月省 17 亿 Token
- Devtools 必须开源:当 AI 让每个人都能改源码
- GSAP 入门:现代 Web 动画引擎完全指南
- Hyperframes:HTML-first 短视频渲染框架实战
