自托管服务
jamiepine/voicebox avatar
jamiepine/voicebox

Voicebox:把语音合成、克隆和听写全部压进本地的开源方案

Voicebox 是一个本地 AI 语音工作室,用于录音、克隆声音、听写和语音生成。

53,792 个 Star6,728 个 ForkTypeScriptMIT

秒懂

它是什么?
Voicebox 是一个本地优先的 AI 语音工作室,用 Tauri 打包,同时覆盖语音合成、声音克隆、全局听写和 Agent 语音输出。它想用一个应用替代 ElevenLabs 和 WisprFlow,但多引擎切换和模型下载带来的复杂度,需要你先想清楚自己是不是目标用户。
适合谁用?
Voicebox 适合那些对语音数据隐私敏感、愿意折腾多引擎配置的独立开发者或小团队。它不适合追求开箱即用的普通用户,因为 Linux 没有预编译包,模型需要按引擎逐个下载,且不同引擎对标签和语言的支持差异明显。
能商用吗?
可以。MIT 是宽松许可证:你可以使用、修改并销售基于它的软件,只需保留版权和许可证声明。
还在维护吗?
在维护。仓库最近一次提交在 38 天前。
用什么语言写的?
主要是 TypeScript(依据 GitHub 的语言统计)。

以上回答依据项目的 GitHub 数据(最近同步于 2026年9月15日)和我们的分析,不构成法律意见。

开源项目深度解析

它要解决的问题:语音输入输出的两端割裂

ElevenLabs 和 WisprFlow 分别占据语音输出的合成和语音输入的听写,但它们是两个独立的云服务。Voicebox 的定位是把这两半拼在一起,再塞进本地运行。它不只做 TTS,还做 STT(Whisper 听写)、声音克隆、后期效果,甚至给 MCP Agent 一个 speak 工具。目标用户很明确:不想把语音数据上传云端、又需要同时处理合成和听写的开发者或内容创作者。

七个 TTS 引擎和一个本地 LLM:架构如何拼起来

Voicebox 的核心是一个可切换的多引擎架构。README 列出 7 个 TTS 引擎,从 82M 参数的 Kokoro 到 1B/3B 的 HumeAI TADA,覆盖不同语言和性能档位。每个引擎独立下载、独立调用,生成时按需选择。输入侧用 Whisper 做 STT,输出侧通过一个捆绑的本地 LLM 做文本精修和角色人格化。这个 LLM 不是可选项,而是连接输入输出的桥梁:听写文本可以经过它改写,再交给 TTS。整个数据流都在本机完成,这是它和云服务的根本区别。

安装与启动:从 Docker 到源码构建的路径

官方下载页提供 macOS(Apple Silicon 和 Intel)的 DMG、Windows 的 MSI,以及 Docker 镜像。最简单的方式是 `docker compose up`。Linux 没有预编译二进制,需要按 voicebox.sh/linux-install 的指引从源码构建。这个差异很现实:如果你在 Linux 上想快速试,只能走 Docker 或源码。启动后,模型是按引擎下载的,不是一次装完。README 提到 Troubleshooting 指南专门讲模型下载和 GPU 问题,说明这部分是常见的坑。

克隆、标签和效果:功能边界在哪里

零样本克隆只需要几秒参考音频,这是宣传点。但表达控制有严格边界:只有 Chatterbox Turbo 支持 `[laugh]`、`[sigh]` 这类副语言标签,其他引擎会把标签当字面文本念出来。Qwen3-TTS 和 Qwen CustomVoice 支持自然语言指令(比如“说慢点”),但这是另一种机制。后期效果由 Spotify 的 pedalboard 提供 8 种效果,可实时预览并保存预设。自动分块加交叉淡化支持无限长度生成,适合文章和章节。这些功能不是全引擎通用的,选错引擎就会得到错误输出。

Agent 语音输出:MCP 的接入方式

Voicebox 内置 MCP 服务器,暴露一个 `voicebox.speak` 工具调用。任何支持 MCP 的 Agent(README 提到 Claude Code、Cursor、Cline)都能调用它,让 Agent 用你克隆的声音说话。同时,语音人格(persona)可以附加到声音配置上,Agent 能通过 MCP 触发 Compose、Rewrite、Respond 这些模式。这相当于把语音输出变成 Agent 的一个工具,而不是独立应用。文档没有给出具体的 MCP 配置示例,但 API-first 的设计意味着你可以用 REST API 或 MCP 协议自行集成。

限制与陷阱:引擎选择的代价

一个明显的限制是 Linux 支持不完整。没有预编译包,只能源码构建,这对多数桌面用户是门槛。另一个陷阱是引擎能力差异大:LuxTTS 只支持英语,Chatterbox Multilingual 覆盖 23 种语言但可能不支持副语言标签。如果你需要阿拉伯语或印地语,就必须选 Chatterbox Multilingual,但它的速度和音质未必最优。Kokoro 只有 82M 参数,适合 CPU 快速推理,但克隆质量可能不如 Qwen3-TTS。这些权衡意味着你必须在语言覆盖、性能和质量之间做取舍。

替代方案与维护成本

直接替代品是 ElevenLabs(云端合成)和 WisprFlow(云端听写),但它们是商业服务,数据离开本机。开源替代里,Coqui TTS 或 Piper 提供单引擎合成,但没有听写和 Agent 集成。Voicebox 的差异化在于把多引擎、STT、效果和 MCP 打包在一起。维护方面,项目用 MIT 许可证,最近更新活跃(v0.5.0 在 2026 年 4 月发布),但多引擎意味着每个引擎升级或模型更新时,你都要跟进。Docker 部署可以减轻环境依赖,但模型文件会占大量磁盘空间。

编辑结论

Voicebox 适合那些对语音数据隐私敏感、愿意折腾多引擎配置的独立开发者或小团队。它不适合追求开箱即用的普通用户,因为 Linux 没有预编译包,模型需要按引擎逐个下载,且不同引擎对标签和语言的支持差异明显。采用前先确认三件事:你的 GPU 显存能否跑起 Qwen3-TTS 或 TADA 这类大模型,你常用的语言是否落在 Chatterbox Multilingual 的 23 种范围内,以及你是否接受用 Docker 或源码构建来解决 Linux 下的安装问题。如果这些都能接受,Voicebox 可能是目前唯一一个把输入输出两端都收进本地的开源选择。

官方来源

  1. Official documentation
  2. Official README
  3. Project repository
  4. Release notes
社区笔记

社区笔记