Voicebox 完全指南:开源 AI 语音工作站,本地克隆声音、生成语音、全局听写
一句话总结: Voicebox 是一个完全运行在本地的开源 AI 语音工作站——ElevenLabs 的声音克隆 + WisprFlow 的全局听写,一个应用全搞定,还免费。
它是什么?
Voicebox 是由 jamiepine 开发的开源 AI 语音工作站,GitHub 上已经收获 45,000+ Star,是目前最火的本地语音工具之一。
它解决的核心问题很简单:语音的输入和输出,不应该依赖云端。
- 语音输出(TTS): 7 个 TTS 引擎可选,支持 23 种语言,零样本声音克隆只需几秒音频
- 语音输入(STT): 全局热键听写,基于 Whisper 的本地语音转文字
- AI 集成: 内置 MCP 服务器,让 Claude Code、Cursor 等 AI 编程助手"开口说话"
和 ElevenLabs(只做语音输出)或 WisprFlow(只做语音输入)不同,Voicebox 把两端都做了,还加了一个本地 LLM 做中间桥梁——文本润色、人格设定、语气调整,全在你自己的机器上完成。
核心特性一览
| 特性 | 说明 |
|---|---|
| 7 个 TTS 引擎 | Qwen3-TTS、Qwen CustomVoice、LuxTTS、Chatterbox Multilingual/Turbo、HumeAI TADA、Kokoro |
| 23 种语言 | 英语、中文、日语、阿拉伯语、印地语等 |
| 声音克隆 | 零样本克隆,几秒参考音频即可 |
| 50+ 预设声音 | Kokoro 和 Qwen CustomVoice 提供 |
| 全局听写 | 热键触发,macOS 自动粘贴到当前输入框 |
| 8 种音频特效 | 变调、混响、延迟、合唱、压缩等 |
| Stories 编辑器 | 多轨时间线,做播客/对话/有声书 |
| MCP 协议 | AI 编程助手可直接调用 voicebox.speak |
| 本地运行 | 数据不出本机,支持 macOS/Windows/Linux/Docker |
| 原生性能 | Tauri (Rust) 构建,非 Electron |
安装
macOS(推荐)
直接下载 DMG 安装包:
# Apple Silicon (M1/M2/M3/M4)
# 访问 https://voicebox.sh/download/mac-arm 下载
# Intel Mac
# 访问 https://voicebox.sh/download/mac-intel 下载
下载后双击 DMG,拖入 Applications 即可。首次启动时 macOS 可能提示"无法验证开发者",前往 系统设置 → 隐私与安全性 点击"仍要打开"。
Windows
# 下载 MSI 安装包
# 访问 https://voicebox.sh/download/windows 下载
# 双击安装,自动配置 CUDA(如有 NVIDIA GPU)
Docker(跨平台)
# 克隆仓库
git clone https://github.com/jamiepine/voicebox.git
cd voicebox
# 启动
docker compose up -d
# 访问 Web UI
open http://localhost:3000
Linux
Linux 暂无预编译包,需要从源码构建:
# 安装依赖
sudo apt install -y build-essential pkg-config libssl-dev \
libasound2-dev libjack-dev portaudio19-dev
# 安装 Rust + Tauri 依赖
curl --proto '=https' --tlsv1.2 -sSf https://sh.rustup.rs | sh
source $HOME/.cargo/env
# 克隆并构建
git clone https://github.com/jamiepine/voicebox.git
cd voicebox
cargo tauri build
# 运行
./src-tauri/target/release/voicebox
详细的 Linux 构建指南参考:voicebox.sh/linux-install
快速上手:5 分钟生成第一段语音
第一步:选择 TTS 引擎
启动 Voicebox 后,在顶部引擎选择器中选一个 TTS 引擎。推荐新手从 Kokoro 开始——它只有 82M 参数,CPU 就能跑,速度最快。
| 引擎 | 参数量 | 推荐场景 |
|---|---|---|
| Kokoro | 82M | 快速预览,CPU 可用 |
| LuxTTS | ~1GB VRAM | 英语高质量,48kHz 输出 |
| Qwen3-TTS | 0.6B/1.7B | 多语言克隆,支持语气指令 |
| Chatterbox Turbo | 350M | 英语,支持情感标签 |
| Chatterbox Multilingual | — | 23 语言最广覆盖 |
| HumeAI TADA | 1B/3B | 超长文本(700 秒+) |
| Qwen CustomVoice | — | 自然语言控制语气,无需参考音频 |
第二步:输入文本,生成语音
在文本框中输入内容,点击生成:
Hello, welcome to Voicebox. This is a demo of local AI voice synthesis.
首次生成时,Voicebox 会自动下载对应引擎的模型文件(通常 100MB-2GB),耐心等待即可。后续使用不再需要下载。
第三步:试听和调整
生成完成后可以: - 点击播放试听 - 调整语速、音调 - 添加音频特效(混响、变调等) - 重新生成(换随机种子,获得不同演绎)
进阶功能
声音克隆:用几秒音频复制任何声音
这是 Voicebox 最强大的功能之一。
- 准备一段 5-30 秒 的清晰语音音频(WAV/MP3/FLAC 均可)
- 进入 Profiles → Create Profile
- 上传音频文件,或直接使用应用内录音
- 给声音起个名字,选择语言标签
- 保存后,在生成语音时选择这个 Profile 即可
# 支持的克隆引擎:
# - Qwen3-TTS:高质量多语言克隆
# - Chatterbox 系列:零样本克隆
# - Kokoro:预设声音为主,克隆能力有限
# 技巧:
# - 参考音频越清晰,克隆效果越好
# - 避免背景音乐和噪音
# - 支持多段参考音频提升质量
全局听写:在任何应用中语音输入
Voicebox 的全局听写功能让你在任何文本输入框都能用语音输入:
macOS 配置:
1. 打开 Voicebox → Settings → Dictation
2. 启用 Global Hotkey(默认 Option + Space)
3. 授予 辅助功能 和 输入监控 权限
4. 选择 Whisper 模型大小(推荐 Turbo,速度快质量好)
使用方式: - 按住说话模式: 按住热键说话,松开自动转文字并粘贴 - 切换模式: 点按热键开始/停止录音
# Whisper 模型选择建议:
# - Turbo:~8x 比 Large 快,质量损失极小(推荐)
# - Base:最小最快,适合简单场景
# - Medium:平衡选择
# - Large:最高质量,需要较好 GPU
音频特效:8 种后期处理
生成语音后,可以添加专业级音频特效:
# 内置 4 个预设:
# - Robotic:机器人效果
# - Radio:收音机效果
# - Echo Chamber:回声室
# - Deep Voice:低沉嗓音
# 8 种可调特效:
# 1. Pitch Shift — 变调(±12 半音)
# 2. Reverb — 混响(房间大小、阻尼、干湿比)
# 3. Delay — 延迟回声
# 4. Chorus/Flanger — 合唱/镶边效果
# 5. Compressor — 动态压缩
# 6. Gain — 音量调整(-40 到 +40 dB)
# 7. High-Pass — 高通滤波
# 8. Low-Pass — 低通滤波
特效可以保存为预设,也可以绑定到特定声音 Profile 上作为默认效果。
MCP 集成:让 AI 编程助手"说话"
Voicebox 内置 MCP 服务器,支持 Claude Code、Cursor、Cline 等 AI 工具直接调用语音功能。
配置方法:
// 在你的 MCP 配置文件中添加:
{
"mcpServers": {
"voicebox": {
"command": "voicebox",
"args": ["--mcp"]
}
}
}
配置完成后,AI 助手可以调用 voicebox.speak 工具,用你克隆的声音朗读代码解释、调试信息等内容。
高级玩法 — 声音人格:
给声音 Profile 附加一个"人格描述",Voicebox 会用内置本地 LLM 对文本进行风格化处理:
人格示例:
"你是一位经验丰富的 Linux 系统管理员,说话简洁直接,
偶尔带点技术幽默。解释问题时喜欢用类比。"
AI 助手通过 MCP 也能触发这些模式:Compose(创作)、Rewrite(改写)、Respond(回应)。
Stories 编辑器:多轨语音叙事
Stories 是一个多轨时间线编辑器,适合制作: - 多角色对话 - 播客节目 - 有声书章节 - 语音演示文稿
# 基本操作:
# 1. 创建 Story → 添加多个 Track(每个 Track 对应一个声音)
# 2. 在每个 Track 上生成/拖入语音片段
# 3. 时间线上拖拽排列顺序
# 4. 支持片段裁剪、拆分
# 5. 自动播放,同步播放头
# 6. 导出为完整音频文件
REST API 开发者接口
Voicebox 提供完整的 REST API,方便集成到自己的应用中:
# 生成语音
curl -X POST http://localhost:9876/api/generate \
-H "Content-Type: application/json" \
-d '{
"text": "Hello world",
"engine": "kokoro",
"voice": "af_heart",
"speed": 1.0
}'
# 声音克隆
curl -X POST http://localhost:9876/api/profiles \
-F "name=my-clone" \
-F "audio=@reference.wav"
# 语音转文字
curl -X POST http://localhost:9876/api/transcribe \
-F "audio=@recording.wav" \
-F "model=turbo"
# 查看所有声音 Profile
curl http://localhost:9876/api/profiles
API 支持 SSE(Server-Sent Events)实时状态推送,生成过程是非阻塞的。
硬件需求
| 配置 | 最低要求 | 推荐配置 |
|---|---|---|
| CPU | 4 核 | 8 核+ |
| 内存 | 8GB | 16GB+ |
| GPU | 无(CPU 可运行 Kokoro/LuxTTS) | NVIDIA 6GB+ VRAM |
| 磁盘 | 5GB(模型文件) | 20GB+ |
| macOS | Apple Silicon 或 Intel | M1+ 配合 MLX 加速 |
平台加速支持: - macOS: MLX / Metal(Apple Silicon 原生优化) - Windows: CUDA(NVIDIA)、DirectML(AMD/Intel) - Linux: CUDA、ROCm(AMD)、Intel Arc
和竞品对比
| 特性 | Voicebox | ElevenLabs | WisprFlow |
|---|---|---|---|
| 价格 | 免费开源 | $5/月起 | $15/月起 |
| 运行位置 | 本地 | 云端 | 云端 |
| 声音克隆 | ✅ 零样本 | ✅ | ❌ |
| 全局听写 | ✅ | ❌ | ✅ |
| TTS 引擎数 | 7 | 1 | 1 |
| 语言支持 | 23 种 | 29 种 | 30+ 种 |
| MCP 集成 | ✅ | ❌ | ❌ |
| 隐私 | 数据不出本机 | 数据上传云端 | 数据上传云端 |
| 音频特效 | 8 种 | 有限 | 无 |
| Stories 编辑 | ✅ | ❌ | ❌ |
总结
Voicebox 是目前最完整的开源本地语音解决方案。它把声音克隆、语音合成、全局听写、音频后期、AI 集成全部整合到一个原生应用里,而且完全免费、数据不出本机。
适合谁: - 开发者:MCP 集成让 AI 编程助手有声音 - 内容创作者:本地生成配音,无需付费 API - 隐私敏感用户:所有数据本地处理 - 播客/有声书制作者:Stories 多轨编辑
项目地址: github.com/jamiepine/voicebox 官网: voicebox.sh 文档: docs.voicebox.sh License: 开源
如果这篇文章对你有帮助,欢迎分享给更多开发者。有问题欢迎在评论区讨论!