Voicebox 完全指南:开源 AI 语音工作站,本地克隆声音、生成语音、全局听写

一句话总结: Voicebox 是一个完全运行在本地的开源 AI 语音工作站——ElevenLabs 的声音克隆 + WisprFlow 的全局听写,一个应用全搞定,还免费。

它是什么?

Voicebox 是由 jamiepine 开发的开源 AI 语音工作站,GitHub 上已经收获 45,000+ Star,是目前最火的本地语音工具之一。

它解决的核心问题很简单:语音的输入和输出,不应该依赖云端。

  • 语音输出(TTS): 7 个 TTS 引擎可选,支持 23 种语言,零样本声音克隆只需几秒音频
  • 语音输入(STT): 全局热键听写,基于 Whisper 的本地语音转文字
  • AI 集成: 内置 MCP 服务器,让 Claude Code、Cursor 等 AI 编程助手"开口说话"

和 ElevenLabs(只做语音输出)或 WisprFlow(只做语音输入)不同,Voicebox 把两端都做了,还加了一个本地 LLM 做中间桥梁——文本润色、人格设定、语气调整,全在你自己的机器上完成。

核心特性一览

特性 说明
7 个 TTS 引擎 Qwen3-TTS、Qwen CustomVoice、LuxTTS、Chatterbox Multilingual/Turbo、HumeAI TADA、Kokoro
23 种语言 英语、中文、日语、阿拉伯语、印地语等
声音克隆 零样本克隆,几秒参考音频即可
50+ 预设声音 Kokoro 和 Qwen CustomVoice 提供
全局听写 热键触发,macOS 自动粘贴到当前输入框
8 种音频特效 变调、混响、延迟、合唱、压缩等
Stories 编辑器 多轨时间线,做播客/对话/有声书
MCP 协议 AI 编程助手可直接调用 voicebox.speak
本地运行 数据不出本机,支持 macOS/Windows/Linux/Docker
原生性能 Tauri (Rust) 构建,非 Electron

安装

macOS(推荐)

直接下载 DMG 安装包:

# Apple Silicon (M1/M2/M3/M4)
# 访问 https://voicebox.sh/download/mac-arm 下载

# Intel Mac
# 访问 https://voicebox.sh/download/mac-intel 下载

下载后双击 DMG,拖入 Applications 即可。首次启动时 macOS 可能提示"无法验证开发者",前往 系统设置 → 隐私与安全性 点击"仍要打开"。

Windows

# 下载 MSI 安装包
# 访问 https://voicebox.sh/download/windows 下载
# 双击安装,自动配置 CUDA(如有 NVIDIA GPU)

Docker(跨平台)

# 克隆仓库
git clone https://github.com/jamiepine/voicebox.git
cd voicebox

# 启动
docker compose up -d

# 访问 Web UI
open http://localhost:3000

Linux

Linux 暂无预编译包,需要从源码构建:

# 安装依赖
sudo apt install -y build-essential pkg-config libssl-dev \
  libasound2-dev libjack-dev portaudio19-dev

# 安装 Rust + Tauri 依赖
curl --proto '=https' --tlsv1.2 -sSf https://sh.rustup.rs | sh
source $HOME/.cargo/env

# 克隆并构建
git clone https://github.com/jamiepine/voicebox.git
cd voicebox
cargo tauri build

# 运行
./src-tauri/target/release/voicebox

详细的 Linux 构建指南参考:voicebox.sh/linux-install

快速上手:5 分钟生成第一段语音

第一步:选择 TTS 引擎

启动 Voicebox 后,在顶部引擎选择器中选一个 TTS 引擎。推荐新手从 Kokoro 开始——它只有 82M 参数,CPU 就能跑,速度最快。

引擎 参数量 推荐场景
Kokoro 82M 快速预览,CPU 可用
LuxTTS ~1GB VRAM 英语高质量,48kHz 输出
Qwen3-TTS 0.6B/1.7B 多语言克隆,支持语气指令
Chatterbox Turbo 350M 英语,支持情感标签
Chatterbox Multilingual 23 语言最广覆盖
HumeAI TADA 1B/3B 超长文本(700 秒+)
Qwen CustomVoice 自然语言控制语气,无需参考音频

第二步:输入文本,生成语音

在文本框中输入内容,点击生成:

Hello, welcome to Voicebox. This is a demo of local AI voice synthesis.

首次生成时,Voicebox 会自动下载对应引擎的模型文件(通常 100MB-2GB),耐心等待即可。后续使用不再需要下载。

第三步:试听和调整

生成完成后可以: - 点击播放试听 - 调整语速、音调 - 添加音频特效(混响、变调等) - 重新生成(换随机种子,获得不同演绎)

进阶功能

声音克隆:用几秒音频复制任何声音

这是 Voicebox 最强大的功能之一。

  1. 准备一段 5-30 秒 的清晰语音音频(WAV/MP3/FLAC 均可)
  2. 进入 Profiles → Create Profile
  3. 上传音频文件,或直接使用应用内录音
  4. 给声音起个名字,选择语言标签
  5. 保存后,在生成语音时选择这个 Profile 即可
# 支持的克隆引擎:
# - Qwen3-TTS:高质量多语言克隆
# - Chatterbox 系列:零样本克隆
# - Kokoro:预设声音为主,克隆能力有限

# 技巧:
# - 参考音频越清晰,克隆效果越好
# - 避免背景音乐和噪音
# - 支持多段参考音频提升质量

全局听写:在任何应用中语音输入

Voicebox 的全局听写功能让你在任何文本输入框都能用语音输入:

macOS 配置: 1. 打开 Voicebox → Settings → Dictation 2. 启用 Global Hotkey(默认 Option + Space) 3. 授予 辅助功能输入监控 权限 4. 选择 Whisper 模型大小(推荐 Turbo,速度快质量好)

使用方式: - 按住说话模式: 按住热键说话,松开自动转文字并粘贴 - 切换模式: 点按热键开始/停止录音

# Whisper 模型选择建议:
# - Turbo:~8x 比 Large 快,质量损失极小(推荐)
# - Base:最小最快,适合简单场景
# - Medium:平衡选择
# - Large:最高质量,需要较好 GPU

音频特效:8 种后期处理

生成语音后,可以添加专业级音频特效:

# 内置 4 个预设:
# - Robotic:机器人效果
# - Radio:收音机效果
# - Echo Chamber:回声室
# - Deep Voice:低沉嗓音

# 8 种可调特效:
# 1. Pitch Shift    — 变调(±12 半音)
# 2. Reverb         — 混响(房间大小、阻尼、干湿比)
# 3. Delay          — 延迟回声
# 4. Chorus/Flanger — 合唱/镶边效果
# 5. Compressor     — 动态压缩
# 6. Gain           — 音量调整(-40 到 +40 dB)
# 7. High-Pass      — 高通滤波
# 8. Low-Pass       — 低通滤波

特效可以保存为预设,也可以绑定到特定声音 Profile 上作为默认效果。

MCP 集成:让 AI 编程助手"说话"

Voicebox 内置 MCP 服务器,支持 Claude Code、Cursor、Cline 等 AI 工具直接调用语音功能。

配置方法:

// 在你的 MCP 配置文件中添加:
{
  "mcpServers": {
    "voicebox": {
      "command": "voicebox",
      "args": ["--mcp"]
    }
  }
}

配置完成后,AI 助手可以调用 voicebox.speak 工具,用你克隆的声音朗读代码解释、调试信息等内容。

高级玩法 — 声音人格:

给声音 Profile 附加一个"人格描述",Voicebox 会用内置本地 LLM 对文本进行风格化处理:

人格示例:
"你是一位经验丰富的 Linux 系统管理员,说话简洁直接,
偶尔带点技术幽默。解释问题时喜欢用类比。"

AI 助手通过 MCP 也能触发这些模式:Compose(创作)、Rewrite(改写)、Respond(回应)。

Stories 编辑器:多轨语音叙事

Stories 是一个多轨时间线编辑器,适合制作: - 多角色对话 - 播客节目 - 有声书章节 - 语音演示文稿

# 基本操作:
# 1. 创建 Story → 添加多个 Track(每个 Track 对应一个声音)
# 2. 在每个 Track 上生成/拖入语音片段
# 3. 时间线上拖拽排列顺序
# 4. 支持片段裁剪、拆分
# 5. 自动播放,同步播放头
# 6. 导出为完整音频文件

REST API 开发者接口

Voicebox 提供完整的 REST API,方便集成到自己的应用中:

# 生成语音
curl -X POST http://localhost:9876/api/generate \
  -H "Content-Type: application/json" \
  -d '{
    "text": "Hello world",
    "engine": "kokoro",
    "voice": "af_heart",
    "speed": 1.0
  }'

# 声音克隆
curl -X POST http://localhost:9876/api/profiles \
  -F "name=my-clone" \
  -F "audio=@reference.wav"

# 语音转文字
curl -X POST http://localhost:9876/api/transcribe \
  -F "audio=@recording.wav" \
  -F "model=turbo"

# 查看所有声音 Profile
curl http://localhost:9876/api/profiles

API 支持 SSE(Server-Sent Events)实时状态推送,生成过程是非阻塞的。

硬件需求

配置 最低要求 推荐配置
CPU 4 核 8 核+
内存 8GB 16GB+
GPU 无(CPU 可运行 Kokoro/LuxTTS) NVIDIA 6GB+ VRAM
磁盘 5GB(模型文件) 20GB+
macOS Apple Silicon 或 Intel M1+ 配合 MLX 加速

平台加速支持: - macOS: MLX / Metal(Apple Silicon 原生优化) - Windows: CUDA(NVIDIA)、DirectML(AMD/Intel) - Linux: CUDA、ROCm(AMD)、Intel Arc

和竞品对比

特性 Voicebox ElevenLabs WisprFlow
价格 免费开源 $5/月起 $15/月起
运行位置 本地 云端 云端
声音克隆 ✅ 零样本
全局听写
TTS 引擎数 7 1 1
语言支持 23 种 29 种 30+ 种
MCP 集成
隐私 数据不出本机 数据上传云端 数据上传云端
音频特效 8 种 有限
Stories 编辑

总结

Voicebox 是目前最完整的开源本地语音解决方案。它把声音克隆、语音合成、全局听写、音频后期、AI 集成全部整合到一个原生应用里,而且完全免费、数据不出本机。

适合谁: - 开发者:MCP 集成让 AI 编程助手有声音 - 内容创作者:本地生成配音,无需付费 API - 隐私敏感用户:所有数据本地处理 - 播客/有声书制作者:Stories 多轨编辑

项目地址: github.com/jamiepine/voicebox 官网: voicebox.sh 文档: docs.voicebox.sh License: 开源


如果这篇文章对你有帮助,欢迎分享给更多开发者。有问题欢迎在评论区讨论!