Voicebox 完整指南:開源 AI 語音工作站,本機複製聲音、生成語音、全域聽寫
一句話總結: Voicebox 是一個完全在本機運行的開源 AI 語音工作站——ElevenLabs 的聲音複製 + WisprFlow 的全域聽寫,一個應用全搞定,還免費。
它是什麼?
Voicebox 是由 jamiepine 開發的開源 AI 語音工作站,GitHub 上已經收穫 45,000+ Star,是目前最熱門的本機語音工具之一。
它解決的核心問題很簡單:語音的輸入和輸出,不應該依賴雲端。
- 語音輸出(TTS): 7 個 TTS 引擎可選,支援 23 種語言,零樣本聲音複製只需幾秒音訊
- 語音輸入(STT): 全域快捷鍵聽寫,基於 Whisper 的本機語音轉文字
- AI 整合: 內建 MCP 伺服器,讓 Claude Code、Cursor 等 AI 程式設計助手「開口說話」
和 ElevenLabs(只做語音輸出)或 WisprFlow(只做語音輸入)不同,Voicebox 把兩端都做了,還加了一個本機 LLM 做中間橋樑——文字潤飾、人格設定、語氣調整,全在你自己的機器上完成。
核心特性一覽
| 特性 | 說明 |
|---|---|
| 7 個 TTS 引擎 | Qwen3-TTS、Qwen CustomVoice、LuxTTS、Chatterbox Multilingual/Turbo、HumeAI TADA、Kokoro |
| 23 種語言 | 英語、中文、日語、阿拉伯語、印地語等 |
| 聲音複製 | 零樣本複製,幾秒參考音訊即可 |
| 50+ 預設聲音 | Kokoro 和 Qwen CustomVoice 提供 |
| 全域聽寫 | 快捷鍵觸發,macOS 自動貼上到目前輸入框 |
| 8 種音訊特效 | 變調、混響、延遲、合聲、壓縮等 |
| Stories 編輯器 | 多軌時間軸,做 Podcast/對話/有聲書 |
| MCP 協定 | AI 程式設計助手可直接呼叫 voicebox.speak |
| 本機運行 | 資料不出本機,支援 macOS/Windows/Linux/Docker |
| 原生效能 | Tauri (Rust) 建構,非 Electron |
安裝
macOS(推薦)
直接下載 DMG 安裝包:
# Apple Silicon (M1/M2/M3/M4)
# 前往 https://voicebox.sh/download/mac-arm 下載
# Intel Mac
# 前往 https://voicebox.sh/download/mac-intel 下載
下載後雙擊 DMG,拖入 Applications 即可。首次啟動時 macOS 可能提示「無法驗證開發者」,前往 系統設定 → 隱私權與安全性 點擊「仍要開啟」。
Windows
# 下載 MSI 安裝包
# 前往 https://voicebox.sh/download/windows 下載
# 雙擊安裝,自動設定 CUDA(如有 NVIDIA GPU)
Docker(跨平台)
# 複製儲存庫
git clone https://github.com/jamiepine/voicebox.git
cd voicebox
# 啟動
docker compose up -d
# 存取 Web UI
open http://localhost:3000
Linux
Linux 目前沒有預編譯包,需要從原始碼建構:
# 安裝依賴
sudo apt install -y build-essential pkg-config libssl-dev \
libasound2-dev libjack-dev portaudio19-dev
# 安裝 Rust + Tauri 依賴
curl --proto '=https' --tlsv1.2 -sSf https://sh.rustup.rs | sh
source $HOME/.cargo/env
# 複製並建構
git clone https://github.com/jamiepine/voicebox.git
cd voicebox
cargo tauri build
# 執行
./src-tauri/target/release/voicebox
詳細的 Linux 建構指南參考:voicebox.sh/linux-install
快速上手:5 分鐘生成第一段語音
第一步:選擇 TTS 引擎
啟動 Voicebox 後,在頂部引擎選擇器中選一個 TTS 引擎。推薦新手從 Kokoro 開始——它只有 82M 參數,CPU 就能跑,速度最快。
| 引擎 | 參數量 | 推薦場景 |
|---|---|---|
| Kokoro | 82M | 快速預覽,CPU 可用 |
| LuxTTS | ~1GB VRAM | 英語高品質,48kHz 輸出 |
| Qwen3-TTS | 0.6B/1.7B | 多語言複製,支援語氣指令 |
| Chatterbox Turbo | 350M | 英語,支援情感標籤 |
| Chatterbox Multilingual | — | 23 語言最廣覆蓋 |
| HumeAI TADA | 1B/3B | 超長文字(700 秒+) |
| Qwen CustomVoice | — | 自然語言控制語氣,無需參考音訊 |
第二步:輸入文字,生成語音
在文字框中輸入內容,點擊生成:
Hello, welcome to Voicebox. This is a demo of local AI voice synthesis.
首次生成時,Voicebox 會自動下載對應引擎的模型檔案(通常 100MB-2GB),耐心等待即可。後續使用不再需要下載。
第三步:試聽和調整
生成完成後可以: - 點擊播放試聽 - 調整語速、音調 - 新增音訊特效(混響、變調等) - 重新生成(換隨機種子,獲得不同演繹)
進階功能
聲音複製:用幾秒音訊複製任何聲音
這是 Voicebox 最強大的功能之一。
- 準備一段 5-30 秒 的清晰語音音訊(WAV/MP3/FLAC 均可)
- 進入 Profiles → Create Profile
- 上傳音訊檔案,或直接使用應用內錄音
- 給聲音起個名字,選擇語言標籤
- 儲存後,在生成語音時選擇這個 Profile 即可
# 支援的複製引擎:
# - Qwen3-TTS:高品質多語言複製
# - Chatterbox 系列:零樣本複製
# - Kokoro:預設聲音為主,複製能力有限
# 技巧:
# - 參考音訊越清晰,複製效果越好
# - 避免背景音樂和噪音
# - 支援多段參考音訊提升品質
全域聽寫:在任何應用中語音輸入
Voicebox 的全域聽寫功能讓你在任何文字輸入框都能用語音輸入:
macOS 設定:
1. 開啟 Voicebox → Settings → Dictation
2. 啟用 Global Hotkey(預設 Option + Space)
3. 授予 輔助使用權 和 輸入監控 權限
4. 選擇 Whisper 模型大小(推薦 Turbo,速度快品質好)
使用方式: - 按住說話模式: 按住快捷鍵說話,放開自動轉文字並貼上 - 切換模式: 點擊快捷鍵開始/停止錄音
# Whisper 模型選擇建議:
# - Turbo:~8x 比 Large 快,品質損失極小(推薦)
# - Base:最小最快,適合簡單場景
# - Medium:平衡選擇
# - Large:最高品質,需要較好 GPU
音訊特效:8 種後製處理
生成語音後,可以新增專業級音訊特效:
# 內建 4 個預設:
# - Robotic:機器人效果
# - Radio:收音機效果
# - Echo Chamber:回聲室
# - Deep Voice:低沉嗓音
# 8 種可調特效:
# 1. Pitch Shift — 變調(±12 半音)
# 2. Reverb — 混響(房間大小、阻尼、乾濕比)
# 3. Delay — 延遲回聲
# 4. Chorus/Flanger — 合聲/鑲邊效果
# 5. Compressor — 動態壓縮
# 6. Gain — 音量調整(-40 到 +40 dB)
# 7. High-Pass — 高通濾波
# 8. Low-Pass — 低通濾波
特效可以儲存為預設,也可以綁定到特定聲音 Profile 上作為預設效果。
MCP 整合:讓 AI 程式設計助手「說話」
Voicebox 內建 MCP 伺服器,支援 Claude Code、Cursor、Cline 等 AI 工具直接呼叫語音功能。
設定方法:
// 在你的 MCP 設定檔案中新增:
{
"mcpServers": {
"voicebox": {
"command": "voicebox",
"args": ["--mcp"]
}
}
}
設定完成後,AI 助手可以呼叫 voicebox.speak 工具,用你複製的聲音朗讀程式碼解釋、除錯資訊等內容。
進階玩法 — 聲音人格:
給聲音 Profile 附加一個「人格描述」,Voicebox 會用內建本機 LLM 對文字進行風格化處理:
人格範例:
「你是一位經驗豐富的 Linux 系統管理員,說話簡潔直接,
偶爾帶點技術幽默。解釋問題時喜歡用類比。」
AI 助手透過 MCP 也能觸發這些模式:Compose(創作)、Rewrite(改寫)、Respond(回應)。
Stories 編輯器:多軌語音敘事
Stories 是一個多軌時間軸編輯器,適合製作: - 多角色對話 - Podcast 節目 - 有聲書章節 - 語音簡報
# 基本操作:
# 1. 建立 Story → 新增多個 Track(每個 Track 對應一個聲音)
# 2. 在每個 Track 上生成/拖入語音片段
# 3. 時間軸上拖曳排列順序
# 4. 支援片段裁剪、分割
# 5. 自動播放,同步播放指標
# 6. 匯出為完整音訊檔案
REST API 開發者介面
Voicebox 提供完整的 REST API,方便整合到自己的應用中:
# 生成語音
curl -X POST http://localhost:9876/api/generate \
-H "Content-Type: application/json" \
-d '{
"text": "Hello world",
"engine": "kokoro",
"voice": "af_heart",
"speed": 1.0
}'
# 聲音複製
curl -X POST http://localhost:9876/api/profiles \
-F "name=my-clone" \
-F "audio=@reference.wav"
# 語音轉文字
curl -X POST http://localhost:9876/api/transcribe \
-F "audio=@recording.wav" \
-F "model=turbo"
# 查看所有聲音 Profile
curl http://localhost:9876/api/profiles
API 支援 SSE(Server-Sent Events)即時狀態推送,生成過程是非阻塞的。
硬體需求
| 配置 | 最低要求 | 推薦配置 |
|---|---|---|
| CPU | 4 核 | 8 核+ |
| 記憶體 | 8GB | 16GB+ |
| GPU | 無(CPU 可運行 Kokoro/LuxTTS) | NVIDIA 6GB+ VRAM |
| 磁碟 | 5GB(模型檔案) | 20GB+ |
| macOS | Apple Silicon 或 Intel | M1+ 配合 MLX 加速 |
平台加速支援: - macOS: MLX / Metal(Apple Silicon 原生最佳化) - Windows: CUDA(NVIDIA)、DirectML(AMD/Intel) - Linux: CUDA、ROCm(AMD)、Intel Arc
和競品比較
| 特性 | Voicebox | ElevenLabs | WisprFlow |
|---|---|---|---|
| 價格 | 免費開源 | $5/月起 | $15/月起 |
| 運行位置 | 本機 | 雲端 | 雲端 |
| 聲音複製 | ✅ 零樣本 | ✅ | ❌ |
| 全域聽寫 | ✅ | ❌ | ✅ |
| TTS 引擎數 | 7 | 1 | 1 |
| 語言支援 | 23 種 | 29 種 | 30+ 種 |
| MCP 整合 | ✅ | ❌ | ❌ |
| 隱私 | 資料不出本機 | 資料上傳雲端 | 資料上傳雲端 |
| 音訊特效 | 8 種 | 有限 | 無 |
| Stories 編輯 | ✅ | ❌ | ❌ |
總結
Voicebox 是目前最完整的開源本機語音解決方案。它把聲音複製、語音合成、全域聽寫、音訊後製、AI 整合全部整合到一個原生應用裡,而且完全免費、資料不出本機。
適合誰: - 開發者:MCP 整合讓 AI 程式設計助手有聲音 - 內容創作者:本機生成配音,無需付費 API - 隱私敏感使用者:所有資料本機處理 - Podcast/有聲書製作者:Stories 多軌編輯
專案位址: github.com/jamiepine/voicebox 官網: voicebox.sh 文件: docs.voicebox.sh License: 開源
如果這篇文章對你有幫助,歡迎分享給更多開發者。有問題歡迎在留言區討論!