Voicebox 完整指南:開源 AI 語音工作站,本機複製聲音、生成語音、全域聽寫

一句話總結: Voicebox 是一個完全在本機運行的開源 AI 語音工作站——ElevenLabs 的聲音複製 + WisprFlow 的全域聽寫,一個應用全搞定,還免費。

它是什麼?

Voicebox 是由 jamiepine 開發的開源 AI 語音工作站,GitHub 上已經收穫 45,000+ Star,是目前最熱門的本機語音工具之一。

它解決的核心問題很簡單:語音的輸入和輸出,不應該依賴雲端。

  • 語音輸出(TTS): 7 個 TTS 引擎可選,支援 23 種語言,零樣本聲音複製只需幾秒音訊
  • 語音輸入(STT): 全域快捷鍵聽寫,基於 Whisper 的本機語音轉文字
  • AI 整合: 內建 MCP 伺服器,讓 Claude Code、Cursor 等 AI 程式設計助手「開口說話」

和 ElevenLabs(只做語音輸出)或 WisprFlow(只做語音輸入)不同,Voicebox 把兩端都做了,還加了一個本機 LLM 做中間橋樑——文字潤飾、人格設定、語氣調整,全在你自己的機器上完成。

核心特性一覽

特性 說明
7 個 TTS 引擎 Qwen3-TTS、Qwen CustomVoice、LuxTTS、Chatterbox Multilingual/Turbo、HumeAI TADA、Kokoro
23 種語言 英語、中文、日語、阿拉伯語、印地語等
聲音複製 零樣本複製,幾秒參考音訊即可
50+ 預設聲音 Kokoro 和 Qwen CustomVoice 提供
全域聽寫 快捷鍵觸發,macOS 自動貼上到目前輸入框
8 種音訊特效 變調、混響、延遲、合聲、壓縮等
Stories 編輯器 多軌時間軸,做 Podcast/對話/有聲書
MCP 協定 AI 程式設計助手可直接呼叫 voicebox.speak
本機運行 資料不出本機,支援 macOS/Windows/Linux/Docker
原生效能 Tauri (Rust) 建構,非 Electron

安裝

macOS(推薦)

直接下載 DMG 安裝包:

# Apple Silicon (M1/M2/M3/M4)
# 前往 https://voicebox.sh/download/mac-arm 下載

# Intel Mac
# 前往 https://voicebox.sh/download/mac-intel 下載

下載後雙擊 DMG,拖入 Applications 即可。首次啟動時 macOS 可能提示「無法驗證開發者」,前往 系統設定 → 隱私權與安全性 點擊「仍要開啟」。

Windows

# 下載 MSI 安裝包
# 前往 https://voicebox.sh/download/windows 下載
# 雙擊安裝,自動設定 CUDA(如有 NVIDIA GPU)

Docker(跨平台)

# 複製儲存庫
git clone https://github.com/jamiepine/voicebox.git
cd voicebox

# 啟動
docker compose up -d

# 存取 Web UI
open http://localhost:3000

Linux

Linux 目前沒有預編譯包,需要從原始碼建構:

# 安裝依賴
sudo apt install -y build-essential pkg-config libssl-dev \
  libasound2-dev libjack-dev portaudio19-dev

# 安裝 Rust + Tauri 依賴
curl --proto '=https' --tlsv1.2 -sSf https://sh.rustup.rs | sh
source $HOME/.cargo/env

# 複製並建構
git clone https://github.com/jamiepine/voicebox.git
cd voicebox
cargo tauri build

# 執行
./src-tauri/target/release/voicebox

詳細的 Linux 建構指南參考:voicebox.sh/linux-install

快速上手:5 分鐘生成第一段語音

第一步:選擇 TTS 引擎

啟動 Voicebox 後,在頂部引擎選擇器中選一個 TTS 引擎。推薦新手從 Kokoro 開始——它只有 82M 參數,CPU 就能跑,速度最快。

引擎 參數量 推薦場景
Kokoro 82M 快速預覽,CPU 可用
LuxTTS ~1GB VRAM 英語高品質,48kHz 輸出
Qwen3-TTS 0.6B/1.7B 多語言複製,支援語氣指令
Chatterbox Turbo 350M 英語,支援情感標籤
Chatterbox Multilingual 23 語言最廣覆蓋
HumeAI TADA 1B/3B 超長文字(700 秒+)
Qwen CustomVoice 自然語言控制語氣,無需參考音訊

第二步:輸入文字,生成語音

在文字框中輸入內容,點擊生成:

Hello, welcome to Voicebox. This is a demo of local AI voice synthesis.

首次生成時,Voicebox 會自動下載對應引擎的模型檔案(通常 100MB-2GB),耐心等待即可。後續使用不再需要下載。

第三步:試聽和調整

生成完成後可以: - 點擊播放試聽 - 調整語速、音調 - 新增音訊特效(混響、變調等) - 重新生成(換隨機種子,獲得不同演繹)

進階功能

聲音複製:用幾秒音訊複製任何聲音

這是 Voicebox 最強大的功能之一。

  1. 準備一段 5-30 秒 的清晰語音音訊(WAV/MP3/FLAC 均可)
  2. 進入 Profiles → Create Profile
  3. 上傳音訊檔案,或直接使用應用內錄音
  4. 給聲音起個名字,選擇語言標籤
  5. 儲存後,在生成語音時選擇這個 Profile 即可
# 支援的複製引擎:
# - Qwen3-TTS:高品質多語言複製
# - Chatterbox 系列:零樣本複製
# - Kokoro:預設聲音為主,複製能力有限

# 技巧:
# - 參考音訊越清晰,複製效果越好
# - 避免背景音樂和噪音
# - 支援多段參考音訊提升品質

全域聽寫:在任何應用中語音輸入

Voicebox 的全域聽寫功能讓你在任何文字輸入框都能用語音輸入:

macOS 設定: 1. 開啟 Voicebox → Settings → Dictation 2. 啟用 Global Hotkey(預設 Option + Space) 3. 授予 輔助使用權輸入監控 權限 4. 選擇 Whisper 模型大小(推薦 Turbo,速度快品質好)

使用方式: - 按住說話模式: 按住快捷鍵說話,放開自動轉文字並貼上 - 切換模式: 點擊快捷鍵開始/停止錄音

# Whisper 模型選擇建議:
# - Turbo:~8x 比 Large 快,品質損失極小(推薦)
# - Base:最小最快,適合簡單場景
# - Medium:平衡選擇
# - Large:最高品質,需要較好 GPU

音訊特效:8 種後製處理

生成語音後,可以新增專業級音訊特效:

# 內建 4 個預設:
# - Robotic:機器人效果
# - Radio:收音機效果
# - Echo Chamber:回聲室
# - Deep Voice:低沉嗓音

# 8 種可調特效:
# 1. Pitch Shift    — 變調(±12 半音)
# 2. Reverb         — 混響(房間大小、阻尼、乾濕比)
# 3. Delay          — 延遲回聲
# 4. Chorus/Flanger — 合聲/鑲邊效果
# 5. Compressor     — 動態壓縮
# 6. Gain           — 音量調整(-40 到 +40 dB)
# 7. High-Pass      — 高通濾波
# 8. Low-Pass       — 低通濾波

特效可以儲存為預設,也可以綁定到特定聲音 Profile 上作為預設效果。

MCP 整合:讓 AI 程式設計助手「說話」

Voicebox 內建 MCP 伺服器,支援 Claude Code、Cursor、Cline 等 AI 工具直接呼叫語音功能。

設定方法:

// 在你的 MCP 設定檔案中新增:
{
  "mcpServers": {
    "voicebox": {
      "command": "voicebox",
      "args": ["--mcp"]
    }
  }
}

設定完成後,AI 助手可以呼叫 voicebox.speak 工具,用你複製的聲音朗讀程式碼解釋、除錯資訊等內容。

進階玩法 — 聲音人格:

給聲音 Profile 附加一個「人格描述」,Voicebox 會用內建本機 LLM 對文字進行風格化處理:

人格範例:
「你是一位經驗豐富的 Linux 系統管理員,說話簡潔直接,
偶爾帶點技術幽默。解釋問題時喜歡用類比。」

AI 助手透過 MCP 也能觸發這些模式:Compose(創作)、Rewrite(改寫)、Respond(回應)。

Stories 編輯器:多軌語音敘事

Stories 是一個多軌時間軸編輯器,適合製作: - 多角色對話 - Podcast 節目 - 有聲書章節 - 語音簡報

# 基本操作:
# 1. 建立 Story → 新增多個 Track(每個 Track 對應一個聲音)
# 2. 在每個 Track 上生成/拖入語音片段
# 3. 時間軸上拖曳排列順序
# 4. 支援片段裁剪、分割
# 5. 自動播放,同步播放指標
# 6. 匯出為完整音訊檔案

REST API 開發者介面

Voicebox 提供完整的 REST API,方便整合到自己的應用中:

# 生成語音
curl -X POST http://localhost:9876/api/generate \
  -H "Content-Type: application/json" \
  -d '{
    "text": "Hello world",
    "engine": "kokoro",
    "voice": "af_heart",
    "speed": 1.0
  }'

# 聲音複製
curl -X POST http://localhost:9876/api/profiles \
  -F "name=my-clone" \
  -F "audio=@reference.wav"

# 語音轉文字
curl -X POST http://localhost:9876/api/transcribe \
  -F "audio=@recording.wav" \
  -F "model=turbo"

# 查看所有聲音 Profile
curl http://localhost:9876/api/profiles

API 支援 SSE(Server-Sent Events)即時狀態推送,生成過程是非阻塞的。

硬體需求

配置 最低要求 推薦配置
CPU 4 核 8 核+
記憶體 8GB 16GB+
GPU 無(CPU 可運行 Kokoro/LuxTTS) NVIDIA 6GB+ VRAM
磁碟 5GB(模型檔案) 20GB+
macOS Apple Silicon 或 Intel M1+ 配合 MLX 加速

平台加速支援: - macOS: MLX / Metal(Apple Silicon 原生最佳化) - Windows: CUDA(NVIDIA)、DirectML(AMD/Intel) - Linux: CUDA、ROCm(AMD)、Intel Arc

和競品比較

特性 Voicebox ElevenLabs WisprFlow
價格 免費開源 $5/月起 $15/月起
運行位置 本機 雲端 雲端
聲音複製 ✅ 零樣本
全域聽寫
TTS 引擎數 7 1 1
語言支援 23 種 29 種 30+ 種
MCP 整合
隱私 資料不出本機 資料上傳雲端 資料上傳雲端
音訊特效 8 種 有限
Stories 編輯

總結

Voicebox 是目前最完整的開源本機語音解決方案。它把聲音複製、語音合成、全域聽寫、音訊後製、AI 整合全部整合到一個原生應用裡,而且完全免費、資料不出本機。

適合誰: - 開發者:MCP 整合讓 AI 程式設計助手有聲音 - 內容創作者:本機生成配音,無需付費 API - 隱私敏感使用者:所有資料本機處理 - Podcast/有聲書製作者:Stories 多軌編輯

專案位址: github.com/jamiepine/voicebox 官網: voicebox.sh 文件: docs.voicebox.sh License: 開源


如果這篇文章對你有幫助,歡迎分享給更多開發者。有問題歡迎在留言區討論!