VoiceStudio 教學:開源本機語音克隆與配音工作台,16 個 TTS 引擎、646 種語言,ElevenLabs 免費替代方案(2026 完整指南)

VoiceStudio(原 OmniVoice-Studio)是一套 2.9 萬 stars 的開源語音工作台,可在你自己的電腦上做語音克隆、影片配音、聽寫與長篇有聲書。內建 16 個 TTS 引擎、11 個 ASR 引擎、646 種語言目錄,無需帳號或 API key。本文提供完整安裝步驟(macOS/Windows/Linux/Docker)、首次克隆語音教學、引擎選擇建議、OpenAI 相容 API 用法,以及與 ElevenLabs 等雲端服務的比較。

  • Dennis
  • 6 分鐘閱讀
VoiceStudio 教學:開源本機語音克隆與配音工作台,16 個 TTS 引擎、646 種語言,ElevenLabs 免費替代方案(2026 完整指南)

**VoiceStudio 是一套完全在本機執行的開源語音工作台,讓你不花一毛錢、不上傳任何音檔,就能克隆聲音、幫影片配音、聽寫與製作有聲書。**它整合了 16 個 TTS 引擎與 11 個 ASR 引擎,語言目錄號稱達 646 種,堪稱 ElevenLabs 的開源替代方案。

專案位置:https://github.com/debpalash/VoiceStudio(截至 2026-09-14:約 2.9 萬 stars,AGPL-3.0,前身叫 OmniVoice-Studio)。官方文件齊全,另附簡體中文 README(README_CN.md)。

為什麼你需要一個本機語音工作台?

雲端語音服務(ElevenLabs、Azure TTS、OpenAI TTS)好用,但有幾個繞不開的痛點:

  • 按字計費:長篇有聲書或大量配音,帳單會快速累積。
  • 隱私:你上傳的語音樣本與文字,都會進到服務商的伺服器。
  • 不可離線:沒有網路就無法合成。
  • 有限客製:你無法換底層模型,也很難微調音色。

VoiceStudio 把這些痛點反過來:資料預設留在本機,成本 = 你自己的硬體。它與雲端服務的定位差異,官方整理得很清楚:

VoiceStudio典型雲端語音服務
最適合私有、離線、自架或高量產出不想管模型、快速上手
資料流向預設本機,遠端功能需主動開啟音訊與文字由服務商處理
成本模式軟體免費,你出硬體訂閱、點數或計量 API
離線使用安裝好模型後可以通常需要網路
客製化原始碼、引擎、模型、API 全開受限於服務商選項

能幹嘛:六大工作流程

VoiceStudio 不是單一功能的小工具,而是一整套語音工作站:

工作流程說明
語音克隆(Voice Cloning)用 5~15 秒的乾淨樣本,零樣本(zero-shot)複製音色
語音設計(Voice Design)用年齡、口音、音高、風格、語氣等描述,憑空「造」一個聲音
影片配音(Video Dubbing)轉錄→翻譯→保留說話者→合成→匯出影片,一站式完成
有聲書/故事多角色劇本、支援 EPUB/PDF 匯入、章節渲染、.m4b 匯出
聽寫(Dictation)系統級快捷鍵、即時轉錄、可選本地 LLM 校正
批量佇列(Batch Queue)大量音訊/影片排隊處理,或監看資料夾自動處理新影片

其他進階能力:人聲分離(Demucs)、說話者分離(Pyannote/WhisperX)、AI 浮水印(AudioSeal 隱寫標記,預設開啟)、遠端 worker 分散運算、GPU 自動偵測(CUDA/MPS/ROCm/CPU)。

安裝:四種平台都支援

macOS(Apple Silicon)

Releases 下載 DMG。首次啟動需要「右鍵 → 開啟」解除 Gatekeeper 攔截。⚠️ Intel Mac 無法跑本地 Python 後端(PyTorch 沒有對應 wheel),只能連遠端後端。

Windows 10/11

下載 x64 MSI;選擇「current-user」版本可免管理員權限安裝。

Linux

AppImage(x86_64,需 glibc 2.39+)。

Docker(快速起手)

官方鏡像僅 linux/amd64

docker run -d -p 127.0.0.1:3900:3900 \
  -v omnivoice-data:/app/omnivoice_data \
  --name voicestudio palashdeb/omnivoice-studio:stable

從原始碼跑

git clone https://github.com/debpalash/VoiceStudio.git
cd VoiceStudio
bun install
bun run desktop

桌面啟動器會在首次執行時用 uv 自動設定 Python 依賴。想用瀏覽器 UI 就改成 bun run dev

第一次克隆聲音:三步搞定

  1. 開啟 Voice Cloning(從音訊克隆) 分頁。
  2. 丟一段乾淨的語音樣本——3 秒就夠,5~15 秒效果更好(單一說話者、貼近麥克風、無音樂雜訊迴音)。
  3. 輸入文字、選語言,按 Generate

關鍵觀念:克隆是「零樣本」——樣本只是 prompt,不是訓練資料。想要什麼語調,樣本就錄什麼語調。

不想安裝?官方有 Google Colab 筆記本 可以直接在雲端 GPU 上試跑。

引擎怎麼選:依硬體挑

VoiceStudio 的「引擎」是它的精髓——不同引擎在不同硬體上表現天差地別。官方給了三條建議路線:

硬體推薦 TTS推薦 ASR原因
Apple Silicon(M1–M4)MLX-Audio、OmniVoice(MPS)MLX Whisper、Parakeet MLX原生統一記憶體,macOS 延遲最低
NVIDIA GPU(8GB+ VRAM)OmniVoice、CosyVoice 3WhisperX高保真零樣本克隆、字級時間戳、說話者分離
低 VRAM / 純 CPUPocketTTS、Sherpa-ONNX、KittenTTSMoonshine、Faster-Whisper(int8)記憶體占用低、CPU 推論最佳化

預設 TTS 引擎是 OmniVoice(k2-fsa 出品,600+ 語言、支援克隆與指令控制),預設 ASR 是 WhisperX(約 100 種語言、字級時間戳)。完整的 16 個 TTS 引擎還包含 CosyVoice 3、GPT-SoVITS、VoxCPM2、IndexTTS 2.5、PocketTTS 等;11 個 ASR 引擎則涵蓋 Faster-Whisper、MLX Whisper、FunASR 等。用 Ctrl/Cmd + E 或 Model Catalogue 即可切換。

硬體需求

最低建議
OSWindows 10 x64 / macOS 13.3(Apple Silicon)/ Linux glibc 2.39+最新穩定版
RAM8 GB16 GB+
磁碟10 GB20 GB+ SSD
GPU可選(支援 CPU)NVIDIA CUDA 或 Apple Silicon
VRAM4 GB(用 GPU 時)8 GB+(大型引擎需更多)
flowchart TD
    A["Tauri v2 桌面殼(Rust)"] --> B["React + Vite 前端"]
    B --> C["FastAPI 後端(localhost:3900)"]
    C --> D["TTS / ASR 引擎註冊表"]
    C --> E["配音 / 音訊 / 長篇管線"]
    C --> F["OpenAI 相容 API + MCP Server"]
    C --> G["SQLite + Alembic → omnivoice_data/"]

進階:把 VoiceStudio 當成 API 伺服器

VoiceStudio 後端開在 localhost:3900,而且相容 OpenAI 音訊 API。你只要把 base_url 指過去:

from openai import OpenAI

client = OpenAI(base_url="http://localhost:3900/v1", api_key="local")

with client.audio.speech.with_streaming_response.create(
    model="tts-1",
    voice="<profile-id>",
    input="Made on my own hardware.",
    response_format="wav",
) as response:
    response.stream_to_file("speech.wav")

或用 cURL 快速測試:

curl http://localhost:3900/v1/audio/speech \
  -H "Content-Type: application/json" \
  -d '{"model":"tts-1","input":"Made on my own hardware.","voice":"default","response_format":"wav"}' \
  --output speech.wav

支援的端點:

端點用途
POST /v1/audio/speechTTS,輸出 mp3/opus/aac/flac/wav/pcm
POST /v1/audio/transcriptionsSTT,輸出 json/text/srt/vtt
WS /v1/audio/transcriptions/stream即時串流轉錄
GET /v1/audio/voices列出本機聲音設定檔與引擎

接上 AI Agent:MCP Server 與 skills

VoiceStudio 內建 MCP Server(http://localhost:3900/mcp),Claude Desktop、Cursor 等代理可直接呼叫 generate_speechclone_voicetranscribe

{
  "mcpServers": {
    "voicestudio": { "url": "http://localhost:3900/mcp" }
  }
}

也能為 Claude Code、Codex、Cursor 等裝現成 skills:

npx skills add debpalash/VoiceStudio

三個要注意的坑

  1. 商用授權要看清:VoiceStudio 主程式是 AGPL-3.0,但它只是「殼」;底層模型各有授權。預設 OmniVoice 權重是 CC-BY-NC(非商用),商用前務必核對你選的那個模型的條款。
  2. 樣本不是越長越好:克隆是零樣本 prompt,太長、有雜訊的樣本反而會稀釋效果,5~15 秒的乾淨單人錄音最理想。
  3. 遠端功能預設關閉:分析(analytics)預設關閉,遠端 worker 與外部 ASR 端點都是 opt-in;預設本機流程下,你的音訊、文字、聲音設定檔全都留在自己硬碟上。

小結

VoiceStudio 把「雲端語音服務」這門生意,硬生生壓縮成一套開源、本機、可客製的語音工作站。對台灣開發者來說,它特別適合三種情境:想要零成本大量產生語音(有聲書、課程、Podcast)、在意音檔隱私(客戶錄音、內部會議)、或想把語音能力接進自己的 AI Agent(MCP/OpenAI API 都開好了)。它還在 active beta、桌面端正在改寫成 Electron,但核心功能已經相當完整,值得現在就裝起來玩。

延伸閱讀:

資料來源:

📬 訂閱 most.tw 電子報

每週精選 AI 工具教學與技術乾貨,直接送到你的信箱。免費、隨時可退訂。

💬 有問題想討論?加 LINE 聯絡我

歡迎透過 LINE 官方帳號直接留言,我會盡快回覆你的問題。

加入 LINE 好友