**VoiceStudio 是一套完全在本機執行的開源語音工作台,讓你不花一毛錢、不上傳任何音檔,就能克隆聲音、幫影片配音、聽寫與製作有聲書。**它整合了 16 個 TTS 引擎與 11 個 ASR 引擎,語言目錄號稱達 646 種,堪稱 ElevenLabs 的開源替代方案。
專案位置:https://github.com/debpalash/VoiceStudio(截至 2026-09-14:約 2.9 萬 stars,AGPL-3.0,前身叫 OmniVoice-Studio)。官方文件齊全,另附簡體中文 README(README_CN.md)。
為什麼你需要一個本機語音工作台?
雲端語音服務(ElevenLabs、Azure TTS、OpenAI TTS)好用,但有幾個繞不開的痛點:
- 按字計費:長篇有聲書或大量配音,帳單會快速累積。
- 隱私:你上傳的語音樣本與文字,都會進到服務商的伺服器。
- 不可離線:沒有網路就無法合成。
- 有限客製:你無法換底層模型,也很難微調音色。
VoiceStudio 把這些痛點反過來:資料預設留在本機,成本 = 你自己的硬體。它與雲端服務的定位差異,官方整理得很清楚:
| VoiceStudio | 典型雲端語音服務 | |
|---|---|---|
| 最適合 | 私有、離線、自架或高量產出 | 不想管模型、快速上手 |
| 資料流向 | 預設本機,遠端功能需主動開啟 | 音訊與文字由服務商處理 |
| 成本模式 | 軟體免費,你出硬體 | 訂閱、點數或計量 API |
| 離線使用 | 安裝好模型後可以 | 通常需要網路 |
| 客製化 | 原始碼、引擎、模型、API 全開 | 受限於服務商選項 |
能幹嘛:六大工作流程
VoiceStudio 不是單一功能的小工具,而是一整套語音工作站:
| 工作流程 | 說明 |
|---|---|
| 語音克隆(Voice Cloning) | 用 5~15 秒的乾淨樣本,零樣本(zero-shot)複製音色 |
| 語音設計(Voice Design) | 用年齡、口音、音高、風格、語氣等描述,憑空「造」一個聲音 |
| 影片配音(Video Dubbing) | 轉錄→翻譯→保留說話者→合成→匯出影片,一站式完成 |
| 有聲書/故事 | 多角色劇本、支援 EPUB/PDF 匯入、章節渲染、.m4b 匯出 |
| 聽寫(Dictation) | 系統級快捷鍵、即時轉錄、可選本地 LLM 校正 |
| 批量佇列(Batch Queue) | 大量音訊/影片排隊處理,或監看資料夾自動處理新影片 |
其他進階能力:人聲分離(Demucs)、說話者分離(Pyannote/WhisperX)、AI 浮水印(AudioSeal 隱寫標記,預設開啟)、遠端 worker 分散運算、GPU 自動偵測(CUDA/MPS/ROCm/CPU)。
安裝:四種平台都支援
macOS(Apple Silicon)
從 Releases 下載 DMG。首次啟動需要「右鍵 → 開啟」解除 Gatekeeper 攔截。⚠️ Intel Mac 無法跑本地 Python 後端(PyTorch 沒有對應 wheel),只能連遠端後端。
Windows 10/11
下載 x64 MSI;選擇「current-user」版本可免管理員權限安裝。
Linux
AppImage(x86_64,需 glibc 2.39+)。
Docker(快速起手)
官方鏡像僅 linux/amd64:
docker run -d -p 127.0.0.1:3900:3900 \
-v omnivoice-data:/app/omnivoice_data \
--name voicestudio palashdeb/omnivoice-studio:stable
從原始碼跑
git clone https://github.com/debpalash/VoiceStudio.git
cd VoiceStudio
bun install
bun run desktop
桌面啟動器會在首次執行時用 uv 自動設定 Python 依賴。想用瀏覽器 UI 就改成 bun run dev。
第一次克隆聲音:三步搞定
- 開啟 Voice Cloning(從音訊克隆) 分頁。
- 丟一段乾淨的語音樣本——3 秒就夠,5~15 秒效果更好(單一說話者、貼近麥克風、無音樂雜訊迴音)。
- 輸入文字、選語言,按 Generate。
關鍵觀念:克隆是「零樣本」——樣本只是 prompt,不是訓練資料。想要什麼語調,樣本就錄什麼語調。
不想安裝?官方有 Google Colab 筆記本 可以直接在雲端 GPU 上試跑。
引擎怎麼選:依硬體挑
VoiceStudio 的「引擎」是它的精髓——不同引擎在不同硬體上表現天差地別。官方給了三條建議路線:
| 硬體 | 推薦 TTS | 推薦 ASR | 原因 |
|---|---|---|---|
| Apple Silicon(M1–M4) | MLX-Audio、OmniVoice(MPS) | MLX Whisper、Parakeet MLX | 原生統一記憶體,macOS 延遲最低 |
| NVIDIA GPU(8GB+ VRAM) | OmniVoice、CosyVoice 3 | WhisperX | 高保真零樣本克隆、字級時間戳、說話者分離 |
| 低 VRAM / 純 CPU | PocketTTS、Sherpa-ONNX、KittenTTS | Moonshine、Faster-Whisper(int8) | 記憶體占用低、CPU 推論最佳化 |
預設 TTS 引擎是 OmniVoice(k2-fsa 出品,600+ 語言、支援克隆與指令控制),預設 ASR 是 WhisperX(約 100 種語言、字級時間戳)。完整的 16 個 TTS 引擎還包含 CosyVoice 3、GPT-SoVITS、VoxCPM2、IndexTTS 2.5、PocketTTS 等;11 個 ASR 引擎則涵蓋 Faster-Whisper、MLX Whisper、FunASR 等。用 Ctrl/Cmd + E 或 Model Catalogue 即可切換。
硬體需求
| 最低 | 建議 | |
|---|---|---|
| OS | Windows 10 x64 / macOS 13.3(Apple Silicon)/ Linux glibc 2.39+ | 最新穩定版 |
| RAM | 8 GB | 16 GB+ |
| 磁碟 | 10 GB | 20 GB+ SSD |
| GPU | 可選(支援 CPU) | NVIDIA CUDA 或 Apple Silicon |
| VRAM | 4 GB(用 GPU 時) | 8 GB+(大型引擎需更多) |
flowchart TD
A["Tauri v2 桌面殼(Rust)"] --> B["React + Vite 前端"]
B --> C["FastAPI 後端(localhost:3900)"]
C --> D["TTS / ASR 引擎註冊表"]
C --> E["配音 / 音訊 / 長篇管線"]
C --> F["OpenAI 相容 API + MCP Server"]
C --> G["SQLite + Alembic → omnivoice_data/"]進階:把 VoiceStudio 當成 API 伺服器
VoiceStudio 後端開在 localhost:3900,而且相容 OpenAI 音訊 API。你只要把 base_url 指過去:
from openai import OpenAI
client = OpenAI(base_url="http://localhost:3900/v1", api_key="local")
with client.audio.speech.with_streaming_response.create(
model="tts-1",
voice="<profile-id>",
input="Made on my own hardware.",
response_format="wav",
) as response:
response.stream_to_file("speech.wav")
或用 cURL 快速測試:
curl http://localhost:3900/v1/audio/speech \
-H "Content-Type: application/json" \
-d '{"model":"tts-1","input":"Made on my own hardware.","voice":"default","response_format":"wav"}' \
--output speech.wav
支援的端點:
| 端點 | 用途 |
|---|---|
POST /v1/audio/speech | TTS,輸出 mp3/opus/aac/flac/wav/pcm |
POST /v1/audio/transcriptions | STT,輸出 json/text/srt/vtt |
WS /v1/audio/transcriptions/stream | 即時串流轉錄 |
GET /v1/audio/voices | 列出本機聲音設定檔與引擎 |
接上 AI Agent:MCP Server 與 skills
VoiceStudio 內建 MCP Server(http://localhost:3900/mcp),Claude Desktop、Cursor 等代理可直接呼叫 generate_speech、clone_voice、transcribe:
{
"mcpServers": {
"voicestudio": { "url": "http://localhost:3900/mcp" }
}
}
也能為 Claude Code、Codex、Cursor 等裝現成 skills:
npx skills add debpalash/VoiceStudio
三個要注意的坑
- 商用授權要看清:VoiceStudio 主程式是 AGPL-3.0,但它只是「殼」;底層模型各有授權。預設 OmniVoice 權重是 CC-BY-NC(非商用),商用前務必核對你選的那個模型的條款。
- 樣本不是越長越好:克隆是零樣本 prompt,太長、有雜訊的樣本反而會稀釋效果,5~15 秒的乾淨單人錄音最理想。
- 遠端功能預設關閉:分析(analytics)預設關閉,遠端 worker 與外部 ASR 端點都是 opt-in;預設本機流程下,你的音訊、文字、聲音設定檔全都留在自己硬碟上。
小結
VoiceStudio 把「雲端語音服務」這門生意,硬生生壓縮成一套開源、本機、可客製的語音工作站。對台灣開發者來說,它特別適合三種情境:想要零成本大量產生語音(有聲書、課程、Podcast)、在意音檔隱私(客戶錄音、內部會議)、或想把語音能力接進自己的 AI Agent(MCP/OpenAI API 都開好了)。它還在 active beta、桌面端正在改寫成 Electron,但核心功能已經相當完整,值得現在就裝起來玩。
延伸閱讀:
- VoxCPM2:OpenBMB 免分詞器多語音合成模型
- MLX-Audio:為 Apple Silicon 最佳化的 TTS、STT 和 STS 函式庫
- AI 語音克隆進入「零樣本」時代:解析 TTS 模型四大流派
- LocalAI:自託管 OpenAI API 相容推理伺服器
資料來源:
