Z 世代團隊打造的 AI 語音獨角獸!Fish Audio 獲 5200 萬美元種子輪融資,ARR 突破 2100 萬

AI 語音新創 Fish Audio 完成 5200 萬美元種子輪融資,由 Coreline Ventures 和 Capital Today 領投。公司披露 ARR 已達 2100 萬美元、全球超過 800 萬用戶。Fish Speech S2 Pro 採用 Dual-AR 架構,支援 80+ 語言與自然語言情感控制,正在挑戰 ElevenLabs 的霸主地位。

  • Dennis
  • 4 分鐘閱讀
Z 世代團隊打造的 AI 語音獨角獸!Fish Audio 獲 5200 萬美元種子輪融資,ARR 突破 2100 萬

AI 語音市場正以前所未有的速度成長,而最新加入戰局的「破壞者」,是一支由四位 Z 世代年輕人組成的團隊。

就在今天(7 月 28 日),Fish Audio 宣布完成 5200 萬美元的種子輪融資,由 Coreline VenturesCapital Today 領投。更令人驚訝的是,這家才成立一年多的公司,同時披露了 2100 萬美元的年度經常性收入(ARR),以及 超過 800 萬的全球用戶——這個數字對一個種子輪公司來說,簡直是天文數字。

Fish Audio 是誰?一支 Z 世代團隊的開源傳奇

Fish Audio 總部位於舊金山,由一個四人 Z 世代團隊創立,但它的故事其實更早開始。創辦人暨首席科學家 Shijia Liao 在開源語音社群中早已是傳奇人物——他過去曾參與開發 So-VITS-SVC、GPT-SOVITSBert-VITS2 等廣泛使用的開源語音模型。

現任執行長 Rissa Cao 則帶領公司在 2025 年經歷了爆發性成長:

指標數字
年度經常性收入 (ARR)2100 萬美元
全球用戶800 萬+
GitHub Stars31,000+
團隊人數22 人
已發布模型5 個(3 個開源)
企業客戶HeyGen、Sanas、LiveKit

從 2025 年初開始,Fish Audio 的年化營收在短短四個月內就從 40 萬美元暴漲到 500 萬美元,月活躍用戶也從 5 萬增加到 42 萬。這個成長曲線讓它成為 AI 語音領域最受關注的新創之一。

核心技術:Fish Speech S2 Pro 憑什麼這麼強?

Fish Audio 的技術核心是 Fish Speech S2 Pro,一套多模態語音合成系統。我們來看看它與傳統 TTS 的差異:

graph TD
    A[輸入文字] --> B{S2 Pro 架構}
    B --> C[Slow AR 4B 參數<br/>處理語義碼本]
    B --> D[Fast AR 400M 參數<br/>生成聲學細節]
    C --> E[80+ 語言支援]
    D --> F[自然語言情感控制]
    D --> G[多語者對話]
    E --> H[輸出語音]
    F --> H
    G --> H

Dual-AR(雙重自迴歸)架構

這是 Fish Audio 最創新的設計:

  • Slow AR(慢速自迴歸,40 億參數):沿時間軸運作,預測主要的語義編碼
  • Fast AR(快速自迴歸,4 億參數):在每個時間點生成剩餘的 9 個殘差編碼,還原精細的聲學細節

這種不對稱設計的威力在於:它同時兼顧了音質保真度極高的推理速度

自然語言情感控制

這可能是最讓創作者興奮的功能。使用者可以用中括號語法,在文字中任意位置加入情感指令:

[whisper] 這是祕密,不要告訴別人...
[excited] 我們做到了!太棒了!
[laughing nervously] 呃...這個結果有點意外啊

S2 Pro 支援 超過 15,000 種自訂描述,從氣音、興奮、緊張的笑,到專業播報腔調、提高音調等,幾乎沒有做不到的。

效能數據

指標數值
訓練數據1000 萬小時+ 語音
支援語言80+ 種
首字延遲 (TTFA)~100 毫秒
即時因子 (RTF)0.195
最大吞吐量3000+ 聲學 token/秒

市場定位:挑戰 ElevenLabs 的霸主地位

在 AI 語音市場中,ElevenLabs 一直是最強勢的品牌,尤其英語語音的真實度無人能及。但 Fish Audio 的策略很清楚:以開源為基礎,用多語言 + 情感控制 + 超低延遲打出差異化

根據業界排名,Fish Audio 在情感控制和語音多樣性上已經超越 ElevenLabs:

排名工具最佳用途
🥇Fish Audio情感控制、多語言
🥈ElevenLabs英語語音品質
🥉Descript Overdub播客/影片剪輯
4Resemble AI開發者 API
5Play.ht多語言規模化

版權保護的殺手鐧

AI 語音市場最大的痛點是聲音版權。Fish Audio 創立了業界最快速的版權申訴機制:3 分鐘內自動下架未經授權的語音克隆。這對於擔心法律風險的企業客戶來說,是非常有吸引力的賣點。

商業模式與路線圖

Fish Audio 採用「開源社群 + 商業化」雙引擎模式:

  • API 定價:每百萬 UTF-8 字節 15 美元(約 12 小時語音),且提供免費版供開發測試
  • 消費者訂閱:每月 15 美元或每年 120 美元,無限語音生成
  • 即將推出 Fish Agent:端到端語音代理,專為客服、預約助理等場景打造

執行長 Rissa Cao 表示:「我們認為語音不該只是文字轉語音的產出,而是人機互動的情感核心。Fish Agent 將讓 AI 能夠像真人一樣『表演』語音。」

小結

5200 萬美元的種子輪、2100 萬美元的 ARR、800 萬用戶——這些數字對一個種子輪階段的公司來說並不常見。但 Fish Audio 證明了開源社群的商業潛力:從開源專案起步,累積開發者信任,再透過 API 和企業服務實現商業化。

對於正在評估 AI 語音服務的企業,Fish Audio 提供了一個極具吸引力的第二供應商選擇,尤其是其多語言能力和快速版權保護機制,讓它在亞洲和歐洲市場極具競爭力。

原始來源:TechCrunch - Fish Audio raises $52M seed