Google 在 2026 年 9 月 24 日把 Gemini 3.8 Live with Live Avatar 推上 Gemini Enterprise 正式版:AI 對話時會有一張自己的臉,即時做唇形同步、露出表情,支援 97 種語言並能在同一通對話中無縫切換語言,輸出全面帶上不可見的 SynthID 浮水印。同一天,Google 也讓 Gemini 在美國 Pixel 11 上開始代替使用者打電話:自己撥號、聽語音選單、等客服,還直接跟商家真人對談。
把這兩件事放在一起看,訊號很清楚:語音 AI 的競爭已經從「聽得懂、答得快」,推進到「有沒有臉」和「敢不敢代替你出面講話」。前者是體驗問題,後者是信任與責任問題,而 Google 這次兩邊都先押在企業客戶與單一市場上試水溫。
30 秒掌握
| 項目 | 內容 |
|---|---|
| 宣布日期 | 2026 年 9 月 24 日(Live Avatar 同日登上 Gemini Enterprise 正式版) |
| 主角一 | Gemini 3.8 Live with Live Avatar:即時虛擬人物,唇形同步+表情+螢幕畫面理解 |
| 主角二 | Call for Me:Gemini 代使用者撥打電話給在地商家(Pixel 11、美國早期測試) |
| 語言 | Live Avatar 支援 97 種語言,可在對話中自動偵測並切換 |
| 底層模型 | Gemini 3.8 Live/Gemini 3.8 Live Extended Thinking(約一週前先發表) |
| 可用對象 | Live Avatar:Gemini Enterprise 企業客戶(美國、歐盟端點);Call for Me:美國 Pixel 11 付費訂戶+公測 |
| 安全機制 | 影音皆嵌入 SynthID 不可見浮水印;企業自訂虛擬人物需通過白名單驗證 |
| 台灣現況 | 模型 API 與 AI Studio 可用(支援繁體中文),Live Avatar 與 Call for Me 尚未在台灣開放 |
Live Avatar:AI 會講話不夠,嘴型還要對得上
Live Avatar 做的事,技術上不難描述、但體驗上很難假裝:使用者講話的同時,畫面裡的虛擬人物會即時唇形同步(lip-sync),有頭部動態與自然表情,而且能在 97 種語言之間切換——Google 示範的影片裡,同一個虛擬人物先用英文講、再切日文,嘴型兩種語言都對得上,官方說法是「不會降低影像保真度、也不會產生視覺漂移」。
除了說話,它還有兩個比較容易被忽略的能力:
- 看得懂你給它看的畫面。 能同時處理鏡頭影像與螢幕分享,一邊對話一邊在畫面上標示重點,這讓它更像「線上一對一服務窗口」而不是聊天機器人。
- 背景做事,嘴巴不停。 透過非同步工具呼叫(asynchronous tool execution),模型可以在對話不中斷的情況下於背景查訂單、查庫存、查庫存飯店入住資訊,前景繼續講話。這一點是「像不像人」的關鍵——真人客服不會因為要查資料就靜音 20 秒。
微軟的合作夥伴名單也透露了用途:Agora、LiveKit、Pipecat、Vercel、Salesforce(Agentforce)以及 Google 自家的 Agent Development Kit(ADK)都在整合名單裡,方向就是客服、銷售、線上諮詢這類需要「有人面對你」的情境。
真正的底座:Gemini 3.8 Live 這個模型
Live Avatar 之所以能長出臉,前提是 Gemini 3.8 Live 這個模型本身。Google 在 9 月中旬先發表它(含 Extended Thinking 版本),Verge 的說法是「大約一週前」。幾個開發者會用到的規格:
| 規格項目 | 內容 |
|---|---|
| 架構 | 原生 audio-to-audio,不經過傳統「語音轉文字→模型→文字轉語音」的轉接 |
| 音訊 | 輸入 16-bit PCM/16kHz,輸出 24kHz |
| 視覺輸入 | 最高每秒 1 幀(1 fps)JPEG |
| Token 上限 | 輸入 131,072、輸出 65,536 |
| API 名稱 | gemini-3.8-live、gemini-3.8-live-extended-thinking |
| 傳輸方式 | WebSocket 雙向串流(BidiGenerateContent 端點),不是 WebRTC |
| Extended Thinking | 非同步推理:處理多步驟問題或呼叫工具時在背景想,前景用語音說「我確認一下」補空白 |
| 取得管道 | Gemini API、Google AI Studio(含免費額度)、Search Live、Gemini Live App、Google Workspace |
其中「Extended Thinking 用講話填補思考時間」這個設計,比規格表上的任何數字都重要。多數語音助理的破功點不是答錯,而是答話前那段沉默;把推理挪到背景、用口語敘述撐住對話節奏,是目前語音 agent 最實際的解法。
第三方整理的 Gemini 3.8 Live API 參考價如下(實際計價請以官方價目表為準):
| 輸入/輸出類型 | 每 100 萬 token | 換算約每分鐘 |
|---|---|---|
| 音訊輸入 | US$3.00 | US$0.005 |
| 音訊輸出 | US$12.00 | US$0.018 |
| 文字輸入 | US$0.75 | — |
| 文字輸出 | US$4.50 | — |
| 影像/影片輸入 | US$1.00 | US$0.002 |
| Thinking token | 以輸出 token 計費 | — |
不只會動嘴:SynthID 與白名單
AI 有臉、有聲音、還能替你講電話,最直接的副作用就是身分冒用。Google 這次把防線放在兩處:
- SynthID 不可見浮水印。 生成的音訊與影片串流都會嵌入浮水印,官方說法即使經過剪輯或壓縮仍可被偵測工具識別。這是目前對付「AI 語音詐騙」最被廣泛採用的技術路線,Google 也已把 SynthID 擴展到 C2PA 內容憑證。
- 虛擬人物的來源管制。 企業可以選用經過預先審核的虛擬人物庫,也可以用自己的參考照片與音訊樣本建立專屬人物,但後者需要走企業白名單與身分驗證流程,等於把「長得像誰」的責任壓回企業端。
值得注意的是,這些機制的存在本身就說明了 Google 的判斷:能露臉的 AI,風險等級比只有聲音的 AI 高一個檔次。 這也是為什麼 Live Avatar 首發不是給一般消費者,而是給有合規壓力的企業客戶。
Call for Me:不是幫你等電話,是直接跟真人談
同一天在美國上線的 Call for Me,性質完全不同。它不是「幫你等客服」這種半自動功能,而是Gemini 直接代替你打完整通電話:
- 使用者在 Pixel 11 的 Gemini App 裡說「幫我打給某某餐廳訂位、要戶外座位」。
- Gemini 自己撥號、自我介紹,通過語音選單(IVR),等候排隊。
- 接通真人後,Gemini 主動表明自己是 AI 助理、正在代表使用者通話。
- 使用者手機上顯示即時逐字稿,隨時可以點下去接手對話。
跟 Google 過去幾年的通話輔助功能相比,差異在「誰開口」:
| 功能 | 做什麼 | 使用者要做的事 |
|---|---|---|
| Hold for Me | 代你在線上等,真人接起來再通知你 | 仍要自己撥、自己講 |
| Direct My Call | 把語音選單轉成文字按鈕 | 自己選按、自己講 |
| Call Screen | 代接陌生來電、過濾騷擾 | 主要用於擋電話 |
| Call for Me | 全程代打,含與真人對話 | 只需下指令、看逐字稿、必要時接手 |
限制也很硬:目前僅限美國、Pixel 11、Gemini 付費訂戶,且要加入 Phone by Google 公開測試,現階段以英語為主。台灣使用者短期內用不到。
爭議:這是「代表你」還是「冒充你」?
Call for Me 的細節裡有兩個值得留意的設計。第一,通話時顯示的是使用者的真實電話號碼,並使用 AI 生成的語音——有評論直接形容,這更接近「AI 冒充使用者」而不是單純的語音助理。第二,電話另一端是真人商家員工,他們得花時間跟一個 AI 對話;對小店而言,這是新的營運負擔。
更耐人尋味的是對照組。Verge 的報導提到 Meta 也在為 Muse AI agent 開發類似的自動打電話功能——但據 404 Media 報導,那些電話可能是由客服中心裡的真人代打的。這個對比點出的是整個產業的落差:發表會上流暢的 AI 通話示範,跟「真的沒有真人插手」之間,往往還有一段距離。Google 這次把逐字稿、接手按鈕、主動表明 AI 身分全部做進流程,本質上是在為這段落差預先建立信任機制。
台灣使用者什麼時候能用?
| 功能 | 目前狀態 | 台灣可用性 |
|---|---|---|
| Gemini 3.8 Live 模型(API、AI Studio) | 已開放,開發者文件列出繁體中文支援 | 可用 |
| Live Avatar | Gemini Enterprise 正式版,僅美國與歐盟雲端端點 | 尚未開放 |
| Call for Me | 美國 Pixel 11、付費訂戶+公測,以英語為主 | 尚未開放 |
| Gemini Enterprise | 企業方案(第三方報導的席位價約 US$21–30/月起,超額另計) | 需洽 Google 業務,端點限制同上 |
Google 對外只說 Call for Me 是「早期實驗」,沒有給其他市場的時程。以過去 Gemini Live、Siri AI 的節奏推估,非美國市場通常要等一季到一年,且往往取決於當地的電信與隱私法規。
三個值得記下來的訊號
- 語音 AI 的門檻已經從「準不準」變成「斷不斷」。 唇形同步、填話、背景工具呼叫,都是為了讓通話不出現空白;誰先把延遲與節奏做好,誰就能用在真正的商務對話上。
- 企業先、消費者後。 Live Avatar 與 Gemini Enterprise 綁在一起,說明臉孔與聲音的冒用風險,目前只有願意簽合約、能配合白名單驗證的企業才有本錢承擔。
- 「可驗證的 AI」正在變成標準配備。 逐字稿、隨時接手、主動表明 AI 身分、SynthID 浮水印——這四件事過去是加分項,未來大概會是 AI 代打電話能不能落地的入場券,也會是各國監管最可能直接引用的設計。
站內延伸閱讀
- Gemini 3.7 Flash 正式發布:比 3.6 便宜一半、FrontierCode 43.6% 創新高 — 從 3.7 Flash 到 3.8 Live 只隔一個月,Google 的模型發表節奏已經到了「月更」等級。
- Anthropic 大升級 Claude 語音模式!Opus 4.8 和 Sonnet 5 驅動,還能直接操控你的 Gmail — 同一條語音 agent 戰線上的對手版本,可以對照兩家對「聲音+工具呼叫」的設計哲學。
- Google Vids 大升級!Gemini Omni 多模態影片生成 + 個人 AI 化身 — 同樣是「AI 分身」,影片生成走的是預錄路線,Live Avatar 走的是即時對話路線,兩者成本結構完全不同。
- AI Agent 灌爆公共服務:「代理人泛濫」84 案例曝光 — 當 AI 開始代替人類對外發言、申訴、打電話,接收端要付出的成本會是下一個爭議點。
資料來源
- Google 官方部落格:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-with-live-avatar/(Introducing Gemini 3.8 Live with Live Avatar,2026-09-24)
- Google Cloud 部落格:https://cloud.google.com/blog/products/ai-machine-learning/gemini-3-8-live-with-live-avatar-is-now-generally-available(GA、區域端點與語言支援)
- The Verge:https://www.theverge.com/tech/1000328/google-gemini-ai-live-avatar-face(Live Avatar 僅對 Gemini Enterprise 開放、97 種語言、SynthID)
- The Verge:https://www.theverge.com/ai-artificial-intelligence/1000116/google-gemini-business-phone-calls(Call for Me 適用範圍、即時逐字稿與接手、Meta Muse 對照)
- Gemini API 開發者文件:https://ai.google.dev/gemini-api/docs(
gemini-3.8-live模型名稱、串流規格與支援語言) - Android Authority/Android Central:Pixel 11 的 Call for Me 功能細節與取得條件
- Apidog 等第三方整理:Gemini 3.8 Live API 計價與免費額度(非官方數字,僅供試算參考)
