Google 讓 Gemini 有了臉、也開始幫你打電話:Live Avatar 登上企業版、Call for Me 在 Pixel 11 美國首發(2026)

Google 在 2026 年 9 月 24 日把 Gemini 3.8 Live with Live Avatar 推上 Gemini Enterprise 正式版:AI 對話時會有自己的臉,做即時唇形同步與表情,支援 97 種語言並可在對話中無縫切換,輸出戴上不可見的 SynthID 浮水印。同一天,Google 也在美國為 Pixel 11 推出 Call for Me 早期測試,讓 Gemini 自己撥號、聽語音選單、等客服、與商家真人對話,使用者全程看即時逐字稿並可隨時接手。這篇整理兩項功能的實際可用範圍、計價方式、安全設計、與 Meta Muse 的對照,以及台灣使用者什麼時候用得到。

  • Dennis
  • 9 分鐘閱讀
Google 讓 Gemini 有了臉、也開始幫你打電話:Live Avatar 登上企業版、Call for Me 在 Pixel 11 美國首發(2026)

Google 在 2026 年 9 月 24 日把 Gemini 3.8 Live with Live Avatar 推上 Gemini Enterprise 正式版:AI 對話時會有一張自己的臉,即時做唇形同步、露出表情,支援 97 種語言並能在同一通對話中無縫切換語言,輸出全面帶上不可見的 SynthID 浮水印。同一天,Google 也讓 Gemini 在美國 Pixel 11 上開始代替使用者打電話:自己撥號、聽語音選單、等客服,還直接跟商家真人對談。

把這兩件事放在一起看,訊號很清楚:語音 AI 的競爭已經從「聽得懂、答得快」,推進到「有沒有臉」和「敢不敢代替你出面講話」。前者是體驗問題,後者是信任與責任問題,而 Google 這次兩邊都先押在企業客戶與單一市場上試水溫。

30 秒掌握

項目內容
宣布日期2026 年 9 月 24 日(Live Avatar 同日登上 Gemini Enterprise 正式版)
主角一Gemini 3.8 Live with Live Avatar:即時虛擬人物,唇形同步+表情+螢幕畫面理解
主角二Call for Me:Gemini 代使用者撥打電話給在地商家(Pixel 11、美國早期測試)
語言Live Avatar 支援 97 種語言,可在對話中自動偵測並切換
底層模型Gemini 3.8 Live/Gemini 3.8 Live Extended Thinking(約一週前先發表)
可用對象Live Avatar:Gemini Enterprise 企業客戶(美國、歐盟端點);Call for Me:美國 Pixel 11 付費訂戶+公測
安全機制影音皆嵌入 SynthID 不可見浮水印;企業自訂虛擬人物需通過白名單驗證
台灣現況模型 API 與 AI Studio 可用(支援繁體中文),Live Avatar 與 Call for Me 尚未在台灣開放

Live Avatar:AI 會講話不夠,嘴型還要對得上

Live Avatar 做的事,技術上不難描述、但體驗上很難假裝:使用者講話的同時,畫面裡的虛擬人物會即時唇形同步(lip-sync),有頭部動態與自然表情,而且能在 97 種語言之間切換——Google 示範的影片裡,同一個虛擬人物先用英文講、再切日文,嘴型兩種語言都對得上,官方說法是「不會降低影像保真度、也不會產生視覺漂移」。

除了說話,它還有兩個比較容易被忽略的能力:

  1. 看得懂你給它看的畫面。 能同時處理鏡頭影像與螢幕分享,一邊對話一邊在畫面上標示重點,這讓它更像「線上一對一服務窗口」而不是聊天機器人。
  2. 背景做事,嘴巴不停。 透過非同步工具呼叫(asynchronous tool execution),模型可以在對話不中斷的情況下於背景查訂單、查庫存、查庫存飯店入住資訊,前景繼續講話。這一點是「像不像人」的關鍵——真人客服不會因為要查資料就靜音 20 秒。

微軟的合作夥伴名單也透露了用途:Agora、LiveKit、Pipecat、Vercel、Salesforce(Agentforce)以及 Google 自家的 Agent Development Kit(ADK)都在整合名單裡,方向就是客服、銷售、線上諮詢這類需要「有人面對你」的情境。

真正的底座:Gemini 3.8 Live 這個模型

Live Avatar 之所以能長出臉,前提是 Gemini 3.8 Live 這個模型本身。Google 在 9 月中旬先發表它(含 Extended Thinking 版本),Verge 的說法是「大約一週前」。幾個開發者會用到的規格:

規格項目內容
架構原生 audio-to-audio,不經過傳統「語音轉文字→模型→文字轉語音」的轉接
音訊輸入 16-bit PCM/16kHz,輸出 24kHz
視覺輸入最高每秒 1 幀(1 fps)JPEG
Token 上限輸入 131,072、輸出 65,536
API 名稱gemini-3.8-live、gemini-3.8-live-extended-thinking
傳輸方式WebSocket 雙向串流(BidiGenerateContent 端點),不是 WebRTC
Extended Thinking非同步推理:處理多步驟問題或呼叫工具時在背景想,前景用語音說「我確認一下」補空白
取得管道Gemini API、Google AI Studio(含免費額度)、Search Live、Gemini Live App、Google Workspace

其中「Extended Thinking 用講話填補思考時間」這個設計,比規格表上的任何數字都重要。多數語音助理的破功點不是答錯,而是答話前那段沉默;把推理挪到背景、用口語敘述撐住對話節奏,是目前語音 agent 最實際的解法。

第三方整理的 Gemini 3.8 Live API 參考價如下(實際計價請以官方價目表為準):

輸入/輸出類型每 100 萬 token換算約每分鐘
音訊輸入US$3.00US$0.005
音訊輸出US$12.00US$0.018
文字輸入US$0.75—
文字輸出US$4.50—
影像/影片輸入US$1.00US$0.002
Thinking token以輸出 token 計費—

不只會動嘴:SynthID 與白名單

AI 有臉、有聲音、還能替你講電話,最直接的副作用就是身分冒用。Google 這次把防線放在兩處:

  • SynthID 不可見浮水印。 生成的音訊與影片串流都會嵌入浮水印,官方說法即使經過剪輯或壓縮仍可被偵測工具識別。這是目前對付「AI 語音詐騙」最被廣泛採用的技術路線,Google 也已把 SynthID 擴展到 C2PA 內容憑證。
  • 虛擬人物的來源管制。 企業可以選用經過預先審核的虛擬人物庫,也可以用自己的參考照片與音訊樣本建立專屬人物,但後者需要走企業白名單與身分驗證流程,等於把「長得像誰」的責任壓回企業端。

值得注意的是,這些機制的存在本身就說明了 Google 的判斷:能露臉的 AI,風險等級比只有聲音的 AI 高一個檔次。 這也是為什麼 Live Avatar 首發不是給一般消費者,而是給有合規壓力的企業客戶。

Call for Me:不是幫你等電話,是直接跟真人談

同一天在美國上線的 Call for Me,性質完全不同。它不是「幫你等客服」這種半自動功能,而是Gemini 直接代替你打完整通電話:

  1. 使用者在 Pixel 11 的 Gemini App 裡說「幫我打給某某餐廳訂位、要戶外座位」。
  2. Gemini 自己撥號、自我介紹,通過語音選單(IVR),等候排隊。
  3. 接通真人後,Gemini 主動表明自己是 AI 助理、正在代表使用者通話。
  4. 使用者手機上顯示即時逐字稿,隨時可以點下去接手對話。

跟 Google 過去幾年的通話輔助功能相比,差異在「誰開口」:

功能做什麼使用者要做的事
Hold for Me代你在線上等,真人接起來再通知你仍要自己撥、自己講
Direct My Call把語音選單轉成文字按鈕自己選按、自己講
Call Screen代接陌生來電、過濾騷擾主要用於擋電話
Call for Me全程代打,含與真人對話只需下指令、看逐字稿、必要時接手

限制也很硬:目前僅限美國、Pixel 11、Gemini 付費訂戶,且要加入 Phone by Google 公開測試,現階段以英語為主。台灣使用者短期內用不到。

爭議:這是「代表你」還是「冒充你」?

Call for Me 的細節裡有兩個值得留意的設計。第一,通話時顯示的是使用者的真實電話號碼,並使用 AI 生成的語音——有評論直接形容,這更接近「AI 冒充使用者」而不是單純的語音助理。第二,電話另一端是真人商家員工,他們得花時間跟一個 AI 對話;對小店而言,這是新的營運負擔。

更耐人尋味的是對照組。Verge 的報導提到 Meta 也在為 Muse AI agent 開發類似的自動打電話功能——但據 404 Media 報導,那些電話可能是由客服中心裡的真人代打的。這個對比點出的是整個產業的落差:發表會上流暢的 AI 通話示範,跟「真的沒有真人插手」之間,往往還有一段距離。Google 這次把逐字稿、接手按鈕、主動表明 AI 身分全部做進流程,本質上是在為這段落差預先建立信任機制。

台灣使用者什麼時候能用?

功能目前狀態台灣可用性
Gemini 3.8 Live 模型(API、AI Studio)已開放,開發者文件列出繁體中文支援可用
Live AvatarGemini Enterprise 正式版,僅美國與歐盟雲端端點尚未開放
Call for Me美國 Pixel 11、付費訂戶+公測,以英語為主尚未開放
Gemini Enterprise企業方案(第三方報導的席位價約 US$21–30/月起,超額另計)需洽 Google 業務,端點限制同上

Google 對外只說 Call for Me 是「早期實驗」,沒有給其他市場的時程。以過去 Gemini Live、Siri AI 的節奏推估,非美國市場通常要等一季到一年,且往往取決於當地的電信與隱私法規。

三個值得記下來的訊號

  1. 語音 AI 的門檻已經從「準不準」變成「斷不斷」。 唇形同步、填話、背景工具呼叫,都是為了讓通話不出現空白;誰先把延遲與節奏做好,誰就能用在真正的商務對話上。
  2. 企業先、消費者後。 Live Avatar 與 Gemini Enterprise 綁在一起,說明臉孔與聲音的冒用風險,目前只有願意簽合約、能配合白名單驗證的企業才有本錢承擔。
  3. 「可驗證的 AI」正在變成標準配備。 逐字稿、隨時接手、主動表明 AI 身分、SynthID 浮水印——這四件事過去是加分項,未來大概會是 AI 代打電話能不能落地的入場券,也會是各國監管最可能直接引用的設計。

站內延伸閱讀

資料來源

📬 訂閱 most.tw 電子報

每週精選 AI 工具教學與技術乾貨,直接送到你的信箱。免費、隨時可退訂。

訂閱即表示同意收到 most.tw 電子報,隨時可一鍵退訂。

💬 有問題想討論?加 LINE 聯絡我

歡迎透過 LINE 官方帳號直接留言,我會盡快回覆你的問題。

加入 LINE 好友