Google 週四在 Gemini Enterprise 正式推出搭載 Live Avatar 的 Gemini 3.8 Live,為這套即時對話模型加上一個會隨著說話同步嘴型、變換表情的螢幕人物。這項功能把模型原生的語音對語音對話與低延遲串流影像生成綁在一起,因此系統一邊聽、一邊看著鏡頭畫面,再用一張看得見的臉回答,而不是一條波形。
重點摘要
- Live Avatar 於 9 月 24 日在 Gemini Enterprise 正式上線,距離底層的 Gemini 3.8 Live 模型推出剛好一週。
- 這個人物能在 97 種語言中維持嘴型同步與臉部表情,對話中途換語言也不會出現 Google 所說的「視覺漂移」。
- 所有生成的音訊與影像串流都帶有不易察覺的 SynthID 浮水印,而用參考照片打造自訂人物則需通過企業白名單審核。
Live Avatar 實際生成了什麼
Google 在 Gemini 音訊團隊的發布文章中把這項功能定位為原生整合,而非外掛的算圖模組:影像生成與語音是一起產生的,正因如此才能做到精準的嘴型同步與輪流發言,而不是讓嘴部動畫去追著音軌跑。
更實用的新增功能是非同步工具執行。人物可以一邊維持對話,一邊在背景發出工具呼叫去取資料,來電者不必在查詢期間盯著一張凍住的臉。Google 的示範走過一段旅館入住流程,函式呼叫在幕後處理的同時,對話始終沒有中斷。
補上最後一塊的是即時視覺理解。模型會把鏡頭畫面與螢幕分享跟聲音同時處理,這讓它成為真正的多模態代理,而不是貼了張人像的語音機器人。Google 把應用場景放在網頁、行動裝置與互動式服務機。
Google 如何處理身分問題
一個能算出逼真說話臉孔的模型顯然會招來濫用,Google 的解法是分級。客戶可以直接從精選的預建人物庫部署,不需要額外許可。若要用一張高品質參考影像加上一段語音樣本生成自訂人物、保留本人樣貌與品牌風格,就得先通過嚴格的企業白名單與驗證流程。
這項功能輸出的一切都帶有 SynthID 浮水印,而且是織進音訊與影像串流裡,而不是蓋在畫面角落。Google 給出的理由是讓合成內容維持可偵測,藉此降低張冠李戴的情況。
在哪裡執行,還有什麼受限
Google Cloud 的上線公告列出了美國與歐盟端點、預先配置的運算吞吐量,以及企業合規與資料治理控制。這項技術最早在 Google Cloud Next 2026 上預覽。推理能力更強的姊妹版本 Gemini 3.8 Live Extended Thinking 仍處於私人預覽階段。
早期客戶怎麼說
Cox Automotive 為 Autotrader 打造了一個對話式人物,會標出螢幕上的重點並呼叫工具,帶著買家走完搜尋、比較到貸款的流程。該公司執行副總裁暨產品長 Marianne Johnson 表示,目標是讓買家用自己的話說出想要什麼,而不是一層層操作篩選條件與選單。
宣稱每天以九種印度語言處理超過一百萬通即時通話的 Equal AI 則指出,3.8 Live 版本在插話處理與工具呼叫可靠度上都有改善。Salesforce 正把這套模型與 Agentforce 搭配,語音平台 Specs 則特別點出語音活動偵測與整體延遲的進步。
這些說法裡都沒有出現延遲數字、每分鐘價格,或是與沒有臉孔的同一套流程相比的完成率。Google 三者一項也沒公布,於是買家只能憑示範影片、而非實測結果來評估一項算圖功能。正式部署必須先有預先配置的吞吐量,也暗示影像生成的成本不低,Google 寧可賣保留容量,也不想按用量計費。
後續觀察
Live Avatar 是企業產品而非消費端的 Gemini 功能,客戶名單讀起來也比較像客服中心與受理業務,而不是通用助理。這是一場比表面看來更窄的押注,但落點正好是Google 先前的低延遲語音模型與對手全雙工產品交火的地帶。Google 正在驗證的差異點在於:一張臉是否真能讓使用者目前中途放棄的任務提高完成率。Google DeepMind 目前還沒公布這方面的數字。
FAQ · 常見問題
一般消費者能用到搭載 Live Avatar 的 Gemini 3.8 Live 嗎
不能。這項功能只在 Google 的企業方案 Gemini Enterprise 正式開放,存取方式是透過 Gemini Live API。消費端的 Gemini 應用不受這次上線影響。
企業可以做出長得像某位真實人物的人物形象嗎
自訂人物確實可以從一張參考影像生成,但 Google 把這項能力鎖在企業白名單與驗證流程之後。所有生成的音訊與影像也都帶有 SynthID 浮水印,讓輸出始終能被辨識為 AI 生成。
這個人物支援多少種語言
Gemini 3.8 Live 能理解並說出 97 種語言並自動偵測語言,Live Avatar 會針對全部語言調整嘴型與表情。Google 表示,對話中途切換語言也不會讓影像品質下降。






