AI Newsway

Gemini 的 Live Avatar 在 97 種語言間切換,嘴型仍然對得上

Google 在 Gemini Enterprise 正式推出這個動畫人物,每一幀都帶 SynthID 浮水印,自訂臉孔則鎖在白名單之後

|5分鐘閱讀0
A real-time rendered animated character, the kind of continuously generated face Gemini's Live Avatar now produces during enterprise voice calls.
A real-time rendered animated character, the kind of continuously generated face Gemini's Live Avatar now produces during enterprise voice calls.

Google 週四在 Gemini Enterprise 正式推出搭載 Live Avatar 的 Gemini 3.8 Live,為這套即時對話模型加上一個會隨著說話同步嘴型、變換表情的螢幕人物。這項功能把模型原生的語音對語音對話與低延遲串流影像生成綁在一起,因此系統一邊聽、一邊看著鏡頭畫面,再用一張看得見的臉回答,而不是一條波形。

重點摘要

  • Live Avatar 於 9 月 24 日在 Gemini Enterprise 正式上線,距離底層的 Gemini 3.8 Live 模型推出剛好一週。
  • 這個人物能在 97 種語言中維持嘴型同步與臉部表情,對話中途換語言也不會出現 Google 所說的「視覺漂移」。
  • 所有生成的音訊與影像串流都帶有不易察覺的 SynthID 浮水印,而用參考照片打造自訂人物則需通過企業白名單審核。

Live Avatar 實際生成了什麼

Google 在 Gemini 音訊團隊的發布文章中把這項功能定位為原生整合,而非外掛的算圖模組:影像生成與語音是一起產生的,正因如此才能做到精準的嘴型同步與輪流發言,而不是讓嘴部動畫去追著音軌跑。

更實用的新增功能是非同步工具執行。人物可以一邊維持對話,一邊在背景發出工具呼叫去取資料,來電者不必在查詢期間盯著一張凍住的臉。Google 的示範走過一段旅館入住流程,函式呼叫在幕後處理的同時,對話始終沒有中斷。

補上最後一塊的是即時視覺理解。模型會把鏡頭畫面與螢幕分享跟聲音同時處理,這讓它成為真正的多模態代理,而不是貼了張人像的語音機器人。Google 把應用場景放在網頁、行動裝置與互動式服務機。

Google 如何處理身分問題

一個能算出逼真說話臉孔的模型顯然會招來濫用,Google 的解法是分級。客戶可以直接從精選的預建人物庫部署,不需要額外許可。若要用一張高品質參考影像加上一段語音樣本生成自訂人物、保留本人樣貌與品牌風格,就得先通過嚴格的企業白名單與驗證流程。

這項功能輸出的一切都帶有 SynthID 浮水印,而且是織進音訊與影像串流裡,而不是蓋在畫面角落。Google 給出的理由是讓合成內容維持可偵測,藉此降低張冠李戴的情況。

在哪裡執行,還有什麼受限

Google Cloud 的上線公告列出了美國與歐盟端點、預先配置的運算吞吐量,以及企業合規與資料治理控制。這項技術最早在 Google Cloud Next 2026 上預覽。推理能力更強的姊妹版本 Gemini 3.8 Live Extended Thinking 仍處於私人預覽階段。

早期客戶怎麼說

Cox Automotive 為 Autotrader 打造了一個對話式人物,會標出螢幕上的重點並呼叫工具,帶著買家走完搜尋、比較到貸款的流程。該公司執行副總裁暨產品長 Marianne Johnson 表示,目標是讓買家用自己的話說出想要什麼,而不是一層層操作篩選條件與選單。

宣稱每天以九種印度語言處理超過一百萬通即時通話的 Equal AI 則指出,3.8 Live 版本在插話處理與工具呼叫可靠度上都有改善。Salesforce 正把這套模型與 Agentforce 搭配,語音平台 Specs 則特別點出語音活動偵測與整體延遲的進步。

這些說法裡都沒有出現延遲數字、每分鐘價格,或是與沒有臉孔的同一套流程相比的完成率。Google 三者一項也沒公布,於是買家只能憑示範影片、而非實測結果來評估一項算圖功能。正式部署必須先有預先配置的吞吐量,也暗示影像生成的成本不低,Google 寧可賣保留容量,也不想按用量計費。

後續觀察

Live Avatar 是企業產品而非消費端的 Gemini 功能,客戶名單讀起來也比較像客服中心與受理業務,而不是通用助理。這是一場比表面看來更窄的押注,但落點正好是Google 先前的低延遲語音模型與對手全雙工產品交火的地帶。Google 正在驗證的差異點在於:一張臉是否真能讓使用者目前中途放棄的任務提高完成率。Google DeepMind 目前還沒公布這方面的數字。

FAQ · 常見問題

一般消費者能用到搭載 Live Avatar 的 Gemini 3.8 Live 嗎

不能。這項功能只在 Google 的企業方案 Gemini Enterprise 正式開放,存取方式是透過 Gemini Live API。消費端的 Gemini 應用不受這次上線影響。

企業可以做出長得像某位真實人物的人物形象嗎

自訂人物確實可以從一張參考影像生成,但 Google 把這項能力鎖在企業白名單與驗證流程之後。所有生成的音訊與影像也都帶有 SynthID 浮水印,讓輸出始終能被辨識為 AI 生成。

這個人物支援多少種語言

Gemini 3.8 Live 能理解並說出 97 種語言並自動偵測語言,Live Avatar 會針對全部語言調整嘴型與表情。Google 表示,對話中途切換語言也不會讓影像品質下降。

對這篇文章有什麼感想?

SJ
載入中...

相關文章

Gemini登陸Windows:一個Alt+Space快捷鍵,直撲桌面入口
LLM & Chatbots

Gemini登陸Windows:一個Alt+Space快捷鍵,直撲桌面入口

谷歌Windows版Gemini原生應用可用Alt+Space浮在任意程式之上,接入Gmail和Google Drive,面向全球Windows 10和11開放。

Seung Jung14 天前
GPT-6 Astra上崗:OpenAI最貴模型把全部籌碼押在電腦操作上
LLM & Chatbots

GPT-6 Astra上崗:OpenAI最貴模型把全部籌碼押在電腦操作上

OpenAI的GPT-6 Astra面向企業使用者開放,具備電腦操作能力、百萬token上下文和10/50美元定價,其頭條成績則附帶測試框架的註腳。

Seung Jung15 天前
ChatGPT 在 79% 的購物回答中直接點名首選,Gemini 只有 7%
LLM & Chatbots

ChatGPT 在 79% 的購物回答中直接點名首選,Gemini 只有 7%

一份針對 1,536 則 AI 購物回答的稽核發現,ChatGPT 有 79% 以第一人稱表態偏好,Gemini 僅 7%,兩者引用的來源也幾乎不重疊。

Seung Jung8 天前
ChatGPT Images 2.5生成延遲減半,新增手繪畫布
LLM & Chatbots

ChatGPT Images 2.5生成延遲減半,新增手繪畫布

OpenAI推出ChatGPT Images 2.5,延遲最多降低50%,新增Sketch繪圖畫布、模板、定點批註,並向API釋出兩款新模型。

Seung Jung14 天前
OpenAI 的 Astra for Law 不是新模型,而是一套 2.3 億網址的法律檢索索引
LLM & Chatbots

OpenAI 的 Astra for Law 不是新模型,而是一套 2.3 億網址的法律檢索索引

OpenAI 推出 Astra for Law,替 GPT-6 Astra 接上涵蓋 2.3 億個網址的法律索引,法律研究基準正確率自 38.7% 升至 54%。

Seung Jung7 天前
Meta的Muse智慧體,盯上了你的郵箱、日曆和信用卡
LLM & Chatbots

Meta的Muse智慧體,盯上了你的郵箱、日曆和信用卡

Meta釋出個人AI智慧體Muse,在美國通過iOS、安卓、網頁和WhatsApp代替使用者訂行程、付賬單和購物。

Seung Jung14 天前