Google 最新的語音模型要複製任何人的聲音之前,聲音的主人得先對著麥克風說出同意。Google 於 9 月 23 日推出 Gemini 3.8 Flash TTS 與 Gemini 3.8 Flash-Lite TTS,複製功能出貨時綁著一道口頭同意查核、一枚嵌進波形的浮水印,以及一份避開全球六個最嚴格生物特徵與肖像法域的封鎖名單。
重點摘要
- 語音複製只需 30 秒樣本就能重建聲音輪廓,但前提是聲音主人提供一段與參考說話者相符的口頭同意錄音。
- 這項功能在伊利諾州、德州、歐洲經濟區(EEA)、英國、瑞士與印度都不提供,這些都是生物特徵與肖像權法規最嚴的法域。
- Google 音訊模型產出的每一段音檔,波形內都帶有 SynthID 浮水印,並附上 C2PA 內容憑證,讓合成語音離開平台後仍可被辨識。
封鎖名單畫的是法律地圖,不是技術地圖
被排除的六個地區沒有共同的基礎設施特徵,共同的是法律。伊利諾州與德州都有把聲紋列為受保護識別資訊的生物特徵隱私法,伊利諾州更給了個人直接訴訟權。EEA、英國與瑞士處在同意優先的資料規範之下,印度則透過法院不斷收緊人格權的執行力道。Google 這道切割等於承認:一段 30 秒的聲紋在法律上是輻射物,而用提示詞寫出來的合成聲音不是——從零設計一個聲音的功能,在所有地區都照常開放。
這個區分才是這次真正的產品決策。生成式語音設計讓開發者用白話描述角色、口音與性格特徵,跨 100 多種語言與方言造出一個不存在的人;複製則是借走一個存在的人。
同意查核究竟驗證了什麼
Google 的系統在建立聲音之前,要求聲音主人提供一段與參考說話者相符的口頭同意錄音。「相符」這一步是關鍵:它不是勾選框,也不是簽名表單,而是音訊比對,因此冒名者無法用自己的聲音代替他人送出同意。
弱點出在結構而非技術。同意驗證保護的是親自參與流程的那位聲音主人,卻管不到樣本與同意音檔同樣來自一名被脅迫或被收買的說話者,也管不到早已在 Google 平台外流通的音訊。那正是浮水印這一層要補的位置——SynthID 把人耳無法察覺的訊號直接織進生成波形,C2PA 憑證則以來源中繼資料的形式隨行。
防護欄底下的實力
Flash TTS 是吃重演出指令的那一顆,把 Google 的語音庫從 30 個預設音色擴到 2,000 種以上的可上線聲音,並納入墨西哥西班牙語、魁北克法語與蘇格蘭英語等地區變體。Flash-Lite TTS 瞄準以每分鐘成本為核心的大量配音與語音代理。兩者都接受逐行演出指令與 <laughs>、<sigh> 這類非語言標籤,以及 |mhm| 之類的附和語氣,也能從單一腳本演出雙人對話並保持兩個聲音互不混淆。
Google 表示 Flash TTS 以 71.4 分在 Hume AI 的 Voice Design Benchmark 排名第一,口音模擬則以 60.8 分領先。不過這是廠商引用第三方排行榜的名次,並未經過獨立複現。這兩個模型疊在一套既有的音訊堆疊之上,其中已包含為即時對話打造的 3.8 Live 模型,並透過 API 以及 Agora、LiveKit、Pipecat、Vercel 等平台送到開發者手上。
後續觀察
地理圍欄很可能會變成常態而非例外。當一項能力的主要風險從技術轉為法律,最便宜的控制手段就是一份國家清單,而 Google 已經為合成語音畫出了第一份。調整音色、音高與口音的混音功能列為即將推出,企業存取也承諾透過 Gemini Enterprise 開放——兩者都會照單繼承同一張地圖。
FAQ — 常見問題
Gemini 語音複製在哪些地區不能用
透過 Google AI Studio 使用的語音複製,在伊利諾州、德州、歐洲經濟區、英國、瑞士與印度都不提供。這項限制只針對複製既有聲音,用自然語言提示詞打造原創聲音不在同一份地區排除名單內。
Gemini 3.8 複製一個聲音需要多長音檔
Google 表示 30 秒樣本就足以重建一個跨專案仍幾乎不飄移的穩定聲音輪廓。樣本必須是你自己的聲音或你握有權利的聲音,而且要搭配一段來自聲音主人、與參考說話者相符的口頭同意錄音。
能不能分辨音訊是否出自這些模型
Google 為 Gemini 音訊模型產出的每一段音檔加上 SynthID,這個訊號是織進音訊本身而非以中繼資料附加,另外再加上 C2PA 內容憑證。官方說法是要讓 AI 生成語音維持可偵測,以限制不實資訊擴散。






