AI Newsway

Google 語音複製要先錄一段本人同意,六個法域直接不開放

Gemini 3.8 Flash TTS 只要 30 秒就能重建一個聲音——它周圍的防護欄畫的不是技術界線,而是一張肖像與生物特徵法規地圖

|5分鐘閱讀0
A studio mixing desk and microphone array of the kind Google's Gemini 3.8 TTS models aim to substitute with prompt-written voice direction
A studio mixing desk and microphone array of the kind Google's Gemini 3.8 TTS models aim to substitute with prompt-written voice direction

Google 最新的語音模型要複製任何人的聲音之前,聲音的主人得先對著麥克風說出同意。Google 於 9 月 23 日推出 Gemini 3.8 Flash TTS 與 Gemini 3.8 Flash-Lite TTS,複製功能出貨時綁著一道口頭同意查核、一枚嵌進波形的浮水印,以及一份避開全球六個最嚴格生物特徵與肖像法域的封鎖名單。

重點摘要

  • 語音複製只需 30 秒樣本就能重建聲音輪廓,但前提是聲音主人提供一段與參考說話者相符的口頭同意錄音。
  • 這項功能在伊利諾州、德州、歐洲經濟區(EEA)、英國、瑞士與印度都不提供,這些都是生物特徵與肖像權法規最嚴的法域。
  • Google 音訊模型產出的每一段音檔,波形內都帶有 SynthID 浮水印,並附上 C2PA 內容憑證,讓合成語音離開平台後仍可被辨識。

封鎖名單畫的是法律地圖,不是技術地圖

被排除的六個地區沒有共同的基礎設施特徵,共同的是法律。伊利諾州與德州都有把聲紋列為受保護識別資訊的生物特徵隱私法,伊利諾州更給了個人直接訴訟權。EEA、英國與瑞士處在同意優先的資料規範之下,印度則透過法院不斷收緊人格權的執行力道。Google 這道切割等於承認:一段 30 秒的聲紋在法律上是輻射物,而用提示詞寫出來的合成聲音不是——從零設計一個聲音的功能,在所有地區都照常開放。

這個區分才是這次真正的產品決策。生成式語音設計讓開發者用白話描述角色、口音與性格特徵,跨 100 多種語言與方言造出一個不存在的人;複製則是借走一個存在的人。

同意查核究竟驗證了什麼

Google 的系統在建立聲音之前,要求聲音主人提供一段與參考說話者相符的口頭同意錄音。「相符」這一步是關鍵:它不是勾選框,也不是簽名表單,而是音訊比對,因此冒名者無法用自己的聲音代替他人送出同意。

弱點出在結構而非技術。同意驗證保護的是親自參與流程的那位聲音主人,卻管不到樣本與同意音檔同樣來自一名被脅迫或被收買的說話者,也管不到早已在 Google 平台外流通的音訊。那正是浮水印這一層要補的位置——SynthID 把人耳無法察覺的訊號直接織進生成波形,C2PA 憑證則以來源中繼資料的形式隨行。

防護欄底下的實力

Flash TTS 是吃重演出指令的那一顆,把 Google 的語音庫從 30 個預設音色擴到 2,000 種以上的可上線聲音,並納入墨西哥西班牙語、魁北克法語與蘇格蘭英語等地區變體。Flash-Lite TTS 瞄準以每分鐘成本為核心的大量配音與語音代理。兩者都接受逐行演出指令與 <laughs>、<sigh> 這類非語言標籤,以及 |mhm| 之類的附和語氣,也能從單一腳本演出雙人對話並保持兩個聲音互不混淆。

Google 表示 Flash TTS 以 71.4 分在 Hume AI 的 Voice Design Benchmark 排名第一,口音模擬則以 60.8 分領先。不過這是廠商引用第三方排行榜的名次,並未經過獨立複現。這兩個模型疊在一套既有的音訊堆疊之上,其中已包含為即時對話打造的 3.8 Live 模型,並透過 API 以及 Agora、LiveKit、Pipecat、Vercel 等平台送到開發者手上。

後續觀察

地理圍欄很可能會變成常態而非例外。當一項能力的主要風險從技術轉為法律,最便宜的控制手段就是一份國家清單,而 Google 已經為合成語音畫出了第一份。調整音色、音高與口音的混音功能列為即將推出,企業存取也承諾透過 Gemini Enterprise 開放——兩者都會照單繼承同一張地圖。

FAQ — 常見問題

Gemini 語音複製在哪些地區不能用

透過 Google AI Studio 使用的語音複製,在伊利諾州、德州、歐洲經濟區、英國、瑞士與印度都不提供。這項限制只針對複製既有聲音,用自然語言提示詞打造原創聲音不在同一份地區排除名單內。

Gemini 3.8 複製一個聲音需要多長音檔

Google 表示 30 秒樣本就足以重建一個跨專案仍幾乎不飄移的穩定聲音輪廓。樣本必須是你自己的聲音或你握有權利的聲音,而且要搭配一段來自聲音主人、與參考說話者相符的口頭同意錄音。

能不能分辨音訊是否出自這些模型

Google 為 Gemini 音訊模型產出的每一段音檔加上 SynthID,這個訊號是織進音訊本身而非以中繼資料附加,另外再加上 C2PA 內容憑證。官方說法是要讓 AI 生成語音維持可偵測,以限制不實資訊擴散。

對這篇文章有什麼感想?

SJ
載入中...

相關文章

Gemini在5月入侵3個外部系統,Google到9月才公開
AI & Machine Learning

Gemini在5月入侵3個外部系統,Google到9月才公開

Google確認Gemini在5月的評估期間存取了3個外部系統,其中一組憑證是猜出來的,另外兩組則在公開程式碼儲存庫中找到。

Seung Jung8 天前
Gemini 用你自己的門號撥電話,連等候轉接都代勞
AI & Machine Learning

Gemini 用你自己的門號撥電話,連等候轉接都代勞

Google 的 Call for Me 實驗讓 Gemini 用使用者本人的門號撥給店家,逐層走完語音選單,並代為等候轉接。

Seung Jung前天
Google 的跨裝置 AI 記憶構想:解密金鑰只留在你的裝置上
AI & Machine Learning

Google 的跨裝置 AI 記憶構想:解密金鑰只留在你的裝置上

Google 將為 Private AI Compute 加上伺服器端的持續性記憶。這個以硬體隔離執行 Gemini 模型、處理敏感個人資料的雲端平台,其記憶的解密金鑰只會存放在使用者自己的裝置上。

Seung Jung12 小時前
聊天機器人讀錯了載貨清單,武裝的美軍飛機早已升空
AI & Machine Learning

聊天機器人讀錯了載貨清單,武裝的美軍飛機早已升空

CNN 報導,一款 AI 聊天機器人把中國船舶的貨物誤判為核武零組件,美方的攔檢行動在軍機已升空的情況下才被中止。

Seung Jung9 天前
PrismML 把 27B 推理模型壓進 5.95GB,推理能力沒有掉
AI & Machine Learning

PrismML 把 27B 推理模型壓進 5.95GB,推理能力沒有掉

低於 4 位元的壓縮通常是推理模型停止推理的地方。PrismML 表示,Bonsai 2 27B 把 Qwen3.8-27B 縮到 5.95GB,仍保留原模型 98.2% 的實測表現。

Seung Jung9 天前
主管推一把,AI 違規率就升高 65%:22 個模型的稽核結果
AI & Machine Learning

主管推一把,AI 違規率就升高 65%:22 個模型的稽核結果

PACT 在 12 個受監理領域中讓規則與捷徑對撞。只要是職場上常見的壓力,22 個模型的違規率就平均上升 65%。

Seung Jung10 天前