グーグルの最新音声モデルが誰かの声を複製するには、その声の持ち主が自らマイクに向かって同意を述べる必要がある。グーグルは9月23日にGemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSを公開した。複製機能には口頭の同意確認、波形に埋め込まれたウォーターマーク、そして生体情報と肖像権の規制が世界で最も厳しい6地域を外したブロックリストが付いている。
記事の要点
- 音声複製は30秒のサンプルから声のプロファイルを再構築するが、声の持ち主が参照話者と一致する口頭同意録音を提出した場合にのみ動作する。
- 機能はイリノイ州、テキサス州、欧州経済領域(EEA)、英国、スイス、インドでは提供されない。いずれも生体情報・肖像権の法規制が最も厳格な法域である。
- グーグルの音声モデルが生成したすべての音源には、波形の内部にSynthIDのウォーターマークが入り、C2PAコンテンツクレデンシャルが併走する。プラットフォームの外に出ても合成音声だと判別できるようにするためだ。
ブロックリストは技術の地図ではなく法律の地図だ
除外された6つの地域に、共通するインフラ上の特徴はない。共通するのは法律である。イリノイ州とテキサス州はいずれも声紋を保護対象の識別情報として扱う生体情報プライバシー法を持ち、イリノイ州の場合は個人に直接の訴権まで認めている。EEA、英国、スイスは同意優先のデータ規制下にあり、インドは裁判所を通じてパブリシティ権の執行を強めてきた。グーグルの地域除外は、30秒の声紋がプロンプトで書いた合成音声とはまったく異なる法的リスク物質であることを、自ら認めたに等しい。声を一から設計する機能はどの地域でも使える。
この線引きこそが今回の製品判断の核心だ。開発者が役柄やアクセント、性格を平易な言葉で記述して声をつくる生成型ボイスデザインは、100を超える言語と方言で存在しない人物を生み出す。複製は実在する人物を借りる。
同意確認は何を検証しているのか
グーグルのシステムは、声を作成する前に、参照話者と一致する口頭同意録音を声の持ち主から求める。この「一致」が肝心だ。チェックボックスや署名書類ではなく音声の照合であるため、なりすました者が自分の声で他人に代わって同意を差し出すことはできない。
弱点は技術ではなく構造にある。同意検証が守るのは、その手続きに自ら参加した声の持ち主だけだ。強要された話者や報酬を受けた話者がサンプルと同意クリップの両方を出すケースには何の効力もなく、すでにグーグルの外を流通している音声にも手が届かない。そこを埋めるのがウォーターマーク層である。SynthIDは知覚できない信号を生成波形そのものに埋め込み、C2PAクレデンシャルが来歴メタデータとして併走する。
ガードレールの下にある性能
Flash TTSは演出指示を厚く受け取るモデルで、グーグルの音声カタログをプリセット30種から実用水準2,000種超へ広げた。メキシコ・スペイン語、ケベック・フランス語、スコットランド英語といった地域バリアントも含む。Flash-Lite TTSは分あたり単価が支配的な大量吹き替えや音声エージェントを狙う。両モデルとも行単位の演出指示と、<laughs>や<sigh>のような非言語タグ、|mhm|といった相づち表現を受け付け、1本の台本から2人の話者の声を区別したまま場面を描き出す。
グーグルはFlash TTSがHume AIのVoice Design Benchmarkで71.4点の首位、アクセントモデリングでも60.8点で先頭だとしている。ただしこれは第三者リーダーボードの順位をベンダーが引用した数字であり、独立した追試を経たものではない。これらのモデルは、リアルタイム会話向けに作られた3.8 Liveモデルがすでに載るオーディオスタックの上に積まれ、APIとAgora、LiveKit、Pipecat、Vercelなどのプラットフォーム経由で開発者に届く。
今後の見通し
ジオフェンスは例外ではなく定石になるだろう。ある機能の主なリスクが技術ではなく法律になった瞬間、最も安上がりな制御は国のリストになる。グーグルは合成音声について、そのリストを初めて引いた。音色やピッチ、アクセントを調整するリミックス機能が近日提供として挙がり、Gemini Enterprise経由の法人向け提供も予告されているが、どちらも同じ地図をそのまま引き継ぐ。
FAQ — よくある質問
Geminiの音声複製が使えない地域はどこか
Google AI Studioでの音声複製は、イリノイ州、テキサス州、欧州経済領域、英国、スイス、インドでは提供されていない。制限は既存の声を複製する機能にのみ適用され、自然言語のプロンプトから新しい声を作る機能は同じ地域除外の対象ではない。
Gemini 3.8が声を複製するにはどれだけの音声が必要か
グーグルによれば、30秒のサンプルがあればプロジェクトをまたいでもぶれの少ない一貫した声のプロファイルを再現できる。サンプルは自分の声か権利を保有する声でなければならず、参照話者と一致する声の持ち主の口頭同意録音と組み合わせる必要がある。
これらのモデルが生成した音声かどうかは判別できるのか
グーグルはGeminiオーディオモデルが生成するすべての音源にSynthIDを付与する。メタデータとして添付するのではなく音声そのものに信号を織り込む方式で、さらにC2PAコンテンツクレデンシャルを加える。誤情報を抑えるためにAI生成音声を検出可能な状態に保つことが、同社が掲げる狙いだ。






