Googleは木曜、Live Avatarを備えたGemini 3.8 LiveをGemini Enterpriseで一般提供した。リアルタイム対話モデルに、話しながら口を動かし表情を変える画面上のアニメーションペルソナが加わった形だ。モデル本来の音声対音声の対話と、低遅延のストリーミング映像生成を組み合わせているため、システムは音を聞き、カメラ映像を見ながら、波形ではなく目に見える顔で応答する。
要点
- Live Avatarは基盤となるGemini 3.8 Liveの提供開始から1週間後の9月24日、Gemini Enterpriseで一般提供に入った。
- アバターは97言語にわたって口の動きと表情を保ち、会話の途中で言語を切り替えてもGoogleが言うところの「視覚的なぶれ」が生じない。
- 生成される音声・映像ストリームにはすべて知覚できないSynthIDの透かしが入り、参照写真から独自アバターを作るには企業向け許可リストの承認が要る。
Live Avatarが実際に生成しているもの
GoogleはGeminiオーディオチームによる発表記事で、この機能を後付けのレンダラーではなくネイティブな結合だと位置づけている。映像生成と音声を同時に作り出すからこそ、口のアニメーションが音声トラックを追いかけるのではなく、正確なリップシンクと発話の受け渡しが成り立つという説明だ。
実務で効くのはむしろ非同期のツール実行である。アバターは会話を続けたままツールを呼び出し、裏でデータを取ってこられる。検索の間、相手が止まった顔を眺めて待つことがない。Googleのデモでは、ホテルのチェックイン対応で関数呼び出しが裏側で処理される間も会話が途切れない様子が示される。
これを仕上げるのがリアルタイムの視覚理解だ。モデルはカメラ映像や画面共有を音声と同時に処理する。肖像画を貼り付けた音声ボットではなく、本当の意味でのマルチモーダルエージェントである理由がここにある。Googleはウェブ、モバイル、対話型キオスクを想定用途に挙げている。
Googleが本人性の問題をどう捌いたか
説得力のある「話す顔」を描けるモデルは当然のように悪用を招く。Googleの答えは段階分けだった。顧客は、あらかじめ用意されたアバターのライブラリからなら特別な許可なしに導入できる。高品質な参照画像1枚と音声サンプルから、本人の面影とブランドの雰囲気を残した独自アバターを生成する機能は、厳格な企業向け許可リストと審査の先に置かれている。
この機能が出力するものにはすべてSynthIDの透かしが入る。画面の隅に刻印するのではなく、音声と映像の両ストリームに織り込む方式だ。合成コンテンツを検出可能なままにして、出所の取り違えを抑えるためだとGoogleは説明している。
どこで動き、何がまだ制限されているか
Google Cloudの提供開始告知には、米国とEUのエンドポイント、プロビジョニングされたスループット、企業向けのコンプライアンスとデータガバナンス制御が並ぶ。この技術はGoogle Cloud Next 2026で初めて披露された。推論を強化した兄弟モデルGemini 3.8 Live Extended Thinkingは、いまも非公開プレビューのままだ。
先行導入した顧客の評価
Cox AutomotiveはAutotrader向けに対話型アバターを作った。画面の一部を指し示しつつツールを呼び出し、検索から比較、ローンまで購入者を導く。同社のEVP兼最高製品責任者マリアンヌ・ジョンソン氏は、フィルターやメニューをたどらせる代わりに、買い手が自分の言葉で望みを語れるようにするのが狙いだと述べた。
インドの9言語で1日100万件を超える通話をさばいているというEqual AIは、3.8 Liveで割り込み処理とツール呼び出しの安定性が向上したと評価した。SalesforceはこのモデルをAgentforceと組み合わせており、音声プラットフォームのSpecsは音声区間検出と全体的な遅延の改善を挙げた。
これらの発言のどこにも、遅延の数値も、1分あたりの料金も、顔なしで同じ業務を回した場合との完了率の比較も出てこない。Google自身も3つのいずれも公表していない。結果として買い手は、測定された成果ではなくデモ映像を頼りに描画機能を評価することになる。本格導入の前提にプロビジョニングされたスループットが置かれている点も、映像生成のコストが重く、Googleが従量課金よりも予約容量を売りたがっていることをうかがわせる。
今後の見通し
Live Avatarは消費者向けGeminiの機能ではなく企業向け製品であり、顧客の顔ぶれも汎用アシスタントというよりコンタクトセンターや受付業務に寄っている。一見するより狭い賭けだが、着地した場所はGoogleが先に出した低遅延の音声モデルや競合の全二重リリースがぶつかり合う激戦区だ。Googleが試しているのは、ユーザーがいま途中で投げ出している作業において、顔があることで完了率が実際に上がるのかという点である。Google DeepMindはまだその数字を出していない。
FAQ · よくある質問
Live Avatarを備えたGemini 3.8 Liveは一般利用者も使えるのか
使えない。この機能が一般提供されているのはGoogleの法人向け階層Gemini Enterpriseに限られ、利用はGemini Live API経由となる。消費者向けGeminiアプリは今回の提供開始の対象外だ。
実在する特定人物に似たアバターを企業が作れるのか
参照画像1枚から独自アバターを生成すること自体は可能だが、Googleはこの機能を企業向け許可リストと審査の先に置いている。生成される音声と映像にはすべてSynthIDの透かしが入り、AI生成物だと識別できる状態が保たれる。
アバターは何言語に対応しているのか
Gemini 3.8 Liveは自動言語検出を伴って97言語を理解し話す。Live Avatarはそのすべてに合わせて口の動きと表情を調整する。会話の途中で言語を切り替えても映像の質は落ちないとGoogleは説明している。






