Gemini의 Live Avatar, 97개 언어를 오가면서도 입 모양을 놓치지 않는다

Google이 Gemini Enterprise에서 애니메이션 페르소나를 정식 출시했다. 모든 프레임에 SynthID 워터마크가 들어가고, 맞춤 얼굴 생성은 허용 목록으로 잠가뒀다.

|5분 읽기0
A real-time rendered animated character, the kind of continuously generated face Gemini's Live Avatar now produces during enterprise voice calls.
A real-time rendered animated character, the kind of continuously generated face Gemini's Live Avatar now produces during enterprise voice calls.

Google이 목요일 Gemini Enterprise에서 Live Avatar를 탑재한 Gemini 3.8 Live를 정식 출시했다. 실시간 대화 모델에 말에 맞춰 입 모양을 움직이고 표정을 바꾸는 화면 속 애니메이션 페르소나가 붙었다. 모델 자체의 음성 대 음성 대화와 저지연 스트리밍 영상 생성을 묶은 구조라, 시스템은 듣고 카메라 화면을 보면서 파형이 아닌 실제 얼굴로 답한다.

핵심 요약

  • Live Avatar는 기반 모델인 Gemini 3.8 Live 출시 일주일 뒤인 9월 24일 Gemini Enterprise에서 정식 출시됐다.
  • 아바타는 97개 언어에서 입 모양과 표정을 유지하며, 대화 도중 언어를 바꿔도 Google이 말하는 "시각적 흔들림"이 생기지 않는다.
  • 생성된 모든 오디오·영상 스트림에는 감지되지 않는 SynthID 워터마크가 들어가고, 참조 사진으로 맞춤 아바타를 만들려면 기업 허용 목록 승인이 필요하다.

Live Avatar가 실제로 만들어내는 것

Google은 Gemini 오디오 팀의 출시 게시물에서 이 기능을 렌더러를 덧붙인 것이 아니라 네이티브 결합이라고 설명했다. 영상 생성과 음성을 함께 만들어내기 때문에, 입 애니메이션이 오디오 트랙을 뒤쫓는 방식이 아니라 정확한 립싱크와 발언 차례 전환이 가능하다는 것이다.

실무에서 더 와닿는 추가 기능은 비동기 도구 실행이다. 아바타는 대화를 이어가는 동시에 백그라운드로 도구를 호출해 데이터를 가져올 수 있다. 조회하는 동안 통화 상대가 멈춰 있는 얼굴만 보고 있을 일이 없다는 뜻이다. Google 시연은 호텔 체크인 상황에서 함수 호출이 뒤에서 처리되는 동안 대화가 끊기지 않는 장면을 보여준다.

실시간 시각 이해가 나머지를 채운다. 모델은 카메라 영상과 화면 공유를 오디오와 동시에 처리한다. 초상화를 붙인 음성 봇이 아니라 제대로 된 멀티모달 에이전트인 이유다. Google은 웹과 모바일, 대화형 키오스크를 적용처로 잡았다.

Google이 신원 문제를 다룬 방식

그럴듯하게 말하는 얼굴을 만들어내는 모델은 오용을 부르기 마련이고, Google의 답은 등급 분리다. 고객은 미리 만들어둔 아바타 라이브러리에서 별도 승인 없이 골라 쓸 수 있다. 고화질 참조 이미지 한 장과 음성 샘플로 인물의 생김새와 브랜드 스타일을 살린 맞춤 아바타를 만드는 기능은 엄격한 기업 허용 목록과 검증 절차 뒤에 놓였다.

이 기능이 내놓는 결과물에는 전부 SynthID 워터마크가 들어간다. 화면 귀퉁이에 도장을 찍는 방식이 아니라 오디오와 영상 스트림 양쪽에 짜 넣는다. 합성 콘텐츠를 계속 탐지 가능하게 두어 출처가 잘못 알려지는 일을 줄이겠다는 것이 Google이 밝힌 이유다.

어디서 돌아가고, 무엇이 아직 잠겨 있나

Google Cloud 출시 공지는 미국·EU 엔드포인트와 프로비저닝된 처리량, 기업 컴플라이언스 및 데이터 거버넌스 통제를 함께 안내한다. 이 기술은 Google Cloud Next 2026에서 처음 공개됐다. 추론 능력을 강화한 형제 모델인 Gemini 3.8 Live Extended Thinking은 여전히 비공개 프리뷰 상태다.

초기 고객이 내놓은 반응

Cox Automotive는 Autotrader용 대화형 아바타를 만들었다. 화면의 특정 부분을 짚어주고 도구를 호출해 검색과 비교, 금융 상품까지 구매자를 안내한다. 매리앤 존슨(Marianne Johnson) 수석부사장 겸 최고제품책임자는 필터와 메뉴를 헤집는 대신 구매자가 원하는 바를 자기 말로 설명하게 하는 것이 목표라고 밝혔다.

인도 9개 언어로 하루 100만 건 넘는 실시간 통화를 처리한다는 Equal AI는 3.8 Live 버전에서 끼어들기 처리와 도구 호출 안정성이 좋아졌다고 평가했다. Salesforce는 이 모델을 Agentforce와 묶고 있고, 음성 플랫폼 Specs는 음성 활동 감지와 전반적인 지연 시간 개선을 꼽았다.

이 발언들 어디에도 지연 시간 수치나 분당 요금, 얼굴 없이 같은 작업을 돌렸을 때와의 완료율 비교는 없다. Google도 셋 중 아무것도 공개하지 않았다. 결국 구매자는 측정된 결과가 아니라 시연 영상만 보고 렌더링 기능을 판단해야 한다. 본격 도입에 프로비저닝된 처리량이 전제로 붙는다는 점도, 영상 생성 비용이 만만치 않아 Google이 사용량 과금보다 예약 용량을 팔고 싶어 한다는 신호로 읽힌다.

전망

Live Avatar는 소비자용 Gemini 기능이 아니라 기업용 제품이고, 고객 명단도 범용 비서보다는 콜센터와 접수 업무 쪽에 가깝다. 처음 보이는 것보다 좁은 베팅이지만, 자리 잡은 곳은 Google이 앞서 내놓은 저지연 음성 모델과 경쟁사의 풀듀플렉스 출시가 맞붙는 격전지다. Google이 시험하는 차별점은 사용자가 지금 도중에 포기하는 작업에서 얼굴이 완료율을 실제로 끌어올리느냐다. Google DeepMind는 아직 그에 관한 수치를 내놓지 않았다.

FAQ · 자주 묻는 질문

Live Avatar를 탑재한 Gemini 3.8 Live는 일반 사용자도 쓸 수 있나

쓸 수 없다. 이 기능은 Google의 기업용 등급인 Gemini Enterprise에서만 정식 제공되고, 접근은 Gemini Live API를 통한다. 소비자용 Gemini 앱은 이번 출시와 무관하다.

특정 실존 인물처럼 보이는 아바타를 기업이 만들 수 있나

참조 이미지 한 장으로 맞춤 아바타를 만들 수는 있지만, Google은 이 기능을 기업 허용 목록과 검증 절차 뒤에 두고 있다. 생성된 오디오와 영상에는 모두 SynthID 워터마크가 들어가 AI 생성물임을 계속 확인할 수 있다.

아바타는 몇 개 언어를 지원하나

Gemini 3.8 Live는 자동 언어 감지와 함께 97개 언어를 알아듣고 말하며, Live Avatar는 그 전부에 맞춰 입 모양과 표정을 조정한다. Google은 대화 도중 언어를 바꿔도 영상 품질이 떨어지지 않는다고 밝혔다.

이 기사에 대한 반응을 남겨주세요!

SJ
로딩 중...

관련 기사

Gemini가 윈도우에 상륙했다, Alt+Space 한 번으로 뜨는 데스크톱 비서
LLM & Chatbots

Gemini가 윈도우에 상륙했다, Alt+Space 한 번으로 뜨는 데스크톱 비서

Google의 윈도우용 Gemini 네이티브 앱이 Alt+Space로 어떤 프로그램 위에든 뜬다. Gmail·Google Drive에 연결되며 Windows 10·11에서 전 세계 이용이 가능하다.

Seung Jung14일 전
업무에 투입된 GPT-6 Astra, OpenAI 최고가 모델이 컴퓨터 사용에 모든 것을 걸었다
LLM & Chatbots

업무에 투입된 GPT-6 Astra, OpenAI 최고가 모델이 컴퓨터 사용에 모든 것을 걸었다

OpenAI의 GPT-6 Astra가 컴퓨터 사용 기능과 100만 토큰 컨텍스트, 10/50달러 가격으로 기업 사용자에게 풀린다. 대표 점수에는 하네스 단서가 붙는다.

Seung Jung15일 전
ChatGPT는 쇼핑 답변 79%에서 콕 집어 추천한다, Gemini는 7%
LLM & Chatbots

ChatGPT는 쇼핑 답변 79%에서 콕 집어 추천한다, Gemini는 7%

AI 쇼핑 답변 1,536건 감사에서 ChatGPT는 79%가 1인칭 선호를 밝힌 반면 Gemini는 7%에 그쳤다. 인용 출처도 거의 겹치지 않았다.

Seung Jung8일 전
ChatGPT Images 2.5, 생성 속도 두 배로… 스케치 캔버스도 붙였다
LLM & Chatbots

ChatGPT Images 2.5, 생성 속도 두 배로… 스케치 캔버스도 붙였다

OpenAI가 ChatGPT Images 2.5를 내놨다. 지연 시간을 최대 50% 줄이고 Sketch 캔버스와 템플릿, 고정 댓글, API 모델 두 종을 함께 공개했다.

Seung Jung14일 전
OpenAI의 Astra for Law는 새 모델이 아니다, 2억 3000만 URL 법률 색인이다
LLM & Chatbots

OpenAI의 Astra for Law는 새 모델이 아니다, 2억 3000만 URL 법률 색인이다

OpenAI가 GPT-6 Astra에 2억 3000만 URL 규모 법률 색인을 결합한 Astra for Law를 공개했다. 리걸 리서치 벤치 정확도는 38.7%에서 54%로 올랐다.

Seung Jung7일 전
메타 뮤즈, 당신의 메일함과 일정 그리고 신용카드를 노린다
LLM & Chatbots

메타 뮤즈, 당신의 메일함과 일정 그리고 신용카드를 노린다

메타가 개인 AI 에이전트 뮤즈를 공개했다. 미국에서 iOS·안드로이드·웹·왓츠앱을 통해 여행 예약과 요금 납부, 쇼핑을 대신 처리한다.

Seung Jung14일 전