구글의 최신 음성 모델이 누군가의 목소리를 복제하려면, 그 목소리의 주인이 직접 마이크 앞에서 동의한다고 말해야 한다. 구글은 9월 23일 Gemini 3.8 Flash TTS와 Gemini 3.8 Flash-Lite TTS를 공개했다. 음성 복제 기능에는 구두 동의 확인, 파형에 새긴 워터마크, 그리고 생체·초상권 규제가 가장 강한 여섯 개 지역을 막은 차단 목록이 함께 붙었다.
핵심 요약
- 음성 복제는 30초 샘플만으로 목소리 프로필을 재구성하지만, 목소리 주인이 기준 화자와 일치하는 구두 동의 녹음을 제출해야만 작동한다.
- 일리노이, 텍사스, 유럽경제지역(EEA), 영국, 스위스, 인도에서는 기능을 제공하지 않는다. 모두 생체정보·초상권 규제가 가장 엄격한 곳이다.
- 구글 오디오 모델이 만든 모든 음원에는 파형 안에 SynthID 워터마크가 들어가고 C2PA 콘텐츠 자격증명이 따라붙는다. 플랫폼 밖으로 나가도 합성 음성임을 알아볼 수 있게 한 장치다.
차단 목록은 기술 지도가 아니라 법률 지도다
제외된 여섯 지역에는 공통된 인프라 조건이 없다. 공통점은 법이다. 일리노이와 텍사스는 성문(聲紋)을 보호 대상 식별정보로 규정한 생체정보 프라이버시법을 두고 있고, 일리노이는 개인에게 직접 소송권까지 준다. EEA와 영국, 스위스는 동의 우선 데이터 규제 아래 있으며, 인도는 법원을 통해 퍼블리시티권 집행을 강화해왔다. 구글의 지역 제외는 30초짜리 성문이 프롬프트로 만든 합성 음성과는 전혀 다른 법적 위험 물질임을 스스로 인정한 셈이다. 목소리를 처음부터 설계하는 기능은 전 지역에서 그대로 쓸 수 있다.
바로 이 구분이 이번 제품 결정의 핵심이다. 개발자가 역할과 억양, 성격을 자연어로 묘사해 목소리를 만드는 생성형 보이스 디자인은 100개 이상 언어·방언에서 실존하지 않는 인물을 빚어낸다. 복제는 실존하는 사람을 빌려 쓴다.
동의 확인은 무엇을 검증하나
구글 시스템은 목소리를 만들기 전에 기준 화자와 일치하는 구두 동의 녹음을 목소리 주인에게서 받는다. 여기서 '일치'가 관건이다. 체크박스나 서명 양식이 아니라 오디오 대조이기 때문에, 사칭자가 자기 목소리로 남을 대신해 동의를 제출할 수 없다.
약점은 기술이 아니라 구조에 있다. 동의 검증은 절차에 직접 참여한 목소리 주인만 보호한다. 강요받거나 대가를 받은 화자가 샘플과 동의 녹음을 함께 제공하는 경우에는 아무 역할을 못 하고, 이미 구글 플랫폼 밖을 떠도는 음원에도 손을 대지 못한다. 워터마킹 계층이 그 자리를 메운다. SynthID는 사람이 감지할 수 없는 신호를 생성 파형 자체에 심고, C2PA 자격증명은 출처 메타데이터로 함께 따라다닌다.
안전장치 아래 깔린 성능
Flash TTS는 연출 지시를 폭넓게 받는 모델로, 구글의 음성 목록을 프리셋 30개에서 상용 수준 2,000개 이상으로 늘렸다. 멕시코 스페인어, 퀘벡 프랑스어, 스코틀랜드 영어 같은 지역 변이도 들어갔다. Flash-Lite TTS는 분당 단가가 중요한 대량 더빙과 음성 에이전트를 겨냥한다. 두 모델 모두 줄 단위 연출 지시와 <laughs>, <sigh> 같은 비언어 태그, |mhm| 같은 맞장구 표현을 받아들이고, 대본 하나에서 두 화자의 목소리를 구분해 장면을 만들어낸다.
구글은 Flash TTS가 Hume AI의 보이스 디자인 벤치마크에서 71.4점으로 1위, 억양 모델링에서 60.8점으로 선두라고 밝혔다. 다만 제3자 리더보드 순위를 업체가 인용한 수치일 뿐 독립 재현을 거친 결과는 아니다. 이 모델들은 실시간 대화용으로 만든 3.8 Live 모델이 이미 자리 잡은 오디오 스택 위에 얹혔고, API와 Agora·LiveKit·Pipecat·Vercel 등을 통해 개발자에게 닿는다.
전망
지오펜스는 예외가 아니라 표준이 될 가능성이 크다. 어떤 기능의 주된 위험이 기술이 아니라 법이 되는 순간, 가장 싼 통제 수단은 국가 목록이다. 구글은 합성 음성을 두고 그 목록을 처음 그렸다. 음색과 높이, 억양을 조정하는 리믹싱 기능이 출시 예정으로 올라 있고 Gemini Enterprise를 통한 기업 접근도 예고됐는데, 둘 다 같은 지도를 그대로 물려받는다.
FAQ — 자주 묻는 질문
Gemini 음성 복제를 쓸 수 없는 지역은 어디인가
Google AI Studio의 음성 복제는 일리노이, 텍사스, 유럽경제지역, 영국, 스위스, 인도에서 제공하지 않는다. 제한은 기존 목소리를 복제하는 기능에만 적용되며, 자연어 프롬프트로 새 목소리를 만드는 기능은 같은 지역 제외 대상이 아니다.
Gemini 3.8은 목소리를 복제하는 데 음성이 얼마나 필요한가
구글은 30초 샘플이면 프로젝트를 옮겨 다녀도 흔들림이 거의 없는 일관된 목소리 프로필을 재현할 수 있다고 설명한다. 샘플은 본인 목소리이거나 권리를 보유한 목소리여야 하고, 기준 화자와 일치하는 목소리 주인의 구두 동의 녹음이 반드시 함께 있어야 한다.
이 모델로 만든 음성인지 구분할 수 있나
구글은 Gemini 오디오 모델이 생성한 모든 음원에 SynthID를 넣는다. 메타데이터로 붙이는 방식이 아니라 오디오 자체에 신호를 짜 넣는 방식이며, 여기에 C2PA 콘텐츠 자격증명을 더한다. 허위정보 확산을 줄이기 위해 AI 생성 음성을 계속 식별 가능하게 두겠다는 것이 구글이 밝힌 목표다.






