Google exige una grabación de consentimiento para clonar voces y deja fuera seis jurisdicciones

Gemini 3.8 Flash TTS reconstruye una voz con 30 segundos de audio, y las barreras que lo rodean responden al derecho a la imagen, no a límites de ingeniería

|5 min de lectura0
A studio mixing desk and microphone array of the kind Google's Gemini 3.8 TTS models aim to substitute with prompt-written voice direction
A studio mixing desk and microphone array of the kind Google's Gemini 3.8 TTS models aim to substitute with prompt-written voice direction

Antes de que el nuevo modelo de voz de Google copie a alguien, el dueño de esa voz tiene que hablar ante un micrófono y decirlo. Google lanzó Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS el 23 de septiembre, y la función de replicación llega con una verificación de consentimiento verbal, una marca de agua incrustada y una lista de bloqueo que cubre seis de los regímenes más estrictos del mundo en materia biométrica y de imagen personal.

Claves del anuncio

  • La replicación de voz reconstruye un perfil vocal a partir de una muestra de 30 segundos, pero solo después de que el dueño de la voz entregue una grabación de consentimiento verbal que coincida con el hablante de referencia.
  • La función no se ofrece en Illinois, Texas, el Espacio Económico Europeo, Reino Unido, Suiza ni India, las jurisdicciones con la normativa biométrica y de imagen más dura.
  • Cada clip generado por los modelos de audio de Google lleva una marca de agua SynthID dentro de la onda sonora y credenciales de contenido C2PA, de modo que el habla sintética siga siendo identificable fuera de la plataforma.

Por qué la lista de bloqueo es un mapa legal y no técnico

Los seis territorios excluidos no comparten ninguna característica de infraestructura. Lo que comparten es legislación. Illinois y Texas aplican leyes de privacidad biométrica que tratan la huella vocal como identificador protegido y, en el caso de Illinois, conceden acción privada al afectado. El EEE, Reino Unido y Suiza operan bajo regímenes de datos con consentimiento previo, e India viene endureciendo por vía judicial la protección de los derechos de personalidad. La exclusión de Google admite que una huella vocal de 30 segundos es material radiactivo en términos legales, algo que no ocurre con las voces sintéticas escritas por prompt: diseñar una voz desde cero sigue disponible en todas partes.

Esa distinción es la verdadera decisión de producto. El diseño generativo de voces, donde el desarrollador describe en lenguaje natural un papel, un acento y un conjunto de rasgos en más de 100 idiomas y dialectos, crea a una persona que no existe. La replicación toma prestada a una que sí.

Qué verifica en realidad la comprobación de consentimiento

El sistema de Google pide al dueño de la voz una grabación de consentimiento verbal que coincida con el hablante de referencia antes de crear la voz. Ese cotejo es lo relevante: no se trata de una casilla ni de un formulario firmado, sino de una comparación de audio, así que un suplantador no puede dar el consentimiento por otra persona usando su propia voz.

La debilidad es estructural, no técnica. La verificación protege al dueño de la voz que participa en el proceso. No hace nada cuando la muestra y el clip de consentimiento provienen del mismo hablante coaccionado o pagado, ni con el audio que ya circula fuera de la plataforma. Para eso está la capa de marcado: SynthID incrusta una señal imperceptible en la propia onda generada, y las credenciales C2PA viajan junto al archivo como metadatos de procedencia.

La capacidad que hay debajo de las barreras

Flash TTS es el modelo que admite dirección detallada y amplía el catálogo de Google de 30 voces predefinidas a más de 2.000 listas para producción, con variantes regionales como el español mexicano, el francés de Quebec y el inglés escocés. Flash-Lite TTS apunta al doblaje de alto volumen y a los agentes de voz, donde manda el coste por minuto. Ambos aceptan acotaciones línea a línea y etiquetas no verbales como <laughs> y <sigh>, además de interjecciones de escucha como |mhm|, y los dos resuelven escenas a dos voces desde un único guion sin que estas se confundan.

Google sitúa a Flash TTS en el primer puesto del Voice Design Benchmark de Hume AI con 71,4 y al frente en modelado de acentos con 60,8. Son posiciones en una tabla de terceros citadas por el propio proveedor, sin replicación independiente. Los modelos se apoyan en una pila de audio que ya incluye los modelos 3.8 Live pensados para conversación en vivo, y llegan a los desarrolladores mediante la API y plataformas como Agora, LiveKit, Pipecat y Vercel.

Perspectiva

El geobloqueo tiene pinta de convertirse en norma y no en excepción. Cuando el riesgo principal de una capacidad pasa a ser legal en vez de técnico, el control más barato es una lista de países, y Google acaba de dibujar la suya para la voz sintética. Ya figura como próxima una función de remezcla para ajustar timbre, tono y acento, y el acceso empresarial llegará vía Gemini Enterprise: ambos heredarán el mismo mapa.

FAQ — Preguntas frecuentes

¿Dónde no está disponible la replicación de voz de Gemini?

La replicación de voz a través de Google AI Studio no se ofrece en Illinois, Texas, el Espacio Económico Europeo, Reino Unido, Suiza ni India. La restricción afecta solo a clonar una voz existente; crear una voz original a partir de un prompt en lenguaje natural no está sujeto a esa exclusión regional.

¿Cuánto audio necesita Gemini 3.8 para copiar una voz?

Google afirma que una muestra de 30 segundos basta para recrear un perfil vocal consistente con una desviación mínima entre proyectos. La muestra debe ser tu propia voz o una sobre la que tengas derechos, y hay que acompañarla de una grabación de consentimiento verbal del dueño de la voz que coincida con el hablante de referencia.

¿Se puede saber si un audio salió de estos modelos?

Google marca cada clip que generan sus modelos de audio Gemini con SynthID, una señal tejida en el propio sonido en lugar de adjuntarse como metadato, y añade credenciales de contenido C2PA. El objetivo declarado es mantener detectable el habla generada por IA para limitar la desinformación.

¿Qué te parece este artículo?

SJ
Cargando...

Artículos relacionados

Gemini entró en tres sistemas externos en mayo y Google lo reveló en septiembre
AI & Machine Learning

Gemini entró en tres sistemas externos en mayo y Google lo reveló en septiembre

Google confirmó que Gemini accedió a tres sistemas externos durante una evaluación de mayo: adivinó un juego de credenciales y halló otros dos en un repositorio público.

Seung Junghace 8 días
Gemini esperará en línea por ti, desde tu propio número
AI & Machine Learning

Gemini esperará en línea por ti, desde tu propio número

El experimento Call for Me de Google permite que Gemini llame a un negocio, recorra su menú telefónico y espere en línea marcando desde el número del propio usuario.

Seung Junganteayer
El plan de Google para la memoria de IA en la nube deja las claves de descifrado en tus dispositivos
AI & Machine Learning

El plan de Google para la memoria de IA en la nube deja las claves de descifrado en tus dispositivos

Google añadirá memoria persistente en servidor a Private AI Compute, la plataforma en la nube aislada por hardware con la que ejecuta modelos Gemini sobre datos personales sensibles.

Seung Junghace 12 horas
Un chatbot leyó mal el manifiesto de un barco. Los aviones armados de EE. UU. ya estaban en el aire
AI & Machine Learning

Un chatbot leyó mal el manifiesto de un barco. Los aviones armados de EE. UU. ya estaban en el aire

CNN informa que un chatbot de IA identificó erróneamente la carga de un buque chino como componentes nucleares, y que la interceptación estadounidense se abortó con los aviones ya en el aire.

Seung Junghace 9 días
PrismML metió un modelo de razonamiento de 27B en 5,95 GB sin perder el razonamiento
AI & Machine Learning

PrismML metió un modelo de razonamiento de 27B en 5,95 GB sin perder el razonamiento

Por debajo de los 4 bits los modelos de razonamiento suelen dejar de razonar. PrismML dice que comprimió Qwen3.8-27B a 5,95 GB conservando el 98,2 % del original.

Seung Junghace 9 días
Un empujón del jefe eleva un 65% las infracciones de la IA, según una auditoría de 22 modelos
AI & Machine Learning

Un empujón del jefe eleva un 65% las infracciones de la IA, según una auditoría de 22 modelos

PACT enfrenta una norma vigente con un atajo cómodo en 12 ámbitos regulados. La presión habitual del usuario elevó un 65% las infracciones en 22 modelos.

Seung Junghace 10 días