Google lanzó el jueves Gemini 3.8 Live con Live Avatar de forma general en Gemini Enterprise y dotó a su modelo conversacional en tiempo real de una persona animada que sincroniza los labios y cambia de expresión mientras habla. La función acopla el diálogo nativo de voz a voz del modelo con generación de vídeo en streaming de baja latencia, de modo que el sistema escucha, mira la señal de una cámara y responde con un rostro visible en lugar de una onda de audio.
Claves
- Live Avatar quedó disponible de forma general en Gemini Enterprise el 24 de septiembre, una semana después de la salida del modelo Gemini 3.8 Live en el que se apoya.
- El avatar conserva la sincronía labial y la expresión facial en 97 idiomas y puede alternar entre ellos en mitad de una conversación sin lo que Google llama deriva visual.
- Todo el audio y el vídeo generados llevan una marca de agua SynthID imperceptible, y crear un avatar a medida a partir de una foto de referencia exige figurar en una lista de acceso empresarial.
Qué genera realmente Live Avatar
En su anuncio firmado por el equipo de audio de Gemini, Google presenta la función como un acoplamiento nativo y no como un renderizador añadido: el vídeo y la voz se producen a la vez, y eso es lo que permite una sincronía labial precisa y una alternancia de turnos limpia, en lugar de una animación de boca persiguiendo una pista de audio.
La incorporación más práctica es la ejecución asíncrona de herramientas. El avatar puede lanzar una llamada a una herramienta y recuperar datos en segundo plano mientras la conversación sigue su curso, de modo que nadie se queda mirando un rostro congelado durante una consulta. La demostración de Google recorre el registro en un hotel: el diálogo continúa sin interrupciones mientras las llamadas a funciones se resuelven de fondo.
La comprensión visual en vivo completa el conjunto. El modelo procesa señales de cámara y pantallas compartidas al mismo tiempo que el audio, lo que lo convierte en un agente genuinamente multimodal y no en un bot de voz con un retrato encima. Google lo orienta a la web, el móvil y los quioscos interactivos.
Cómo resolvió Google el problema de la identidad
Un modelo capaz de dibujar un rostro parlante convincente invita al uso indebido, y la respuesta de Google pasa por los niveles. Los clientes pueden desplegar avatares de una biblioteca curada sin permisos especiales. Generar uno a medida —a partir de una sola imagen de referencia de alta calidad y una muestra de audio, conservando el parecido y el estilo de marca— queda detrás de un estricto proceso de verificación y lista de acceso empresarial.
Todo lo que produce la función lleva marca de agua SynthID, entretejida tanto en el audio como en el vídeo en lugar de estampada en una esquina del fotograma. La razón que alega Google es mantener detectable el contenido sintético para limitar las atribuciones erróneas.
Dónde funciona y qué sigue restringido
El aviso de disponibilidad de Google Cloud enumera puntos de acceso en Estados Unidos y la Unión Europea, rendimiento aprovisionado y controles de cumplimiento y gobernanza de datos para empresas. La tecnología se mostró por primera vez en Google Cloud Next 2026. Gemini 3.8 Live Extended Thinking, la variante de razonamiento más profundo, sigue en vista previa privada.
Qué cuentan los primeros clientes
Cox Automotive construyó un avatar conversacional para Autotrader que resalta partes de la pantalla y llama a herramientas para guiar al comprador por la búsqueda, la comparación y la financiación. Marianne Johnson, vicepresidenta ejecutiva y directora de producto de la compañía, describió el objetivo como permitir que el comprador diga con sus propias palabras qué quiere en vez de pelearse con filtros y menús.
Equal AI, que asegura atender ya más de un millón de llamadas en vivo al día en nueve idiomas de la India, atribuyó a la versión 3.8 Live una mejor gestión de las interrupciones y llamadas a herramientas más fiables. Salesforce está combinando el modelo con Agentforce, y la plataforma de voz Specs destacó las mejoras en la detección de actividad vocal y en la latencia general.
En ninguna de esas declaraciones aparece una cifra de latencia, un precio por minuto o una comparación de tasas de finalización frente al mismo flujo sin rostro. Google no ha publicado ninguno de los tres datos, así que el comprador acaba evaluando una función de renderizado con material de demostración en lugar de resultados medidos. Que el rendimiento aprovisionado sea requisito para un despliegue serio también sugiere que generar vídeo sale lo bastante caro como para que Google prefiera vender capacidad reservada antes que llamadas medidas.
Perspectiva
Live Avatar es un producto empresarial y no una función del Gemini de consumo, y la lista de clientes se parece más al centro de contacto y la atención inicial que a los asistentes generales. Es una apuesta más estrecha de lo que parece a primera vista, pero cae en el mismo terreno disputado que los anteriores modelos de voz de baja latencia de Google y los lanzamientos full-duplex de la competencia. El factor diferencial que Google está poniendo a prueba es si un rostro mejora de forma medible la tasa de finalización en tareas que hoy los usuarios abandonan. Google DeepMind aún no ha publicado cifras al respecto.
FAQ · Preguntas frecuentes
¿Está Gemini 3.8 Live con Live Avatar disponible para el público general?
No. La función solo está disponible de forma general en Gemini Enterprise, el nivel empresarial de Google, y el acceso se realiza a través de la Gemini Live API. Las aplicaciones de Gemini para consumidores no se ven afectadas por este lanzamiento.
¿Puede una empresa crear un avatar con el aspecto de una persona real concreta?
Los avatares a medida pueden generarse a partir de una única imagen de referencia, pero Google restringe esa capacidad mediante una lista de acceso empresarial y un proceso de verificación. Todo el audio y el vídeo generados llevan además una marca de agua SynthID para que el resultado siga siendo identificable como material creado con IA.
¿Cuántos idiomas admite el avatar?
Gemini 3.8 Live entiende y habla 97 idiomas con detección automática, y Live Avatar adapta la sincronía labial y las expresiones a todos ellos. Google afirma que el avatar puede cambiar de idioma en mitad de una conversación sin degradar la calidad del vídeo.






