El avatar en vivo de Gemini mantiene la sincronía labial mientras alterna entre 97 idiomas

Google lanzó de forma general esta persona animada en Gemini Enterprise, con marcas de agua SynthID en cada fotograma y los rostros personalizados restringidos a una lista de acceso

|5 min de lectura0
A real-time rendered animated character, the kind of continuously generated face Gemini's Live Avatar now produces during enterprise voice calls.
A real-time rendered animated character, the kind of continuously generated face Gemini's Live Avatar now produces during enterprise voice calls.

Google lanzó el jueves Gemini 3.8 Live con Live Avatar de forma general en Gemini Enterprise y dotó a su modelo conversacional en tiempo real de una persona animada que sincroniza los labios y cambia de expresión mientras habla. La función acopla el diálogo nativo de voz a voz del modelo con generación de vídeo en streaming de baja latencia, de modo que el sistema escucha, mira la señal de una cámara y responde con un rostro visible en lugar de una onda de audio.

Claves

  • Live Avatar quedó disponible de forma general en Gemini Enterprise el 24 de septiembre, una semana después de la salida del modelo Gemini 3.8 Live en el que se apoya.
  • El avatar conserva la sincronía labial y la expresión facial en 97 idiomas y puede alternar entre ellos en mitad de una conversación sin lo que Google llama deriva visual.
  • Todo el audio y el vídeo generados llevan una marca de agua SynthID imperceptible, y crear un avatar a medida a partir de una foto de referencia exige figurar en una lista de acceso empresarial.

Qué genera realmente Live Avatar

En su anuncio firmado por el equipo de audio de Gemini, Google presenta la función como un acoplamiento nativo y no como un renderizador añadido: el vídeo y la voz se producen a la vez, y eso es lo que permite una sincronía labial precisa y una alternancia de turnos limpia, en lugar de una animación de boca persiguiendo una pista de audio.

La incorporación más práctica es la ejecución asíncrona de herramientas. El avatar puede lanzar una llamada a una herramienta y recuperar datos en segundo plano mientras la conversación sigue su curso, de modo que nadie se queda mirando un rostro congelado durante una consulta. La demostración de Google recorre el registro en un hotel: el diálogo continúa sin interrupciones mientras las llamadas a funciones se resuelven de fondo.

La comprensión visual en vivo completa el conjunto. El modelo procesa señales de cámara y pantallas compartidas al mismo tiempo que el audio, lo que lo convierte en un agente genuinamente multimodal y no en un bot de voz con un retrato encima. Google lo orienta a la web, el móvil y los quioscos interactivos.

Cómo resolvió Google el problema de la identidad

Un modelo capaz de dibujar un rostro parlante convincente invita al uso indebido, y la respuesta de Google pasa por los niveles. Los clientes pueden desplegar avatares de una biblioteca curada sin permisos especiales. Generar uno a medida —a partir de una sola imagen de referencia de alta calidad y una muestra de audio, conservando el parecido y el estilo de marca— queda detrás de un estricto proceso de verificación y lista de acceso empresarial.

Todo lo que produce la función lleva marca de agua SynthID, entretejida tanto en el audio como en el vídeo en lugar de estampada en una esquina del fotograma. La razón que alega Google es mantener detectable el contenido sintético para limitar las atribuciones erróneas.

Dónde funciona y qué sigue restringido

El aviso de disponibilidad de Google Cloud enumera puntos de acceso en Estados Unidos y la Unión Europea, rendimiento aprovisionado y controles de cumplimiento y gobernanza de datos para empresas. La tecnología se mostró por primera vez en Google Cloud Next 2026. Gemini 3.8 Live Extended Thinking, la variante de razonamiento más profundo, sigue en vista previa privada.

Qué cuentan los primeros clientes

Cox Automotive construyó un avatar conversacional para Autotrader que resalta partes de la pantalla y llama a herramientas para guiar al comprador por la búsqueda, la comparación y la financiación. Marianne Johnson, vicepresidenta ejecutiva y directora de producto de la compañía, describió el objetivo como permitir que el comprador diga con sus propias palabras qué quiere en vez de pelearse con filtros y menús.

Equal AI, que asegura atender ya más de un millón de llamadas en vivo al día en nueve idiomas de la India, atribuyó a la versión 3.8 Live una mejor gestión de las interrupciones y llamadas a herramientas más fiables. Salesforce está combinando el modelo con Agentforce, y la plataforma de voz Specs destacó las mejoras en la detección de actividad vocal y en la latencia general.

En ninguna de esas declaraciones aparece una cifra de latencia, un precio por minuto o una comparación de tasas de finalización frente al mismo flujo sin rostro. Google no ha publicado ninguno de los tres datos, así que el comprador acaba evaluando una función de renderizado con material de demostración en lugar de resultados medidos. Que el rendimiento aprovisionado sea requisito para un despliegue serio también sugiere que generar vídeo sale lo bastante caro como para que Google prefiera vender capacidad reservada antes que llamadas medidas.

Perspectiva

Live Avatar es un producto empresarial y no una función del Gemini de consumo, y la lista de clientes se parece más al centro de contacto y la atención inicial que a los asistentes generales. Es una apuesta más estrecha de lo que parece a primera vista, pero cae en el mismo terreno disputado que los anteriores modelos de voz de baja latencia de Google y los lanzamientos full-duplex de la competencia. El factor diferencial que Google está poniendo a prueba es si un rostro mejora de forma medible la tasa de finalización en tareas que hoy los usuarios abandonan. Google DeepMind aún no ha publicado cifras al respecto.

FAQ · Preguntas frecuentes

¿Está Gemini 3.8 Live con Live Avatar disponible para el público general?

No. La función solo está disponible de forma general en Gemini Enterprise, el nivel empresarial de Google, y el acceso se realiza a través de la Gemini Live API. Las aplicaciones de Gemini para consumidores no se ven afectadas por este lanzamiento.

¿Puede una empresa crear un avatar con el aspecto de una persona real concreta?

Los avatares a medida pueden generarse a partir de una única imagen de referencia, pero Google restringe esa capacidad mediante una lista de acceso empresarial y un proceso de verificación. Todo el audio y el vídeo generados llevan además una marca de agua SynthID para que el resultado siga siendo identificable como material creado con IA.

¿Cuántos idiomas admite el avatar?

Gemini 3.8 Live entiende y habla 97 idiomas con detección automática, y Live Avatar adapta la sincronía labial y las expresiones a todos ellos. Google afirma que el avatar puede cambiar de idioma en mitad de una conversación sin degradar la calidad del vídeo.

¿Qué te parece este artículo?

SJ
Cargando...

Artículos relacionados

Gemini llega a Windows con un atajo Alt+Space y una apuesta por el escritorio
LLM & Chatbots

Gemini llega a Windows con un atajo Alt+Space y una apuesta por el escritorio

La app nativa de Gemini para Windows se abre sobre cualquier programa con Alt+Espacio, se conecta a Gmail y Drive y está disponible en todo el mundo en Windows 10 y 11.

Seung Junghace 14 días
GPT-6 Astra se pone a trabajar: el modelo más caro de OpenAI lo apuesta todo al manejo del ordenador
LLM & Chatbots

GPT-6 Astra se pone a trabajar: el modelo más caro de OpenAI lo apuesta todo al manejo del ordenador

GPT-6 Astra llega a los clientes empresariales con manejo del ordenador, un contexto de un millón de tokens y precios de 10 y 50 dólares, con una salvedad sobre su puntuación estrella.

Seung Junghace 15 días
ChatGPT elige un favorito en el 79% de sus respuestas de compra; Gemini, en el 7%
LLM & Chatbots

ChatGPT elige un favorito en el 79% de sus respuestas de compra; Gemini, en el 7%

Una auditoría de 1,536 respuestas de compra con IA halló que ChatGPT expresa una preferencia en primera persona el 79% de las veces y Gemini solo el 7%.

Seung Junghace 8 días
ChatGPT Images 2.5 reduce a la mitad la latencia y suma un lienzo de dibujo
LLM & Chatbots

ChatGPT Images 2.5 reduce a la mitad la latencia y suma un lienzo de dibujo

OpenAI lanzó ChatGPT Images 2.5 con hasta un 50% menos de latencia, un lienzo de dibujo Sketch, plantillas, comentarios anclados y dos modelos nuevos en la API.

Seung Junghace 14 días
Astra for Law de OpenAI no es un modelo nuevo: es un índice de búsqueda de 230 millones de URL
LLM & Chatbots

Astra for Law de OpenAI no es un modelo nuevo: es un índice de búsqueda de 230 millones de URL

Astra for Law combina GPT-6 Astra con un índice jurídico de 230 millones de URL y eleva la precisión del Legal Research Bench del 38,7% al 54%.

Seung Junghace 7 días
El agente Muse de Meta quiere tu correo, tu calendario y tu tarjeta de crédito
LLM & Chatbots

El agente Muse de Meta quiere tu correo, tu calendario y tu tarjeta de crédito

Meta lanzó Muse, un agente de IA personal que reserva viajes, paga facturas y compra por ti en iOS, Android, la web y WhatsApp en Estados Unidos.

Seung Junghace 14 días