Lo que delata a una máquina es la pausa. Si se le pide a un agente de voz que consulte un dato, se queda callado, porque el modelo no puede hablar y llamar a una herramienta al mismo tiempo. Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, que Google DeepMind lanzó el 15 de septiembre, están diseñados para eliminar ese silencio.
Claves
- Ambos modelos ejecutan llamadas a herramientas en segundo plano mientras la conversación continúa, y detectan de forma automática los cambios entre 97 idiomas sin reiniciar la sesión.
- Extended Thinking encabeza el índice de calidad Speech to Speech de Artificial Analysis con 82.6 puntos, frente a los 81.5 de GPT-Live-1 Astra y los 81.3 de Grok Voice Think Fast 2.0.
- Una hora de audio de entrada cuesta 0.84 dólares en el modelo estándar y 3.50 dólares en Extended Thinking, contra los 5.83 dólares de Astra.
Qué aporta la ejecución en segundo plano
Extended Thinking razona y habla a la vez. En lugar del silencio, ofrece una señal verbal temprana -algo del estilo de "déjame consultarlo"- y va narrando una tarea de varios pasos a medida que la completa. El modelo pesado apunta a ese tipo de trabajo; el Gemini 3.8 Live estándar es el hermano barato y de alto volumen, afinado para el diálogo fluido y la comprensión visual.
El contexto visual funciona en tiempo real en ambos. El usuario puede enfocar la cámara hacia una pantalla y preguntar por lo que aparece, y el modelo incorpora esa información al intercambio en curso. La llamada a funciones ocurre en paralelo, y ahí está la diferencia entre un asistente y el menú telefónico al que todavía se parecen la mayoría de los agentes de IA.
Cómo se compara con Astra y Grok
Frente al GPT-Live-1 Astra de OpenAI, los márgenes son estrechos en calidad y amplios en tareas resueltas. Extended Thinking obtiene un 68.6% en la prueba de agentes tau-Voice, donde Astra llega al 67.9%. En la evaluación tau-Voice-banking de Sierra -que mide si el agente resuelve una solicitud de atención al cliente y no solo si suena competente- alcanza un 35.1% frente al 32.0% de Astra.
Las propuestas de xAI quedan más atrás. Grok Voice Think Fast 2.0 logra un 56.5% en tau-Voice y xAI-Realtime se queda en un 16.5% en la prueba bancaria. Google reporta un 97.7% para Extended Thinking en Big Bench Audio, mientras que el modelo estándar suma 76.0 puntos en el índice de voz y el segundo puesto en la Speech Agent Arena, una clasificación basada en preferencias y no en puntuaciones.
El precio es el argumento
Los despliegues de voz se facturan por hora, así que la tabla de tarifas pesa más que la de resultados. Según el repaso de las cifras de Artificial Analysis, Grok Voice Think Fast 2.0 cobra 4.80 dólares por hora de audio de entrada y Astra, 5.83. Ambos quedan por encima de los 3.50 dólares que pide Google por el modelo que los supera, y muy lejos de los 0.84 dólares del nivel estándar.
Ganar y a la vez cobrar menos es una jugada repetida. La compañía puso Gemini 3.7 Flash a la mitad del precio de su antecesor, y 3.8 Flash llegó apenas dos semanas antes de este lanzamiento, de modo que la línea de audio ya avanza al mismo ritmo que la de texto.
Quién puede usarlo
Los desarrolladores acceden a ambos modelos a través de la API de Gemini y Google AI Studio; las empresas reciben una vista previa privada en Gemini Enterprise. LiveKit, Pipecat, Agora, LangChain y Vercel ya exponen la Live API, y Salesforce, Genspark y Lumeris figuran como primeros clientes.
Los usuarios finales se encuentran con Extended Thinking dentro de Gemini Live, Search Live y las aplicaciones de Workspace -Docs, Gmail y Keep- en los planes de pago de Google AI. Cada segundo de audio generado lleva una marca de agua SynthID, el identificador de procedencia de audio de Google.
Lo que nada de esto resuelve es si los modelos aguantan fuera del guion. Las evaluaciones siguen un plan; una cola de soporte, no. El peor escenario para Google DeepMind es un agente que narra con aplomo una tarea que nunca completó. La ventaja de precio compra margen para averiguarlo en producción.
Preguntas frecuentes
¿Pueden los desarrolladores usar Gemini 3.8 Live desde hoy?
Sí. Gemini 3.8 Live y 3.8 Live Extended Thinking quedaron disponibles el 15 de septiembre de 2026 a través de la API de Gemini y Google AI Studio. El acceso empresarial es una vista previa privada en Gemini Enterprise, y Gemini Enterprise for Customer Experience figura como próximamente.
¿Cuánto cuesta Gemini 3.8 Live frente a GPT-Live-1 Astra?
Sobre el costo por hora de audio de entrada calculado con el subconjunto Big Bench Audio, Gemini 3.8 Live cuesta 0.84 dólares y Extended Thinking, 3.50. GPT-Live-1 Astra cobra 5.83 dólares la hora, lo que deja el nivel barato de Google en torno a una séptima parte del precio.
¿Cuántos idiomas manejan los modelos?
Noventa y siete, con detección automática cuando el hablante cambia de idioma a mitad de la conversación. No hace falta reiniciar la sesión ni declarar el idioma de antemano para que el cambio se registre.






