Los nuevos modelos de voz de Google hablan mientras piensan, y cuestan menos

Gemini 3.8 Live elimina los silencios de los agentes de voz y cobra menos que los modelos a los que supera

|4 min de lectura0
Google's voice assistant running on a Pixel handset, the consumer surface where Gemini 3.8 Live's speech-to-speech models now land
Google's voice assistant running on a Pixel handset, the consumer surface where Gemini 3.8 Live's speech-to-speech models now land

Lo que delata a una máquina es la pausa. Si se le pide a un agente de voz que consulte un dato, se queda callado, porque el modelo no puede hablar y llamar a una herramienta al mismo tiempo. Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, que Google DeepMind lanzó el 15 de septiembre, están diseñados para eliminar ese silencio.

Claves

  • Ambos modelos ejecutan llamadas a herramientas en segundo plano mientras la conversación continúa, y detectan de forma automática los cambios entre 97 idiomas sin reiniciar la sesión.
  • Extended Thinking encabeza el índice de calidad Speech to Speech de Artificial Analysis con 82.6 puntos, frente a los 81.5 de GPT-Live-1 Astra y los 81.3 de Grok Voice Think Fast 2.0.
  • Una hora de audio de entrada cuesta 0.84 dólares en el modelo estándar y 3.50 dólares en Extended Thinking, contra los 5.83 dólares de Astra.

Qué aporta la ejecución en segundo plano

Extended Thinking razona y habla a la vez. En lugar del silencio, ofrece una señal verbal temprana -algo del estilo de "déjame consultarlo"- y va narrando una tarea de varios pasos a medida que la completa. El modelo pesado apunta a ese tipo de trabajo; el Gemini 3.8 Live estándar es el hermano barato y de alto volumen, afinado para el diálogo fluido y la comprensión visual.

El contexto visual funciona en tiempo real en ambos. El usuario puede enfocar la cámara hacia una pantalla y preguntar por lo que aparece, y el modelo incorpora esa información al intercambio en curso. La llamada a funciones ocurre en paralelo, y ahí está la diferencia entre un asistente y el menú telefónico al que todavía se parecen la mayoría de los agentes de IA.

Cómo se compara con Astra y Grok

Frente al GPT-Live-1 Astra de OpenAI, los márgenes son estrechos en calidad y amplios en tareas resueltas. Extended Thinking obtiene un 68.6% en la prueba de agentes tau-Voice, donde Astra llega al 67.9%. En la evaluación tau-Voice-banking de Sierra -que mide si el agente resuelve una solicitud de atención al cliente y no solo si suena competente- alcanza un 35.1% frente al 32.0% de Astra.

Las propuestas de xAI quedan más atrás. Grok Voice Think Fast 2.0 logra un 56.5% en tau-Voice y xAI-Realtime se queda en un 16.5% en la prueba bancaria. Google reporta un 97.7% para Extended Thinking en Big Bench Audio, mientras que el modelo estándar suma 76.0 puntos en el índice de voz y el segundo puesto en la Speech Agent Arena, una clasificación basada en preferencias y no en puntuaciones.

El precio es el argumento

Los despliegues de voz se facturan por hora, así que la tabla de tarifas pesa más que la de resultados. Según el repaso de las cifras de Artificial Analysis, Grok Voice Think Fast 2.0 cobra 4.80 dólares por hora de audio de entrada y Astra, 5.83. Ambos quedan por encima de los 3.50 dólares que pide Google por el modelo que los supera, y muy lejos de los 0.84 dólares del nivel estándar.

Ganar y a la vez cobrar menos es una jugada repetida. La compañía puso Gemini 3.7 Flash a la mitad del precio de su antecesor, y 3.8 Flash llegó apenas dos semanas antes de este lanzamiento, de modo que la línea de audio ya avanza al mismo ritmo que la de texto.

Quién puede usarlo

Los desarrolladores acceden a ambos modelos a través de la API de Gemini y Google AI Studio; las empresas reciben una vista previa privada en Gemini Enterprise. LiveKit, Pipecat, Agora, LangChain y Vercel ya exponen la Live API, y Salesforce, Genspark y Lumeris figuran como primeros clientes.

Los usuarios finales se encuentran con Extended Thinking dentro de Gemini Live, Search Live y las aplicaciones de Workspace -Docs, Gmail y Keep- en los planes de pago de Google AI. Cada segundo de audio generado lleva una marca de agua SynthID, el identificador de procedencia de audio de Google.

Lo que nada de esto resuelve es si los modelos aguantan fuera del guion. Las evaluaciones siguen un plan; una cola de soporte, no. El peor escenario para Google DeepMind es un agente que narra con aplomo una tarea que nunca completó. La ventaja de precio compra margen para averiguarlo en producción.

Preguntas frecuentes

¿Pueden los desarrolladores usar Gemini 3.8 Live desde hoy?

Sí. Gemini 3.8 Live y 3.8 Live Extended Thinking quedaron disponibles el 15 de septiembre de 2026 a través de la API de Gemini y Google AI Studio. El acceso empresarial es una vista previa privada en Gemini Enterprise, y Gemini Enterprise for Customer Experience figura como próximamente.

¿Cuánto cuesta Gemini 3.8 Live frente a GPT-Live-1 Astra?

Sobre el costo por hora de audio de entrada calculado con el subconjunto Big Bench Audio, Gemini 3.8 Live cuesta 0.84 dólares y Extended Thinking, 3.50. GPT-Live-1 Astra cobra 5.83 dólares la hora, lo que deja el nivel barato de Google en torno a una séptima parte del precio.

¿Cuántos idiomas manejan los modelos?

Noventa y siete, con detección automática cuando el hablante cambia de idioma a mitad de la conversación. No hace falta reiniciar la sesión ni declarar el idioma de antemano para que el cambio se registre.

¿Qué te parece este artículo?

SJ
Cargando...

Artículos relacionados

Una prueba de presión de 25 turnos revela que los LLM ceden aunque su razonamiento resista
AI & Machine Learning

Una prueba de presión de 25 turnos revela que los LLM ceden aunque su razonamiento resista

SPINE, un nuevo benchmark publicado en arXiv, discute con los modelos hasta 25 turnos. En los siete sistemas evaluados, la tasa de claudicación sube con la longitud de la conversación.

Seung Junghace 4 días
Una IA descifró una clave de 373 años. Luego alguien revisó el microfilm
AI & Machine Learning

Una IA descifró una clave de 373 años. Luego alguien revisó el microfilm

Vals AI reportó que Claude Fable 5.1 resolvió en 44 minutos un criptograma de 373 años. Una réplica independiente sostiene que solo coinciden 8 de 64 letras.

Seung Junghace 4 días
Cien agentes de DeepMind se dividieron entre tramposos y denunciantes
AI & Machine Learning

Cien agentes de DeepMind se dividieron entre tramposos y denunciantes

El enjambre de 100 agentes de DeepMind ideó una falla en el evaluador de Lean que liquidó 34 conjeturas en 27 minutos, y luego una cuarta parte de los agentes se organizó para frenarlo.

Seung Junghace 3 días
El enjambre de agentes de Google alcanza el 71% en demostraciones matemáticas de nivel de investigación
AI & Machine Learning

El enjambre de agentes de Google alcanza el 71% en demostraciones matemáticas de nivel de investigación

El sistema Stellar Colosseum de Google obtiene un 71.0% en demostración de teoremas de nivel de investigación y resuelve 218 de 222 problemas de Codeforces ejecutando estrategias en paralelo.

Seung Junghace 3 días
DeepMind precomputó 9.000 millones de variantes de ADN en un atlas de un petabyte
AI & Machine Learning

DeepMind precomputó 9.000 millones de variantes de ADN en un atlas de un petabyte

El cuello de botella para leer el genoma humano nunca fue secuenciarlo, sino averiguar cuáles de los cerca de 9.000 millones de cambios de una sola letra hacen algo.

Seung Junghace 4 días
Astra triplicó el beneficio de Claude en Vending-Bench y se negó a coludir
AI & Machine Learning

Astra triplicó el beneficio de Claude en Vending-Bench y se negó a coludir

Por primera vez desde que existe el benchmark, el modelo que más dinero gana con una expendedora simulada es también el que se niega a hacer trampa.

Seung Junghace 4 días