Grok 4.7 mantiene su precio y duplica su nota en terminal: la factura sigue siendo el argumento

SpaceXAI lanzó un nuevo modelo frontera un mes después del anterior sin tocar la tarifa de 2 y 6 dólares, lo que convierte cada diferencia en los benchmarks en una cuestión de coste por punto

|4 min de lectura0
A GPU cluster in a data centre — the compute tier behind the extended reinforcement learning run SpaceXAI credits for Grok 4.7's gains
A GPU cluster in a data centre — the compute tier behind the extended reinforcement learning run SpaceXAI credits for Grok 4.7's gains

Los lanzamientos de modelos frontera suelen llegar con una subida de precio incorporada. Grok 4.7, que SpaceXAI puso en disponibilidad general el 21 de septiembre, no la trae. La entrada se mantiene en 2 dólares por millón de tokens y la salida en 6, la misma etiqueta que llevaba Grok 4.6 un mes antes, y es esa única decisión la que vuelve interesante el resto del boletín de notas.

Claves del lanzamiento (Key takeaways)

  • Grok 4.7 llega con la tarifa intacta de 2 y 6 dólares por millón de tokens: una quinta parte de lo que cuesta la entrada en Claude Fable 5.1 y una octava parte de su salida.
  • Su resultado en Terminal-Bench 4.0 pasa del 20,3% al 38,0% en una sola generación, el mayor salto del anuncio.
  • Todas las cifras proceden de SpaceXAI, y el benchmark que encabeza el anuncio lo mantiene Cursor, una empresa que SpaceX terminó de comprar el mes pasado.

Por qué el precio congelado pesa más que las victorias

Quien compra capacidad para agentes no adquiere puntos de benchmark, sino tokens que una tarea larga consume de forma impredecible. Con 2 y 6 dólares, Grok 4.7 queda por debajo de los 4 y 20 de GPT-5.6 Sol y muy lejos de los 10 y 50 de Fable 5.1. Un equipo que ya había presupuestado Grok 4.6 hereda la mejora sin coste adicional, algo poco habitual en un mercado donde cada salto de capacidad suele traer consigo una nueva tarifa.

Ese encuadre cambia la lectura de las derrotas. Allí donde Grok 4.7 se queda atrás, la pregunta deja de ser si el modelo va rezagado y pasa a ser si esa diferencia justifica multiplicar por cinco u ocho la factura de tokens.

Los siete benchmarks, en una sola tabla

SpaceXAI ejecutó Grok 4.7 con esfuerzo xHigh frente a Grok 4.6 en High, y a GPT-5.6 Sol y Fable 5.1 en Max.

BenchmarkGrok 4.7Grok 4.6GPT-5.6 SolFable 5.1
CursorBench 4.046,3%40,4%41,7%51,8%
DeepSWE v1.171,0%*65,2%72,7%70,0%
EEBench64,0%53,0%39,4%56,4%
AA Briefcase v1.11.6571.5461.4871.678
Terminal-Bench 4.038,0%20,3%37,3%57,9%
Harvey Legal Agent19,6%15,8%2,5%6,7%
HealthBench Professional56,7%48,5%60,5%62,1%

*Resultado con esfuerzo High.

Contadas sin matices, son cinco victorias sobre Sol y tres sobre Fable 5.1, con mejora respecto a Grok 4.6 en todas las filas. Las columnas de ingeniería eléctrica y de tareas jurídicas son lo bastante desiguales como para sugerir una cobertura de dominio que los rivales sencillamente no entrenaron. Terminal-Bench cuenta la historia opuesta: el 57,9% de Fable 5.1 saca casi veinte puntos de ventaja, y el trabajo en terminal de varias horas sigue siendo el terreno donde pagar más compra algo con claridad.

Qué cambió SpaceXAI para llegar hasta aquí

La compañía atribuye la mejora a un modelo base más grande y a una ronda ampliada de aprendizaje por refuerzo inclinada hacia tareas que se miden en horas y no en minutos. Según el anuncio, eso mejoró la autoverificación y el manejo de contextos largos, y el modelo se entrenó además para operar de forma nativa el entorno Grok Bot, un detalle relevante porque lo que suele decidir el comportamiento de un agente en tareas abiertas es la familiaridad con el entorno, no el razonamiento en bruto.

La seguridad recibió una reconstrucción paralela. SpaceXAI declara un 62,4% en el benchmark de bioseguridad de LatchBio y una tasa de paso del 3,3% para instrucciones de doble uso peligrosas en su propio HackerBench v0.3, y ha empezado a dar acceso a las capacidades de red team del modelo a socios de seguridad invitados.

Dos salvedades que conviene retener

La primera es la procedencia. CursorBench 4.0 abre el anuncio, y Cursor es ahora una filial de SpaceX tras la adquisición del mes pasado: un benchmark propiedad del propio fabricante en el primer puesto exige replicación independiente antes de que la cifra empiece a circular. La segunda es la selección: GPT-6 Astra, el modelo que OpenAI lanzó este mes por encima del precio de Sol, solo aparece en los gráficos secundarios, donde los 1.695 puntos Elo de Grok 4.7 superan los 1.542 de Astra pero quedan por debajo de los 1.735 de Anthropic.

Grok 4.7 ya funciona en Cursor y Grok Build, y es accesible mediante la API de Grok, entornos de terceros, enrutadores y plataformas cloud. Igual que con el lanzamiento de Grok 4.6, la prueba duradera no es la tabla del anuncio, sino lo que midan los evaluadores neutrales en las próximas semanas.

FAQ

¿Cuánto cuesta Grok 4.7?

Grok 4.7 cuesta 2 dólares por millón de tokens de entrada y 6 por millón de salida, sin cambios respecto a Grok 4.6. Existe una variante más rápida que duplica la velocidad de salida y también el precio.

¿Es Grok 4.7 mejor que Claude Fable 5.1?

Depende de la tarea. Grok 4.7 va por delante en DeepSWE v1.1, EEBench y el benchmark jurídico de Harvey; Fable 5.1 lidera en CursorBench 4.0, AA Briefcase, Terminal-Bench 4.0 y HealthBench Professional, aunque cuesta cinco veces más por token de entrada.

¿Están verificados de forma independiente los resultados de Grok 4.7?

No. Todas las puntuaciones publicadas proceden de las evaluaciones internas de SpaceXAI, y CursorBench lo mantiene Cursor, empresa que SpaceX adquirió el mes pasado. Todavía no hay resultados de terceros.

¿Qué te parece este artículo?

SJ
Cargando...

Artículos relacionados

GPT-6 Astra se pone a trabajar: el modelo más caro de OpenAI lo apuesta todo al manejo del ordenador
LLM & Chatbots

GPT-6 Astra se pone a trabajar: el modelo más caro de OpenAI lo apuesta todo al manejo del ordenador

GPT-6 Astra llega a los clientes empresariales con manejo del ordenador, un contexto de un millón de tokens y precios de 10 y 50 dólares, con una salvedad sobre su puntuación estrella.

Seung Junghace 12 días
Mercury 2.5 llega a 1.107 tokens por segundo y cuatro centavos el millón
LLM & Chatbots

Mercury 2.5 llega a 1.107 tokens por segundo y cuatro centavos el millón

Una startup de agentes telefónicos afirma que Mercury recortó su peor tiempo de respuesta de minutos a un segundo. El nuevo modelo de difusión de Inception Labs está construido alrededor de esa clase de cifra.

Seung Junghace 8 días
El nombre no cambia, los pesos sí: qué garantiza realmente el nombre de un modelo
LLM & Chatbots

El nombre no cambia, los pesos sí: qué garantiza realmente el nombre de un modelo

Un identificador de endpoint fijado empezará a servir otros pesos sin posibilidad de rechazarlo, y los ingenieros sostienen que eso rompe el contrato de gestión de cambios del que dependen.

Seung Junghace 12 días
ChatGPT Images 2.5 reduce a la mitad la latencia y suma un lienzo de dibujo
LLM & Chatbots

ChatGPT Images 2.5 reduce a la mitad la latencia y suma un lienzo de dibujo

OpenAI lanzó ChatGPT Images 2.5 con hasta un 50% menos de latencia, un lienzo de dibujo Sketch, plantillas, comentarios anclados y dos modelos nuevos en la API.

Seung Junghace 11 días
ChatGPT elige un favorito en el 79% de sus respuestas de compra; Gemini, en el 7%
LLM & Chatbots

ChatGPT elige un favorito en el 79% de sus respuestas de compra; Gemini, en el 7%

Una auditoría de 1,536 respuestas de compra con IA halló que ChatGPT expresa una preferencia en primera persona el 79% de las veces y Gemini solo el 7%.

Seung Junghace 5 días
Gemini llega a Windows con un atajo Alt+Space y una apuesta por el escritorio
LLM & Chatbots

Gemini llega a Windows con un atajo Alt+Space y una apuesta por el escritorio

La app nativa de Gemini para Windows se abre sobre cualquier programa con Alt+Espacio, se conecta a Gmail y Drive y está disponible en todo el mundo en Windows 10 y 11.

Seung Junghace 11 días