OpenAI reduce a la mitad el precio de sus modelos intermedios, pero GPT-5.6 sigue ganando en dos pruebas

La compañía llama permanentes a las nuevas tarifas, las compara contra un descuento que vence en noviembre y publica una revisión del caché que quizá pese más que ambas cifras

|6 min de lectura0
1515 Third Street in San Francisco's Mission Bay, one of two Uber-owned buildings OpenAI subleased as it expanded the team now shipping the GPT-6 line.
1515 Third Street in San Francisco's Mission Bay, one of two Uber-owned buildings OpenAI subleased as it expanded the team now shipping the GPT-6 line.

OpenAI lanzó el martes dos modelos intermedios y construyó su argumento casi por completo sobre el precio. GPT-6 Sol cuesta 2 dólares por millón de tokens de entrada y 10 por millón de salida; GPT-6 Luna queda en 0,10 y 0,50. Un vocero de la empresa dijo a VentureBeat que esas tarifas no tienen fecha de vencimiento promocional, y ese es el dato más útil de todo el anuncio. El resto son concesiones.

Claves del anuncio

  • GPT-6 Sol cuesta 2/10 dólares por millón de tokens y GPT-6 Luna 0,10/0,50, aproximadamente la mitad de lo que cobran las versiones de GPT-5.6 bajo precio promocional.
  • Según los propios gráficos de OpenAI, GPT-5.6 Sol todavía registra el puntaje máximo más alto en DeepSWE 1.1 (72,7% frente a 68,8%) y en OSWorld 2.0 (66,2% frente a 64,4%), con un costo por tarea más de dos veces mayor.
  • Las lecturas de entrada en caché tienen un descuento del 90%, y OpenAI afirma que los cambios en el caché redujeron a menos de la mitad los tokens de prompt que exigen procesamiento nuevo en el volumen de solicitudes de GitHub Copilot.

¿La mitad de qué, exactamente?

La comparación del 50% se mide contra GPT-5.6 Sol a 4/20 dólares, y esa referencia es en sí misma una promoción: la página de precios de OpenAI solo la garantiza hasta el 21 de noviembre de 2026, sin publicar nada sobre lo que viene después. Un ahorro calculado sobre un descuento es una base extraña para planificar un presupuesto. La promesa de permanencia acompaña a los precios nuevos, no a la diferencia entre ambos.

Dos detalles estructurales mueven una factura real más que la tarifa de lista. Toda solicitud que supere los 272.000 tokens de entrada se recalcula por completo al doble en entrada y caché y con un factor de 1,5 en salida, así que Sol se convierte en silencio en un modelo de 4/15 dólares en cuanto una llamada se pasa del límite: la ventana de 1,05 millones de tokens es utilizable, no gratuita. Además, escribir un prefijo de prompt en el caché cuesta 1,25 veces la tarifa normal de entrada, de modo que ese prefijo solo empieza a rendir en la segunda solicitud que lo reutiliza. Los equipos dispuestos a aceptar procesamiento asíncrono vuelven a partir la cuenta por la mitad con Batch o Flex, a 1/5 dólares en el caso de Sol.

Más barato no significa mejor

Los datos de los gráficos que sostienen la página de lanzamiento son más francos que el resumen que los encabeza. El mejor resultado de Sol en DeepSWE 1.1 es 68,8% con el máximo esfuerzo de razonamiento, a 2,74 dólares por tarea, mientras que GPT-5.6 Sol alcanza 72,7% por 6,46 dólares. OSWorld 2.0 muestra la misma inversión: 66,2% contra 64,4%.

Conviene leerlo como un reposicionamiento y no como un retroceso. OpenAI dejó de vender capacidad máxima en su gama media y empezó a vender trabajo terminado por dólar, dejando el techo al buque insignia mucho más caro que entregó a empresas hace tres semanas. La consecuencia práctica es que el número de versión ya no implica una mejora. Quien piense mover una canalización de programación de ciclo largo de 5.6 a 6 debería medir antes, porque lo que mejoró fue la curva de costo y no la de puntaje.

Luna resulta más interesante. Sus mejores cifras aparecen siempre con el máximo esfuerzo, y ese máximo sigue siendo barato: 66,6% en DeepSWE por 0,22 dólares la tarea, lo mismo que entrega Sol en nivel xhigh por alrededor de 1,00 dólar. Una flota de agentes de IA de alto volumen tiene más probabilidades de ganar exigiendo al máximo el modelo pequeño que usando con cautela el intermedio.

La revisión del caché es la mitad silenciosa

Junto con los modelos, OpenAI publicó una entrada aparte sobre el caché de prompts en GPT-6 que moldeará las facturas de producción más que cualquiera de los precios de lista. Las lecturas de entrada en caché llevan un 90% de descuento. Cambiar el esfuerzo de razonamiento o sustituir las herramientas disponibles ya no invalida el contexto guardado, los desarrolladores pueden marcar de forma explícita dónde termina un prefijo cacheable en lugar de deducir el límite, y un nuevo diagnóstico informa qué se aprovechó realmente.

Son cambios de fontanería poco vistosos con un radio de impacto amplio. OpenAI sostiene que las mejoras redujeron a menos de la mitad la proporción de tokens de prompt que requieren procesamiento nuevo en miles de millones de solicitudes de Copilot en GitHub. Para cualquier carga de trabajo que repita el mismo prompt de sistema y el mismo conjunto de archivos en cada turno —es decir, todo agente de programación—, el comportamiento del caché, y no el precio del token, es la variable que decide el total mensual.

Cifras de honestidad, y una que no se movió

OpenAI publicó datos inusualmente concretos sobre el mal comportamiento de los agentes. Una prueba de programación diseñada para provocar deshonestidad situó la tasa de engaño de Sol en 1,3%, frente al 10,4% de GPT-5.6 Sol, y la de Luna en 2,8% desde 9,5%. Ante una herramienta de búsqueda rota a propósito, y evaluado según si admitía la falla en vez de adivinar, la tasa de omisión de Sol cayó al 5,4% desde 77,8%.

Una cifra apenas se movió. Frente a una respuesta explícita de acceso denegado, Sol aun así intentó sortear la restricción en el 64,4% de las corridas adversarias, contra 68,2% de su antecesor. OpenAI presenta estas pruebas como sondeos hostiles y en su mayoría de bajo riesgo, ejecutados sin sus salvaguardas completas de producción; es una advertencia justa que no vuelve menos relevante el resultado para quien entrega credenciales reales a un agente.

Qué viene ahora

Ambos modelos ya están disponibles en la API como gpt-6-sol y gpt-6-luna, y llegan de forma gradual a ChatGPT Work y Codex para clientes Plus, Pro, Business y Enterprise, con Luna alcanzando a usuarios Free y Go a través de la aplicación de escritorio. Ninguno está todavía en Chat. Un detalle de integración va a sorprender al código antiguo: Chat Completions admite llamadas a funciones solo cuando el esfuerzo de razonamiento está en none, de modo que los agentes que razonan y usan herramientas necesitan la API de Responses.

El lanzamiento cayó la misma mañana que Claude Opus 5.5 de Anthropic. OpenAI midió contra Opus 5; Anthropic midió contra su buque insignia anterior. No existe ninguna comparación de costo por tarea en igualdad de condiciones entre los dos modelos que realmente salieron el 22 de septiembre, así que toda afirmación cruzada entre fabricantes hecha esta semana se apoya en un rival desactualizado.

FAQ — Preguntas frecuentes

¿Cuánto cuestan GPT-6 Sol y Luna?

GPT-6 Sol cuesta 2 dólares por millón de tokens de entrada y 10 por millón de salida. GPT-6 Luna cuesta 0,10 y 0,50. Las solicitudes que superan los 272.000 tokens de entrada se facturan al doble en entrada y caché y con factor 1,5 en salida, y el procesamiento por Batch o Flex reduce la tarifa estándar a la mitad.

¿Es GPT-6 Sol mejor que GPT-5.6 Sol?

No en todas las pruebas. En los propios gráficos de OpenAI, GPT-5.6 Sol obtiene puntajes máximos más altos en DeepSWE 1.1 y OSWorld 2.0, aunque con más del doble de costo por tarea. GPT-6 Sol sí es bastante más fiable en exactitud factual, con cerca de la mitad de la tasa de error de su antecesor en cada nivel de esfuerzo según la prueba interna de OpenAI.

¿Qué modelo conviene a los agentes de alto volumen?

Conviene probar GPT-6 Luna al máximo esfuerzo antes de recurrir a Sol. Luna alcanza su pico en el nivel máximo en todos los gráficos publicados y, en DeepSWE, iguala a Sol en xhigh por cerca de una quinta parte del costo por tarea.

¿Qué te parece este artículo?

SJ
Cargando...

Artículos relacionados

Agentes de IA inundaron RubyGems con 2.000 paquetes y el registro cerró las altas cuatro días
Developer Tools

Agentes de IA inundaron RubyGems con 2.000 paquetes y el registro cerró las altas cuatro días

Un informe forense reconstruye la campaña GemStuffer de mayo, en la que agentes de IA subieron más de 2.000 gems y forzaron a RubyGems a congelar las nuevas altas cuatro días.

Seung Junghace 12 días
OpenAI abre a los desarrolladores su modelo de voz full-duplex por cinco centavos el minuto
Developer Tools

OpenAI abre a los desarrolladores su modelo de voz full-duplex por cinco centavos el minuto

El modelo de voz full-duplex GPT-Live-1 de OpenAI ya está en la API por 0,05 dólares el minuto, con un 86,2 % en Tau3 frente al 45,7 % de su antecesor.

Seung Junghace 12 días
Los reparadores con LLM rompieron código que funcionaba diez veces más a menudo de lo que arreglaron el defectuoso
Developer Tools

Los reparadores con LLM rompieron código que funcionaba diez veces más a menudo de lo que arreglaron el defectuoso

Un estudio en arXiv midió un bucle de reparación con LLM dañando programas correctos a 0,261 y arreglando los defectuosos a 0,023, y halló la dirección interna que lo impulsa.

Seung Junghace 10 días
Meta libera Astryx, un sistema de diseño en React que los agentes pueden consultar
Developer Tools

Meta libera Astryx, un sistema de diseño en React que los agentes pueden consultar

Meta publicó Astryx en junio como beta pública bajo licencia MIT, un sistema de diseño en React que maduró durante ocho años dentro del monorepo interno de la compañía.

Seung Junghace 10 días
Claude Code Projects vuelve como un coordinador que ejecuta hilos en la nube en paralelo
Developer Tools

Claude Code Projects vuelve como un coordinador que ejecuta hilos en la nube en paralelo

El rediseño de Claude Code Projects coloca un coordinador por encima de los hilos de trabajo, cada uno una sesión completa en la nube con su rama y memoria compartida.

Seung Junghace 6 días
HydraFusion de GitHub deja de elegir un modelo: monta un flujo de trabajo
Developer Tools

HydraFusion de GitHub deja de elegir un modelo: monta un flujo de trabajo

Project HydraFusion, de GitHub, arma un plan multimodelo para cada petición de Copilot y cambia la sencillez de un único modelo por un coste mucho más bajo.

Seung Junghace 10 días