Los modelos de pesos abiertos ya mueven la mayoría del tráfico de Vercel, y casi no tocan la factura

El índice de producción del AI Gateway de septiembre muestra una mayoría del 56% del volumen que equivale al 14% del gasto, mientras Anthropic retiene 64 centavos de cada dólar

|6 min de lectura0
Open-weight models crossed a majority of production inference traffic on Vercel's AI Gateway for the first time in August 2026.
Open-weight models crossed a majority of production inference traffic on Vercel's AI Gateway for the first time in August 2026.

Dos cifras del índice de producción del AI Gateway de septiembre de Vercel solo cobran sentido juntas. En agosto, los modelos de pesos abiertos procesaron el 56% de cada token enrutado por la pasarela, el primer mes en que alcanzaron la mayoría. Representaron el 14% de lo que pagaron los equipos.

Esa brecha resume el estado actual de la inferencia empresarial. El volumen migró hacia modelos que los equipos pueden ejecutar barato; el dinero no lo siguió. Hace nueve meses, los pesos abiertos manejaban menos de uno de cada diez tokens. Han ganado participación cada mes desde abril, subiendo del 13% al 56%, y los laboratorios de frontera casi no han perdido ingresos.

Claves del informe

  • Los modelos de pesos abiertos movieron el 56% de los tokens de la pasarela en agosto, pero solo atrajeron el 14% del gasto, tras haber representado el 7% del volumen en diciembre de 2025.
  • El precio promedio por token cayó 23,2% en agosto, tercera baja mensual consecutiva, y el equipo mediano de alto volumen pagó 7,6% menos.
  • Anthropic conservó 64 centavos de cada dólar gastado en la pasarela, incluso después de que su modelo insignia Fable 5 cediera dos tercios de su participación en el gasto al más económico Opus 5.

Qué compran realmente los tokens más baratos

El desplome de precios es la señal más nítida del informe. El costo promedio por token bajó 23,2% durante agosto: la tercera caída mensual seguida y la más pronunciada desde abril. Entre los equipos que procesaron más de diez millones de tokens tanto en julio como en agosto, el mediano pagó 7,6% menos por token, frente a una baja de 2,9% el mes anterior. El propio ritmo de la caída se está acelerando.

La lectura de Vercel es que la capacidad por fin alcanzó a la gama económica, de modo que el trabajo rutinario de producción ya no justifica precios de frontera. Los equipos obtienen más inferencia con un presupuesto fijo y reservan el nivel caro para las tareas que lo devuelven. Es un cambio estructural en cómo se asignan los presupuestos, no un descuento pasajero.

Por qué perder su modelo insignia no le costó nada a Anthropic

Fable es el modelo más capaz que vende Anthropic; Opus se ubica un escalón por debajo, a aproximadamente la mitad de precio. Cuando se levantó el control de exportación estadounidense sobre Fable 5 y el acceso se reanudó el 1 de julio, su participación en el gasto de la pasarela saltó al 13,2%. Opus 5 llegó a fines de ese mismo mes y, para agosto, Fable 5 había bajado a 4,9% mientras Opus 5 trepaba a 22,5%.

Nueve de cada diez equipos que usaban Fable recortaron su consumo, y más de ellos aterrizaron en Opus 5 que en cualquier otra opción. El veredicto fue sobre valor, no sobre calidad: el doble de precio no compró un resultado proporcional en las cargas que estos equipos ejecutaban. Lo decisivo es que el tráfico bajó un escalón en lugar de cruzar a un competidor. Anthropic se ha quedado con al menos 61 centavos de cada dólar de la pasarela todos los meses desde diciembre, 64 en agosto, y ha mantenido los dos primeros puestos por gasto durante todo ese tramo aunque cambiaran los modelos que los ocupaban.

Gemini 3 Flash de Google perdió el 95% de su volumen

El contraejemplo es severo. Gemini 3 Flash ha perdido el 95% de su participación en los tokens de la pasarela desde mayo, y más de tres cuartas partes de ese volumen se fue directamente a otros laboratorios: los sucesores Flash de tamaño completo del propio Google recuperaron menos de una décima parte.

Hacia dónde fue resulta revelador. Cerca de la mitad se movió a opciones más baratas, encabezadas por GPT-5.6 Luna a menos de la mitad del precio por token. La mayor parte del resto tomó el camino inverso, hacia Claude Opus 5 y Sonnet 5, a unas nueve y tres veces el precio de Gemini 3 Flash. Los equipos no perseguían un punto de precio, sino un ajuste, y estaban dispuestos a moverse en cualquier dirección para encontrarlo. La participación global de Google en el volumen de tokens de la pasarela cayó de 30% a 5% en el período, y Gemini 3 Flash por sí solo explica 22 de los 25 puntos perdidos.

El mismo patrón aparece en la subida. A los cinco días de que Z.ai lanzara GLM-5.3-Flash, el modelo ya movía el triple del volumen diario de GLM-5.2, y al 31 de agosto concentraba dos tercios de los tokens de Z.ai. Lo que retiene el tráfico es la continuidad del perfil del modelo, no la lealtad a la marca; una dinámica visible también en la rapidez con que las capas de enrutamiento se reorganizaron en torno a los lanzamientos chinos de pesos abiertos.

Astra superó dos a uno a Fable 5.1 en la cima

La sección especial del informe cubre el segmento premium, donde dos modelos insignia se lanzaron con dos días de diferencia en la misma franja de precio. Anthropic publicó Fable 5.1 el 1 de septiembre; OpenAI puso GPT-6 Astra en la pasarela el 3 de septiembre a dos veces y media el precio de GPT-5.6 Sol.

Astra se llevó uno de cada tres dólares gastados en modelos de OpenAI en apenas dos días, y su participación se ha mantenido entre 28% y 39% desde entonces. Medido sobre los primeros doce días de cada modelo, Astra captó el 7,7% de todo el gasto de la pasarela frente al 3,7% de Fable 5.1, y lo usaron el doble de equipos. Dentro de la propia línea de OpenAI el reparto es tajante: Astra y Sol manejaron el 27% de los tokens pero el 71% del gasto entre el 4 y el 16 de septiembre, mientras Luna y Nano movieron más del doble de tokens por cerca de un noveno del costo.

En el resto de los datos, Nano Banana de Google lideró por primera vez el gasto en imagen con 50% frente al 44% de GPT Image, aunque GPT Image generó más imágenes, 46% contra 39%. Veo subió al segundo lugar en gasto de video con 20%, desde 15% en julio, detrás de Seedance. La proporción de videos generados por Grok Imagine de xAI se ha reducido a menos de la mitad desde junio, cayendo de 42% a 31% y luego a 19%.

Cuánto pesan estas cifras

Se trata de agregados anonimizados del tráfico que enruta Vercel, no de un censo de la industria, y las salvedades importan. El gasto se estima a partir de los precios de lista publicados por los laboratorios, así que las tarifas empresariales negociadas quedan invisibles. El conteo de tokens incluye tokens de razonamiento y de entrada en caché. La clasificación de pesos abiertos es más amplia que en ediciones previas, lo que infla las comparaciones con las cifras más antiguas. Los meses anteriores se revisan cuando cambia la metodología.

Aun descontando todo eso, la dirección se sostiene. Si los pesos abiertos cargan la mayoría del volumen de producción mientras los modelos de frontera retienen la mayoría de los ingresos, los dos mercados se separaron: uno compite en precio por el trabajo rutinario y el otro en capacidad por la minoría de tareas que lo justifican. El índice del próximo mes mostrará si la ventaja inicial de Astra sobre Fable 5.1 fue un efecto de lanzamiento o una posición duradera.

FAQ — Preguntas frecuentes

¿Qué es el índice de producción del AI Gateway?

Es un informe mensual de Vercel basado en tráfico anonimizado y agregado que pasa por su AI Gateway, ubicado entre las aplicaciones en producción y los laboratorios de IA. La edición de septiembre de 2026 cubre datos recogidos hasta agosto de 2026, con el informe especial sobre GPT-6 Astra extendido hasta mediados de septiembre.

¿Los modelos de pesos abiertos dominan hoy el gasto en IA?

No. Movieron el 56% de los tokens de la pasarela en agosto, pero representaron apenas el 14% del gasto. Los modelos de frontera de pesos cerrados siguen llevándose la mayor parte del dinero porque cuestan mucho más por token y atienden las cargas por las que los equipos están dispuestos a pagar una prima.

¿Por qué Anthropic conservó su participación en ingresos tras la caída de Fable 5?

Porque las cargas bajaron un escalón en lugar de irse a otro laboratorio. Fable 5 pasó de 13,2% a 4,9% del gasto de la pasarela en agosto, mientras Opus 5, a aproximadamente la mitad de precio, subió a 22,5%. Anthropic cerró el mes con el 64% de todo el gasto de la pasarela.

¿Qué te parece este artículo?

SJ
Cargando...

Artículos relacionados

Huang defiende el 70 % de crecimiento de Nvidia: "Ponemos un dólar y vuelven cien"
Tech & Business

Huang defiende el 70 % de crecimiento de Nvidia: "Ponemos un dólar y vuelven cien"

Huang ratificó la guía del 70 % de Nvidia, que implica 680.000 millones en ingresos, y respondió a las críticas de circularidad: un dólar entra, cien vuelven.

Seung Junghace 7 días
NVIDIA convierte los tokens por megavatio en la métrica, y Lambda le pone cifra
Tech & Business

NVIDIA convierte los tokens por megavatio en la métrica, y Lambda le pone cifra

En el AI Infra Summit, NVIDIA replanteó la infraestructura de IA en torno a los tokens por megavatio, con el 24% más de rendimiento de Lambda como respaldo.

Seung Junganteayer
Temporal levanta 550 millones mientras los agentes de IA empiezan a ejecutarse durante semanas
Tech & Business

Temporal levanta 550 millones mientras los agentes de IA empiezan a ejecutarse durante semanas

Temporal Technologies levantó una Serie E de 550 millones de dólares con una valoración de 12.550 millones, coliderada por Lightspeed.

Seung Junghace 3 días
Universal Music firma con ElevenLabs su primer acuerdo con un gran sello para una plataforma de remezclas con licencia
Tech & Business

Universal Music firma con ElevenLabs su primer acuerdo con un gran sello para una plataforma de remezclas con licencia

UMG y ElevenLabs construirán una plataforma de consumo para remezclas y mezclas combinadas a partir de catálogo con licencia, el primer acuerdo de la empresa de audio con un gran sello.

Seung Junghace 6 días
La Corte Suprema de Nuevo México multa con 5.000 dólares a un abogado por los testigos falsos de ChatGPT
Tech & Business

La Corte Suprema de Nuevo México multa con 5.000 dólares a un abogado por los testigos falsos de ChatGPT

La Corte Suprema de Nuevo México multó con 5.000 dólares al abogado Stephen Aarons y lo declaró en desacato después de que ChatGPT inventara testigos y testimonio policial en una apelación.

Seung Junghace 6 días
Moonshot AI apunta a 2.000 millones de dólares tras triplicar ingresos con Kimi K3
Tech & Business

Moonshot AI apunta a 2.000 millones de dólares tras triplicar ingresos con Kimi K3

Moonshot AI dijo a sus inversores que apunta a 2.000 millones de dólares de ingresos anualizados a cierre de año, después de que Kimi K3 llevara su ritmo por encima de los 1.000 millones en agosto.

Seung Junghace 6 días