Fireworks AI lanzó Ember-1, un modelo de razonamiento construido sobre Kimi K3, de Moonshot AI, que según la compañía alcanza la calidad del modelo base emitiendo alrededor de un 40% menos de tokens. El modelo entró en funcionamiento el 24 de septiembre como versión preliminar de investigación en la plataforma sin servidor de Fireworks, y su tarifario publicado es idéntico al de K3: 3 dólares por millón de tokens de entrada sin caché, 0,30 dólares por millón en caché y 15 dólares por millón de salida. El precio por token no cambió en nada; la factura baja solo porque lleva menos tokens.
Claves del lanzamiento
- Ember-1 se ofrece a 3 dólares por millón de tokens de entrada y 15 por millón de salida, la misma tarifa pública que el modelo base Kimi K3 con el que fue entrenado, y con una ventana de contexto de 1.048.576 tokens.
- En siete pruebas públicas y en el tráfico en producción de dos clientes, Fireworks informa que acortó el razonamiento de K3 entre un 35% y un 50% sin perder precisión.
- En pruebas A/B en vivo sobre cargas de programación de dos clientes, Ember-1 usó cerca de un 35% menos de tokens por tarea con calidad comparable, y uno de los dos ya lo pasó a producción.
Por qué las trazas de razonamiento se volvieron la parte cara
Los modelos de razonamiento como K3 destinan la mayoría de los tokens que generan —a veces más del 90%— a la deliberación interna y no a la respuesta que lee el usuario.
Los bucles con agentes convierten ese costo en interés compuesto. Como cada turno reinyecta la transcripción previa completa, una traza escrita en el primer turno se vuelve a pagar en todos los turnos siguientes, y la ventana de contexto que describe Fireworks crece de forma aproximadamente cuadrática con la cantidad de turnos.
El atajo evidente no resiste. Bajar la perilla del esfuerzo de razonamiento de K3 recortaba tokens pero entregaba demasiada precisión, según el anuncio de la compañía, de modo que Fireworks decidió entrenar la economía en el modelo en vez de configurarla.
Cómo Fireworks entrenó un razonamiento más corto
Llegar hasta ahí exigió más de 50 experimentos de entrenamiento y más de 200 evaluaciones en el producto de entrenamiento sin servidor de la empresa, además de nuevos algoritmos para comprimir la salida de cadena de pensamiento sin perder precisión. Fireworks afirma que usó datos propios y no datos de clientes.
El equipo preservó a propósito una clase de razonamiento: la autorreflexión. Revisar una suposición o rastrear un resultado hasta una decisión anterior ayuda al modelo a recuperarse de sus propios errores, así que el objetivo fue conservar eso y recortar los bucles improductivos. La mezcla de entrenamiento se mantuvo amplia —de matemáticas y programación a búsqueda, uso de herramientas e ingeniería de software—, una cobertura frente al fallo más previsible: un modelo escueto solo en problemas con forma de benchmark.
En siete pruebas públicas y en el tráfico en producción de dos clientes, Fireworks informa que el razonamiento de K3 pudo acortarse entre un 35% y un 50% sin sacrificar precisión. El comportamiento entrenado también muestra contención en los intentos fallidos y corta justamente los bucles prolongados que generan las facturas más altas.
Qué muestran las pruebas y los test A/B
Fireworks evaluó Ember-1 con su Specialized Intelligence Index, presentado días antes, que incluye el Bedside Bench de Doximity: 500 casos clínicos validados por médicos en 10 categorías de especialidad. En costo por tarea allí, la compañía sostiene que Ember-1 fijó una nueva frontera de Pareto frente a modelos abiertos y cerrados por igual, incluidos GPT-5.6 Sol, GPT-6 Astra y Claude Opus 5.
La comparación que importa es contra K3 mismo en tres niveles de esfuerzo de razonamiento. En cada prueba con más de 50 muestras, Fireworks ubica a Ember-1 sobre la frontera de costo y calidad o muy cerca de ella, que es otra forma de decir que la manera más barata de usar K3 ya no consiste en pedirle que piense menos.
La evidencia en producción es más acotada pero más concreta. En pruebas A/B en vivo sobre cargas de programación de dos clientes, Ember-1 usó alrededor de un 35% menos de tokens por tarea con calidad comparable, y la finalización de tareas, los puntajes de éxito y las tasas de fallo se mantuvieron o mejoraron. Uno de los dos ya lo pasó a producción y planea retirar el modelo base. Puertas adentro, Fireworks cuenta que sus propios desarrolladores no notaron el cambio.
Perspectiva
Los reparos son estructurales antes que técnicos. Ember-1 llega como una versión preliminar de investigación de dos semanas que se vuelve permanente solo si la comunidad lo pide, y lo sirve un único proveedor en OpenRouter. Como el ahorro depende del volumen, se reduce en cargas donde el razonamiento ya representa una porción pequeña de la salida.
K3, mientras tanto, se convirtió en una base que terceros reentrenan y revenden, un giro que ya se aprecia en la trayectoria de ingresos de Moonshot AI. Fireworks está abriendo el entrenamiento sobre Ember-1 para que las empresas puedan especializarlo todavía más.
FAQ — Preguntas frecuentes
¿Ember-1 es más barato por token que Kimi K3?
No. El precio publicado de Ember-1 coincide con el de K3: 3 dólares por millón de tokens de entrada sin caché, 0,30 por millón de entrada en caché y 15 por millón de salida. La reducción de costo proviene por completo de generar menos tokens de razonamiento para la misma tarea, no de una tarifa más baja.
¿Ember-1 es de código abierto?
Fireworks no liberó los pesos de Ember-1. Se ofrece como opción alojada junto al modelo base Kimi K3 en la plataforma sin servidor de Fireworks y a través de OpenRouter, en principio como versión preliminar de investigación.
¿Cuánto de la cifra del 40% está verificado de forma independiente?
Los números de reducción de tokens provienen de las corridas de benchmark de Fireworks y de pruebas A/B sobre el tráfico en producción de dos clientes cuyos nombres no se revelaron. Ningún tercero publicó una réplica independiente, así que el rango de 35% a 50% debe leerse como dato aportado por el proveedor.






