Ember-1 cuesta lo mismo por token que Kimi K3 y consume un 40% menos

Fireworks Research sostiene que entrenar al modelo para acortar sus trazas de razonamiento —en lugar de bajar la perilla del esfuerzo de razonamiento— es lo que preservó la precisión en siete pruebas y en el tráfico de programación en producción de dos clientes.

|5 min de lectura0
Server racks in a computer room installation — Ember-1 targets the inference bill that long reasoning traces run up in multi-turn agentic workloads.
Server racks in a computer room installation — Ember-1 targets the inference bill that long reasoning traces run up in multi-turn agentic workloads.

Fireworks AI lanzó Ember-1, un modelo de razonamiento construido sobre Kimi K3, de Moonshot AI, que según la compañía alcanza la calidad del modelo base emitiendo alrededor de un 40% menos de tokens. El modelo entró en funcionamiento el 24 de septiembre como versión preliminar de investigación en la plataforma sin servidor de Fireworks, y su tarifario publicado es idéntico al de K3: 3 dólares por millón de tokens de entrada sin caché, 0,30 dólares por millón en caché y 15 dólares por millón de salida. El precio por token no cambió en nada; la factura baja solo porque lleva menos tokens.

Claves del lanzamiento

  • Ember-1 se ofrece a 3 dólares por millón de tokens de entrada y 15 por millón de salida, la misma tarifa pública que el modelo base Kimi K3 con el que fue entrenado, y con una ventana de contexto de 1.048.576 tokens.
  • En siete pruebas públicas y en el tráfico en producción de dos clientes, Fireworks informa que acortó el razonamiento de K3 entre un 35% y un 50% sin perder precisión.
  • En pruebas A/B en vivo sobre cargas de programación de dos clientes, Ember-1 usó cerca de un 35% menos de tokens por tarea con calidad comparable, y uno de los dos ya lo pasó a producción.

Por qué las trazas de razonamiento se volvieron la parte cara

Los modelos de razonamiento como K3 destinan la mayoría de los tokens que generan —a veces más del 90%— a la deliberación interna y no a la respuesta que lee el usuario.

Los bucles con agentes convierten ese costo en interés compuesto. Como cada turno reinyecta la transcripción previa completa, una traza escrita en el primer turno se vuelve a pagar en todos los turnos siguientes, y la ventana de contexto que describe Fireworks crece de forma aproximadamente cuadrática con la cantidad de turnos.

El atajo evidente no resiste. Bajar la perilla del esfuerzo de razonamiento de K3 recortaba tokens pero entregaba demasiada precisión, según el anuncio de la compañía, de modo que Fireworks decidió entrenar la economía en el modelo en vez de configurarla.

Cómo Fireworks entrenó un razonamiento más corto

Llegar hasta ahí exigió más de 50 experimentos de entrenamiento y más de 200 evaluaciones en el producto de entrenamiento sin servidor de la empresa, además de nuevos algoritmos para comprimir la salida de cadena de pensamiento sin perder precisión. Fireworks afirma que usó datos propios y no datos de clientes.

El equipo preservó a propósito una clase de razonamiento: la autorreflexión. Revisar una suposición o rastrear un resultado hasta una decisión anterior ayuda al modelo a recuperarse de sus propios errores, así que el objetivo fue conservar eso y recortar los bucles improductivos. La mezcla de entrenamiento se mantuvo amplia —de matemáticas y programación a búsqueda, uso de herramientas e ingeniería de software—, una cobertura frente al fallo más previsible: un modelo escueto solo en problemas con forma de benchmark.

En siete pruebas públicas y en el tráfico en producción de dos clientes, Fireworks informa que el razonamiento de K3 pudo acortarse entre un 35% y un 50% sin sacrificar precisión. El comportamiento entrenado también muestra contención en los intentos fallidos y corta justamente los bucles prolongados que generan las facturas más altas.

Qué muestran las pruebas y los test A/B

Fireworks evaluó Ember-1 con su Specialized Intelligence Index, presentado días antes, que incluye el Bedside Bench de Doximity: 500 casos clínicos validados por médicos en 10 categorías de especialidad. En costo por tarea allí, la compañía sostiene que Ember-1 fijó una nueva frontera de Pareto frente a modelos abiertos y cerrados por igual, incluidos GPT-5.6 Sol, GPT-6 Astra y Claude Opus 5.

La comparación que importa es contra K3 mismo en tres niveles de esfuerzo de razonamiento. En cada prueba con más de 50 muestras, Fireworks ubica a Ember-1 sobre la frontera de costo y calidad o muy cerca de ella, que es otra forma de decir que la manera más barata de usar K3 ya no consiste en pedirle que piense menos.

La evidencia en producción es más acotada pero más concreta. En pruebas A/B en vivo sobre cargas de programación de dos clientes, Ember-1 usó alrededor de un 35% menos de tokens por tarea con calidad comparable, y la finalización de tareas, los puntajes de éxito y las tasas de fallo se mantuvieron o mejoraron. Uno de los dos ya lo pasó a producción y planea retirar el modelo base. Puertas adentro, Fireworks cuenta que sus propios desarrolladores no notaron el cambio.

Perspectiva

Los reparos son estructurales antes que técnicos. Ember-1 llega como una versión preliminar de investigación de dos semanas que se vuelve permanente solo si la comunidad lo pide, y lo sirve un único proveedor en OpenRouter. Como el ahorro depende del volumen, se reduce en cargas donde el razonamiento ya representa una porción pequeña de la salida.

K3, mientras tanto, se convirtió en una base que terceros reentrenan y revenden, un giro que ya se aprecia en la trayectoria de ingresos de Moonshot AI. Fireworks está abriendo el entrenamiento sobre Ember-1 para que las empresas puedan especializarlo todavía más.

FAQ — Preguntas frecuentes

¿Ember-1 es más barato por token que Kimi K3?

No. El precio publicado de Ember-1 coincide con el de K3: 3 dólares por millón de tokens de entrada sin caché, 0,30 por millón de entrada en caché y 15 por millón de salida. La reducción de costo proviene por completo de generar menos tokens de razonamiento para la misma tarea, no de una tarifa más baja.

¿Ember-1 es de código abierto?

Fireworks no liberó los pesos de Ember-1. Se ofrece como opción alojada junto al modelo base Kimi K3 en la plataforma sin servidor de Fireworks y a través de OpenRouter, en principio como versión preliminar de investigación.

¿Cuánto de la cifra del 40% está verificado de forma independiente?

Los números de reducción de tokens provienen de las corridas de benchmark de Fireworks y de pruebas A/B sobre el tráfico en producción de dos clientes cuyos nombres no se revelaron. Ningún tercero publicó una réplica independiente, así que el rango de 35% a 50% debe leerse como dato aportado por el proveedor.

¿Qué te parece este artículo?

SJ
Cargando...

Artículos relacionados

GPT-6 Astra se pone a trabajar: el modelo más caro de OpenAI lo apuesta todo al manejo del ordenador
LLM & Chatbots

GPT-6 Astra se pone a trabajar: el modelo más caro de OpenAI lo apuesta todo al manejo del ordenador

GPT-6 Astra llega a los clientes empresariales con manejo del ordenador, un contexto de un millón de tokens y precios de 10 y 50 dólares, con una salvedad sobre su puntuación estrella.

Seung Junghace 18 días
ChatGPT elige un favorito en el 79% de sus respuestas de compra; Gemini, en el 7%
LLM & Chatbots

ChatGPT elige un favorito en el 79% de sus respuestas de compra; Gemini, en el 7%

Una auditoría de 1,536 respuestas de compra con IA halló que ChatGPT expresa una preferencia en primera persona el 79% de las veces y Gemini solo el 7%.

Seung Junghace 11 días
ChatGPT Images 2.5 reduce a la mitad la latencia y suma un lienzo de dibujo
LLM & Chatbots

ChatGPT Images 2.5 reduce a la mitad la latencia y suma un lienzo de dibujo

OpenAI lanzó ChatGPT Images 2.5 con hasta un 50% menos de latencia, un lienzo de dibujo Sketch, plantillas, comentarios anclados y dos modelos nuevos en la API.

Seung Junghace 17 días
Astra for Law de OpenAI no es un modelo nuevo: es un índice de búsqueda de 230 millones de URL
LLM & Chatbots

Astra for Law de OpenAI no es un modelo nuevo: es un índice de búsqueda de 230 millones de URL

Astra for Law combina GPT-6 Astra con un índice jurídico de 230 millones de URL y eleva la precisión del Legal Research Bench del 38,7% al 54%.

Seung Junghace 10 días
Gemini llega a Windows con un atajo Alt+Space y una apuesta por el escritorio
LLM & Chatbots

Gemini llega a Windows con un atajo Alt+Space y una apuesta por el escritorio

La app nativa de Gemini para Windows se abre sobre cualquier programa con Alt+Espacio, se conecta a Gmail y Drive y está disponible en todo el mundo en Windows 10 y 11.

Seung Junghace 17 días
El agente Muse de Meta quiere tu correo, tu calendario y tu tarjeta de crédito
LLM & Chatbots

El agente Muse de Meta quiere tu correo, tu calendario y tu tarjeta de crédito

Meta lanzó Muse, un agente de IA personal que reserva viajes, paga facturas y compra por ti en iOS, Android, la web y WhatsApp en Estados Unidos.

Seung Junghace 17 días