DeepSeek-V4.1-Flash reduce la caché KV a 890 bytes por token

Un MoE de pesos abiertos con 552.000 millones de parámetros que solo activa 8.000 millones durante el prellenado, pensado para sesiones de agentes prolongadas

|5 min de lectura0
Partially populated server racks — DeepSeek-V4.1-Flash targets the memory ceiling that limits how many concurrent agent sessions a machine can host.
Partially populated server racks — DeepSeek-V4.1-Flash targets the memory ceiling that limits how many concurrent agent sessions a machine can host.

DeepSeek presentó DeepSeek-V4.1-Flash, un modelo multimodal de mezcla de expertos con 552.000 millones de parámetros cuyo argumento central no es una puntuación de benchmark sino una cifra de almacenamiento: 890 bytes de caché global de claves y valores por token. Es aproximadamente una cuarta parte de lo que necesitaba su antecesor con la misma longitud de secuencia y es el número que define cuántas sesiones de agente simultáneas puede sostener una máquina. Los pesos y el informe técnico que los acompaña están en Hugging Face bajo licencia MIT.

Claves

  • DeepSeek-V4.1-Flash comprime su caché KV global a 890 bytes por token, cerca de una cuarta parte de DeepSeek-V4-Flash, y la caché persistente baja a alrededor de una octava parte.
  • La división Causal Encoder-Decoder hace que durante el prellenado solo se activen 8.000 millones de parámetros frente a 16.000 millones en la decodificación, un diseño orientado a cargas de agentes dominadas por la entrada más que por la salida.
  • Entre las puntuaciones reportadas figuran 90,9 en GPQA Diamond, 90,6% en Terminal-Bench 2.1 y una puntuación Codeforces de 3471, con una ventana de contexto de un millón de tokens.

Por qué la caché KV se volvió el cuello de botella

Los flujos de trabajo de agentes de larga duración rompieron el viejo modelo de costos. Cada llamada a una herramienta alarga el contexto, y la caché que guarda todas las claves y valores anteriores crece con él: ocupa la memoria HBM del acelerador y se desborda hacia la memoria del host y el SSD cuando las sesiones se conservan para reutilizar prefijos. La atención dispersa ya había recortado la aritmética del procesamiento de secuencias largas; lo que no recortó fue el almacenamiento ni el ancho de banda que consume mover todos esos datos, que es justamente donde hoy se concentra el costo de servir el modelo.

La respuesta de DeepSeek ataca la caché por tres frentes a la vez en lugar de optimizar uno solo. La reducción del número de cabezas achica cada entrada, la compresión a nivel de bloque reduce la cantidad de entradas y el uso compartido entre capas elimina directamente las copias duplicadas: la red conserva apenas tres cachés de codificador y una de decodificador a lo largo de sus cuarenta capas. Encima de todo eso, la cuantización FP4 en formato E2M1, con factores de escala cada 16 canales, recorta aún más los bytes restantes.

Qué hace realmente la división codificador-decodificador

El cambio arquitectónico de fondo es un Causal Encoder-Decoder (CED), adaptado de la línea de trabajo You Only Cache Once. Las cuarenta capas del modelo se dividen en partes iguales: las veinte inferiores funcionan como un codificador que construye representaciones reutilizables del contexto, y las veinte superiores obtienen sus entradas de clave y valor proyectando el estado oculto final del codificador en lugar de calcularlas por su cuenta.

La consecuencia es que la mayoría de las posiciones de un prompt largo solo recorren la mitad de la red. El prellenado activa 8.000 millones de parámetros por token y la decodificación 16.000 millones, una asimetría que importa precisamente porque el tráfico de agentes está dominado por la entrada: un modelo que relee un contexto extenso y emite una llamada breve a una herramienta gasta casi todo su cómputo en la mitad que acaba de abaratarse.

La atención dentro del codificador usa lo que DeepSeek llama CSA2, que combina una ventana deslizante de 128 tokens para el contexto local con recuperación dispersa global y reutilización entre capas. Cada capa recibe un modo fijo —Full, Reindex o Reuse— que determina si calcula índices de atención dispersa nuevos o los hereda, lo que evita repetir cuarenta veces las mismas decisiones de recuperación. Un truco adicional de despliegue, la reproducción acotada de la caché de ventana deslizante, es lo que lleva el almacenamiento persistente a cerca de una octava parte de la generación anterior.

Cómo puntúa

Con el esfuerzo de razonamiento al máximo —el modelo expone un control de 1 a 100—, DeepSeek reporta 90,9 en GPQA Diamond, 74,1% en MMLU-Pro y una puntuación Codeforces de 3471. Las evaluaciones de agentes son su punto fuerte: 90,6% en Terminal-Bench 2.1, 88,1% en CyberGym y 74,2% de incidencias resueltas en DeepSWE v1.1. Los benchmarks de programación quedan más abajo, con 79,4% en HumanEval y 60,6% en BigCodeBench.

La dispersión es agresiva: cada capa lleva un experto compartido junto a 384 expertos enrutados, de los cuales se activan seis por token. La ruta multimodal suma un transformador de visión de 32 capas con parches de tamaño 14, limitado a 1.024 tokens visuales por imagen, y el modelo se preentrenó con 45 billones de tokens. Un desglose arquitectónico independiente firmado por el ingeniero que escribe como zartbot midió unos 420 tokens por segundo en la práctica y sostuvo que el salto es lo bastante grande como para que el nombre de versión menor se quede corto.

Qué significa para el despliegue de pesos abiertos

El marco competitivo aquí pasa por la economía del despliegue, no por la posición en las tablas. Un modelo de pesos abiertos bajo términos MIT que reduce a la cuarta parte su huella de caché cambia lo que cuesta alojarlo uno mismo, porque son la memoria y el ancho de banda de caché —y no los FLOPs brutos— los que limitan las sesiones simultáneas con un presupuesto fijo de GPU. DeepSeek ya jugó esta carta antes, cuando combinó pesos competentes con un costo de servicio inusualmente bajo al lanzar V4 Pro a una fracción del precio de los modelos de frontera.

La incógnita es la degradación de calidad. La reutilización entre capas y la cuantización de la caché a cuatro bits son, por construcción, procesos con pérdida, y los benchmarks agregados son instrumentos pobres para detectar un deterioro que solo aparece muy dentro de una sesión de un millón de tokens. Si esos 890 bytes por token aguantan a lo largo de ejecuciones prolongadas de agentes lo decidirán los despliegues reales, no las suites de evaluación.

Preguntas frecuentes

¿DeepSeek-V4.1-Flash es de código abierto?

Los pesos están publicados en Hugging Face bajo licencia MIT, que permite uso comercial, modificación y redistribución. Como ocurre con la mayoría de los lanzamientos de pesos abiertos, no se incluyen los datos ni el proceso completo de entrenamiento, así que se trata de pesos abiertos más que de código abierto en sentido estricto.

¿Cuánto más pequeña es la caché KV frente a DeepSeek-V4-Flash?

La caché KV global queda en unos 890 bytes por token, alrededor de una cuarta parte del modelo anterior con la misma longitud de secuencia. La caché persistente, la que pesa cuando las sesiones se almacenan para reutilizar prefijos, baja todavía más, hasta cerca de una octava parte, gracias a la reproducción acotada de la caché de ventana deslizante.

¿Por qué el prellenado y la decodificación activan cantidades distintas de parámetros?

El diseño Causal Encoder-Decoder permite que las veinte capas superiores tomen prestadas entradas de clave y valor proyectadas desde la salida del codificador en vez de calcularlas. Por eso los prompts largos solo necesitan la primera mitad de la red y activan 8.000 millones de parámetros, mientras que la generación token a token recurre a toda la pila, con 16.000 millones.

¿Qué te parece este artículo?

SJ
Cargando...

Artículos relacionados

La pregunta de los 200GB: qué pesos de un modelo necesitan de verdad estar en la GPU
AI & Machine Learning

La pregunta de los 200GB: qué pesos de un modelo necesitan de verdad estar en la GPU

DeepSeek V4.1 Flash necesita 567GB de memoria de GPU en lugar de 763GB porque 196.000 millones de sus pesos están hechos para ejecutarse desde la RAM del sistema.

Seung Junghace 6 días
Anthropic señala a Alibaba, Moonshot y DeepSeek en un informe sobre 200 millones de interacciones
AI & Machine Learning

Anthropic señala a Alibaba, Moonshot y DeepSeek en un informe sobre 200 millones de interacciones

Anthropic afirma que cinco campañas consumieron casi 200 millones de interacciones con Claude para copiar su razonamiento, y que Moonshot y DeepSeek reenviaron tráfico real de clientes.

Seung Junghace 6 días
Una prueba de presión de 25 turnos revela que los LLM ceden aunque su razonamiento resista
AI & Machine Learning

Una prueba de presión de 25 turnos revela que los LLM ceden aunque su razonamiento resista

SPINE, un nuevo benchmark publicado en arXiv, discute con los modelos hasta 25 turnos. En los siete sistemas evaluados, la tasa de claudicación sube con la longitud de la conversación.

Seung Junghace 3 días
Suno reconstruyó sus modelos con catálogo licenciado y retira todo lo anterior
AI & Machine Learning

Suno reconstruyó sus modelos con catálogo licenciado y retira todo lo anterior

La generación v6 de Suno se entrenó con catálogo licenciado de Warner, BMG y Believe, y la empresa asegura que no reutilizó ningún dato de entrenamiento previo.

Seung Junghace 4 días
Apple explica cómo la nueva escucha ambiental de Siri protege la privacidad
AI & Machine Learning

Apple explica cómo la nueva escucha ambiental de Siri protege la privacidad

El documento de privacidad de Apple detalla cómo las funciones de Siri Audio Intelligence escuchan el entorno mientras retienen el audio original dentro del Secure Exclave del chip S11.

Seung Junghace 7 días
Un modelo convenció a su supervisor de seguridad de no señalar un ataque real
AI & Machine Learning

Un modelo convenció a su supervisor de seguridad de no señalar un ataque real

Un supervisor que lee trazas de razonamiento no señaló un ataque a sistemas reales porque el modelo pasó toda la sesión describiendo los objetivos como simulados.

Seung Junghace 5 días