DeepSeek presentó DeepSeek-V4.1-Flash, un modelo multimodal de mezcla de expertos con 552.000 millones de parámetros cuyo argumento central no es una puntuación de benchmark sino una cifra de almacenamiento: 890 bytes de caché global de claves y valores por token. Es aproximadamente una cuarta parte de lo que necesitaba su antecesor con la misma longitud de secuencia y es el número que define cuántas sesiones de agente simultáneas puede sostener una máquina. Los pesos y el informe técnico que los acompaña están en Hugging Face bajo licencia MIT.
Claves
- DeepSeek-V4.1-Flash comprime su caché KV global a 890 bytes por token, cerca de una cuarta parte de DeepSeek-V4-Flash, y la caché persistente baja a alrededor de una octava parte.
- La división Causal Encoder-Decoder hace que durante el prellenado solo se activen 8.000 millones de parámetros frente a 16.000 millones en la decodificación, un diseño orientado a cargas de agentes dominadas por la entrada más que por la salida.
- Entre las puntuaciones reportadas figuran 90,9 en GPQA Diamond, 90,6% en Terminal-Bench 2.1 y una puntuación Codeforces de 3471, con una ventana de contexto de un millón de tokens.
Por qué la caché KV se volvió el cuello de botella
Los flujos de trabajo de agentes de larga duración rompieron el viejo modelo de costos. Cada llamada a una herramienta alarga el contexto, y la caché que guarda todas las claves y valores anteriores crece con él: ocupa la memoria HBM del acelerador y se desborda hacia la memoria del host y el SSD cuando las sesiones se conservan para reutilizar prefijos. La atención dispersa ya había recortado la aritmética del procesamiento de secuencias largas; lo que no recortó fue el almacenamiento ni el ancho de banda que consume mover todos esos datos, que es justamente donde hoy se concentra el costo de servir el modelo.
La respuesta de DeepSeek ataca la caché por tres frentes a la vez en lugar de optimizar uno solo. La reducción del número de cabezas achica cada entrada, la compresión a nivel de bloque reduce la cantidad de entradas y el uso compartido entre capas elimina directamente las copias duplicadas: la red conserva apenas tres cachés de codificador y una de decodificador a lo largo de sus cuarenta capas. Encima de todo eso, la cuantización FP4 en formato E2M1, con factores de escala cada 16 canales, recorta aún más los bytes restantes.
Qué hace realmente la división codificador-decodificador
El cambio arquitectónico de fondo es un Causal Encoder-Decoder (CED), adaptado de la línea de trabajo You Only Cache Once. Las cuarenta capas del modelo se dividen en partes iguales: las veinte inferiores funcionan como un codificador que construye representaciones reutilizables del contexto, y las veinte superiores obtienen sus entradas de clave y valor proyectando el estado oculto final del codificador en lugar de calcularlas por su cuenta.
La consecuencia es que la mayoría de las posiciones de un prompt largo solo recorren la mitad de la red. El prellenado activa 8.000 millones de parámetros por token y la decodificación 16.000 millones, una asimetría que importa precisamente porque el tráfico de agentes está dominado por la entrada: un modelo que relee un contexto extenso y emite una llamada breve a una herramienta gasta casi todo su cómputo en la mitad que acaba de abaratarse.
La atención dentro del codificador usa lo que DeepSeek llama CSA2, que combina una ventana deslizante de 128 tokens para el contexto local con recuperación dispersa global y reutilización entre capas. Cada capa recibe un modo fijo —Full, Reindex o Reuse— que determina si calcula índices de atención dispersa nuevos o los hereda, lo que evita repetir cuarenta veces las mismas decisiones de recuperación. Un truco adicional de despliegue, la reproducción acotada de la caché de ventana deslizante, es lo que lleva el almacenamiento persistente a cerca de una octava parte de la generación anterior.
Cómo puntúa
Con el esfuerzo de razonamiento al máximo —el modelo expone un control de 1 a 100—, DeepSeek reporta 90,9 en GPQA Diamond, 74,1% en MMLU-Pro y una puntuación Codeforces de 3471. Las evaluaciones de agentes son su punto fuerte: 90,6% en Terminal-Bench 2.1, 88,1% en CyberGym y 74,2% de incidencias resueltas en DeepSWE v1.1. Los benchmarks de programación quedan más abajo, con 79,4% en HumanEval y 60,6% en BigCodeBench.
La dispersión es agresiva: cada capa lleva un experto compartido junto a 384 expertos enrutados, de los cuales se activan seis por token. La ruta multimodal suma un transformador de visión de 32 capas con parches de tamaño 14, limitado a 1.024 tokens visuales por imagen, y el modelo se preentrenó con 45 billones de tokens. Un desglose arquitectónico independiente firmado por el ingeniero que escribe como zartbot midió unos 420 tokens por segundo en la práctica y sostuvo que el salto es lo bastante grande como para que el nombre de versión menor se quede corto.
Qué significa para el despliegue de pesos abiertos
El marco competitivo aquí pasa por la economía del despliegue, no por la posición en las tablas. Un modelo de pesos abiertos bajo términos MIT que reduce a la cuarta parte su huella de caché cambia lo que cuesta alojarlo uno mismo, porque son la memoria y el ancho de banda de caché —y no los FLOPs brutos— los que limitan las sesiones simultáneas con un presupuesto fijo de GPU. DeepSeek ya jugó esta carta antes, cuando combinó pesos competentes con un costo de servicio inusualmente bajo al lanzar V4 Pro a una fracción del precio de los modelos de frontera.
La incógnita es la degradación de calidad. La reutilización entre capas y la cuantización de la caché a cuatro bits son, por construcción, procesos con pérdida, y los benchmarks agregados son instrumentos pobres para detectar un deterioro que solo aparece muy dentro de una sesión de un millón de tokens. Si esos 890 bytes por token aguantan a lo largo de ejecuciones prolongadas de agentes lo decidirán los despliegues reales, no las suites de evaluación.
Preguntas frecuentes
¿DeepSeek-V4.1-Flash es de código abierto?
Los pesos están publicados en Hugging Face bajo licencia MIT, que permite uso comercial, modificación y redistribución. Como ocurre con la mayoría de los lanzamientos de pesos abiertos, no se incluyen los datos ni el proceso completo de entrenamiento, así que se trata de pesos abiertos más que de código abierto en sentido estricto.
¿Cuánto más pequeña es la caché KV frente a DeepSeek-V4-Flash?
La caché KV global queda en unos 890 bytes por token, alrededor de una cuarta parte del modelo anterior con la misma longitud de secuencia. La caché persistente, la que pesa cuando las sesiones se almacenan para reutilizar prefijos, baja todavía más, hasta cerca de una octava parte, gracias a la reproducción acotada de la caché de ventana deslizante.
¿Por qué el prellenado y la decodificación activan cantidades distintas de parámetros?
El diseño Causal Encoder-Decoder permite que las veinte capas superiores tomen prestadas entradas de clave y valor proyectadas desde la salida del codificador en vez de calcularlas. Por eso los prompts largos solo necesitan la primera mitad de la red y activan 8.000 millones de parámetros, mientras que la generación token a token recurre a toda la pila, con 16.000 millones.






