El ds4 de antirez corre DeepSeek V4 Flash a 34.4 tokens/s en un M5 Max y a 14.4 en un DGX Spark

El motor en C con licencia MIT solo carga los GGUF que él mismo produce, y la tabla de referencia invierte el orden del hardware según si se mira el prellenado o la generación.

|5 min de lectura0
Apple's Mac Studio: high-memory Apple Silicon desktops are ds4's primary Metal target for running DeepSeek V4 Flash locally.
Apple's Mac Studio: high-memory Apple Silicon desktops are ds4's primary Metal target for running DeepSeek V4 Flash locally.

Los benchmarks de referencia de DwarfStar 4 (ds4), el motor de inferencia escrito en C y con licencia MIT por el creador de Redis, Salvatore Sanfilippo, dejan al descubierto una división que importa a cualquiera que esté especificando una estación de trabajo personal de IA: de dos máquinas de 128 GB, una ingiere los prompts mucho más rápido y la otra devuelve tokens a más del doble de velocidad.

Al ejecutar DeepSeek V4 Flash en q2 y con un contexto de 32,768 tokens, ds4 genera 34.4 tokens por segundo en una Mac M5 Max con 128 GB de memoria unificada, frente a 14.4 en una NVIDIA DGX Spark con los mismos 128 GB. El prellenado invierte el orden: con ese contexto, la Spark ingiere 855.9 tokens por segundo mientras la Mac alcanza 557.0. Al estirar el contexto a 65,536 tokens, la Spark apenas se mueve y queda en 823.0, mientras la Mac cae a 398.5.

Puntos clave

  • ds4 es un motor de inferencia en C autocontenido y con licencia MIT, obra de Salvatore Sanfilippo, que apunta a una lista corta de modelos de pesos abiertos concretos en lugar de funcionar como un ejecutor genérico de GGUF.
  • Con un contexto de 32,768 tokens sobre DeepSeek V4 Flash en q2, las filas publicadas muestran 34.4 tokens generados por segundo en un M5 Max de 128 GB frente a 14.4 en un DGX Spark de 128 GB, mientras la Spark lidera el prellenado por 855.9 a 557.0.
  • Se distribuyen tres binarios juntos: una CLI, un servidor local compatible con las APIs de OpenAI y Anthropic, y un agente de programación que ejecuta la inferencia dentro del propio proceso y no a través de un socket.

Lo que ds4 deliberadamente no es

La documentación del proyecto es tajante: ds4 no es un ejecutor genérico de GGUF. Solo carga los archivos GGUF que el propio proyecto produce, y el soporte de modelos se describe como oportunista, de modo que un modelo sale de la lista cuando llega un reemplazo mejor. El motor no se enlaza con GGML, aunque acredita a llama.cpp y conserva de ahí los diseños de cuantización con licencia MIT, la lógica de producto punto en CPU y algunos kernels.

Las familias soportadas abarcan hoy DeepSeek V4 Flash, incluido un checkpoint de visión experimental, DeepSeek V4.1 Flash, DeepSeek V4 PRO, GLM 5.2 y 5.3, GLM 5.3 Flash y Qwen3.8 Flash Next. Metal es el objetivo principal en las Mac de 96 GB o más. El trabajo en CUDA se centra en la DGX Spark, pero se extiende a equipos multi-GPU con tarjetas Ada Lovelace como la L40S, y ROCm cubre sistemas Strix Halo como la Framework Desktop.

Meter un modelo grande de mezcla de expertos en un solo escritorio se apoya en una cuantización asimétrica: comprimir a fondo los expertos enrutados y mantener con precisión las rutas críticas compartidas. La compilación Q2 más pequeña de Qwen3.8 queda en 41.73 GiB entre los pesos principales y los de predicción multitoken, y el proyecto la presenta como la opción de entrada para Mac de 64 GB.

Por qué el agente corre dentro del motor

El binario ds4-server habla APIs al estilo de OpenAI y Anthropic, así que herramientas como Claude Code, Codex CLI y OpenCode pueden apuntar su URL base a la máquina local. El binario aparte ds4-agent se salta esa frontera por completo y conduce la inferencia dentro del proceso, lo que convierte la propia sesión de programación en la caché KV en disco: los prefijos largos se guardan en el SSD y se reanudan por el hash del prompt en lugar de volver a ingerirse tras un reinicio.

Esa es la mitad costosa del trabajo con agentes. DeepSeek viene empujando la misma palanca desde el lado del modelo, donde V4.1 Flash redujo la caché KV a 890 bytes por token.

Las advertencias están dichas en voz alta

Sanfilippo califica el software como de calidad beta: hay una ronda amplia de QA antes de cada versión, pero las regresiones siguen siendo posibles. También revela que ds4 se construyó con una fuerte asistencia de agentes de programación con IA, con humanos al frente de las ideas, las pruebas y la depuración, y dice que quien no esté conforme con código desarrollado por IA debería buscar en otra parte. Plantea el resultado menos como un producto terminado que como una plantilla funcional que se espera que cada dueño extienda con sus propios agentes.

Las cifras distribuidas enfrían cualquier impulso de encadenar máquinas. Entre dos Mac M5 Max conectadas por Thunderbolt 5 con Flash Q4, el prellenado escala pero la generación no: sigue siendo autorregresiva y paga cerca de un 19 por ciento de penalización frente a una sola máquina. Una configuración más densa de ocho L40S se reporta en torno a 126 tokens por segundo de generación agregada en 16 sesiones concurrentes, un perfil de servidor multiusuario y no un chat individual más rápido.

Los números salen de ds4-bench, que recorre un texto de dominio público hasta cada frontera de contexto en pasos de 2,048 tokens y mide 128 tokens voraces, por lo que cada fila es el rendimiento a ese tamaño de contexto y no un promedio de la ejecución. Están publicados en la guía de rendimiento del proyecto y replicados en la tabla comunitaria de benchmarks de DwarfStar, que ahora pide a quienes tengan ROCm o CUDA genérico que envíen sus propias mediciones.

FAQ

¿ds4 es de código abierto?

Sí. ds4 se publica bajo la licencia MIT, la misma que cubre las tablas de cuantización y los kernels que adapta de llama.cpp. El código está en github.com/antirez/ds4, y el repositorio también incluye las herramientas del proyecto para GGUF, imatrix, calidad y velocidad.

¿ds4 puede ejecutar cualquier archivo de modelo GGUF?

No. El motor es estrecho por diseño y solo ejecuta los archivos GGUF que el proyecto compila para sus familias soportadas. Los GGUF genéricos de otras fuentes quedan explícitamente fuera del objetivo, y ese es el canje que hace para validar cada diseño soportado de extremo a extremo.

¿Cuánta memoria necesita DeepSeek V4 Flash con ds4?

Metal apunta a Mac de 96 GB o más, y las filas de referencia se midieron en máquinas de 128 GB. Los sistemas más pequeños pueden recurrir al streaming desde SSD, y la compilación Q2 de Qwen3.8, de 41.73 GiB, se plantea como el punto de partida para Mac de 64 GB.

¿Qué te parece este artículo?

SJ
Cargando...

Artículos relacionados

Un laboratorio "con un par de GPUs" afirma que un modelo de 125B ya cabe en una tarjeta de 24 GB
Developer Tools

Un laboratorio "con un par de GPUs" afirma que un modelo de 125B ya cabe en una tarjeta de 24 GB

Tim Dettmers, de la CMU, asegura que el framework de su laboratorio ejecuta un modelo de 125.000 millones de parámetros en una sola GPU de 24 GB y uno de 550.000 millones en una MacBook de 128 GB, a un día de una semana de seis lanzamientos abiertos.

Seung Junghace 11 días
Cuatro peticiones válidas en Opus 5 ahora devuelven 400 en Claude Opus 5.5
Developer Tools

Cuatro peticiones válidas en Opus 5 ahora devuelven 400 en Claude Opus 5.5

Claude Opus 5.5 cuesta un 20% menos que Opus 5 y devuelve HTTP 400 en cuatro peticiones que Opus 5 aceptaba. Un quinto cambio silencia el progreso del agente.

Seung Junghace 5 días
Docker lleva sus sandboxes para agentes de IA a la nube, con cobro por segundo desde 0,07 dólares la hora
Developer Tools

Docker lleva sus sandboxes para agentes de IA a la nube, con cobro por segundo desde 0,07 dólares la hora

Docker lanzó Cloud Sandboxes, que lleva su aislamiento por microVM para agentes a cómputo gestionado con cobro por segundo desde 0,07 dólares la hora, y cede Kits a la CNCF.

Seung Junghace 8 días
Una encuesta a 305 desarrolladores halla que el 71 % publicó código de IA que no entendía
Developer Tools

Una encuesta a 305 desarrolladores halla que el 71 % publicó código de IA que no entendía

Coddy encuestó a 305 usuarios semanales de herramientas de programación con IA. Cuatro de cada cinco hablaron de dependencia, no de ventaja, y el trabajo fuera de horario osciló entre el 36 % y el 62 % según la herramienta.

Seung Junghace 13 días
Vercel desactivó AVIF en toda su plataforma por un error corregido hace un año
Developer Tools

Vercel desactivó AVIF en toda su plataforma por un error corregido hace un año

Vercel rastreó un RCE reportado en Next.js hasta libheif, desactivó AVIF en toda su plataforma el 13 de agosto y coordinó los arreglos en sharp, libvips y libheif para el 25 de agosto.

Seung Junghace 14 días
OpenAI reduce a la mitad el precio de sus modelos intermedios, pero GPT-5.6 sigue ganando en dos pruebas
Developer Tools

OpenAI reduce a la mitad el precio de sus modelos intermedios, pero GPT-5.6 sigue ganando en dos pruebas

OpenAI lanzó el martes dos modelos intermedios y construyó su argumento casi por completo sobre el precio. GPT-6 Sol cuesta 2 dólares por millón de tokens de entrada y 10 por millón de salida.

Seung Junghace 10 días