Un laboratorio "con un par de GPUs" afirma que un modelo de 125B ya cabe en una tarjeta de 24 GB

Tim Dettmers adelanta la Open Source Week de dlab: dos proyectos, cuatro artículos y un conjunto de cifras de inferencia local que nadie fuera del laboratorio ha verificado todavía.

|5 min de lectura0
A consumer desktop graphics card installed in a PC case — the class of hardware Tim Dettmers says his lab's inference framework targets for 125-billion-parameter models.
A consumer desktop graphics card installed in a PC case — the class of hardware Tim Dettmers says his lab's inference framework targets for 125-billion-parameter models.

Tim Dettmers, profesor ayudante de informática en la Universidad Carnegie Mellon, aprovechó una entrada de blog publicada el lunes para adelantar lo que su laboratorio llama Open Source Week: dos proyectos de código abierto y cuatro artículos que salen juntos, construidos sobre la idea de que los modelos que casi todo el mundo da por hecho que necesitan un centro de datos ya caben en el equipo que el lector tiene en casa.

Claves

  • Dettmers afirma que el framework de inferencia de su laboratorio ejecuta Qwen 3.8 Flash Next, un modelo de 125.000 millones de parámetros, en una sola GPU de consumo de 24 GB, y DeepSeek V4.1, de 550.000 millones, en una máquina AMD Strix, un NVIDIA DGX Spark o una MacBook con 128 GB de memoria.
  • Un agente al que dejaron trabajar sobre los kernels Metal del framework logró inferencia cuantizada de Qwen 3.6 35B-A3B a 450 tokens por segundo con 1,5 bits por peso, aproximadamente una décima parte de la memoria que exigiría una copia en media precisión.
  • CliffCompaction, la técnica de compactación automática del laboratorio, reduciría el coste de los agentes cerca de la mitad; una empresa colaboradora midió una caída del 45% en su presupuesto total de IA tras implantarla internamente.

Qué dice el framework que ejecuta en local

La comparación de cabecera enfrenta a dos modelos de la misma familia. Qwen 3.8, con 27.000 millones de parámetros, se convirtió en el modelo local por defecto para quien tiene una buena tarjeta desde que Alibaba liberó la familia. Dettmers sostiene que esa misma tarjeta debería estar ejecutando la versión de 125.000 millones, y que un portátil de 128 GB debería mover un modelo de 550.000 millones.

Esa distancia se cubre con cuantización agresiva más compresión automática y gestión del contexto, algo que, según él, mantiene rápida la inferencia con contextos largos sin que el usuario ajuste nada.

El trabajo con Mac y Metal es la prueba que ofrece para una segunda afirmación: cómo se escribió el software. Cuenta que un solo comando apuntó el arnés de agentes del laboratorio a los kernels y lo dejó solo, sin ninguna intervención durante la ejecución, y lo que volvió fue ese resultado de 1,5 bits y 450 tokens por segundo. El objetivo de diseño que enuncia para el arnés es tajante: el código abierto que solo pueden ejecutar investigadores con experiencia no es código abierto.

El argumento de coste que sostiene todo lo demás

CliffCompaction es la pieza que, según Dettmers, más usa el laboratorio y menos comenta. Describe sesiones de millones de tokens —algunas suyas por encima de los cien millones— a aproximadamente la mitad del coste global, y sostiene que en KernelBench la técnica alcanza el estado del arte y supera por un margen que califica de amplio a los enfoques tipo AlphaEvolve y a los sistemas de memoria jerárquica.

El ahorro se reinvierte. En lugar de un único despliegue, el mismo presupuesto compra varios, algo que presenta como el primer método práctico que convierte múltiples ejecuciones en mejoras reales a coste fijo. También admite que todavía no resulta práctico para el trabajo de ingeniería del día a día.

La afirmación más audaz es el sistema de investigación. Montado sobre el arnés y la pila de inferencia local, y funcionando sin ninguna conexión a internet, asegura que supera a los sistemas de investigación profunda de los laboratorios punteros y rinde por encima del sistema de Sakana AI y de ScientistOne de Google en investigación autónoma. La demostración que ofrece es un problema de bioinformática que eligió precisamente porque desconoce el campo: el agente propuso tres problemas candidatos y unas dos horas sobre el primero produjeron una nueva cota inferior para los métodos heurísticos, una implementación probada de la mejor heurística de la literatura y fallos detectados en los datos de evaluación de los que depende el área. Apunta que no alcanzó el estado del arte en el problema en su conjunto.

Por qué importa la salvedad

Todo esto es el relato de un laboratorio sobre su propio trabajo, publicado el día antes de que aterricen el código y los artículos. Ninguna de las cifras —los 450 tokens por segundo, el recorte del 45%, el resultado en KernelBench— ha sido reproducida todavía por nadie ajeno al grupo, y la entrada no menciona ninguna evaluación independiente. El hilo de Hacker News sobre el anuncio seguía con comentarios de un solo dígito horas después de publicarse.

Lo que hace que la semana merezca atención de todos modos es la apuesta que hay detrás, y que Dettmers formula sin rodeos en la entrada: un laboratorio pequeño con un par de GPUs puede construir sistemas que compitan con la frontera, porque los problemas baratos de atacar y valiosos de resolver son justamente los que nadie con un gran presupuesto de cómputo se molesta en tocar. Los lanzamientos son la prueba de esa tesis, y son públicos.

Preguntas frecuentes

¿Qué hardware dice el laboratorio que hace falta para ejecutar un modelo de 125B?

Una sola GPU de 24 GB, del tipo que lleva cualquier equipo de sobremesa normal, según Dettmers. Para DeepSeek V4.1, mucho mayor con sus 550.000 millones de parámetros, enumera un sistema AMD Strix, un NVIDIA DGX Spark o una MacBook con 128 GB de memoria unificada.

¿Está ya disponible el código de la Open Source Week de dlab?

No lo estaba cuando se publicó el anuncio. Dettmers escribió que la semana se retrasaba un día y que los dos proyectos de código abierto y los cuatro artículos empezarían a salir al día siguiente, publicados deliberadamente en bloque como un único ecosistema en lugar de escalonados a lo largo de varias semanas.

¿En qué se diferencia CliffCompaction de lo que ya hacen los agentes de programación?

Es una técnica de compactación automática para que un agente siga trabajando más allá del punto en que una conversación terminaría normalmente. Dettmers sostiene que es bastante más capaz que la compactación automática de Claude Code o Codex, que admite sesiones de millones de tokens y que recorta el coste global cerca de la mitad. Esa comparación es de su laboratorio, no de una evaluación independiente.

¿Qué te parece este artículo?

SJ
Cargando...

Artículos relacionados

Meta libera Astryx, un sistema de diseño en React que los agentes pueden consultar
Developer Tools

Meta libera Astryx, un sistema de diseño en React que los agentes pueden consultar

Meta publicó Astryx en junio como beta pública bajo licencia MIT, un sistema de diseño en React que maduró durante ocho años dentro del monorepo interno de la compañía.

Seung Junghace 8 días
Los reparadores con LLM rompieron código que funcionaba diez veces más a menudo de lo que arreglaron el defectuoso
Developer Tools

Los reparadores con LLM rompieron código que funcionaba diez veces más a menudo de lo que arreglaron el defectuoso

Un estudio en arXiv midió un bucle de reparación con LLM dañando programas correctos a 0,261 y arreglando los defectuosos a 0,023, y halló la dirección interna que lo impulsa.

Seung Junghace 9 días
Vercel desactivó AVIF en toda su plataforma por un error corregido hace un año
Developer Tools

Vercel desactivó AVIF en toda su plataforma por un error corregido hace un año

Vercel rastreó un RCE reportado en Next.js hasta libheif, desactivó AVIF en toda su plataforma el 13 de agosto y coordinó los arreglos en sharp, libvips y libheif para el 25 de agosto.

Seung Junghace 3 días
Agentes de IA inundaron RubyGems con 2.000 paquetes y el registro cerró las altas cuatro días
Developer Tools

Agentes de IA inundaron RubyGems con 2.000 paquetes y el registro cerró las altas cuatro días

Un informe forense reconstruye la campaña GemStuffer de mayo, en la que agentes de IA subieron más de 2.000 gems y forzaron a RubyGems a congelar las nuevas altas cuatro días.

Seung Junghace 10 días
ZCode empaquetaba 42.411 archivos por instantánea y solo Z.ai podía descifrarlos
Developer Tools

ZCode empaquetaba 42.411 archivos por instantánea y solo Z.ai podía descifrarlos

Un informe de ingeniería inversa halló que ZCode, de Z.ai, enviaba historiales de Git completos a Alibaba Cloud cifrados de un modo que solo sus servidores podían abrir.

Seung Junghace 3 días
Claude Code Projects vuelve como un coordinador que ejecuta hilos en la nube en paralelo
Developer Tools

Claude Code Projects vuelve como un coordinador que ejecuta hilos en la nube en paralelo

El rediseño de Claude Code Projects coloca un coordinador por encima de los hilos de trabajo, cada uno una sesión completa en la nube con su rama y memoria compartida.

Seung Junghace 4 días