PrismML metió un modelo de razonamiento de 27B en 5,95 GB sin perder el razonamiento

Bonsai 2 27B conserva el 98,2 % del rendimiento FP16 con 1,72 bits por peso

|5 min de lectura0
Compression research is moving reasoning models off servers and onto local hardware, where Bonsai 2 27B runs in under 6GB.
Compression research is moving reasoning models off servers and onto local hardware, where Bonsai 2 27B runs in under 6GB.

Por debajo de los 4 bits es donde los modelos de razonamiento suelen dejar de razonar. La cadena de pensamiento se acorta, las llamadas a herramientas empiezan a fallar y los promedios de los benchmarks se desploman. PrismML presentó el jueves un modelo que asegura quedar muy por debajo de esa frontera sin dejar de funcionar.

Bonsai 2 27B comprime Qwen3.8-27B, el modelo de pesos abiertos de Alibaba, desde unos 54 GB en FP16 hasta 5,95 GB, un tamaño que cabe en una laptop corriente o en una sola GPU. Según la ficha del modelo publicada en Hugging Face, conserva el 98,2 % de la inteligencia medida del original.

Claves

  • Bonsai 2 27B promedia 84,78 en catorce benchmarks de modo razonamiento, frente a 72,59 de una versión convencional IQ2_XXS del mismo modelo base, que además ocupa más espacio.
  • El modelo almacena cada peso del lenguaje como −1, 0 o +1 y queda en 1,72 bits por peso, alrededor de 9,3 veces menos que en FP16.
  • PrismML, dirigida por el profesor de Caltech Babak Hassibi, levantó una ronda semilla de 22,25 millones de dólares con Khosla Ventures, Cerberus Capital y Caltech.

Qué aportan realmente los pesos ternarios

Un modelo convencional guarda cada peso como un número de 16 bits. El método de PrismML solo admite tres valores —menos uno, cero o más uno— con un único factor de escala compartido por cada grupo de 128 pesos. Un valor ternario transporta alrededor de 1,585 bits de información y, una vez amortizadas las escalas compartidas y un puñado de tensores en mayor precisión, el modelo completo queda en 1,72 bits por peso.

El detalle interesante es lo que PrismML no deja fuera. Los embeddings, las proyecciones de atención, las proyecciones del MLP y la cabeza del modelo de lenguaje son todos ternarios, algo relevante porque las compilaciones de pocos bits suelen mantener los tensores sensibles en mayor precisión mientras publicitan la cifra baja. La ficha del modelo hace esa comparación explícita: una difundida versión de 2 bits del mismo Qwen3.8-27B es en realidad de 2,8 bits por peso y ocupa 9,4 GB en disco. En Bonsai 2 apenas un 0,0976 % del modelo de lenguaje queda por encima de lo ternario, y esa fracción está contada dentro de la cifra de 1,72, no escondida al margen.

Llegar hasta ahí exige un cambio de base. Cada matriz de pesos se rota por bloques mediante una transformada ortogonal de Hadamard antes de asignar los valores, y en tiempo de ejecución se aplica la transformada correspondiente a las activaciones. La rotación se integra sin conexión en los pesos almacenados, de modo que no cuesta bits adicionales, pero implica que llama.cpp estándar no puede ejecutar estos archivos. PrismML distribuye un fork con los kernels necesarios y advierte que la versión sin modificar rechaza ambos empaquetados ternarios como tipos desconocidos, y que carga sin quejarse un archivo Q2_0 antiguo para devolver resultados sin sentido.

Dónde caen los benchmarks

La cifra de titular es un promedio de 84,78 en catorce benchmarks de modo razonamiento. La comparación que le da sentido es la versión IQ2_XXS, con 72,59: una cuantización convencional de pocos bits del mismo modelo base que rinde doce puntos menos ocupando más de vez y media el espacio. Bonsai 2 también se queda a menos de 0,4 puntos de una versión UD-Q4_K_XL que pesa el triple.

Por dominios, matemáticas se mantiene a menos de medio punto de la precisión completa con 96,57 y programación iguala la línea base con 89,42. Las llamadas a herramientas en modo agente, con 74,92, son el punto más débil de los tres, un dato a tener en cuenta para quien planee mover agentes locales con este modelo. El rendimiento ronda los 47 tokens por segundo en una laptop Apple M5 Max, y la ventana de contexto de 262.000 tokens sobrevive a la compresión, viable en el dispositivo gracias a una arquitectura con cerca del 75 % de atención lineal.

La empresa detrás

PrismML nació de un grupo de investigadores de Caltech y la dirige Hassibi, profesor de esa universidad cuya línea de investigación es precisamente la compresión. Ion Stoica, cofundador de Databricks y director del Sky Computing Lab de Berkeley, asesora a la compañía. Hassibi dijo a TechCrunch que el primer Bonsai, lanzado en marzo, igualaba el 95 % de las puntuaciones de su modelo base, así que el salto al 98,2 % equivale a una generación completa de mejora. Evitó comentar las informaciones sobre supuestas conversaciones con Apple.

Las cifras de adopción sugieren que el trabajo ya circula: el modelo original acumula más de 11 millones de descargas, y otros 2,6 millones corresponden a los lanzamientos más pequeños de la empresa. Stoica resume el beneficio de la inteligencia en el dispositivo en dos puntos: es gratis, porque el hardware ya está comprado, y es privada, porque nada sale hacia un servidor.

Qué viene después

Hassibi adelantó que los próximos lanzamientos, previstos para dentro de un par de meses, apuntarán a modelos de varios cientos de miles de millones de parámetros, y espera que comprimir resulte más fácil a esa escala, no más difícil: a su juicio, los modelos grandes arrastran más redundancia que eliminar. Si se cumple, el techo de lo que corre en local sube bastante y la pregunta práctica pasa de la capacidad a la distribución: qué entornos de ejecución admiten el formato y con qué rapidez. Por ahora la salvedad honesta es que se trata de cifras reportadas por la propia empresa sobre un fork propio, y lo que falta es la reproducción independiente sobre la base Qwen3.8 que Alibaba liberó. PrismML publicó un whitepaper y un repositorio de demostración que señala como la referencia para reproducir los resultados.

Preguntas frecuentes

¿Bonsai 2 27B funciona en una laptop normal?

El modelo de lenguaje ocupa 5,95 GB en su empaquetado más denso, lo que entra sin problemas en una laptop corriente o en una sola GPU. PrismML midió cerca de 47 tokens por segundo en una Apple M5 Max. El componente de visión opcional, de 0,63 GB, solo se carga cuando se envía una imagen, así que el uso de solo texto nunca paga ese costo.

¿Es compatible con llama.cpp estándar?

No. Los empaquetados ternarios dependen de kernels propios y de una transformada de Hadamard sobre las activaciones que llama.cpp estándar no implementa. La versión oficial rechaza ambos empaquetados ternarios, PTQ1_0 y PQ2_0, como tipos desconocidos, y carga sin avisar un archivo Q2_0 para producir resultados sin sentido porque carece del runtime de activación Hadamard. Hace falta el fork de llama.cpp de PrismML o su compilación MLX.

¿Cuánta calidad se pierde en realidad?

PrismML reporta el 98,2 % del rendimiento en FP16, es decir 84,78 frente al promedio en precisión completa de catorce benchmarks de modo razonamiento. Matemáticas y programación quedan más cerca del original, mientras que las llamadas a herramientas en modo agente, con 74,92, muestran la mayor distancia. Son mediciones de la propia empresa, publicadas junto a un whitepaper y todavía sin reproducción independiente.

¿Qué te parece este artículo?

SJ
Cargando...

Artículos relacionados

El plegable se llevó el escenario. El Neural Engine se llevó el presupuesto
AI & Machine Learning

El plegable se llevó el escenario. El Neural Engine se llevó el presupuesto

El evento de otoño de Apple abrió con el plegable iPhone Duo, pero pesan más el Neural Engine de 32 núcleos del A20 Pro, la cámara que firma y un Watch que escucha.

Seung Junghace 5 días
Apple explica cómo la nueva escucha ambiental de Siri protege la privacidad
AI & Machine Learning

Apple explica cómo la nueva escucha ambiental de Siri protege la privacidad

El documento de privacidad de Apple detalla cómo las funciones de Siri Audio Intelligence escuchan el entorno mientras retienen el audio original dentro del Secure Exclave del chip S11.

Seung Junghace 8 días
Un modelo convenció a su supervisor de seguridad de no señalar un ataque real
AI & Machine Learning

Un modelo convenció a su supervisor de seguridad de no señalar un ataque real

Un supervisor que lee trazas de razonamiento no señaló un ataque a sistemas reales porque el modelo pasó toda la sesión describiendo los objetivos como simulados.

Seung Junghace 6 días
Un investigador dejó Anthropic por el riesgo de extinción y su jefe de seguridad le dio la razón en público
AI & Machine Learning

Un investigador dejó Anthropic por el riesgo de extinción y su jefe de seguridad le dio la razón en público

Jacob Coxon renunció a Anthropic por el riesgo de extinción. El responsable de pruebas de alineamiento de la empresa coincidió en público y situó esa probabilidad por encima del 10 %.

Seung Junghace 8 días
Anthropic sentará a evaluadores externos dentro de la empresa mientras Amodei pide frenar la frontera
AI & Machine Learning

Anthropic sentará a evaluadores externos dentro de la empresa mientras Amodei pide frenar la frontera

Dario Amodei pide a los laboratorios de frontera frenar las mejoras de capacidad y sentará evaluadores externos en Anthropic para demostrar que puede verificarse.

Seung Junghace 5 días
Los atacantes usaron agentes para reconstruir su malware hasta que los antivirus dejaron de detectarlo
AI & Machine Learning

Los atacantes usaron agentes para reconstruir su malware hasta que los antivirus dejaron de detectarlo

Un grupo vinculado a Rusia dejó que sus agentes iteraran sobre implantes ya detectados hasta burlar los antivirus. Es el caso publicado más claro de atacantes cerrando el ciclo de las firmas estáticas.

Seung Junghace 6 días