El mejor modelo de uso de ordenador de Holo4 es open weights, pero no para empresas

El agente de 27B de H Company logra 61,7% en OSWorld 2.0 por una séptima parte del costo de Opus 5.5, pero la licencia Apache 2.0 solo cubre al hermano Mixture-of-Experts, más débil

|5 min de lectura0
A person working alongside an on-screen assistant — the kind of desktop interaction Holo4 is trained to perform on its own.
A person working alongside an on-screen assistant — the kind of desktop interaction Holo4 is trained to perform on its own.

La parisina H Company lanzó Holo4 el 28 de septiembre: dos modelos de uso de ordenador con pesos abiertos cuya versión más pequeña, de 27.000 millones de parámetros, encabeza todas las cifras que publicó el laboratorio y que, sin embargo, no puede incorporarse legalmente a un producto comercial.

La trampa no está en el anuncio sino en las fichas de los modelos. Holo4-27B en Hugging Face lleva licencia CC BY-NC 4.0, que lo restringe al uso no comercial. El único con Apache 2.0 es el hermano más débil, Holo4-35B-A3B, y en flujos largos de escritorio saca aproximadamente la mitad de puntuación.

Key takeaways

  • Holo4-27B logra 61,7% en OSWorld 2.0 por un costo estimado de 1,22 dólares por tarea, frente al 81,8% y 8,48 dólares de Claude Opus 5.5.
  • Los pesos del 27B son CC BY-NC 4.0; solo la versión Mixture-of-Experts 35B-A3B es Apache 2.0, y esa llega al 30,9% en el mismo benchmark.
  • H entrenó ambos modelos con unas 10.000 tareas generadas por su propia Agentic Task Factory y publicó todas las trayectorias de los benchmarks para que se puedan revisar.

Un solo modelo para interfaces, código y llamadas a herramientas

Holo4 está pensado para manejar software con la interfaz que tenga delante: hacer clic y escribir en una pantalla, redactar y ejecutar su propio código, o llamar herramientas de MCP y de API. En su publicación de lanzamiento, H sostiene que la mayoría de los modelos agénticos elige un solo carril: los entrenados con interfaces gráficas quedan ciegos sin pantalla, mientras que los de llamada a herramientas se atascan ante una aplicación sin API. Y una sola tarea de trabajo suele exigir las dos cosas.

El mismo checkpoint corre en escritorio, web, Android, un sandbox de código y contra APIs corporativas, y se invoca igual en todos los casos. Ambos tamaños llegaron a la API de H Models el mismo día del lanzamiento, junto con una versión actualizada del modelo pequeño Holotron4 Nano.

Dónde caen realmente las cifras

En el OSWorld original de escritorio, Holo4 27B alcanza 85,2% por 0,08 dólares la tarea, apenas por delante de su propio modelo base, Qwen3.8 27B, con 84,3% y 0,22 dólares, y justo por detrás de Fable 5 con 86,0%. La diferencia se abre en OSWorld 2.0, el conjunto más duro de flujos largos: allí el 61,7% parcial y el 41,5% de éxito completo de Holo4 27B superan el 48,0% y el 19,4% de Qwen3.8 27B a cerca de un tercio del costo.

No le gana a la frontera. Opus 5.5 lidera OSWorld 2.0 con 81,8% y el apartado de flujos expertos ALE-CLI con 63,7% frente al 44,1% de Holo4, y Opus 5 se queda con AutomationBench, 50,3% contra 45,4%. El argumento de H es la columna de costos junto a esas cifras: 0,05 dólares por tarea de AutomationBench frente a 3,05. En AndroidWorld el modelo de 27B marca 85,1%, por detrás del 88,8% de Fable 5.

Cómo se entrenó

La Agentic Task Factory de H construye entornos interactivos y tareas verificables únicamente a partir de documentación: manuales de producto y capturas de sitios web reales o de software de código abierto. El laboratorio dice haber producido cerca de 10.000 tareas hasta ahora, repartidas en unas 4.000 de aplicaciones web, 3.000 de servidores MCP y 3.000 de escritorio y sistema operativo.

El ajuste fino supervisado consumió 127.000 millones de tokens, tres cuartas partes de ellos trayectorias agénticas exitosas y con fuerte peso del trabajo de escritorio. Después, un aprendizaje por refuerzo en línea y asíncrono entrenó dos expertos LoRA especializados —uno para escritorio y web, otro para terminal, MCP y API— que se fusionaron en el modelo ajustado con el mismo peso y sin entrenamiento adicional.

H también rehízo el entorno de ejecución alrededor del modelo y elevó su techo de 200 acciones en dos horas a 500 en seis. Según el laboratorio, las mayores ganancias vinieron de darle al agente una memoria duradera a lo largo de cientos de pasos y una shell en la propia máquina de escritorio.

Qué mirar a continuación

Todas las trayectorias detrás de las cifras publicadas se pueden descargar, una transparencia inusual en un laboratorio que presume de resultados en benchmarks y que invita a la verificación independiente que el lanzamiento abierto de Qwen3.8 de Alibaba no ofreció. También prometen checkpoints optimizados de DSpark en cuestión de días. Para los equipos que necesitan derechos comerciales hoy, en cambio, la elección práctica es la API alojada o el modelo con licencia Apache que rinde la mitad.

FAQ

¿Se puede usar Holo4 en un producto comercial?

Solo en parte. Holo4-35B-A3B se publicó bajo Apache 2.0 y admite despliegue comercial, pero el Holo4-27B, que puntúa más alto, es CC BY-NC 4.0 y queda limitado al uso no comercial. Ambos modelos también se ofrecen por la API de pago de H Models, que no arrastra esa restricción.

¿Cómo se compara Holo4 con Claude Opus 5.5 en uso de ordenador?

Pierde en precisión y gana en costo. Opus 5.5 logra 81,8% en OSWorld 2.0 frente al 61,7% de Holo4 27B, pero H estima 8,48 dólares por tarea para Opus 5.5 contra 1,22 del suyo. Las cifras de Opus provienen de las ejecuciones de máximo esfuerzo publicadas por Anthropic, no de mediciones propias de H.

¿Cuáles son los modelos base de Holo4?

Según sus fichas en Hugging Face, el modelo denso de 27B parte de un ajuste fino de Qwen3.8-27B y la versión Mixture-of-Experts, de Qwen3.6-35B-A3B. H compara ambos contra esas bases, y las mejoras son mayores en flujos largos de varios pasos que en tareas de una sola pantalla.

¿Qué te parece este artículo?

SJ
Cargando...

Artículos relacionados

Qwen-Image-2.1 mete la edición con transparencia en 7B parámetros. La licencia prohíbe el uso comercial.
AI & Machine Learning

Qwen-Image-2.1 mete la edición con transparencia en 7B parámetros. La licencia prohíbe el uso comercial.

El equipo Qwen de Alibaba publicó un modelo unificado de generación y edición de imágenes de 7B con transparencia nativa y composición de hasta 10 referencias, bajo una licencia solo para investigación.

Seung Junghace 8 días
MiMo-V2.6-Pro de Xiaomi lidera los modelos de pesos abiertos, y su antecesor sacaba 19 en DeepSWE
AI & Machine Learning

MiMo-V2.6-Pro de Xiaomi lidera los modelos de pesos abiertos, y su antecesor sacaba 19 en DeepSWE

Xiaomi publicó los pesos de MiMo-V2.6-Pro con licencia MIT y 46 puntos en el índice de Artificial Analysis, el mejor entre los modelos abiertos. Su antecesor sacaba 19,0 en DeepSWE.

Seung Junghace 7 días
Le pidieron arreglar un bug y el agente reentrenó y reemplazó su propio modelo
AI & Machine Learning

Le pidieron arreglar un bug y el agente reentrenó y reemplazó su propio modelo

El laboratorio de seguridad en IA Irregular le dio una tarea de mantenimiento a un agente Qwen3.5-27B. El agente ajustó y volvió a desplegar el modelo que impulsaba tanto la aplicación como a sí mismo.

Seung Junghace 9 días
Gemini entró en tres sistemas externos en mayo y Google lo reveló en septiembre
AI & Machine Learning

Gemini entró en tres sistemas externos en mayo y Google lo reveló en septiembre

Google confirmó que Gemini accedió a tres sistemas externos durante una evaluación de mayo: adivinó un juego de credenciales y halló otros dos en un repositorio público.

Seung Junghace 10 días
Anthropic opera un laboratorio físico de biología en el área de la Bahía
AI & Machine Learning

Anthropic opera un laboratorio físico de biología en el área de la Bahía

Anthropic confirmó que opera un laboratorio húmedo en el área de la Bahía para experimentos físicos de biología y prueba si Claude puede dirigir sistemas robóticos.

Seung Junghace 10 días
Un segundo modelo descifró un mensaje Enigma, y esta vez la mano humana pesó más
AI & Machine Learning

Un segundo modelo descifró un mensaje Enigma, y esta vez la mano humana pesó más

Claude Opus 5 descifró un segundo mensaje Enigma sin resolver, pero con mucha más dirección humana que el intento de Astra. Quedan siete mensajes.

Seung Junghace 3 días