La parisina H Company lanzó Holo4 el 28 de septiembre: dos modelos de uso de ordenador con pesos abiertos cuya versión más pequeña, de 27.000 millones de parámetros, encabeza todas las cifras que publicó el laboratorio y que, sin embargo, no puede incorporarse legalmente a un producto comercial.
La trampa no está en el anuncio sino en las fichas de los modelos. Holo4-27B en Hugging Face lleva licencia CC BY-NC 4.0, que lo restringe al uso no comercial. El único con Apache 2.0 es el hermano más débil, Holo4-35B-A3B, y en flujos largos de escritorio saca aproximadamente la mitad de puntuación.
Key takeaways
- Holo4-27B logra 61,7% en OSWorld 2.0 por un costo estimado de 1,22 dólares por tarea, frente al 81,8% y 8,48 dólares de Claude Opus 5.5.
- Los pesos del 27B son CC BY-NC 4.0; solo la versión Mixture-of-Experts 35B-A3B es Apache 2.0, y esa llega al 30,9% en el mismo benchmark.
- H entrenó ambos modelos con unas 10.000 tareas generadas por su propia Agentic Task Factory y publicó todas las trayectorias de los benchmarks para que se puedan revisar.
Un solo modelo para interfaces, código y llamadas a herramientas
Holo4 está pensado para manejar software con la interfaz que tenga delante: hacer clic y escribir en una pantalla, redactar y ejecutar su propio código, o llamar herramientas de MCP y de API. En su publicación de lanzamiento, H sostiene que la mayoría de los modelos agénticos elige un solo carril: los entrenados con interfaces gráficas quedan ciegos sin pantalla, mientras que los de llamada a herramientas se atascan ante una aplicación sin API. Y una sola tarea de trabajo suele exigir las dos cosas.
El mismo checkpoint corre en escritorio, web, Android, un sandbox de código y contra APIs corporativas, y se invoca igual en todos los casos. Ambos tamaños llegaron a la API de H Models el mismo día del lanzamiento, junto con una versión actualizada del modelo pequeño Holotron4 Nano.
Dónde caen realmente las cifras
En el OSWorld original de escritorio, Holo4 27B alcanza 85,2% por 0,08 dólares la tarea, apenas por delante de su propio modelo base, Qwen3.8 27B, con 84,3% y 0,22 dólares, y justo por detrás de Fable 5 con 86,0%. La diferencia se abre en OSWorld 2.0, el conjunto más duro de flujos largos: allí el 61,7% parcial y el 41,5% de éxito completo de Holo4 27B superan el 48,0% y el 19,4% de Qwen3.8 27B a cerca de un tercio del costo.
No le gana a la frontera. Opus 5.5 lidera OSWorld 2.0 con 81,8% y el apartado de flujos expertos ALE-CLI con 63,7% frente al 44,1% de Holo4, y Opus 5 se queda con AutomationBench, 50,3% contra 45,4%. El argumento de H es la columna de costos junto a esas cifras: 0,05 dólares por tarea de AutomationBench frente a 3,05. En AndroidWorld el modelo de 27B marca 85,1%, por detrás del 88,8% de Fable 5.
Cómo se entrenó
La Agentic Task Factory de H construye entornos interactivos y tareas verificables únicamente a partir de documentación: manuales de producto y capturas de sitios web reales o de software de código abierto. El laboratorio dice haber producido cerca de 10.000 tareas hasta ahora, repartidas en unas 4.000 de aplicaciones web, 3.000 de servidores MCP y 3.000 de escritorio y sistema operativo.
El ajuste fino supervisado consumió 127.000 millones de tokens, tres cuartas partes de ellos trayectorias agénticas exitosas y con fuerte peso del trabajo de escritorio. Después, un aprendizaje por refuerzo en línea y asíncrono entrenó dos expertos LoRA especializados —uno para escritorio y web, otro para terminal, MCP y API— que se fusionaron en el modelo ajustado con el mismo peso y sin entrenamiento adicional.
H también rehízo el entorno de ejecución alrededor del modelo y elevó su techo de 200 acciones en dos horas a 500 en seis. Según el laboratorio, las mayores ganancias vinieron de darle al agente una memoria duradera a lo largo de cientos de pasos y una shell en la propia máquina de escritorio.
Qué mirar a continuación
Todas las trayectorias detrás de las cifras publicadas se pueden descargar, una transparencia inusual en un laboratorio que presume de resultados en benchmarks y que invita a la verificación independiente que el lanzamiento abierto de Qwen3.8 de Alibaba no ofreció. También prometen checkpoints optimizados de DSpark en cuestión de días. Para los equipos que necesitan derechos comerciales hoy, en cambio, la elección práctica es la API alojada o el modelo con licencia Apache que rinde la mitad.
FAQ
¿Se puede usar Holo4 en un producto comercial?
Solo en parte. Holo4-35B-A3B se publicó bajo Apache 2.0 y admite despliegue comercial, pero el Holo4-27B, que puntúa más alto, es CC BY-NC 4.0 y queda limitado al uso no comercial. Ambos modelos también se ofrecen por la API de pago de H Models, que no arrastra esa restricción.
¿Cómo se compara Holo4 con Claude Opus 5.5 en uso de ordenador?
Pierde en precisión y gana en costo. Opus 5.5 logra 81,8% en OSWorld 2.0 frente al 61,7% de Holo4 27B, pero H estima 8,48 dólares por tarea para Opus 5.5 contra 1,22 del suyo. Las cifras de Opus provienen de las ejecuciones de máximo esfuerzo publicadas por Anthropic, no de mediciones propias de H.
¿Cuáles son los modelos base de Holo4?
Según sus fichas en Hugging Face, el modelo denso de 27B parte de un ajuste fino de Qwen3.8-27B y la versión Mixture-of-Experts, de Qwen3.6-35B-A3B. H compara ambos contra esas bases, y las mejoras son mayores en flujos largos de varios pasos que en tareas de una sola pantalla.






