H lanza Holo 4, modelos abiertos que manejan interfaces gráficas de escritorio
El desarrollador francés H publica Holo 4, una familia de modelos de computer use con pesos abiertos que hace clic, escribe y se desplaza en Windows y Linux, además de operar por CLI y API.
El desarrollador francés H ha presentado este lunes Holo 4, una familia de modelos de uso de computadora que se maneja dentro de interfaces gráficas: hacer clic, escribir, desplazarse o arrastrar en aplicaciones de escritorio, además de operar por línea de comandos y API. Los pesos están abiertos y ya se pueden descargar, con versiones preparadas para llama.cpp.
La historia del uso de computadoras se reparte en tres terrenos: CLI, API y GUI. Un agente se enchufa sin problema a los dos primeros. El tercero, donde las aplicaciones anteponen la forma a la función, sigue siendo el hueso. Ahí apunta Holo 4.
Sobre qué está construido
El ajuste combina entrenamiento supervisado y aprendizaje por refuerzo sobre Qwen 3.8 27B y Qwen 3.6 35B-A3B de Alibaba. En paralelo, H ha actualizado Holotron, que parte de Nemotron 3 de Nvidia, con capacidades similares. El argumento de la empresa es la versatilidad: al optimizar para los tres escenarios a la vez, los modelos sirven para más cosas que un modelo de computer use puro.
En los ejemplos que ha enseñado, Holo 4 27B usa las macros de FreeCAD para generar por código un modelo 3D de la Torre Eiffel en lugar de montarlo a base de cubos, y en otro caso hace lo contrario, reconstruir el logotipo de la compañía con formas extruidas. Ambos son ejemplos de la propia empresa, verificados por nadie más.
Las cifras de rendimiento son suyas, no de un tercero. H sostiene que Holo 4 supera a modelos frontera mucho mayores de OpenAI con una fracción de los parámetros. El matiz incómodo: en muchos casos cuesta más por tarea. Con lo que se sabe de Qwen 3.8 27B, lo probable es que Holo 4 queme bastantes más tokens de "pensamiento" hasta llegar al resultado, frente a algo como GPT 6 Luna, que rinde peor en el benchmark OSWorld 2.0 pero sale más barato.
Qué hace falta para moverlo
El tamaño reducido tiene una consecuencia práctica: entra en hardware modesto. Una Nvidia RTX 3090 de 24 GB debería bastar para ejecutarlos a 4 bits. Hay pesos en BF16, FP8 y NVFP4, además del GGUF para llama.cpp y, por extensión, LM Studio y Ollama. Los modelos están en Hugging Face. H dice que publicará también pesos DSpark para acelerar la inferencia con decodificación especulativa, la técnica en la que un modelo pequeño adivina la salida del grande y se cae al base cuando falla.
Un modelo sin arnés no sirve de mucho. H mantiene varios, entre ellos el repositorio HAI-Agents, que es open source, y en teoría los modelos encajan con arneses de terceros. La competencia en este terreno ya tiene nombres: AWS presentó sus propios modelos de computer use en el Re:Invent del año pasado, y OpenAI, Google y Anthropic están invirtiendo en lo mismo.
Lo interesante no es que un modelo controle un escritorio, sino que esto llegue en abierto y a tamaño de tarjeta de consumo. El asterisco está en el coste por tarea, que es justo el dato que la empresa no destaca.


