Holo4 lanza dos modelos agénticos abiertos que operan GUI, código y API
H Company publica Holo4 en 27B denso y 35B-A3B MoE con pesos abiertos, y dice competir con modelos frontera en control de escritorio a menor coste por tarea.

H Company ha publicado Holo4, una familia de modelos agénticos en dos tamaños: 27B denso y 35B-A3B de mezcla de expertos. Ambos se distribuyen con pesos abiertos en FP16, FP8 y GGUF, y también se sirven desde la API de H Models. La compañía ha actualizado además Holotron4 Nano, la versión pequeña de su modelo anterior.
Lo que quiere vender no es el tamaño sino la interfaz. Holo4 hace clic y teclea sobre una pantalla, escribe y ejecuta su propio código y llama a herramientas por MCP o por API, eligiendo el canal que encaje con la tarea. La mayoría de los modelos agénticos se entrenan para uno solo: los que van a GUI se quedan ciegos sin pantalla, y los que tiran de tool calling se atascan delante de una aplicación sin API. Holo4 es el mismo modelo en escritorio, web, Android, sandbox de código y contra APIs de negocio, y se invoca igual en todos los casos.
Los números, con matices
Holo4 parte de una base Qwen y, según las cifras de la compañía, mejora de forma clara sobre Qwen3.8 27B. En OSWorld 2.0, el benchmark de control de escritorio, Holo4 27B marca 61,7% frente al 81,8% de Opus 5.5; el 35B-A3B se queda en 30,9%. La distancia con el modelo frontera es grande y H Company no la esconde: lo que reclama es que se recorta con muchos menos parámetros y a un coste por tarea bastante menor.
Ese coste es suyo, calculado a partir de los tokens de entrada y salida de cada ejecución a precios de la API de H Models. La comparación en AutomationBench también lo es: las puntuaciones y costes de Holo4, Qwen3.8 27B y Qwen3.6 35B-A3B salen de un harness interno, mientras que el resto de modelos toma la tabla pública, que corre sobre el conjunto privado. La propia compañía dice que reportará Holo4 sobre el conjunto privado cuando lo evalúe. Los harness y los subconjuntos de tareas no son idénticos, así que las líneas de esas gráficas hay que leerlas con la cautela habitual.
Sí hay algo comprobable: publican todas las trayectorias que hay detrás de sus puntuaciones en los benchmarks públicos. Se pueden reproducir paso a paso en el visor de trayectorias o descargarlas. El quickstart de la API está abierto para quien quiera medir por su cuenta.
Entrenados con aprendizaje supervisado y por refuerzo sobre entornos generados por su Agentic Task Factory, los ejemplos que enseñan son de software profesional: montar un modelo 3D de la Torre Eiffel en FreeCAD a partir de un pliego de especificaciones largo, o un Pac-Man en Godot que se juega solo con una heurística y corre sin intervención.
Que el mismo peso sirva para mover un ratón, escribir código y llamar a una API cambia la ecuación para quien despliega agentes: una sola integración y un solo modelo que mantener, en lugar de encadenar especialistas. Queda por ver si ese 61,7% aguanta fuera del harness propio, y qué pasa con el 35B-A3B, que se queda muy por detrás de su hermano denso.

