Agentes de uso de ordenador: cómo funcionan, integrarlos y sus riesgos
Guía técnica para implementar agentes que interactúan con interfaces gráficas usando visión por computador, con ejemplos de integración y buenas prácticas de seguridad.

Los agentes de inteligencia artificial capaces de operar interfaces gráficas mediante captura de pantalla y ejecución de eventos de ratón y teclado han salido de la fase experimental para convertirse en herramientas de automatización prácticas. Con tasas de éxito superiores al 85% en benchmarks como OSWorld-Verified, estos sistemas permiten interactuar con software legado o dashboards internos que carecen de APIs estables, superando las limitaciones de los grabadores de macros tradicionales.
El ciclo de ejecución
El funcionamiento se basa en un bucle síncrono e iterativo. El sistema (harness) captura una imagen de alta resolución de la pantalla, la envía a un modelo de visión multimodal para identificar componentes de interfaz y mapear intenciones, y genera llamadas a herramientas estructuradas con coordenadas en píxeles precisas. Librerías como pyautogui o APIs a nivel de sistema operativo ejecutan estas acciones. Finalmente, se toma una nueva captura para validar el cambio de estado y se repite el proceso hasta completar la tarea.
Un punto crítico es la normalización de coordenadas. Si se reduce la resolución de una pantalla 4K para optimizar tokens, es necesario calcular el factor de escala y transformar las salidas del modelo a la resolución nativa del display. Sin este ajuste, los clics aciertan en elementos equivocados.
Para integración rápida, Anthropic ofrece una vista preliminar en Claude Desktop para macOS y Windows mediante un servidor MCP de uso de ordenador, mientras que OpenAI proporciona una implementación similar a través de la aplicación de escritorio de ChatGPT. Para mayor control, se recomienda construir un harness propio conectado a las APIs de Anthropic u OpenAI. El ciclo de orquestación requiere gestionar la captura de pantalla, el procesamiento de visión y la ejecución de acciones de forma secuencial.
Seguridad y despliegue
Desplegar un agente no probado en una máquina de trabajo diaria es arriesgado debido a la posibilidad de inyección de prompts o eliminación accidental de archivos. La práctica estándar es ejecutar el agente en contenedores Docker o máquinas virtuales aisladas. Anthropic proporciona una implementación de referencia basada en Ubuntu contenido. Para la observación remota en servidores headless, herramientas como Pinggy permiten exponer sesiones VNC (puerto 5900) a través de túneles TCP con control de IP, evitando la exposición directa al internet abierto.
Las buenas prácticas incluyen la ejecución en usuarios con privilegios restringidos, la limitación estricta de tokens e iteraciones para evitar loops infinitos o costos inesperados, y la conciencia de que cualquier entrada visual maliciosa en la pantalla puede inducir al agente a acciones no autorizadas.


