Computer Use Agents (CUAs)
Descubre cómo los Agentes de Uso de Computadora (CUA) automatizan GUIs como los humanos. Aprende a construir sistemas de percepción CUA avanzados usando Ultralytics YOLO26.
Los Computer Use Agents (CUAs) representan un gran avance en la forma en que los sistemas de inteligencia artificial interactúan con entornos digitales. A diferencia de los AI Agents tradicionales que dependen exclusivamente de API de backend o de instrucciones basadas en texto, un CUA está diseñado para interactuar con una interfaz gráfica de usuario (GUI) exactamente como lo haría un humano. Al observar la pantalla, mover un cursor, hacer clic en elementos y escribir en un teclado virtual, los CUAs cierran la brecha entre las capacidades abstractas de la Generative AI y las operaciones de software prácticas y cotidianas.
Esta evolución se considera a menudo como un paso hacia la Artificial General Intelligence (AGI), ya que desafía las limitaciones históricas de la inteligencia de las máquinas —a veces denominada Moravec's Paradox— al requerir que la IA perciba y navegue de forma fluida por entornos visuales idiosincrásicos.
El cambio hacia las interfaces visuales#
Históricamente, automatizar tareas en diferentes aplicaciones de software requería integraciones directas o un rígido DOM-based parsing. Sin embargo, la última generación de CUAs utiliza avanzados Vision-Language Models (VLM) y sofisticadas técnicas de Computer Vision (CV) para interpretar los píxeles de una pantalla.
Avances significativos entre finales de 2024 y principios de 2025 han acelerado la adopción de CUAs. Por ejemplo, Anthropic's Claude Computer Use introdujo una API generalizada para que los modelos observen un escritorio y hagan clic en aplicaciones. De igual manera, OpenAI's Operator debutó como una vista previa de investigación capaz de ejecutar tareas de navegación web abiertas. Estos sistemas se evalúan ahora de forma rutinaria en benchmarks rigurosos como WebArena y OSWorld para medir su capacidad de completar flujos de trabajo digitales complejos y de múltiples pasos.
Debido a que estos agentes tienen control directo sobre un sistema, se recomienda encarecidamente a los desarrolladores que los ejecuten dentro de Virtual Machines en entorno aislado para mitigar riesgos como acciones no deseadas o Prompt Injection maliciosos.
Aplicaciones en el mundo real#
Los CUA están transformando rápidamente los sectores al ejecutar tareas complejas de varios pasos a través de ecosistemas de software aislados.
- Control de Calidad Autónomo (QA): En GUI automation testing, los CUAs pueden navegar visualmente a través de aplicaciones web, hacer clic en flujos de trabajo de usuario y verificar elementos de diseño sin scripts de prueba frágiles. Si un botón cambia de color o se mueve, el agente se adapta de forma natural.
- Automatización Robótica de Procesos Heredados: Para aplicaciones de escritorio antiguas que carecen de API modernas, los CUAs potencian la Robotic Process Automation (RPA). El agente puede abrir un CRM heredado, leer facturas no estructuradas y escribir manualmente los datos extraídos en el sistema, agilizando la entrada de datos empresariales.
Desarrollar la percepción para los CUA#
Aunque los VLM grandes pueden analizar capturas de pantalla completas, a menudo resulta más eficiente y preciso combinarlos con modelos de object detection localizados. Estos modelos mapean UI elements como botones, iconos y campos de texto en tiempo real, proporcionando coordenadas exactas para que el agente haga clic.
Los desarrolladores pueden usar frameworks como PyTorch junto con el modelo Ultralytics YOLO26 para construir capas de percepción altamente receptivas para un CUA. La Ultralytics Platform se puede utilizar para el model training en conjuntos de datos de GUI personalizados. El siguiente fragmento de Python demuestra cómo un CUA podría usar el predict mode del paquete ultralytics para encontrar un botón en la pantalla:
from ultralytics import YOLO
# Initialize a YOLO26 model specifically trained to detect GUI components
model = YOLO("yolo26n-gui.pt")
# The CUA captures a screenshot and maps out the visual interface
results = model.predict("desktop_screenshot.png")
# The agent extracts coordinates to execute a physical action (e.g., mouse click)
for box in results[0].boxes:
if model.names[int(box.cls)] == "button":
x1, y1, x2, y2 = box.xyxy[0].tolist()
print(f"CUA Action: Moving cursor to center of button at ({(x1 + x2) / 2}, {(y1 + y2) / 2})")CUA frente a conceptos relacionados#
Comprender cómo encajan los Computer Use Agents en el ecosistema de IA más amplio es esencial para implementar las estrategias de action chunking adecuadas:
- vs. Auto-GPT: Mientras que Auto-GPT es un agente autónomo que se basa principalmente en la generación de texto y scripts predefinidos para recorrer tareas en bucle, un CUA interactúa intrínsecamente de forma directa con interfaces visuales y sistemas operativos.
- vs. Llamada a funciones (Uso de herramientas): Function Calling (Tool Use) permite que una IA ejecute una función de código de backend específica y predefinida (como recuperar una API del clima). En contraste, los CUAs ejecutan acciones de UI de front-end, manipulando el entorno digital exactamente como lo haría un usuario final.






