Computer Use Agents (CUAs)
Entdecke, wie Computer Use Agents (CUAs) grafische Benutzeroberflächen wie Menschen automatisieren. Lerne, fortschrittliche CUA-Wahrnehmungssysteme mit Ultralytics YOLO26 zu entwickeln.
Computer Use Agents (CUAs) stellen einen großen Sprung in der Interaktion von Künstlicher Intelligenz mit digitalen Umgebungen dar. Im Gegensatz zu traditionellen AI Agents, die ausschließlich auf Backend-APIs oder textbasierte Prompts angewiesen sind, ist ein CUA so konzipiert, dass er genau wie ein Mensch mit einer grafischen Benutzeroberfläche (GUI) interagiert. Indem sie den Bildschirm beobachten, einen Cursor bewegen, auf Elemente klicken und auf einer virtuellen Tastatur tippen, schlagen CUAs die Brücke zwischen abstrakten Generative AI-Fähigkeiten und praktischen, alltäglichen Software-Aktivitäten.
Diese Entwicklung wird oft als Schritt in Richtung Artificial General Intelligence (AGI) angesehen, da sie die historischen Einschränkungen der maschinellen Intelligenz – die manchmal als Moravec's Paradox bezeichnet werden – herausfordert, indem sie von der KI verlangt, eigenwillige visuelle Umgebungen nahtlos wahrzunehmen und zu navigieren.
Der Wandel zu visuellen Schnittstellen#
Historisch gesehen erforderte die Automatisierung von Aufgaben über verschiedene Softwareanwendungen hinweg direkte Integrationen oder starre DOM-based parsing. Die neueste Generation von CUAs nutzt jedoch fortschrittliche Vision-Language Models (VLM) und ausgefeilte Computer Vision (CV)-Techniken, um Pixel auf einem Bildschirm zu interpretieren.
Signifikante Durchbrüche zwischen Ende 2024 und Anfang 2025 haben die Einführung von CUAs beschleunigt. Beispielsweise führte Anthropic's Claude Computer Use eine verallgemeinerte API für Modelle ein, um einen Desktop zu betrachten und in Anwendungen herumzuklicken. Ähnlich debütierte OpenAI's Operator als Forschungsvorschau, die offene Webbrowser-Aufgaben ausführen kann. Diese Systeme werden nun routinemäßig anhand strenger Benchmarks wie WebArena und OSWorld bewertet, um ihre Fähigkeit zu messen, komplexe, mehrstufige digitale Workflows abzuschließen.
Da diese Agenten die direkte Kontrolle über ein System besitzen, wird Entwicklern dringend empfohlen, sie in isolierten Virtual Machines auszuführen, um Risiken wie unbeabsichtigte Aktionen oder böswillige Prompt Injection zu mindern.
Praxisanwendungen#
CUAs verändern Branchen rapide, indem sie komplexe, mehrstufige Aufgaben über isolierte Software-Ökosysteme hinweg ausführen.
- Autonomous Quality Assurance (QA): Bei der GUI automation testing können CUAs visuell durch Webanwendungen navigieren, durch Benutzer-Workflows klicken und Layoutelemente ohne fragile Testskripte überprüfen. Wenn ein Button seine Farbe ändert oder sich bewegt, passt sich der Agent auf natürliche Weise an.
- Legacy Robotic Process Automation: Für ältere Desktop-Anwendungen, denen moderne APIs fehlen, optimieren CUAs Robotic Process Automation (RPA) maßgeblich. Der Agent kann ein Altsystem-CRM öffnen, unstrukturierte Rechnungen lesen und die extrahierten Daten manuell in das System tippen, wodurch die Unternehmensdateneingabe optimiert wird.
Wahrnehmung für CUAs aufbauen#
Während große VLMs ganze Screenshots analysieren können, ist es oft effizienter und genauer, sie mit lokalisierten object detection-Modellen zu koppeln. Diese Modelle bilden UI elements wie Buttons, Symbole und Textfelder in Echtzeit ab und liefern dem Agenten exakte Koordinaten zum Anklicken.
Entwickler können Frameworks wie PyTorch neben dem Ultralytics YOLO26-Modell verwenden, um hochgradig reaktionsfähige Wahrnehmungsschichten für ein CUA aufzubauen. Die Ultralytics Platform kann für model training auf benutzerdefinierten GUI-Datensätzen genutzt werden. Das folgende Python-Snippet veranschaulicht, wie ein CUA den predict mode des Pakets ultralytics verwenden könnte, um einen Button auf dem Bildschirm zu finden:
from ultralytics import YOLO
# Initialize a YOLO26 model specifically trained to detect GUI components
model = YOLO("yolo26n-gui.pt")
# The CUA captures a screenshot and maps out the visual interface
results = model.predict("desktop_screenshot.png")
# The agent extracts coordinates to execute a physical action (e.g., mouse click)
for box in results[0].boxes:
if model.names[int(box.cls)] == "button":
x1, y1, x2, y2 = box.xyxy[0].tolist()
print(f"CUA Action: Moving cursor to center of button at ({(x1 + x2) / 2}, {(y1 + y2) / 2})")CUAs vs. verwandte Konzepte#
Es ist von entscheidender Bedeutung zu verstehen, wie Computer Use Agents in das breitere KI-Ökosystem passen, um die richtigen action chunking-Strategien zu implementieren:
- vs. Auto-GPT: Während Auto-GPT ein autonomer Agent ist, der sich primär auf Texterzeugung und vordefinierte Skripte verlässt, um Aufgaben in Schleifen auszuführen, interagiert ein CUA inhärent direkt mit visuellen Schnittstellen und Betriebssystemen.
- vs. Function Calling (Tool Use): Function Calling (Tool Use) ermöglicht es einer KI, eine spezifische, vordefinierte Backend-Codefunktion auszuführen (wie das Abrufen einer Wetter-API). Im Gegensatz dazu führen CUAs Front-End-UI-Aktionen aus und manipulieren die digitale Umgebung genau so, wie es ein Endbenutzer tun würde.






