AI Agent
Erkunde die Welt der AI-Agenten. Erfahre, wie diese autonomen Systeme Ultralytics YOLO26 nutzen, um in Echtzeit wahrzunehmen, zu schlussfolgern und zu handeln und komplexe Aufgaben zu lösen.
Ein KI-Agent ist ein autonomes System, das seine Umgebung wahrnehmen, komplexe Zusammenhänge analysieren und Schlussfolgerungen ziehen kann, um Entscheidungen zu treffen und bestimmte Aktionen zur Erreichung definierter Ziele auszuführen. Im Gegensatz zu einem statischen Machine-Learning-Modell, das Eingaben passiv verarbeitet, um eine Ausgabe zu erzeugen, arbeitet ein Agent dynamisch innerhalb eines kontinuierlichen Arbeitsablaufs. Diese Systeme bilden die „aktive“ Ebene der künstlichen Intelligenz und schließen die Lücke zwischen digitalen Vorhersagen und der Ausführung in der realen Welt. Mithilfe von Gedächtnis und adaptivem Lernen können Agenten Aufgaben von der Softwareautomatisierung bis zur physischen Navigation ohne ständiges menschliches Eingreifen bewältigen.
Die Schleife aus Wahrnehmung, Schlussfolgern und Handeln#
Die Funktionsweise eines KI-Agenten beruht auf einem zyklischen Prozess, der häufig als Wahrnehmungs-Aktions-Schleife bezeichnet wird. Diese Architektur ermöglicht es dem Agenten, sinnvoll mit seiner Umgebung zu interagieren.
-
Wahrnehmung (Erfassen): Der Agent sammelt Informationen aus der Welt. In Anwendungen der Computer Vision nutzt der Agent Kameras als „Augen“. Er verwendet schnelle Modelle wie YOLO26, um Objekterkennung oder Segmentierung durchzuführen und rohe Pixel in strukturierte Daten umzuwandeln.
-
Schlussfolgern (Denken): Der Agent verarbeitet die wahrgenommenen Daten im Hinblick auf seine Ziele. In dieser Phase werden häufig große Sprachmodelle (LLMs) zum semantischen Verständnis oder Algorithmen für bestärkendes Lernen eingesetzt, um Strategien zur Entscheidungsoptimierung zu entwickeln. Fortschrittliche Agenten können mehrere Schritte im Voraus planen, ähnlich wie ein Schachspieler, der zukünftige Züge vorausberechnet.
-
Handeln (Ausführen): Auf Grundlage seiner Schlussfolgerungen führt der Agent eine Aufgabe aus. Dabei kann es sich um eine digitale Aktion handeln, etwa das Abfragen einer Datenbank oder das Senden eines Alarms, oder um eine physische Aktion in der Robotik, beispielsweise wenn ein Roboterarm einen bestimmten Gegenstand von einem Förderband aufnimmt.
KI-Agent im Vergleich zu KI-Modell#
Es ist wichtig, zwischen einem Agenten und einem Modell zu unterscheiden, da sie im Technologiestack unterschiedliche Rollen erfüllen.
- KI-Modell: Ein Modell ist eine mathematische Recheneinheit, beispielsweise ein neuronales Netz, das darauf trainiert wurde, Muster zu erkennen. Es ist ein Werkzeug, das Vorhersagen liefert, etwa „Das ist ein Auto“, aber nicht selbstständig auf diese Vorhersagen reagiert.
- KI-Agent: Ein Agent ist das übergeordnete System, das Modelle als Werkzeuge verwendet. Er besitzt Handlungsfähigkeit – also die Fähigkeit, Veränderungen herbeizuführen. Während ein Modell beispielsweise eine rote Ampel erkennt, entscheidet der Agent, die Bremsen zu betätigen.
Anwendungen in der Praxis#
KI-Agenten verändern Branchen, indem sie Arbeitsabläufe automatisieren, die kognitive Flexibilität erfordern.
- Intelligente Fertigung: In der industriellen Automatisierung überwachen visuelle Agenten Produktionslinien. Wenn ein Qualitätskontrollsystem einen Fehler erkennt, kann der Agent die Maschinen autonom anhalten und den Vorfall protokollieren, um Ausschuss zu vermeiden.
- Autonome Logistik: Lager nutzen agentenbasierte Roboter für die Bestandsverwaltung. Diese Agenten navigieren mithilfe von SLAM (Simultane Lokalisierung und Kartenerstellung) und Bildverarbeitungsmodellen durch dynamische Umgebungen, um Pakete effizient zu finden, aufzunehmen und zu transportieren.
Einen einfachen Bildverarbeitungsagenten erstellen#
Entwickler können einfache Agenten erstellen, indem sie Wahrnehmungsmodelle mit bedingter Logik kombinieren. Das folgende Python-Beispiel zeigt einen einfachen „Sicherheitsagenten“, der das Paket ultralytics verwendet. Der Agent erkennt eine Person und entscheidet auf Grundlage der Konfidenz des Modells, ob ein Alarm ausgelöst werden soll.
from ultralytics import YOLO
# Load the YOLO26 model (The Agent's Perception)
model = YOLO("yolo26n.pt")
# 1. Perceive: The agent analyzes an image
results = model("bus.jpg")
# 2. Reason & 3. Act: Decision logic based on perception
for result in results:
# Check if a 'person' (class 0) is detected with high confidence
if 0 in result.boxes.cls and result.boxes.conf.max() > 0.5:
print("ACTION: Person detected! Initiating security protocol.")
else:
print("ACTION: Area clear. Continuing surveillance.")Verwandte Konzepte#
- Edge-KI: Um in Echtzeit zu reagieren, laufen Agenten häufig lokal auf Hardware wie dem NVIDIA Jetson. Dadurch wird die Latenz minimiert, weil die Daten an der Quelle statt in der Cloud verarbeitet werden.
- Künstliche allgemeine Intelligenz (AGI): Während aktuelle Agenten spezialisiert sind (enge KI), bezeichnet AGI hypothetische Agenten, die jede intellektuelle Aufgabe ausführen können, zu der ein Mensch fähig ist.
- Generative KI: Moderne Agenten verwenden häufig GenAI, um dynamische Antworten oder Code zu erstellen, und fungieren dabei als Assistenten, die im Rahmen ihres Arbeitsablaufs Inhalte generieren können.
Wer die zugrunde liegenden Modelle für seine Agenten trainieren möchte, findet in der Ultralytics Platform eine optimierte Umgebung zum Annotieren von Datensätzen und Verwalten von Trainingsläufen. Weitere Informationen zu Agentenarchitekturen findest du in Forschungsarbeiten von Organisationen wie Stanford HAI und DeepMind.









