AI Agent
Erkunde die Welt der KI-Agenten. Lerne, wie diese autonomen Systeme Ultralytics YOLO26 nutzen, um in Echtzeit wahrzunehmen, zu schlussfolgern und zu handeln, um komplexe Aufgaben zu lösen.
Ein AI Agent ist ein autonomes System, das in der Lage ist, seine Umgebung wahrzunehmen, komplexe Logik zu durchdenken, um Entscheidungen zu treffen, und bestimmte Aktionen auszuführen, um definierte Ziele zu erreichen. Im Gegensatz zu einem statischen machine learning-Modell, das Eingaben passiv verarbeitet, um eine Ausgabe zu erzeugen, agiert ein Agent dynamisch innerhalb eines kontinuierlichen Workflows. Diese Systeme bilden die „aktive“ Schicht der artificial intelligence und schlagen die Brücke zwischen digitalen Vorhersagen und der Ausführung in der realen Welt. Durch die Nutzung von Speicher und adaptivem Lernen können Agenten Aufgaben bewältigen, die von Software-Automatisierung bis hin zu physischer Navigation reichen, ganz ohne ständiges menschliches Eingreifen.
Die Wahrnehmungs-Schlussfolgerungs-Aktions-Schleife#
Die Funktionalität eines KI-Agenten beruht auf einem zyklischen Prozess, der oft als Wahrnehmungs-Aktions-Schleife (Perception-Action Loop) beschrieben wird. Diese Architektur ermöglicht es dem Agenten, sinnvoll mit seiner Umgebung zu interagieren.
-
Perception (Sensing): Der Agent sammelt Informationen aus der Welt. In computer vision-Anwendungen nutzt der Agent Kameras als „Augen“. Er setzt Hochgeschwindigkeitsmodelle wie YOLO26 ein, um object detection oder Segmentierung durchzuführen und rohe Pixel in strukturierte Daten umzuwandeln.
-
Reasoning (Thinking): Der Agent verarbeitet die wahrgenommenen Daten im Hinblick auf seine Ziele. Diese Phase integriert häufig Large Language Models (LLMs) für das semantische Verständnis oder reinforcement learning-Algorithmen zur Optimierung von Entscheidungsfindungsstrategien. Fortgeschrittene Agenten können mehrere Schritte im Voraus planen, ähnlich wie ein Schachspieler, der zukünftige Züge antizipiert.
-
Action (Executing): Basierend auf seinem Reasoning führt der Agent eine Aufgabe aus. Dies kann eine digitale Aktion sein, wie das Abfragen einer Datenbank oder das Senden einer Warnung, oder eine physische Aktion in der robotics, wie beispielsweise ein Roboterarm, der einen bestimmten Gegenstand von einem Förderband greift.
KI-Agent vs. KI-Modell#
Es ist wichtig, zwischen einem Agenten und einem Modell zu unterscheiden, da sie unterschiedliche Rollen im Technologie-Stack einnehmen.
- AI Model: Ein Modell ist eine mathematische Engine wie ein neural network, das darauf trainiert ist, Muster zu erkennen. Es ist ein Werkzeug, das Vorhersagen liefert (z. B. „Das ist ein Auto“), aber nicht von Natur aus darauf reagiert.
- KI-Agent: Ein Agent ist das umfassende System, das Modelle als Werkzeuge nutzt. Er besitzt Agency – die Fähigkeit, Veränderungen einzuleiten. Während ein Modell beispielsweise ein rotes Licht erkennt, entscheidet der Agent, die Bremsen zu betätigen.
Praxisanwendungen#
KI-Agenten verändern Industrien, indem sie Arbeitsabläufe automatisieren, die kognitive Flexibilität erfordern.
- Smart Manufacturing: In der industrial automation überwachen visuelle Agenten Produktionslinien. Wird von einem quality control system ein Defekt festgestellt, kann der Agent Maschinen autonom anhalten und den Vorfall protokollieren, um Ausschuss zu vermeiden.
- Autonomous Logistics: Lagerhäuser nutzen agentenbasierte Roboter für die Bestandsverwaltung. Diese Agenten navigieren mithilfe von SLAM (Simultaneous Localization and Mapping) und Visionsmodellen durch dynamische Umgebungen, um Pakete effizient zu finden, zu greifen und zu transportieren.
Einen einfachen Vision-Agenten erstellen#
Entwickler können grundlegende Agenten erstellen, indem sie Wahrnehmungsmodelle mit bedingter Logik kombinieren. Das folgende Python-Beispiel demonstriert einen einfachen „Security Agent“ unter Verwendung des ultralytics-Pakets. Der Agent erkennt eine Person und entscheidet anhand der Konfidenz des Modells, ob ein Alarm ausgelöst wird.
from ultralytics import YOLO
# Load the YOLO26 model (The Agent's Perception)
model = YOLO("yolo26n.pt")
# 1. Perceive: The agent analyzes an image
results = model("bus.jpg")
# 2. Reason & 3. Act: Decision logic based on perception
for result in results:
# Check if a 'person' (class 0) is detected with high confidence
if 0 in result.boxes.cls and result.boxes.conf.max() > 0.5:
print("ACTION: Person detected! Initiating security protocol.")
else:
print("ACTION: Area clear. Continuing surveillance.")Verwandte Konzepte#
- Edge AI: Um in Echtzeit zu reagieren, laufen Agenten oft lokal auf Hardware wie dem NVIDIA Jetson, wodurch die Latenz minimiert wird, indem Daten an der Quelle statt in der Cloud verarbeitet werden.
- Artificial General Intelligence (AGI): Während aktuelle Agenten spezialisiert sind (Narrow AI), bezieht sich AGI auf hypothetische Agenten, die jede intellektuelle Aufgabe ausführen können, die auch ein Mensch erledigen kann.
- Generative AI: Moderne Agenten verwenden häufig GenAI, um dynamische Antworten oder Code zu erstellen, und fungieren als Assistenten, die als Teil ihres Workflows Inhalte generieren können.
Für diejenigen, die die zugrunde liegenden Modelle für ihre Agenten trainieren möchten, bietet die Ultralytics Platform eine optimierte Umgebung zum Annotieren von Datensätzen und Verwalten von Trainingsläufen. Weiterführende Literatur zu Agentenarchitekturen findet sich in Forschungsarbeiten von Organisationen wie Stanford HAI und DeepMind.






