Large Action Models (LAM)
Entdecke Large Action Models (LAM) und erfahre, wie sie autonome KI-Agenten antreiben. Erfahre, wie du Ultralytics YOLO26 für Workflows von der Bildverarbeitung zur Aktion und zur Aufgabenautomatisierung integrierst.
Große Aktionsmodelle (LAM) sind eine fortschrittliche Klasse generativer künstlicher Intelligenz, die über die Texterzeugung hinausgeht, indem sie autonom Aufgaben ausführt und mit digitalen Umgebungen interagiert. Im Gegensatz zu herkömmlichen Modellen, die ausschließlich Text verarbeiten und erzeugen, fungieren LAMs als kognitive Kernkomponente für KI-Agenten, indem sie menschliche Absichten in konkrete, mehrstufige Aktionen übersetzen. Indem sie die Lücke zwischen dem Verständnis natürlicher Sprache und der Ausführung in der realen Welt schließen, stellen diese Modelle einen bedeutenden Schritt in Richtung künstlicher allgemeiner Intelligenz (AGI) und hochautonomer Systeme dar.
Funktionsweise großer Aktionsmodelle#
LAMs bauen auf der grundlegenden Architektur herkömmlicher Basismodelle auf, werden aber speziell darauf trainiert, mit Software, APIs und Webumgebungen zu interagieren. Mithilfe von Techniken wie bestärkendem Lernen und Funktionsaufrufen kann ein LAM eine komplexe Benutzeranfrage in logische Schritte zerlegen, grafische Benutzeroberflächen bedienen und API-Endpunkte ausführen. So zeigen beispielsweise die jüngsten Entwicklungen rund um Anthropics Claude 3.5 Computer Use und die xLAM-Familie von Salesforce, wie diese Systeme autonom Schaltflächen anklicken, Formulare ausfüllen und Arbeitsabläufe genauso verwalten können wie ein menschlicher Bediener.
In Kombination mit Systemen für Computer Vision werden LAMs noch leistungsfähiger. Visuelle Eingaben können von hocheffizienten Modellen wie Ultralytics YOLO26 verarbeitet werden, sodass das LAM seine Umgebung „sehen“, den visuellen Kontext interpretieren und auf Grundlage der erkannten Inhalte bestimmte programmatische Aktionen auslösen kann.
Anwendungen in der Praxis#
LAMs verändern die Herangehensweise von Branchen an die Aufgabenautomatisierung und führen von passiver Unterstützung zu aktiver Ausführung.
- KI im Einzelhandel und Kundensupport: Statt lediglich Kundenfragen zu beantworten, kann ein LAM autonom eine Produktrückgabe bearbeiten. Wenn ein Benutzer darum bittet, eine Bestellung zu stornieren, kann das Modell die Abrechnungssoftware des Unternehmens bedienen, die Richtlinie prüfen, die Rückerstattung veranlassen und die Inventardatenbank ohne menschliches Eingreifen aktualisieren.
- KI in der Gesundheitsverwaltung: Im klinischen Umfeld koordinieren LAMs komplexe Arbeitsabläufe. Sie können Patientenanfragen extrahieren, die Verfügbarkeit von Ärzten abgleichen, Elektronische Patientenakten (EHR) automatisch über interne medizinische Software aktualisieren und die Terminplanung abschließen.
Automatisierung von Vision-Arbeitsabläufen mit Code#
LAMs werden häufig in Vision-Modelle integriert, um visuelle Prüfungen zu automatisieren. Das folgende Python-Beispiel zeigt, wie ein hypothetischer LAM-Arbeitsablauf ultralytics nutzen könnte, um ein Bild zu scannen und auf Grundlage der Ergebnisse der Objekterkennung eine automatisierte Bestandsaktion auszulösen.
from ultralytics import YOLO
# Load the recommended Ultralytics YOLO26 model for an agentic vision task
model = YOLO("yolo26n.pt")
# The LAM commands the model to scan a warehouse shelf image
results = model.predict("inventory_shelf.jpg")
# The LAM extracts actionable data to autonomously trigger a supply reorder
for result in results:
detected_items = len(result.boxes)
if detected_items < 10:
print(f"Low inventory ({detected_items} items). Action triggered: Reordering supplies via API.")Benutzer können solche integrierten visuellen Aktionsabläufe nahtlos mit der Ultralytics Platform bereitstellen und überwachen, die eine leistungsfähige Cloud-Infrastruktur für moderne KI-Lösungen bietet.
Verwandte Konzepte unterscheiden#
Um die moderne KI-Landschaft vollständig zu verstehen, ist es hilfreich, LAMs von anderen eng verwandten Begriffen zu unterscheiden:
- LAM vs. großes Sprachmodell (LLM): Ein LLM ist ausschließlich darauf ausgelegt, Sprache zu verarbeiten, zusammenzufassen und zu erzeugen – ähnlich wie ein hochentwickelter Textprädiktor. Ein LAM umfasst dieses Sprachverständnis, ist aber speziell darauf ausgelegt, mit externen Werkzeugen zu interagieren und digitale Aktionen abzuschließen.
- LAM vs. agentische KI: „Agentische KI“ bezeichnet das übergeordnete System oder die Softwareeinheit, die autonom arbeitet. Das große Aktionsmodell ist das zugrunde liegende neuronale Netzwerk – das „Gehirn“ –, das dem Agenten die Fähigkeit verleiht, diese Aktionen zu planen und auszuführen.
- LAM vs. agentisches RAG: Agentisches RAG konzentriert sich darauf, externe Informationen autonom abzurufen und zusammenzuführen, um die Genauigkeit einer generierten Antwort zu verbessern. Ein LAM konzentriert sich darauf, Systeme zu bedienen und Zustände zu verändern, etwa einen Flug zu buchen oder Dateien zu verschieben, anstatt lediglich Daten abzurufen.








