Ultralytics YOLO27:
Zurück zum Glossar von Ultralytics

Grounding

Entdecke die Grundlagen des Grounding in der KI. Erfahre, wie du natürliche Sprache mithilfe von Ultralytics YOLO26 und YOLO-World mit visuellen Daten verknüpfst, um Erkennung mit offenem Vokabular zu ermöglichen.

Grounding bezeichnet die Fähigkeit eines Systems der künstlichen Intelligenz, abstrakte Konzepte – typischerweise aus natürlicher Sprache abgeleitet – mit spezifischen, konkreten Repräsentationen in der physischen Welt zu verknüpfen, etwa visuellen Daten oder sensorischen Eingaben. Im Kontext der Computer Vision bedeutet dies, dass ein Modell nicht einfach nur Text verarbeitet, sondern eine Formulierung wie „eine Person, die mit einem Hund spazieren geht“ analysieren und die entsprechenden Entitäten innerhalb eines Bildes oder Videostreams präzise lokalisieren kann. Dieser Prozess überbrückt die Lücke zwischen symbolischem Schlussfolgern und Wahrnehmung auf Pixelebene und befasst sich mit dem grundlegenden Problem der symbolischen Verankerung in der Kognitionswissenschaft. Durch die Verknüpfung sprachlicher Tokens mit visuellen Merkmalen ist Grounding ein Grundpfeiler moderner multimodaler KI und ermöglicht es Maschinen, intuitiver mit dynamischen menschlichen Umgebungen zu interagieren.

Die Funktionsweise von Grounding#

Auf technischer Ebene umfasst Grounding die Ausrichtung von Daten aus verschiedenen Modalitäten in einem gemeinsamen hochdimensionalen Vektorraum. Fortschrittliche Architekturen, die häufig auf dem Transformer-Framework aus der Verarbeitung natürlicher Sprache (NLP) aufbauen, erzeugen für Textbeschreibungen und visuelle Eingaben numerische Repräsentationen, die als Embeddings bezeichnet werden. Während des Trainings lernt das Modell, den Abstand zwischen dem Embedding einer Texteingabe (z. B. „blauer Rucksack“) und dem Embedding der entsprechenden visuellen Region zu minimieren.

Diese Ausrichtung ermöglicht die Erkennung mit offenem Vokabular. Anders als beim traditionellen überwachten Lernen, bei dem ein Modell auf eine feste Kategorienmenge beschränkt ist, ermöglicht Grounding Zero-Shot-Lernen. Ein Grounding-Modell kann Objekte identifizieren, die es während des Trainings nie explizit gesehen hat, sofern es die Sprache versteht, mit der sie beschrieben werden. Diese Flexibilität wird durch Deep-Learning-Frameworks wie PyTorch unterstützt, die die für diese multimodalen Ausrichtungen erforderlichen komplexen Matrixoperationen ermöglichen.

Anwendungen in der Praxis#

Die Grounding-Technologie verändert Branchen, indem sie Systemen ermöglicht, die Absichten von Benutzern zu interpretieren und sich effektiv in unstrukturierten Umgebungen zurechtzufinden.

  • KI in der Robotik: Grounding ist für autonome Agenten, die verbale Anweisungen ausführen, unverzichtbar. Wenn ein Lagerroboter die Anweisung erhält, „das Paket aus dem obersten Regal zu nehmen“, muss er die Konzepte „Paket“ und „oberstes Regal“ mit bestimmten 3D-Koordinaten in seinem Sichtfeld verknüpfen. Diese Fähigkeit ist ein wesentlicher Schwerpunkt der Robotikforschung am MIT CSAIL und ermöglicht es Robotern, sicher neben Menschen zu arbeiten.
  • Semantische Suche und Medienabruf: Grounding ermöglicht fortschrittliche Suchmaschinen, die über den Abgleich von Schlüsselwörtern hinausgehen. Benutzer können Videoarchive mit komplexen Beschreibungen wie „ein Radfahrer, der bei Sonnenuntergang nach links abbiegt“ durchsuchen, und das System verwendet Grounding, um bestimmte Zeitstempel abzurufen. Dies verbessert das Verständnis von Videos für Sicherheits- und Medienverwaltungsanwendungen erheblich.
  • Assistenztechnologie: Für Menschen mit Sehbehinderung ermöglicht Grounding Anwendungen, die Umgebung in Echtzeit zu beschreiben oder Fragen zur Umgebung zu beantworten, indem sie auf eine robuste, mit der Sprachgenerierung verknüpfte Bilderkennung zurückgreifen.

Grounding mit Ultralytics YOLO-World#

Das Ultralytics-Ökosystem unterstützt Grounding durch spezialisierte Architekturen wie YOLO-World. Während Standardmodelle ein Training mit bestimmten Datensätzen erfordern, können Benutzer mit YOLO-World mithilfe von Texteingaben sofort eigene Erkennungsklassen definieren. Dadurch wird die Eingabe in natürlicher Sprache effektiv im Bild verankert, ohne dass ein erneutes Training erforderlich ist.

Das folgende Beispiel zeigt, wie du das Paket ultralytics verwenden kannst, um Objekte anhand benutzerdefinierter Textbeschreibungen zu erkennen:

from ultralytics import YOLO

# Load a pre-trained YOLO-World model for open-vocabulary detection
model = YOLO("yolov8s-world.pt")

# Define custom text prompts (classes) to ground in the image
# The model maps these descriptions to visual features
model.set_classes(["person wearing hat", "blue backpack"])

# Run prediction on an image source to localize the described objects
results = model.predict("https://ultralytics.com/images/bus.jpg")

# Display the results
results[0].show()

Grounding von verwandten Konzepten unterscheiden#

Um den Nutzen von Grounding vollständig zu verstehen, ist es hilfreich, Grounding von ähnlichen Aufgaben der Computer Vision zu unterscheiden:

  • vs. Objekterkennung: Herkömmliche Erkennungsmodelle wie das hochmoderne YOLO26 identifizieren Objekte aus einer geschlossenen, vordefinierten Kategorienmenge (z. B. den 80 Klassen in COCO). Grounding ist offen angelegt und identifiziert Objekte anhand frei formulierter Texteingaben.
  • vs. Bildbeschreibung: Bei der Bildbeschreibung wird ein gesamtes Bild durch einen beschreibenden Satz erläutert (Bild $\to$ Text). Grounding arbeitet typischerweise in umgekehrter Richtung oder bidirektional und lokalisiert bestimmte visuelle Elemente anhand einer Texteingabe (Text $\to$ Bildregion).
  • vs. visuelle Fragebeantwortung (VQA): Bei VQA wird eine bestimmte Frage zu einem Bild beantwortet (z. B. „Welche Farbe hat das Auto?“). Grounding konzentriert sich speziell auf den Lokalisierungsschritt und zeichnet eine Bounding Box um das erwähnte Objekt.

Herausforderungen und Ausblick#

Trotz der Fortschritte bleibt Grounding rechenintensiv. Die Ausrichtung großer Sprachmodelle mit visuellen Encodern erfordert erhebliche GPU-Ressourcen und eine effiziente Speicherverwaltung – eine Herausforderung, der sich häufig Hardwareinnovatoren wie NVIDIA widmen. Darüber hinaus können Modelle Schwierigkeiten mit sprachlicher Mehrdeutigkeit haben, sodass große Kontextfenster erforderlich sind, um aufzulösen, ob sich das Wort „bat“ auf ein Sportgerät oder ein Tier bezieht.

Künftige Entwicklungen gehen in Richtung vereinheitlichter Basismodelle, die von Grund auf multimodal ausgelegt sind. Tools wie die Ultralytics Platform werden weiterentwickelt, um Entwicklern die Verwaltung der komplexen Datensätze zu erleichtern, die für diese Aufgaben erforderlich sind, und bieten optimierte Workflows für die Datenannotation und die Bereitstellung von Modellen. Mit der Weiterentwicklung dieser Technologien ist damit zu rechnen, dass Grounding nahtlos in Edge-Geräte integriert wird und dadurch intelligentere, reaktionsschnellere KI-Anwendungen ermöglicht.

Explore solutions

Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren

Lass uns gemeinsam die Zukunft der KI gestalten!

Beginne deine Reise in die Zukunft des maschinellen Lernens