YOLO-World praktisch kennenlernen
Erfahre mehr über YOLO-World, ein innovatives Objekterkennungsmodell, das Objekte anhand von Texteingaben erkennen kann. Entdecke, wie YOLO-World funktioniert und eingesetzt wird, und probiere es mit einem kurzen Codebeispiel aus.

Bei Computer-Vision-Projekten wird oft viel Zeit für die Annotation von Daten und das Training von Objekterkennungsmodellen aufgewendet. Doch das könnte schon bald der Vergangenheit angehören. Das AI Lab von Tencent hat am 31. Januar 2024 YOLO-World veröffentlicht, ein Echtzeitmodell zur Objekterkennung mit offenem Vokabular. YOLO-World ist ein Zero-Shot-Modell. Das bedeutet, dass du Objekterkennungsinferenz auf Bildern ausführen kannst, ohne das Modell trainieren zu müssen.
Zero-Shot-Modelle können die Herangehensweise an Computer-Vision-Anwendungen grundlegend verändern. In diesem Blogbeitrag erklären wir, wie YOLO-World funktioniert, welche Einsatzmöglichkeiten es gibt, und zeigen dir ein praktisches Codebeispiel für den Einstieg.
Ein Blick auf YOLO-World#
Du kannst ein Bild und eine Textbeschreibung der gesuchten Objekte an das YOLO-World-Modell übergeben. Wenn du beispielsweise in einem Foto nach „einer Person mit einem roten Hemd“ suchen möchtest, verarbeitet YOLO-World diese Eingaben und legt los.
Die einzigartige Architektur des Modells kombiniert drei Hauptelemente:
- Einen Detektor auf Basis des Ultralytics YOLOv8-Objekterkennungsmodells zur Analyse des visuellen Inhalts des Bildes.
- Einen von OpenAI mit CLIP vortrainierten Text-Encoder, der speziell darauf ausgelegt ist, deine Textbeschreibung zu verstehen.
- Ein Netzwerk, das Vision-Language Path Aggregation Network (RepVL-PAN), das die verarbeiteten Bilddaten mit den Textdaten zusammenführt.
Der YOLO-Detektor durchsucht dein Eingabebild nach möglichen Objekten. Der Text-Encoder wandelt deine Beschreibung in ein für das Modell verständliches Format um. Diese beiden Informationsströme werden anschließend mithilfe einer mehrstufigen Fusion zwischen den Modalitäten über das RepVL-PAN zusammengeführt. Dadurch kann YOLO-World die in deiner Beschreibung genannten Objekte im Bild präzise erkennen und lokalisieren.

Ein Beispiel für Ergebnisse von YOLO-World.
Vorteile von YOLO-World#
Einer der größten Vorteile von YOLO-World ist, dass du das Modell nicht für eine bestimmte Klasse trainieren musst. Es hat bereits aus Bild-Text-Paaren gelernt und weiß daher, wie es Objekte anhand von Beschreibungen findet. Du sparst dir stundenlanges Sammeln und Annotieren von Daten, Training auf teuren GPUs und vieles mehr.
Hier sind einige weitere Vorteile von YOLO-World:
- Echtzeitleistung – YOLO-World unterstützt wie die ursprüngliche YOLO-Architektur die Verarbeitung in Echtzeit. Das Modell eignet sich ideal für Anwendungen, die eine sofortige Objekterkennung erfordern, etwa autonome Fahrzeuge und Überwachungssysteme.
- Instanzsegmentierung – YOLO-World kann Objekte in Bildern präzise umreißen und voneinander trennen, selbst wenn diese Objekte im Training nicht gezielt vermittelt wurden.
- Effizienz – YOLO-World verbindet hohe Genauigkeit mit recheneffizienter Verarbeitung und ist dadurch für praktische Anwendungen geeignet. Seine schlanke Architektur ermöglicht eine schnelle Objekterkennung, ohne die Rechenleistung übermäßig zu beanspruchen.
Anwendungsbereiche von YOLO-World#
YOLO-World-Modelle können für eine Vielzahl von Anwendungen eingesetzt werden. Sehen wir uns einige davon an.
Qualitätskontrolle in der Fertigung#
Produkte, die an einer Montagelinie gefertigt werden, werden vor dem Verpacken visuell auf Fehler geprüft. Die Fehlererkennung erfolgt häufig manuell, was zeitaufwendig ist und zu Fehlern führen kann. Solche Fehler können hohe Kosten sowie Reparaturen oder Rückrufaktionen nach sich ziehen. Um dies zu unterstützen, wurden spezielle Kameras für die industrielle Bildverarbeitung und KI-Systeme entwickelt, die diese Prüfungen durchführen.
YOLO-World-Modelle stellen in diesem Bereich einen großen Fortschritt dar. Dank ihrer Zero-Shot-Fähigkeiten können sie Fehler in Produkten erkennen, auch wenn sie nicht speziell für das jeweilige Problem trainiert wurden. Eine Fabrik, die beispielsweise Wasserflaschen herstellt, kann mit YOLO-World problemlos unterscheiden, ob eine Flasche ordnungsgemäß mit einem Verschluss versiegelt ist oder ob der Verschluss fehlt beziehungsweise fehlerhaft ist.

Ein Beispiel für die Prüfung von Flaschenverschlüssen.
Robotik#
YOLO-World-Modelle ermöglichen es Robotern, mit unbekannten Umgebungen zu interagieren. Auch ohne Training auf bestimmten Objekten, die sich in einem Raum befinden könnten, können sie erkennen, welche Objekte vorhanden sind. Angenommen, ein Roboter betritt einen Raum, in dem er zuvor noch nie war. Mit einem YOLO-World-Modell kann er weiterhin Objekte wie Stühle, Tische oder Lampen erkennen und identifizieren, obwohl er nicht speziell auf diese Gegenstände trainiert wurde.
Neben der Objekterkennung kann YOLO-World dank seiner Funktion „prompt-then-detect“ auch den Zustand dieser Objekte bestimmen. In der Landwirtschaftsrobotik kann das Modell beispielsweise reife von unreifen Früchten unterscheiden, indem der Roboter entsprechend programmiert wird.
KI in der Automobilindustrie#
Die Automobilindustrie umfasst zahlreiche bewegliche Komponenten, und YOLO-World kann für verschiedene Anwendungen rund um Fahrzeuge eingesetzt werden. Bei der Fahrzeugwartung ist beispielsweise die Fähigkeit von YOLO-World, eine große Vielfalt an Objekten ohne manuelle Kennzeichnung oder umfangreiches Vortraining zu erkennen, äußerst nützlich. YOLO-World kann zu ersetzende Fahrzeugteile identifizieren. Es könnte sogar Aufgaben wie Qualitätsprüfungen automatisieren und dabei Fehler oder fehlende Teile in neuen Fahrzeugen erkennen.
Eine weitere Anwendung ist die Zero-Shot-Objekterkennung in selbstfahrenden Autos. Die Zero-Shot-Erkennungsfähigkeiten von YOLO-World können die Fähigkeit eines autonomen Fahrzeugs verbessern, Objekte auf der Straße wie Fußgänger, Verkehrsschilder und andere Fahrzeuge in Echtzeit zu erkennen und zu klassifizieren. Dadurch lassen sich Hindernisse erkennen und Unfälle vermeiden, was für eine sicherere Fahrt sorgt.

Ein Beispiel für die Erkennung von Objekten auf einer Straße.
Bestandsverwaltung für Einzelhandelsgeschäfte#
Die Identifizierung von Objekten in Regalen von Einzelhandelsgeschäften ist ein wichtiger Bestandteil der Bestandsüberwachung, der Lagerpflege und der Automatisierung von Abläufen. Die Fähigkeit von Ultralytics YOLO-World, eine große Vielfalt an Objekten ohne manuelle Kennzeichnung oder umfangreiches Vortraining zu erkennen, ist für die Bestandsverwaltung äußerst nützlich.
Bei der Bestandsverwaltung kann YOLO-World beispielsweise Artikel in einem Regal wie verschiedene Marken von Energydrinks schnell erkennen und kategorisieren. Einzelhandelsgeschäfte können so ihre Bestände korrekt erfassen, Lagerbestände effizient verwalten und Abläufe in der Lieferkette optimieren.
Alle diese Anwendungsbereiche sind einzigartig und zeigen, wie vielseitig YOLO-World eingesetzt werden kann. Probieren wir YOLO-World nun praktisch aus und sehen uns ein Codebeispiel an.
Ein Codebeispiel#
Wie bereits erwähnt, kann YOLO-World zur Erkennung verschiedener Fahrzeugteile für Wartungszwecke eingesetzt werden. Eine Computer-Vision-Anwendung, die erforderliche Reparaturen erkennt, würde ein Foto des Fahrzeugs aufnehmen, Fahrzeugteile identifizieren, jedes Teil auf Schäden untersuchen und Reparaturen empfehlen. Für jeden Teil dieses Systems kämen unterschiedliche KI-Techniken und Ansätze zum Einsatz. In diesem Codebeispiel konzentrieren wir uns auf die Erkennung der Fahrzeugteile.
Mit YOLO-World kannst du verschiedene Fahrzeugteile in einem Bild in weniger als 5 Minuten identifizieren. Du kannst diesen Code erweitern und auch andere Anwendungen mit YOLO-World ausprobieren. Für den Einstieg müssen wir wie unten gezeigt das Ultralytics-Paket mit pip installieren.
Weitere Anweisungen und bewährte Vorgehensweisen zur Installation findest du in unserem Leitfaden zur Installation von Ultralytics. Sollten bei der Installation der für YOLOv8 erforderlichen Pakete Probleme auftreten, findest du in unserem Leitfaden zu häufigen Problemen Lösungen und Tipps.
Sobald du das benötigte Paket installiert hast, können wir ein Bild aus dem Internet herunterladen, auf dem wir unsere Inferenz ausführen. Dafür verwenden wir das folgende Bild.

Unser Eingabebild.
Anschließend importieren wir das benötigte Paket, initialisieren unser Modell und legen die Klassen fest, nach denen wir in unserem Eingabebild suchen. In diesem Beispiel interessieren wir uns für die folgenden Klassen: Auto, Rad, Autotür, Außenspiegel und Kennzeichen.
Anschließend verwenden wir die Methode predict und übergeben den Bildpfad sowie Parameter für die maximale Anzahl an Erkennungen und Schwellenwerte für Intersection over Union (IoU) und Konfidenz (conf), um eine Inferenz auf dem Bild auszuführen. Abschließend werden die erkannten Objekte in einer Datei mit dem Namen „result.jpg“ gespeichert.
Das folgende Ausgabebild wird in deinen Dateien gespeichert.

Unser Ausgabebild.
Wenn du ohne Programmierung sehen möchtest, was YOLO-World leisten kann, rufe die YOLO-World-Demoseite auf, lade ein Eingabebild hoch und gib die benutzerdefinierten Klassen ein.
Lies unsere Dokumentationsseite zu YOLO-World, um zu erfahren, wie du das Modell mit den benutzerdefinierten Klassen speicherst, damit du es später direkt verwenden kannst, ohne die benutzerdefinierten Klassen wiederholt eingeben zu müssen.
Ist dir aufgefallen, dass die Autotüren nicht erkannt wurden?#
Wenn du dir das Ausgabebild noch einmal ansiehst, wirst du feststellen, dass die benutzerdefinierte Klasse „Autotür“ nicht erkannt wurde. Trotz seiner beachtlichen Leistungen hat YOLO-World gewisse Einschränkungen. Um diese zu umgehen und das YOLO-World-Modell effektiv einzusetzen, ist es wichtig, die richtigen Arten von Textbeschreibungen zu verwenden.
Hier sind einige Hinweise dazu:
- YOLO-World benötigt möglicherweise keine hohen Konfidenzwerte für genaue Vorhersagen. Das Verringern der Konfidenzschwellenwerte kann daher die Erkennungsraten verbessern.
- Füge Klassen hinzu, die dich nicht interessieren. Dadurch lässt sich die primäre Objekterkennung verbessern, da falsch positive Erkennungen sekundärer Objekte reduziert werden.
- Wenn du zuerst größere Objekte erkennst, bevor du dich auf kleinere Details konzentrierst, kann sich die Erkennungsgenauigkeit verbessern.
- Nenne die Farben in deinen Klassen, um Objekte anhand von Farbinformationen zu erkennen.
- Auch die Beschreibung von Objektgrößen in den Textbeschreibungen kann YOLO-World dabei helfen, bestimmte Objekte genauer zu identifizieren.
- Nachbearbeitungsmethoden wie das Filtern von Vorhersagen nach Größe oder das Anpassen der Konfidenzwerte pro Klasse können die Ergebnisse der Objekterkennung weiter verbessern.
Die Möglichkeiten sind grenzenlos#
Insgesamt können YOLO-World-Modelle dank ihrer fortschrittlichen Fähigkeiten zur Objekterkennung zu leistungsstarken Werkzeugen werden. Sie bieten hohe Effizienz und Genauigkeit und helfen dabei, verschiedene Aufgaben in unterschiedlichen Anwendungsbereichen zu automatisieren – beispielsweise die Identifizierung von Fahrzeugteilen, die wir praktisch besprochen haben.
Sieh dir gerne unser GitHub-Repository an, um mehr über unsere Beiträge zu Computer Vision und KI zu erfahren. Wenn du wissen möchtest, wie KI Bereiche wie die Gesundheitstechnologie verändert, besuche unsere Lösungsseiten. Die Möglichkeiten von Innovationen wie YOLO-World scheinen grenzenlos zu sein!









