Ultralytics YOLO27:
Zurück zum Glossar von Ultralytics

CLIP (Contrastive Language-Image Pre-training)

Entdecke CLIP (kontrastives Sprach-Bild-Vortraining), um Vision und Sprache zu verbinden. Erfahre, wie es Zero-Shot-Learning ermöglicht und Ultralytics YOLO26 unterstützt.

CLIP (kontrastives Vortraining von Sprache und Bildern) ist eine revolutionäre neuronale Netzwerkarchitektur, die von OpenAI entwickelt wurde und eine Verbindung zwischen visuellen Daten und natürlicher Sprache herstellt. Im Gegensatz zu herkömmlichen Systemen für maschinelles Sehen (CV), die für eine festgelegte Anzahl von Kategorien aufwendig Daten annotieren müssen, lernt CLIP, Bilder zu verstehen, indem es mit Millionen von Bild-Text-Paaren trainiert wird, die aus dem Internet stammen. Dieser Ansatz ermöglicht dem Modell Zero-Shot-Lernen. Das bedeutet, dass es Objekte, Konzepte oder Stile identifizieren kann, die es während des Trainings nie ausdrücklich gesehen hat, indem es einfach eine Textbeschreibung liest. Durch die Abbildung visueller und sprachlicher Informationen in einen gemeinsamen Merkmalsraum dient CLIP als leistungsfähiges Basismodell für eine Vielzahl nachgelagerter Aufgaben, ohne dass ein umfangreiches aufgabenspezifisches Feintuning erforderlich ist.

Funktionsweise der Architektur#

Der Kernmechanismus von CLIP umfasst zwei parallel arbeitende Encoder: einen Bild-Encoder, der typischerweise auf einem Vision-Transformer (ViT) oder einem ResNet basiert, sowie einen Text-Transformer, der den in modernen großen Sprachmodellen (LLMs) verwendeten Modellen ähnelt. Durch ein als kontrastives Lernen bezeichnetes Verfahren wird das System darauf trainiert, vorherzusagen, welcher Textausschnitt zu welchem Bild innerhalb eines Batches passt.

Während des Trainings optimiert das Modell seine Parameter so, dass die Vektor-Embeddings übereinstimmender Bild-Text-Paare näher zusammenrücken und nicht übereinstimmende Paare voneinander entfernt werden. Dadurch entsteht ein multimodaler latenter Raum, in dem die mathematische Darstellung eines Bildes eines „Golden Retrievers“ räumlich nahe am Text-Embedding für „ein Foto eines Hundes“ liegt. Durch die Berechnung der Kosinusähnlichkeit zwischen diesen Vektoren kann das Modell quantifizieren, wie gut ein Bild zu einer Eingabe in natürlicher Sprache passt, und so eine flexible Bildklassifizierung und Suche ermöglichen.

Anwendungen in der Praxis#

Die Fähigkeit, Sehen und Sprache miteinander zu verbinden, hat CLIP zu einer Schlüsseltechnologie moderner KI-Anwendungen gemacht:

  • Intelligente semantische Suche: Mit CLIP können Nutzer große Bilddatenbanken mithilfe komplexer Abfragen zur Verarbeitung natürlicher Sprache (NLP) durchsuchen. Im Bereich der KI im Einzelhandel könnte eine Kundin beispielsweise nach „Vintage-Sommerkleid mit Blumenmuster“ suchen und visuell passende Ergebnisse erhalten, ohne dass die Bilder mit diesen spezifischen Metadaten versehen sein müssen. Dies wird häufig durch leistungsstarke Vektordatenbanken ermöglicht.
  • Steuerung generativer KI: Modelle wie Stable Diffusion nutzen CLIP, um Benutzereingaben zu interpretieren und den Generierungsprozess zu steuern. CLIP fungiert als Bewertungsmodell und beurteilt, wie gut die erzeugte visuelle Ausgabe mit der Textbeschreibung übereinstimmt. Das ist entscheidend für eine hochwertige Text-zu-Bild-Synthese.
  • Objekterkennung mit offenem Vokabular: Fortschrittliche Architekturen wie YOLO-World integrieren CLIP-Embeddings, um Objekte anhand beliebiger Texteingaben zu erkennen. Dies ermöglicht eine dynamische Erkennung in Bereichen wie der KI im Gesundheitswesen, in denen neue Ausrüstung oder Anomalien erkannt werden müssen, ohne das Modell neu zu trainieren.

CLIP-Features mit Ultralytics verwenden#

Während herkömmliche Objekterkennungsmodelle auf ihre Trainingsklassen beschränkt sind, ermöglichen CLIP-basierte Features eine Erkennung mit offenem Vokabular. Der folgende Python-Code zeigt, wie du das Paket ultralytics verwenden kannst, um Objekte mithilfe eigener Texteingaben zu erkennen:

from ultralytics import YOLOWorld

# Load a pre-trained YOLO-World model utilizing CLIP features
model = YOLOWorld("yolov8s-world.pt")

# Define custom classes using natural language text prompts
model.set_classes(["person wearing sunglasses", "red backpack"])

# Run inference on an image to detect the text-defined objects
results = model.predict("travelers.jpg")

# Display the results
results[0].show()

Verwandte Konzepte unterscheiden#

Um den spezifischen Nutzen von CLIP zu verstehen, ist es hilfreich, CLIP von anderen gängigen KI-Paradigmen abzugrenzen:

  • CLIP im Vergleich zu überwachtem Lernen: Herkömmliche überwachte Modelle erfordern für jede Kategorie (z. B. „Katze“, „Auto“) eindeutige Definitionen und annotierte Beispiele. CLIP lernt aus unverarbeiteten Text-Bild-Paaren aus dem Internet, bietet dadurch mehr Flexibilität und beseitigt den Engpass der manuellen Annotation, die häufig mit Tools wie der Ultralytics Platform durchgeführt wird.
  • CLIP im Vergleich zu YOLO26: Während CLIP ein generalisiertes Verständnis von Konzepten vermittelt, ist YOLO26 ein spezialisierter Objektdetektor für Echtzeitanwendungen, der auf Geschwindigkeit und präzise Lokalisierung optimiert ist. CLIP wird häufig als Merkmalsextraktor oder Zero-Shot-Klassifikator eingesetzt, während YOLO26 in Produktionsumgebungen als Grundlage für schnelle Echtzeit-Inferenz dient.
  • CLIP im Vergleich zum standardmäßigen kontrastiven Lernen: Methoden wie SimCLR vergleichen in der Regel zwei augmentierte Ansichten desselben Bildes, um Merkmale zu erlernen. CLIP stellt ein Bild einer Textbeschreibung gegenüber und verbindet dadurch zwei unterschiedliche Datenmodalitäten statt nur einer.

Explore solutions

Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren

Lass uns gemeinsam die Zukunft der KI gestalten!

Beginne deine Reise in die Zukunft des maschinellen Lernens