Visual Prompting
Entdecke Visual Prompting, um KI-Modelle mit Punkten und Boxen zu steuern. Erfahre, wie Ultralytics YOLO und SAM eine präzise Segmentierung und schnellere Datenannotation ermöglichen.
Visuelles Prompting ist eine aufkommende Technik im Bereich Computer Vision, bei der Nutzer räumliche oder visuelle Hinweise – etwa Punkte, Begrenzungsrahmen oder Skizzen – bereitstellen, um den Fokus eines KI-Modells auf bestimmte Objekte oder Bereiche innerhalb eines Bildes zu lenken. Anders als beim traditionellen Prompt Engineering, das sich hauptsächlich auf Textbeschreibungen stützt, ermöglicht visuelles Prompting eine präzisere und intuitivere Interaktion mit Künstlicher Intelligenz (AI). Diese Methode nutzt die Fähigkeiten moderner Basismodelle, um Aufgaben wie Segmentierung und Erkennung auszuführen, ohne umfangreiches erneutes Training oder große annotierte Datensätze zu erfordern. Indem Nutzer effektiv auf das Wesentliche „zeigen“, können sie Modelle für allgemeine Zwecke sofort an neue Aufgaben anpassen und so die Lücke zwischen menschlicher Absicht und maschineller Wahrnehmung überbrücken.
Mechanismen des visuellen Promptings#
Im Kern funktioniert visuelles Prompting, indem räumliche Informationen direkt in die Verarbeitungspipeline des Modells eingespeist werden. Wenn ein Nutzer auf ein Objekt klickt oder einen Rahmen zeichnet, werden diese Eingaben in koordinatenbasierte Einbettungen umgewandelt, die das neuronale Netzwerk mit den Bildmerkmalen verknüpft. Dieser Prozess ist zentral für interaktive Architekturen wie das Segmentierungsmodell für beliebige Objekte (SAM), bei dem das Modell Masken auf Grundlage geometrischer Prompts vorhersagt.
Die Flexibilität des visuellen Promptings ermöglicht verschiedene Interaktionsarten:
- Punkt-Prompts: Ein Nutzer klickt auf ein bestimmtes Pixel, um das gewünschte Objekt zu kennzeichnen. Das Modell erweitert diese Auswahl anschließend auf die gesamte Objektgrenze.
- Rahmen-Prompts: Das Zeichnen eines Begrenzungsrahmens liefert eine grobe Lokalisierung und signalisiert dem Modell, alles innerhalb dieses Bereichs zu segmentieren oder zu klassifizieren.
- Skizzen-Prompts: Freihandlinien, die über ein Objekt gezeichnet werden, können dabei helfen, komplexe Szenen zu unterscheiden, in denen sich Objekte überlappen oder ähnliche Texturen aufweisen.
Neuere auf der CVPR 2024 vorgestellte Forschungsergebnisse zeigen, wie visuelles Prompting den für die Datenannotation erforderlichen Zeitaufwand deutlich reduziert, da menschliche Annotatoren Modellvorhersagen in Echtzeit mit einfachen Klicks korrigieren können, anstatt Polygone manuell nachzuzeichnen.
Visuelles Prompting vs. Text-Prompting#
Obwohl beide Techniken darauf abzielen, das Verhalten eines Modells zu steuern, ist es wichtig, visuelles Prompting von textbasierten Methoden zu unterscheiden. Die Text-zu-Bild-Generierung oder die Zero-Shot-Erkennung stützt sich auf die Verarbeitung natürlicher Sprache (NLP), um semantische Beschreibungen zu interpretieren (z. B. „Finde das rote Auto“). Sprache kann jedoch mehrdeutig oder unzureichend sein, wenn präzise räumliche Positionen oder abstrakte Formen beschrieben werden sollen.
Visuelles Prompting beseitigt diese Mehrdeutigkeit, indem es die Anweisung direkt im Pixelraum verankert. Beispielsweise ist es bei der medizinischen Bildanalyse weitaus genauer, wenn ein Radiologe auf einen verdächtigen Knoten klickt, als wenn er versucht, dessen exakte Koordinaten und unregelmäßige Form per Text zu beschreiben. Häufig kombinieren die leistungsfähigsten Arbeitsabläufe beide Ansätze – Text für die semantische Filterung und visuelle Prompts für räumliche Präzision –, ein Konzept, das als multimodales Lernen bezeichnet wird.
Anwendungen in der Praxis#
Die Anpassungsfähigkeit des visuellen Promptings hat zu seiner schnellen Verbreitung in zahlreichen Branchen geführt:
- Interaktive medizinische Diagnostik: Ärzte verwenden Werkzeuge für visuelles Prompting, um Tumore oder Organe in MRT-Aufnahmen zu isolieren. Durch einen einfachen Klick auf einen relevanten Bereich können sie sofort dreidimensionale Volumenmessungen erzeugen, die eine präzise Tumorerkennung und Operationsplanung unterstützen.
- Intelligente Fotobearbeitung: In Anwendungen für Endnutzer wie Adobe Photoshop oder mobilen Apps ermöglicht visuelles Prompting Werkzeuge zur „intelligenten Auswahl“. Nutzer können auf eine Person oder ein Objekt tippen, um den Hintergrund zu entfernen oder gezielte Filter anzuwenden. Dabei kommen zugrunde liegende Technologien zur Instanzsegmentierung zum Einsatz, ohne dass manuelle Kenntnisse zum Erstellen von Masken erforderlich sind.
- Robotermanipulation: Im Bereich KI in der Robotik können Roboter angewiesen werden, bestimmte Gegenstände über eine visuelle Benutzeroberfläche aufzuheben. Ein Bediener klickt im Kamerabild des Roboters auf ein Objekt und liefert damit einen visuellen Prompt, den der Roboter in Greifkoordinaten übersetzt. Dadurch wird die Automatisierung mit menschlicher Beteiligung in Lagern erleichtert.
Implementierung mit Ultralytics#
Das Ultralytics-Ökosystem unterstützt Arbeitsabläufe mit visuellem Prompting, insbesondere durch Modelle wie FastSAM und SAM. Mit diesen Modellen können Entwickler Punkt- oder Rahmenkoordinaten programmgesteuert übergeben, um Segmentierungsmasken abzurufen.
Das folgende Beispiel zeigt, wie du das Paket ultralytics verwendest, um einen Punkt-Prompt auf ein Bild anzuwenden und das Modell anzuweisen, das Objekt an bestimmten Koordinaten zu segmentieren.
from ultralytics import SAM
# Load the Segment Anything Model (SAM)
model = SAM("sam2.1_b.pt")
# Apply a visual point prompt to the image
# The 'points' argument accepts [x, y] coordinates
# labels: 1 indicates a foreground point (include), 0 indicates background
results = model("https://ultralytics.com/images/bus.jpg", points=[[300, 350]], labels=[1])
# Display the segmented result
results[0].show()Die Agilität von Modellen steigern#
Visuelles Prompting steht für einen Wandel hin zu „per Prompt steuerbarer“ Computer Vision, bei der Modelle keine statischen „Blackboxes“ mehr sind, sondern interaktive Werkzeuge. Diese Fähigkeit ist für Active-Learning-Schleifen unverzichtbar, in denen sich Modelle durch die Einbindung von Nutzerfeedback schnell verbessern.
Für Entwickler, die diese Fähigkeiten in Produktionsumgebungen integrieren möchten, bietet die Ultralytics Platform Werkzeuge zur Verwaltung von Datensätzen und zur Bereitstellung von Modellen, die dynamische Eingaben verarbeiten können. Mit dem Fortschritt der Forschung erwarten wir eine noch engere Integration zwischen visuellen Prompts und großen Sprachmodellen (LLMs), wodurch Systeme visuelle Eingaben mit derselben Sprachgewandtheit interpretieren können, mit der sie derzeit Text verarbeiten.









