Durch Prompts steuerbare Konzeptsegmentierung verstehen
Entdecke die durch Prompts steuerbare Konzeptsegmentierung, ihre Unterschiede zu herkömmlichen Methoden und wie verwandte Modelle wie YOLOE-26 Funktionen mit offenem Vokabular ermöglichen.

Vision AI entwickelt sich rasant weiter und wird zunehmend zur Analyse von Bildern und Videos in realen Umgebungen eingesetzt. So werden beispielsweise Anwendungen von Verkehrsmanagementsystemen bis hin zu Analysen im Einzelhandel in Computer-Vision-Modelle integriert.
In vielen dieser Anwendungen werden Vision-Modelle, etwa Modelle zur Objekterkennung, darauf trainiert, eine vordefinierte Gruppe von Objekten wie Fahrzeuge, Personen und Ausrüstung zu erkennen. Während des Trainings werden diesen Modellen zahlreiche annotierte Beispiele gezeigt, damit sie lernen, wie die einzelnen Objekte aussehen und wie sie in einer Szene voneinander unterschieden werden können.
Bei Segmentierungsaufgaben gehen Modelle noch einen Schritt weiter, indem sie präzise Umrisse dieser Objekte auf Pixelebene erzeugen. Dadurch können Systeme genau verstehen, wo sich jedes Objekt in einem Bild befindet.
Das funktioniert gut, solange das System nur erkennen muss, worauf es trainiert wurde. In realen Umgebungen ist das jedoch selten der Fall.
Visuelle Szenen sind typischerweise dynamisch. Neue Objekte und visuelle Konzepte tauchen auf, Bedingungen ändern sich, und Nutzer möchten häufig Objekte segmentieren, die nicht Teil der ursprünglichen Trainingskonfiguration waren.
Diese Einschränkungen werden bei der Segmentierung besonders deutlich. Mit der Weiterentwicklung von Vision AI steigt der Bedarf an flexibleren Segmentierungsmodellen, die sich an neue Konzepte anpassen können, ohne wiederholt trainiert zu werden. Deshalb gewinnt die promptbare Konzeptsegmentierung (PCS) zunehmend an Aufmerksamkeit.
Statt sich auf eine feste Liste von Objektkategorien zu stützen, können Nutzer mithilfe von Text, visuellen Prompts oder Beispielbildern beschreiben, was sie segmentieren möchten. Diese Modelle können anschließend alle Bereiche erkennen und segmentieren, die dem beschriebenen Konzept entsprechen, selbst wenn dieses Konzept im Training nicht ausdrücklich enthalten war.
In diesem Artikel untersuchen wir, wie promptbare Konzeptsegmentierung funktioniert, wie sie sich von herkömmlichen Ansätzen unterscheidet und wo sie heute eingesetzt wird.
Was ist promptbare Konzeptsegmentierung?#
In den meisten Fällen werden Segmentierungsmodelle darauf trainiert, eine kurze Liste von Objekttypen zu erkennen. Das funktioniert gut, wenn ein Vision-AI-System nur eine bestimmte Gruppe von Objekten erkennen und segmentieren muss.
In realen Anwendungen sind visuelle Szenen jedoch dynamisch. Neue Objekte tauchen auf, die Anforderungen ändern sich, und Nutzer müssen häufig Konzepte segmentieren, die im ursprünglichen Labelsatz nicht enthalten waren. Dies erfordert normalerweise das Sammeln neuer, hochwertiger Daten und Annotationen sowie ein erneutes Training des Modells, was die Kosten erhöht und die Bereitstellung verlangsamt.
Die promptbare Konzeptsegmentierung löst dieses Problem, indem sie Nutzern ermöglicht, dem Modell mitzuteilen, wonach es suchen soll, anstatt aus einer festen Liste von Labels auszuwählen. Nutzer beschreiben das gesuchte Objekt oder die gesuchte Idee, und das Modell hebt alle passenden Bereiche im Bild hervor. Dadurch lässt sich die Absicht des Nutzers wesentlich einfacher mit den tatsächlichen Pixeln eines Bildes verknüpfen.

Abb. 1. Verwendung von Konzept-Prompts für die Segmentierung (Quelle)
Segmentierung mit verschiedenen Prompt-Typen steuern#
Modelle, die promptbare Konzeptsegmentierung unterstützen, sind flexibel, weil sie verschiedene Eingabetypen verarbeiten können. Mit anderen Worten: Es gibt mehr als eine Möglichkeit, dem Modell mitzuteilen, wonach es suchen soll, etwa durch Textbeschreibungen, visuelle Hinweise oder Beispielbilder.
Hier sehen wir uns die einzelnen Ansätze genauer an:
- Text-Prompts: Kurze Ausdrücke wie „Schulbus“ oder „Tumorbereich“ können das zu segmentierende Konzept beschreiben. Das Modell interpretiert die Bedeutung der Wörter und erkennt passende Bereiche.
- Visuelle Prompts: Diese Prompts verwenden Punkte, Boxen oder grobe Skizzen innerhalb des Bildes als Hinweise. Sie geben vor, wo gesucht werden soll, und helfen dabei, die endgültige Grenze festzulegen.
- Bildbeispiele: Referenzbilder oder kleine Bildausschnitte repräsentieren das gewünschte Konzept. Das Modell sucht nach visuell ähnlichen Bereichen und segmentiert sie anhand ihres visuellen Erscheinungsbilds.
Der Unterschied zwischen PCS und herkömmlicher Segmentierung#
Bevor wir uns ansehen, wie promptbare Konzeptsegmentierung funktioniert, vergleichen wir sie zunächst mit verschiedenen herkömmlichen Methoden der Objektsegmentierung.
PCS ermöglicht Modelle mit offenem Vokabular, die durch Prompts gesteuert werden. Sie können mit neuen, durch Prompts beschriebenen Ideen arbeiten, herkömmliche Segmentierung dagegen nicht. Es gibt verschiedene Arten herkömmlicher Segmentierungsansätze, von denen jeder auf eigenen Annahmen und Einschränkungen beruht.
Hier ist ein Überblick über einige wichtige Arten der herkömmlichen Segmentierung:
- Semantische Segmentierung: Jedes Pixel im Bild wird als Teil einer Kategorie wie Straße, Gebäude oder Person gekennzeichnet. Alle Pixel mit demselben Label werden zusammengefasst, sodass das Modell einzelne Objektinstanzen nicht voneinander trennt.
- Instanzsegmentierung: Das Modell erkennt und segmentiert einzelne Objekte, sodass zwei Personen oder zwei Autos als separate Elemente behandelt werden.
- Panoptische Segmentierung: Diese Technik kombiniert semantische Segmentierung und Instanzsegmentierung, um eine vollständige Darstellung der Szene zu liefern, die sowohl Hintergrundbereiche als auch einzelne Objekte abdeckt.
Alle diese Ansätze stützen sich auf eine vordefinierte Liste von Objektkategorien. Innerhalb dieses Rahmens funktionieren sie gut, mit Konzepten außerhalb dieses Rahmens kommen sie jedoch weniger gut zurecht. Wenn ein neues, spezifisches Objekt segmentiert werden soll, sind normalerweise zusätzliche Trainingsdaten und eine Feinabstimmung des Modells erforderlich.
PCS soll das ändern. Statt auf vordefinierte Kategorien beschränkt zu sein, kannst du zur Inferenzzeit beschreiben, was du in einem Bild segmentieren möchtest.
Die Entwicklung von PCS-Modellen#
Sehen wir uns als Nächstes an, wie sich Segmentierungsmodelle in Richtung promptbarer Konzeptsegmentierung entwickelt haben.
Ein beliebtes Basismodell, das einen Wandel in der Segmentierung markierte, ist SAM, also ein Modell zur Segmentierung beliebiger Objekte. Es wurde 2023 vorgestellt. Statt sich auf vordefinierte Objektkategorien zu stützen, ermöglichte SAM den Nutzern, die Segmentierung mithilfe einfacher visueller Prompts wie Punkten oder Begrenzungsboxen zu steuern.
Mit SAM mussten Nutzer kein Label mehr auswählen. Sie konnten einfach angeben, wo sich ein Objekt befand, und das Modell erzeugte dafür eine Maske. Dadurch wurde die Segmentierung flexibler, aber Nutzer mussten dem Modell weiterhin zeigen, wo es suchen sollte.
SAM 2, das 2024 veröffentlicht wurde, baute auf dieser Idee auf, indem es komplexere Szenen verarbeitete und promptbare Segmentierung auf Videos erweiterte. Die Robustheit bei unterschiedlichen Lichtverhältnissen, Objektformen und Bewegungen wurde verbessert, während die Segmentierung weiterhin hauptsächlich durch visuelle Prompts gesteuert wurde.
Das Modell SAM 3 ist der jüngste Schritt in dieser Entwicklung. Es wurde im vergangenen Jahr veröffentlicht und ist ein einheitliches Modell, das visuelles Verständnis mit Sprachsteuerung kombiniert und dadurch ein konsistentes Verhalten bei Segmentierungsaufgaben für Bilder und Videos ermöglicht.
Mit SAM 3 sind Nutzer nicht auf das Zeigen oder Zeichnen von Prompts beschränkt. Stattdessen können sie mithilfe von Text beschreiben, was sie segmentieren möchten, und das Modell sucht im Bild oder in Videoframes nach Bereichen, die dieser Beschreibung entsprechen.
Die Segmentierung wird durch Konzepte statt durch feste Objektkategorien gesteuert, wodurch die Verwendung eines offenen Vokabulars in verschiedenen Szenen und über längere Zeiträume unterstützt wird. Tatsächlich arbeitet SAM 3 in einem großen, erlernten Konzeptbereich, der auf einer aus Quellen wie Wikidata abgeleiteten Ontologie basiert und durch umfangreiche Trainingsdaten erweitert wurde.

Abb. 2. Beispiel für das Prompting von SAM 3 und die Segmentierung eines einzelnen Bildes (Quelle)
Im Vergleich zu früheren Versionen, die sich hauptsächlich auf geometrische Prompts stützten, ist SAM 3 ein Schritt hin zu einer flexibleren, konzeptgesteuerten Segmentierung. Dadurch eignet es sich besser für reale Anwendungen, in denen sich die interessierenden Objekte oder Ideen ändern können und nicht immer im Voraus definiert werden können.
So funktioniert promptbare visuelle Segmentierung#
Wie funktioniert also promptbare Konzeptsegmentierung? Sie baut auf großen vortrainierten Vision- und Vision-Language-Modellen auf, die mit umfangreichen Sammlungen von Bildern und in vielen Fällen mit zugehörigem Text trainiert wurden. Durch dieses Training lernen sie allgemeine visuelle Muster und semantische Bedeutungen.
Die meisten PCS-Modelle verwenden Transformer-basierte Architekturen, die ein vollständiges Bild auf einmal verarbeiten, um zu verstehen, wie verschiedene Bereiche miteinander in Beziehung stehen. Ein Vision Transformer extrahiert visuelle Merkmale aus dem Bild, während ein Text-Encoder Wörter in numerische Repräsentationen umwandelt, die das Modell verarbeiten kann.
Während des Trainings können diese Modelle aus verschiedenen Arten von Trainingssignalen lernen, darunter Masken auf Pixelebene, die genaue Objektgrenzen definieren, Begrenzungsboxen, die Objekte grob lokalisieren, und bildbasierte Labels, die beschreiben, was in einem Bild zu sehen ist. Das Training mit verschiedenen Arten annotierter Daten hilft dem Modell, sowohl feine Details als auch übergeordnete visuelle Konzepte zu erfassen.
Zur Inferenzzeit, also wenn das Modell tatsächlich Vorhersagen trifft, folgt PCS einem promptgesteuerten Prozess. Ein Nutzer gibt über Textbeschreibungen, visuelle Hinweise wie Punkte oder Boxen oder Beispielbilder eine Vorgabe. Das Modell codiert sowohl den Prompt als auch das Bild in eine gemeinsame interne Repräsentation oder in Embeddings und erkennt Bereiche, die mit dem beschriebenen Konzept übereinstimmen.
Ein Maskendecoder wandelt diese gemeinsame Repräsentation anschließend in präzise Segmentierungsmasken auf Pixelebene um. Da das Modell visuelle Merkmale mit semantischer Bedeutung verknüpft, kann es neue Konzepte segmentieren, selbst wenn diese im Training nicht ausdrücklich enthalten waren.
Oft lässt sich die Ausgabe außerdem durch Anpassen des Prompts oder Hinzufügen weiterer Hinweise verfeinern. Dadurch kann das Modell komplexe oder mehrdeutige Szenen besser verarbeiten. Dieser iterative Prozess unterstützt die praktische Optimierung während der Bereitstellung.
Promptbare Konzeptsegmentierungsmodelle werden typischerweise danach bewertet, wie gut sie bisher ungesehene Konzepte segmentieren und wie robust sie in verschiedenen Szenen arbeiten. Benchmarks konzentrieren sich häufig auf Maskenqualität, Generalisierung und Recheneffizienz und berücksichtigen damit die Anforderungen realer Bereitstellungen.
Anwendungsfälle von PCS in der Praxis#
Sehen wir uns nun an, wo die promptbare Konzeptsegmentierung bereits eingesetzt wird und erste spürbare Auswirkungen hat.
Flexible Bildsegmentierung in der medizinischen Bildgebung#
Die medizinische Bildgebung umfasst zahlreiche biologische Strukturen, Krankheiten und Scantypen, wobei täglich neue Fälle hinzukommen. Herkömmliche Segmentierungsmodelle haben Schwierigkeiten, mit dieser Vielfalt Schritt zu halten.
PCS eignet sich für diesen Bereich besonders gut, da Ärzte beschreiben können, wonach sie suchen, anstatt aus einer kurzen, starren Liste auszuwählen. Mithilfe von Textausdrücken oder visuellen Prompts kann PCS Organe oder auffällige Bereiche direkt segmentieren, ohne das Modell für jede neue Aufgabe neu zu trainieren. Dadurch lassen sich vielfältige klinische Anforderungen einfacher bewältigen, manuelles Zeichnen von Masken reduzieren und zahlreiche Bildgebungsverfahren unterstützen.
Ein hervorragendes Beispiel ist MedSAM-3, das die SAM-3-Architektur für textpromptbare PCS in der medizinischen Bildgebung anpasst. Dieses Modell kann mit konkreten anatomischen und pathologischen Begriffen angesteuert werden, etwa mit Organbezeichnungen wie Leber oder Niere sowie mit läsionsbezogenen Konzepten wie Tumor oder Läsion. Bei Vorgabe eines Prompts segmentiert das Modell direkt den entsprechenden Bereich im medizinischen Bild.
MedSAM-3 integriert außerdem multimodale große Sprachmodelle (MLLMs bzw. multimodale LLMs), die sowohl Text als auch Bilder verarbeiten und Schlussfolgerungen daraus ziehen können. Diese Modelle arbeiten in einer Konfiguration mit einem eingebundenen Agenten, bei der die Ergebnisse iterativ verfeinert werden, um die Genauigkeit in anspruchsvolleren Fällen zu verbessern.

Abb. 3. Eine MedSAM-3-Pipeline für die textpromptbasierte Tumorsegmentierung in medizinischen Bildern (Quelle)
MedSAM-3 erzielt gute Ergebnisse bei Röntgen-, MRI-, CT-, Ultraschall- und Videodaten und zeigt, wie PCS flexiblere und effizientere Arbeitsabläufe in der medizinischen Bildgebung unter realen klinischen Bedingungen ermöglichen kann.
Adaptive Segmentierung für robotergestützte Chirurgie und Automatisierung#
Robotergestützte Chirurgie ist auf Vision-Systeme angewiesen, um Instrumente zu verfolgen und sich schnell verändernde Operationsszenen zu verstehen. Instrumente bewegen sich schnell, die Lichtverhältnisse ändern sich, und jederzeit können neue Instrumente auftauchen, wodurch vordefinierte Labels schwer zu verwalten sind.
Mit PCS können Roboter Instrumente verfolgen, Kameras steuern und Operationsschritte in Echtzeit nachverfolgen. Dadurch wird der manuelle Beschriftungsaufwand reduziert und die Anpassung an verschiedene Eingriffe erleichtert. Chirurgen oder automatisierte Systeme können Text-Prompts wie „Greifer“, „Skalpell“ oder „Kamerainstrument“ verwenden, um anzugeben, was in einem Bild segmentiert werden soll.

Abb. 4. Segmentierung chirurgischer Instrumente während einer robotergestützten Operation (Quelle)
Segmentierung mit offenem Vokabular mit Ultralytics YOLOE-26#
Ein weiteres interessantes hochmodernes Modell im Zusammenhang mit promptbarer Konzeptsegmentierung ist unser Ultralytics YOLOE-26. Unser Modell bringt Segmentierung mit offenem Vokabular und Promptsteuerung in die Modellfamilie Ultralytics YOLO.
YOLOE-26 basiert auf der Ultralytics YOLO26-Architektur und unterstützt die Instanzsegmentierung mit offenem Vokabular. YOLOE-26 ermöglicht es Nutzern, die Segmentierung auf verschiedene Arten zu steuern.
Es unterstützt Text-Prompts, mit denen kurze, visuell verankerte Ausdrücke das Zielobjekt angeben können, sowie visuelle Prompts, die auf Grundlage von Bildhinweisen zusätzliche Orientierung geben. Außerdem umfasst YOLOE-26 einen promptfreien Modus für Zero-Shot-Inferenz, in dem das Modell Objekte aus einem integrierten Vokabular erkennt und segmentiert, ohne dass Nutzer Prompts vorgeben müssen.
YOLOE-26 eignet sich hervorragend für Anwendungen wie Videoanalyse, Robotik-Wahrnehmung und Systeme am Netzwerkrand, bei denen sich Objektkategorien ändern können, geringe Latenz und ein zuverlässiger Datendurchsatz jedoch entscheidend bleiben. Es ist außerdem besonders nützlich für die Datenbeschriftung und die Kuration von Datensätzen, da es Arbeitsabläufe durch die Automatisierung von Teilen des Annotationsprozesses vereinfacht.
Vor- und Nachteile der promptbaren Konzeptsegmentierung#
Hier sind einige der wichtigsten Vorteile der promptbaren Konzeptsegmentierung:
- Schnellere Iteration und Prototypentwicklung: Neue Segmentierungsaufgaben können schnell getestet werden, indem Prompts geändert werden, anstatt Datensätze neu zu erstellen oder Modelle erneut zu trainieren. Das beschleunigt Experimente und Entwicklung.
- Anpassungsfähigkeit über verschiedene Bereiche hinweg: Dasselbe PCS-Modell kann häufig mit minimalen Änderungen am Arbeitsablauf in unterschiedlichen Bereichen wie medizinischer Bildgebung, Robotik oder Videoanalyse eingesetzt werden.
- Interaktive Verfeinerung: Nutzer können Prompts schrittweise anpassen oder zusätzliche Hinweise geben, um die Ergebnisse zu verbessern. Dadurch lassen sich mehrdeutige Szenen oder Sonderfälle einfacher bewältigen, ohne das Modell erneut zu trainieren.
PCS bietet zwar klare Vorteile, dennoch solltest du die folgenden Einschränkungen berücksichtigen:
- Prompt-Empfindlichkeit: Kleine Änderungen an der Formulierung oder Eingabe eines Prompts können die Ausgabe beeinflussen. Zu vage oder zu spezifische Prompts können zu einer unvollständigen oder fehlerhaften Segmentierung führen.
- Weniger vorhersehbares Verhalten: Da das Modell Prompts interpretiert, anstatt aus festen Labels auszuwählen, können die Ergebnisse je nach Szene und Eingabe stärker variieren. Das kann bei streng kontrollierten Arbeitsabläufen problematisch sein.
- Mehrdeutige Konzeptinterpretation: Einige Konzepte sind subjektiv oder nur ungenau definiert, was zu uneinheitlichen Segmentierungsergebnissen zwischen verschiedenen Nutzern oder Bildern führen kann.
- Eingeschränkte Zuverlässigkeit bei sehr spezifischen Zielen: Promptbasierte Modelle sind bei eng definierten, instanzspezifischen Aufgaben wie der Fehlererkennung im Allgemeinen weniger zuverlässig, wenn eine präzise und konsistente Identifizierung subtiler Merkmale erforderlich ist.
Die Wahl zwischen promptbarer und herkömmlicher Segmentierung#
Wenn du dich mit promptbarer Segmentierung beschäftigst, fragst du dich vielleicht, für welche Anwendungen sie sich am besten eignet und wann ein herkömmliches Computer-Vision-Modell wie Ultralytics YOLO26 besser zu dem Problem passt, das du lösen möchtest. Promptbare Segmentierung funktioniert gut für allgemeine Objekte, eignet sich jedoch nicht für Anwendungsfälle, die sehr präzise und konsistente Ergebnisse erfordern.
Die Fehlererkennung ist ein gutes Beispiel. In der Fertigung sind Fehler oft winzig und subtil, etwa kleine Kratzer, Dellen, Fehlausrichtungen oder Unregelmäßigkeiten auf der Oberfläche. Außerdem können sie je nach Material, Beleuchtung und Produktionsbedingungen stark variieren.
Diese Probleme lassen sich nur schwer mit einem einfachen Prompt beschreiben und von einem universell einsetzbaren Modell noch schwerer zuverlässig erkennen. Insgesamt übersehen promptbasierte Modelle Fehler tendenziell oder liefern instabile Ergebnisse, während Modelle, die speziell mit Fehlerdaten trainiert wurden, für Prüfsysteme in der Praxis deutlich zuverlässiger sind.
Wichtige Erkenntnisse#
Die promptbare Konzeptsegmentierung erleichtert die Anpassung von Vision-Systemen an die reale Welt, in der ständig neue Objekte und Ideen auftauchen. Statt an feste Labels gebunden zu sein, können Nutzer einfach beschreiben, was sie segmentieren möchten, und den Rest dem Modell überlassen. Das spart Zeit und reduziert den manuellen Aufwand. PCS hat zwar weiterhin Einschränkungen, verändert aber bereits die praktische Nutzung von Segmentierung und wird wahrscheinlich zu einem zentralen Bestandteil künftiger Vision-Systeme werden.
Erfahre mehr über AI, indem du unser GitHub-Repository besuchst und unserer Community beitrittst. Sieh dir unsere Lösungsseiten an, um mehr über AI in der Robotik und Computer Vision in der Fertigung zu erfahren. Entdecke unsere Lizenzoptionen, um noch heute mit Vision AI zu beginnen!









