SAM 3 im Überblick: Metas neues Modell zur Segmentierung beliebiger Objekte
Erfahre, wie SAM 3, Metas neues Modell zur Segmentierung beliebiger Objekte, das Erkennen, Segmentieren und Verfolgen von Objekten in realen Bildern und Videos vereinfacht.

Am 19. November 2025 veröffentlichte Meta AI Segmentierung beliebiger Objekte 3, auch bekannt als SAM 3. Diese neueste Version des Modells zur Segmentierung beliebiger Objekte führt neue Möglichkeiten ein, Objekte in realen Bildern und Videos mithilfe von Textaufforderungen, visuellen Aufforderungen und Bildbeispielen zu erkennen, zu segmentieren und zu verfolgen.
Das Modell SAM 3 baut auf SAM und SAM 2 auf und bietet neue Fortschritte und Funktionen wie Konzeptsegmentierung, Erkennung mit offenem Vokabular und Echtzeit-Videoverfolgung. Es kann kurze Nominalphrasen verstehen, Objekten über mehrere Bilder hinweg folgen und fein abgestufte oder seltene Konzepte erkennen, mit denen frühere Modelle nicht so zuverlässig umgehen konnten.
Als Teil der Veröffentlichung von SAM 3 stellte Meta außerdem SAM 3D vor. Diese Suite von Modellen der nächsten Generation rekonstruiert Objekte, Szenen und vollständige menschliche Körper aus einem einzigen Bild und erweitert das Ökosystem zur Segmentierung beliebiger Objekte um das Verständnis von 3D. Diese Ergänzungen eröffnen neue Anwendungsmöglichkeiten in den Bereichen Computer Vision, Robotik, Medienbearbeitung und kreative Arbeitsabläufe.
In diesem Artikel erfährst du, was SAM 3 ist, wodurch es sich von SAM 2 unterscheidet, wie das Modell funktioniert und welche Anwendungen es in der Praxis gibt. Legen wir los!
Was ist SAM 3? Ein Blick auf Metas Modell zur Segmentierung beliebiger Objekte 3#
SAM 3 ist ein hochmodernes Computer-Vision-Modell, das Objekte in Bildern und Videos anhand einfacher Anweisungen erkennen, voneinander trennen und verfolgen kann. Statt sich auf eine feste Liste von Bezeichnungen zu stützen, versteht SAM 3 natürliche Sprache und visuelle Hinweise. So kannst du dem Modell einfach mitteilen, wonach es suchen soll.
Mit SAM 3 kannst du beispielsweise eine kurze Phrase wie „gelber Schulbus“ oder „eine gestreifte Katze“ eingeben, auf ein Objekt klicken oder ein Beispiel in einem Bild hervorheben. Das Modell erkennt anschließend jedes passende Objekt und erzeugt saubere Segmentierungsmasken (eine visuelle Umrisslinie, die genau zeigt, welche Pixel zu einem Objekt gehören). SAM 3 kann diesen Objekten auch über mehrere Videobilder hinweg folgen und sie während ihrer Bewegung konsistent halten.
SAM 3D ermöglicht die 3D-Rekonstruktion aus einem einzigen Bild#
Ein weiterer bemerkenswerter Teil der Ankündigung von Meta AI ist SAM 3D, das das Projekt zur Segmentierung beliebiger Objekte auf das Verständnis von 3D erweitert. SAM 3D kann ein einzelnes 2D-Bild aufnehmen und die Form, Pose oder Struktur eines Objekts oder eines menschlichen Körpers dreidimensional rekonstruieren. Anders gesagt kann das Modell abschätzen, wie etwas den Raum einnimmt, selbst wenn nur eine Perspektive verfügbar ist.
SAM 3D wurde als zwei unterschiedliche Modelle veröffentlicht: SAM 3D Objects rekonstruiert Alltagsgegenstände mit Geometrie und Textur, während SAM 3D Body die Form und Pose des menschlichen Körpers aus einem einzigen Bild schätzt. Beide Modelle verwenden die Segmentierungsausgabe von SAM 3 und erzeugen anschließend eine 3D-Darstellung, die dem Erscheinungsbild und der Position des Objekts im ursprünglichen Foto entspricht.

Abb. 1. Ein Beispiel für die Verwendung von SAM 3D. (Quelle: Mit Metas Spielwiese zur Segmentierung beliebiger Objekte erstellt)
SAM 3: Neue Funktionen für die Zusammenführung von Erkennung, Segmentierung und Verfolgung#
Hier sind einige der wichtigsten Neuerungen, mit denen SAM 3 Erkennung, Segmentierung und Verfolgung in einem einheitlichen Modell zusammenführt:
- Aufgaben zur Konzeptsegmentierung: Bei SAM und SAM 2 hing die Objektsegmentierung von visuellen Aufforderungen wie Klicks oder Rahmen ab. SAM 3 kann Objekte nun anhand einer kurzen Textphrase oder eines Beispielausschnitts aus dem Bild segmentieren. Dadurch kann das Modell alle passenden Instanzen erkennen, ohne dass du für jede einzelne klicken musst.
- Textaufforderungen mit offenem Vokabular: Anders als frühere Versionen kann SAM 3 kurze Phrasen in natürlicher Sprache interpretieren. Dadurch ist keine feste Liste von Bezeichnungen mehr erforderlich, und das Modell kann mit spezifischeren oder weniger verbreiteten Konzepten arbeiten.
- Ein Modell für Erkennung, Segmentierung und Verfolgung: SAM 3 vereint Erkennung, Segmentierung und Verfolgung in einem Modell. Dadurch entfallen separate Systeme zum Auffinden von Objekten, Erzeugen von Segmentierungsmasken und Verfolgen der Objekte über mehrere Videobilder hinweg. Das schafft einen konsistenteren und schlankeren Arbeitsablauf für Bilder und Videos. Zwar bot auch SAM 2 gewisse Funktionen zur Verfolgung, doch SAM 3 liefert eine deutlich stärkere und zuverlässigere Leistung.
- Stabilere Ergebnisse in komplexen Szenen: Da SAM 3 Text, Beispielbilder und visuelle Aufforderungen kombinieren kann, verarbeitet es überfüllte oder sich wiederholende Szenen zuverlässiger als frühere Versionen, die ausschließlich auf visuelle Klicks angewiesen waren.

Abb. 2. SAM 3 führt die Konzeptsegmentierung anhand von Text- oder Bildbeispielen ein. (Quelle)
SAM 3 vs. SAM 2 vs. SAM 1 im Vergleich#
Nehmen wir an, du siehst ein Safarivideo mit vielen verschiedenen Tieren und möchtest ausschließlich die Elefanten erkennen und segmentieren. Wie würde diese Aufgabe bei den verschiedenen SAM-Versionen aussehen?
Mit SAM müsstest du in jedem Bild manuell auf jeden Elefanten klicken, um eine Segmentierungsmaske zu erzeugen. Es gibt keine Verfolgung, daher sind in jedem neuen Bild neue Klicks erforderlich.
Mit SAM 2 könntest du einmal auf einen Elefanten klicken, seine Maske erhalten, und das Modell würde denselben Elefanten durch das Video verfolgen. Wenn du jedoch mehrere Elefanten (bestimmte Objekte) segmentieren möchtest, müsstest du weiterhin separate Klicks setzen, da SAM 2 Kategorien wie „Elefant“ nicht eigenständig versteht.
Mit SAM 3 wird der Arbeitsablauf deutlich einfacher. Du kannst „Elefant“ eingeben oder als Beispiel einen Rahmen um einen einzelnen Elefanten zeichnen. Das Modell findet dann automatisch jeden Elefanten im Video, segmentiert sie und verfolgt sie konsistent über mehrere Bilder hinweg. Die in früheren Versionen verwendeten Klick- und Rahmenaufforderungen werden weiterhin unterstützt. Jetzt kann das Modell jedoch auch auf Textaufforderungen und Beispielbilder reagieren – etwas, das SAM und SAM 2 nicht konnten.
So funktioniert das Modell SAM 3#
Sehen wir uns als Nächstes genauer an, wie das Modell SAM 3 funktioniert und wie es trainiert wurde.
Überblick über die Modellarchitektur von SAM 3#
SAM 3 führt mehrere Komponenten zusammen, um Konzeptaufforderungen und visuelle Aufforderungen in einem einzigen System zu unterstützen. Im Kern verwendet das Modell den Meta Perception Encoder, einen einheitlichen Open-Source-Encoder für Bilder und Texte von Meta.
Dieser Encoder kann sowohl Bilder als auch kurze Nominalphrasen verarbeiten. Einfach ausgedrückt ermöglicht dies SAM 3, Sprach- und Bildmerkmale effektiver miteinander zu verknüpfen als frühere Versionen des Modells zur Segmentierung beliebiger Objekte.
Auf diesem Encoder baut SAM 3 einen Detektor auf, der auf der Familie der Transformer-Modelle von DETR basiert. Dieser Detektor erkennt Objekte im Bild und hilft dem System zu bestimmen, welche Objekte der Aufforderung des Benutzers entsprechen.
Für die Videosegmentierung verwendet SAM 3 insbesondere eine Verfolgungskomponente, die auf der Speicherbank und dem Speicher-Encoder von SAM 2 aufbaut. Dadurch kann das Modell Informationen über Objekte über mehrere Bilder hinweg speichern, sie im Zeitverlauf erneut identifizieren und verfolgen.

Abb. 3. So funktioniert die Segmentierung beliebiger Objekte anhand von Konzepten (Quelle: scontent)
Die skalierbare Datenpipeline hinter dem Modell zur Segmentierung beliebiger Objekte 3#
Für das Training von SAM 3 benötigte Meta deutlich mehr annotierte Daten, als derzeit im Internet verfügbar sind. Hochwertige Segmentierungsmasken und Textbezeichnungen lassen sich nur schwer in großem Maßstab erstellen, und das vollständige Umranden jeder Instanz eines Konzepts in Bildern und Videos ist langsam und kostspielig.
Um dieses Problem zu lösen, entwickelte Meta eine neue Datenpipeline, in der SAM 3 selbst, zusätzliche KI-Modelle und menschliche Annotatoren zusammenarbeiten. Der Arbeitsablauf beginnt mit einer Pipeline aus KI-Systemen, darunter SAM 3 und ein auf Llama basierendes Modell zur Bildbeschreibung.
Diese Systeme durchsuchen große Sammlungen von Bildern und Videos, erstellen Bildbeschreibungen, wandeln diese in Textbezeichnungen um und erzeugen erste Kandidaten für Segmentierungsmasken. Anschließend prüfen menschliche und KI-gestützte Annotatoren diese Kandidaten.
Die KI-gestützten Annotatoren wurden darauf trainiert, bei Aufgaben wie der Prüfung der Maskenqualität und der Kontrolle der Konzeptabdeckung die Genauigkeit von Menschen zu erreichen oder sogar zu übertreffen. Sie filtern eindeutige Fälle heraus. Menschen greifen nur bei schwierigeren Beispielen ein, bei denen das Modell noch Probleme haben kann.

Abb. 4. Datenpipeline von SAM 3 (Quelle)
Dieser Ansatz steigert die Geschwindigkeit der Annotation bei Meta deutlich. Indem KI-gestützte Annotatoren einfache Fälle übernehmen, wird die Pipeline bei negativen Aufforderungen etwa fünfmal schneller und bei positiven Aufforderungen in fein abgestuften Anwendungsbereichen 36 % schneller.
Diese Effizienz ermöglichte es, den Datensatz auf mehr als vier Millionen einzigartige Konzepte zu skalieren. Die kontinuierliche Schleife aus KI-Vorschlägen, menschlichen Korrekturen und aktualisierten Modellvorhersagen verbessert die Qualität der Bezeichnungen im Laufe der Zeit und hilft SAM 3, eine wesentlich größere Bandbreite visueller und textbasierter Konzepte zu erlernen.
Leistungsverbesserungen von SAM 3#
In Bezug auf die Leistung stellt SAM 3 eine deutliche Verbesserung gegenüber früheren Modellen dar. Auf Metas neuem SA-Co-Benchmark, der die Erkennung und Segmentierung von Konzepten mit offenem Vokabular bewertet, erreicht SAM 3 sowohl bei Bildern als auch bei Videos ungefähr die doppelte Leistung früherer Systeme.
Bei interaktiven visuellen Aufgaben wie Point-to-Mask und Mask-to-Masklet erreicht oder übertrifft das Modell außerdem SAM 2. Meta berichtet von zusätzlichen Verbesserungen bei anspruchsvolleren Bewertungen wie dem Zero-Shot-LVIS (bei dem Modelle seltene Kategorien ohne Trainingsbeispiele erkennen müssen) und der Objekterkennung (bei der gemessen wird, ob alle Instanzen eines Objekts erkannt werden). Dies unterstreicht die stärkere Verallgemeinerungsfähigkeit über verschiedene Bereiche hinweg.
Zusätzlich zu diesen Genauigkeitsverbesserungen ist SAM 3 effizient: Es verarbeitet ein Bild mit mehr als 100 erkannten Objekten auf einer H200-GPU in etwa 30 Millisekunden und erreicht bei der Verfolgung mehrerer Objekte in Videos nahezu Echtzeitgeschwindigkeit.
Anwendungen des Modells zur Segmentierung beliebiger Objekte 3#
Nachdem wir nun ein besseres Verständnis von SAM 3 haben, sehen wir uns an, wie es in realen Anwendungen eingesetzt wird – von fortgeschrittener textgesteuerter Schlussfolgerung bis hin zur wissenschaftlichen Forschung und Metas eigenen Produkten.
Komplexe Textanfragen mit dem SAM 3 Agent verarbeiten#
SAM 3 kann auch als Werkzeug innerhalb eines größeren multimodalen Sprachmodells eingesetzt werden, das Meta als SAM 3 Agent bezeichnet. Anstatt SAM 3 eine kurze Phrase wie „Elefant“ zu geben, kann der Agent eine komplexere Frage in kleinere Aufforderungen zerlegen, die SAM 3 versteht.
Wenn der Benutzer beispielsweise fragt: „Welches Objekt im Bild wird verwendet, um ein Pferd zu steuern und zu führen?“, probiert der Agent verschiedene Nominalphrasen aus, sendet sie an SAM 3 und prüft, welche Masken sinnvoll sind. Er verfeinert die Suche so lange, bis er das richtige Objekt gefunden hat.
Auch ohne Training mit speziellen Datensätzen für Schlussfolgerungen erzielt der SAM 3 Agent gute Ergebnisse bei Benchmarks für komplexe Textanfragen wie ReasonSeg und OmniLabel. Dies zeigt, dass SAM 3 Systeme unterstützen kann, die sowohl Sprachverständnis als auch fein abgestufte visuelle Segmentierung benötigen.
Wissenschaftliche Anwendungen und Naturschutzanwendungen von SAM 3#
SAM 3 wird bereits in Forschungsumgebungen eingesetzt, in denen detaillierte visuelle Bezeichnungen wichtig sind. Meta arbeitete mit Conservation X Labs und Osa Conservation zusammen, um SA-FARI zu entwickeln, einen öffentlichen Datensatz zur Überwachung von Wildtieren mit mehr als 10.000 Videos aus Kamerafallen.
Jedes Tier in jedem Bild wird mit Rahmen und Segmentierungsmasken versehen – eine Aufgabe, deren manuelle Annotation äußerst zeitaufwendig wäre. Auch in der Meeresforschung wird SAM 3 gemeinsam mit FathomNet und MBARI eingesetzt, um Segmentierungsmasken für Unterwasseraufnahmen zu erstellen und neue Bewertungsbenchmarks zu unterstützen.
Solche Datensätze helfen Wissenschaftlern, Videoaufnahmen effizienter zu analysieren und Tiere sowie Lebensräume zu untersuchen, die sich normalerweise nur schwer in großem Maßstab verfolgen lassen. Forschende können diese Ressourcen auch nutzen, um eigene Modelle zur Artenbestimmung, Verhaltensanalyse und automatisierten ökologischen Überwachung zu entwickeln.
So setzt Meta SAM 3 in seinen Produkten ein#
Neben der Nutzung in der Forschung ermöglicht SAM 3 auch neue Funktionen und Anwendungsfälle in Metas Produkten für Endverbraucher. Hier ist ein Überblick über einige Möglichkeiten, wie es bereits integriert wird:
- Instagram-Bearbeitung: Kreative können Effekte auf eine bestimmte Person oder ein bestimmtes Objekt in einem Video anwenden, ohne jeden einzelnen Bildausschnitt manuell bearbeiten zu müssen.
- Meta-AI-App und meta.ai im Web: SAM 3 unterstützt neue Werkzeuge zum Ändern, Optimieren und kreativen Neuzusammenstellen von Bildern und Videos.
- „In Raum ansehen“ im Facebook Marketplace: SAM 3 arbeitet mit SAM 3D zusammen, damit Menschen Möbel oder Dekoration mithilfe eines einzigen Fotos in ihren eigenen vier Wänden anzeigen können.
- Forschungsbrillen Aria Gen 2: Das Modell zur Segmentierung beliebiger Objekte 3 hilft dabei, Hände und Objekte aus der Ich-Perspektive zu segmentieren und zu verfolgen, und unterstützt damit die Forschung zu AR (Augmented Reality), Robotik und kontextbezogener KI.
Wichtige Erkenntnisse#
SAM 3 ist ein bedeutender Fortschritt für die Segmentierung. Es führt Konzeptsegmentierung, Textaufforderungen mit offenem Vokabular und eine verbesserte Verfolgung ein. Dank der deutlich stärkeren Leistung bei Bildern und Videos sowie der Ergänzung durch SAM 3D eröffnet die Modellsuite neue Möglichkeiten für Vision AI, kreative Werkzeuge, wissenschaftliche Forschung und Produkte für die Praxis.
Tritt unserer Community bei und erkunde unser GitHub-Repository, um mehr über KI zu erfahren. Wenn du dein eigenes Vision-AI-Projekt entwickeln möchtest, sieh dir unsere Lizenzoptionen an. Erfahre mehr über Anwendungen wie KI im Gesundheitswesen und Vision AI im Einzelhandel, indem du unsere Lösungsseiten besuchst.









