YOLO Vision 2026:
Vision-KI

Neuigkeiten aus der KI-Forschung von Meta FAIR: SAM 2.1 und CoTracker3

Entdecke die neuesten KI-Modelle von Meta FAIR, SAM 2.1 und CoTracker3, die fortschrittliche Segmentierungs- und Tracking-Funktionen für vielfältige Anwendungen in der Praxis bieten.

ABAbirami Vina5 min read
KI-Forschung von Meta FAIR: SAM 2.1 und CoTracker3

Künstliche Intelligenz (AI) ist ein Forschungsgebiet, in dem derzeit viel Aufregung und Dynamik herrschen, da neue Innovationen und Durchbrüche schneller als je zuvor entstehen. In den vergangenen Wochen hat das Team für Grundlagenforschung zu künstlicher Intelligenz (FAIR) von Meta eine Reihe von Tools und Modellen vorgestellt, die Herausforderungen in verschiedenen Bereichen der KI angehen sollen. Zu diesen Veröffentlichungen gehören Updates, die so unterschiedliche Bereiche wie Gesundheitswesen, Robotik und erweiterte Realität beeinflussen könnten.

Das aktualisierte Modell SAM 2.1 verbessert beispielsweise die Objektsegmentierung, sodass sich Objekte in Bildern und Videos leichter präzise erkennen und voneinander trennen lassen. CoTracker3 konzentriert sich dagegen auf das Tracking von Punkten und hilft dabei, Punkte in Videobildern zu verfolgen, selbst wenn sich Objekte bewegen oder teilweise verdeckt werden.

Meta hat außerdem leichtere und schnellere Versionen seines Sprachmodells Llama für eine effiziente Nutzung auf dem Gerät sowie eine neue Technologie zur taktilen Wahrnehmung für die Robotik vorgestellt. In diesem Artikel sehen wir uns diese neuesten Veröffentlichungen von Meta FAIR genauer an und erläutern, was die einzelnen Tools bieten. Legen wir los!

Metas verbessertes Segmentierungsmodell: SAM 2.1#

Die Objektsegmentierung, eine wichtige Aufgabe des maschinellen Sehens, ermöglicht es, einzelne Objekte in einem Bild oder Video zu erkennen und voneinander zu trennen, wodurch sich bestimmte relevante Bereiche leichter analysieren lassen. Seit seiner Veröffentlichung wird Metas Modell zur Segmentierung beliebiger Objekte 2 (SAM 2) in verschiedenen Bereichen wie der medizinischen Bildgebung und der Meteorologie zur Objektsegmentierung eingesetzt. Auf Grundlage des Feedbacks aus der Community hat Meta nun SAM 2.1 vorgestellt, eine verbesserte Version, die einige der beim ursprünglichen Modell aufgetretenen Herausforderungen bewältigen und insgesamt eine bessere Leistung liefern soll.

Leistungsbenchmark des Modells SAM 2.1

Abb. 1 Leistungsbenchmark des Modells SAM 2.1.

SAM 2.1 enthält Aktualisierungen, die dank neuer Techniken zur Datenerweiterung einen besseren Umgang mit visuell ähnlichen und kleineren Objekten ermöglichen. Außerdem verbessert das Modell den Umgang mit Verdeckungen, also Situationen, in denen Teile eines Objekts nicht sichtbar sind, indem es mit längeren Videosequenzen trainiert wird. Dadurch kann es sich Objekte über längere Zeit „merken“ und wiedererkennen, selbst wenn sie vorübergehend verdeckt sind. Wenn beispielsweise jemand ein Video aufnimmt, in dem eine Person hinter einem Baum entlanggeht, kann SAM 2.1 die Person verfolgen, sobald sie auf der anderen Seite wieder erscheint, und dabei sein Wissen über die Position des Objekts und seine Bewegung nutzen, um kurze Unterbrechungen der Sicht zu überbrücken.

Zusammen mit diesen Aktualisierungen hat Meta die SAM 2 Developer Suite veröffentlicht. Sie umfasst Open-Source-Trainingscode und eine vollständige Infrastruktur für Demos, sodass du SAM 2.1 mit deinen eigenen Daten feinabstimmen und in verschiedene Anwendungen integrieren kannst.

CoTracker3: Metas Tracking-Modell sowie seine Funktionen und Aktualisierungen#

Eine weitere interessante Aufgabe des maschinellen Sehens ist das Tracking von Punkten. Dabei werden bestimmte Punkte oder Merkmale über mehrere Bilder eines Videos hinweg verfolgt. Stell dir ein Video von einem Radfahrer vor, der eine Strecke entlangfährt – durch das Tracking von Punkten kann das Modell Punkte verfolgen, die sich beispielsweise am Helm oder an den Rädern des Radfahrers befinden, selbst wenn sie kurzzeitig von Hindernissen verdeckt werden.

Das Tracking von Punkten ist für Anwendungen wie 3D-Rekonstruktion, Robotik und Videobearbeitung unverzichtbar. Herkömmliche Modelle sind häufig auf komplexe Aufbauten und große synthetische Datensätze angewiesen, was ihre Wirksamkeit in realen Szenarien einschränkt.

Metas Tracking-Modell CoTracker3 begegnet diesen Einschränkungen durch eine vereinfachte Modellarchitektur. Außerdem führt es eine Technik zur Pseudo-Beschriftung ein, mit der das Modell aus echten, nicht annotierten Videos lernen kann. Dadurch wird CoTracker3 für den praktischen Einsatz effizienter und besser skalierbar.

Vergleich von CoTracker3 mit anderen Tracking-Modellen

Abb. 2 Vergleich von CoTracker3 mit anderen Tracking-Modellen.

Eine der Eigenschaften, durch die sich CoTracker3 auszeichnet, ist sein guter Umgang mit Verdeckungen. Mithilfe der Cross-Track-Attention, einer Technik, mit der das Modell Informationen über mehrere verfolgte Punkte hinweg austauschen kann, ermittelt CoTracker3 die Positionen verdeckter Punkte anhand sichtbarer Punkte. Dadurch ist CoTracker3 für dynamische Umgebungen besonders gut geeignet, etwa zum Verfolgen einer Person durch eine belebte Szene.

CoTracker3 bietet außerdem sowohl einen Online- als auch einen Offline-Modus. Der Online-Modus ermöglicht Tracking in Echtzeit, während der Offline-Modus für ein umfassenderes Tracking über vollständige Videosequenzen hinweg eingesetzt werden kann, was sich ideal für Aufgaben wie Videobearbeitung oder Animation eignet.

Weitere Updates und Forschung von Meta FAIR#

Während SAM 2.1 und CoTracker3 die neuesten Fortschritte von Meta im Bereich des maschinellen Sehens zeigen, gibt es auch spannende Updates in anderen Bereichen der KI, etwa in der Verarbeitung natürlicher Sprache (NLP) und der Robotik. Sehen wir uns einige dieser jüngsten Entwicklungen von Meta FAIR an.

Metas Spirit LM: KI-Innovationen bei Sprach- und multimodalen Modellen#

Metas Spirit LM ist ein neues multimodales Sprachmodell, das Funktionen für Text und Sprache kombiniert und dadurch Interaktionen mit KI natürlicher wirken lässt. Anders als herkömmliche Modelle, die ausschließlich Text oder Sprache verarbeiten, kann Spirit LM nahtlos zwischen beiden wechseln.

Spirit LM kann Sprache generieren und auf eine menschenähnlichere Weise verstehen. So kann es beispielsweise virtuelle Assistenten verbessern, die gesprochene oder geschriebene Sprache verstehen und darauf antworten können, oder Hilfsmittel für die Barrierefreiheit unterstützen, die Sprache und Text ineinander umwandeln.

Ein Beispiel für die Sprachsynthese mit Meta Spirit LM

Abb. 3 Ein Beispiel für die Sprachsynthese mit Meta Spirit LM.

Darüber hinaus hat Meta Techniken entwickelt, um große Sprachmodelle effizienter zu machen. Eine davon heißt Layer Skip und trägt dazu bei, den Rechenbedarf und die Energiekosten zu senken, indem nur die für eine bestimmte Aufgabe erforderlichen Schichten aktiviert werden. Das ist besonders nützlich für Anwendungen auf Geräten mit begrenztem Speicher und begrenzter Leistung.

Um dem Bedarf gerecht zu werden, KI-Anwendungen auf solchen Geräten bereitzustellen, hat Meta außerdem quantisierte Versionen seiner Llama-Modelle veröffentlicht. Diese Modelle sind komprimiert und laufen auf mobilen Geräten schneller, ohne an Genauigkeit einzubüßen.

Ein Blick auf die Zukunft der Optimierung mit Meta Lingua#

Da KI-Modelle immer größer und komplexer werden, ist die Optimierung ihres Trainings zu einer entscheidenden Aufgabe geworden. Im Bereich der Optimierung hat Meta Meta Lingua vorgestellt, eine flexible und effiziente Codebasis, die das Training großer Sprachmodelle erleichtert. Das modulare Design von Meta Lingua ermöglicht es Forschenden, ihre Experimente schnell anzupassen und zu skalieren.

Forschende können weniger Zeit für die technische Einrichtung und mehr Zeit für die eigentliche Forschung aufwenden. Die Codebasis ist außerdem schlank und lässt sich leicht integrieren, wodurch sie sich sowohl für kleine Experimente als auch für Projekte im großen Maßstab eignet. Durch die Beseitigung dieser technischen Hürden hilft Meta Lingua Forschenden, schneller voranzukommen und neue Ideen leichter zu testen.

Ein Überblick über Meta Lingua

Abb. 4 Ein Überblick über Meta Lingua.

Metas Verbesserungen im Bereich der KI-Sicherheit#

Mit den Fortschritten in der Quantencomputertechnologie entstehen neue Herausforderungen für die Datensicherheit. Anders als heutige Computer werden Quantencomputer komplexe Berechnungen wahrscheinlich deutlich schneller lösen können. Das bedeutet, dass sie möglicherweise die derzeit verwendeten Verschlüsselungsverfahren aufbrechen könnten, die zum Schutz sensibler Informationen dienen. Deshalb gewinnt die Forschung in diesem Bereich zunehmend an Bedeutung – die Entwicklung neuer Möglichkeiten zum Schutz von Daten ist entscheidend, während wir uns auf die Zukunft des Quantencomputings vorbereiten.

Um diesem Problem zu begegnen, hat Meta Salsa entwickelt, ein Tool zur Stärkung der kryptografischen Sicherheit in der Post-Quanten-Ära. Salsa unterstützt Forschende dabei, KI-gesteuerte Angriffe zu testen und potenzielle Schwachstellen zu erkennen, sodass sie die Sicherheitslücken in kryptografischen Systemen besser verstehen und beheben können. Durch die Simulation fortschrittlicher Angriffsszenarien liefert Salsa wertvolle Erkenntnisse, die zur Entwicklung stärkerer und widerstandsfähigerer Sicherheitsmaßnahmen für das Quantenzeitalter beitragen können.

KI bei Meta: Neueste Innovationen in der Robotik#

Metas aktuelle Arbeit in der Robotik konzentriert sich darauf, die Interaktion von KI mit der physischen Welt natürlicher zu gestalten, indem die Wahrnehmung von Berührungen, die Geschicklichkeit und die Zusammenarbeit mit Menschen verbessert werden. Meta Digit 360 ist insbesondere ein fortschrittlicher taktiler Sensor, der Robotern ein differenziertes Tastempfinden verleiht. Die Sensoren helfen Robotern, Details wie Struktur, Druck und sogar die Form von Objekten zu erkennen. Auf Grundlage dieser Informationen können Roboter Objekte präziser handhaben – etwas, das in Bereichen wie dem Gesundheitswesen und der Fertigung entscheidend ist.

Hier sind einige der wichtigsten Funktionen von Meta Digit 360:

  • Das System verfügt über 18 verschiedene Sensorfunktionen und kann dadurch ein breites Spektrum taktiler Details erfassen.
  • Der Sensor kann Druckänderungen von nur 1 Millinewton erkennen, sodass Roboter auf feine Strukturen und subtile Bewegungen reagieren können.
  • Über die Oberfläche der Fingerspitze verteilt befinden sich mehr als 8 Millionen Taxel (kleine Messpunkte), die eine hochauflösende Karte der taktilen Informationen liefern.

Eine Erweiterung von Meta Digit 360 ist Meta Digit Plexus, eine Plattform, die verschiedene Berührungssensoren in eine einzige Roboterhand integriert. Dieser Aufbau ermöglicht es Robotern, gleichzeitig Berührungsinformationen von mehreren Punkten zu verarbeiten – ähnlich wie die menschliche Hand sensorische Daten erfasst.

Die taktile Sensorplattform Meta Digit Plexus

Abb. 5 Meta Digit Plexus.

Der nächste Abschnitt der KI-Geschichte nimmt Gestalt an#

Metas neueste KI-Updates reichen von Fortschritten im maschinellen Sehen mit SAM 2.1 und CoTracker3 bis hin zu neuen Entwicklungen bei Sprachmodellen und in der Robotik. Sie zeigen, wie sich KI stetig von der Theorie zu praktischen Lösungen mit konkreten Auswirkungen entwickelt.

Diese Tools sollen KI in verschiedenen Bereichen anpassungsfähiger und nützlicher machen – von der Segmentierung komplexer Bilder über das Verstehen menschlicher Sprache bis hin zur Zusammenarbeit mit uns in der physischen Welt.

Indem Meta FAIR den Schwerpunkt auf Zugänglichkeit und Anwendungen in der Praxis legt, bringt das Team uns einer Zukunft näher, in der KI reale Herausforderungen bewältigen und unser tägliches Leben sinnvoll verbessern kann.

Interessierst du dich für KI? Tritt unserer Community bei, um die neuesten Updates und Erkenntnisse zu erhalten, und sieh dir unser GitHub-Repository an. Du kannst außerdem erkunden, wie maschinelles Sehen in Branchen wie bei selbstfahrenden Autos und in der Landwirtschaft eingesetzt werden kann!

Explore solutions

Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren

Lass uns gemeinsam die Zukunft der KI gestalten!

Beginne deine Reise in die Zukunft des maschinellen Lernens