Ultralytics YOLO27:
Anleitungen

Was ist die skalierungsinvariante Merkmalstransformation (SIFT)?

Entdecke den SIFT-Algorithmus. Erfahre, was SIFT ist und welche leistungsstarken Merkmale er für skalierungsinvariante Computer Vision bietet. Optimiere deine Bildverarbeitung.

ABAbirami Vina14 min read
Der skalierungsinvariante Merkmalstransformationsalgorithmus (SIFT) in Computer Vision

Wenn du die in diesem Artikel behandelten Konzepte visuell nachvollziehen möchtest, sieh dir das folgende Video an.

Heutzutage sind viele der intelligenten Geräte, die wir verwenden – von Telefonen und Kameras bis hin zu Smart-Home-Systemen –, mit KI-Lösungen ausgestattet, die Gesichter, Objekte und sogar ganze visuelle Szenen erkennen können. Diese Fähigkeit stammt aus dem Bereich der Computer Vision, einem Teilgebiet der künstlichen Intelligenz, das Maschinen ermöglicht, Bilder und Videos zu verstehen und zu interpretieren.

Wenn du beispielsweise aus einem beliebigen Winkel oder einer beliebigen Entfernung ein Foto vom Eiffelturm aufnimmst, kann dein Gerät ihn in der Regel mithilfe von Computer Vision trotzdem erkennen und in den richtigen Ordner deiner Galerie einordnen. Das klingt zwar einfach, aber die Erkennung von Objekten ist nicht immer unkompliziert. Bilder können je nach Größe, Winkel, Maßstab oder Beleuchtung sehr unterschiedlich aussehen, was es Maschinen erschwert, sie zuverlässig zu identifizieren.

Um dieses Problem zu lösen, entwickelten Forschende einen Computer-Vision-Algorithmus namens skalierungsinvariante Merkmalstransformation, kurz SIFT. Dieser Algorithmus ermöglicht die Erkennung von Objekten unter unterschiedlichen Betrachtungsbedingungen. SIFT wurde 1999 von David Lowe entwickelt und dazu konzipiert, eindeutige Schlüsselpunkte in einem Bild zu finden und zu beschreiben, beispielsweise Ecken, Kanten oder Muster, die auch dann erkennbar bleiben, wenn das Bild skaliert, gedreht oder anders beleuchtet wird.

Bevor Deep-Learning-Modelle für Computer Vision wie Ultralytics YOLO11 populär wurden, war SIFT eine weit verbreitete Technik im Bereich Computer Vision. Sie wurde standardmäßig für Aufgaben wie die Objekterkennung eingesetzt, bei der ein bestimmtes Element in einem Foto identifiziert werden soll, sowie für den Bildabgleich, bei dem Fotos anhand übereinstimmender Bildmerkmale ausgerichtet werden.

In diesem Artikel geben wir dir einen kurzen Überblick darüber, was SIFT ist, wie der Algorithmus grundsätzlich funktioniert und warum er für die Entwicklung von Computer Vision wichtig ist. Los geht's!

Warum der SIFT-Algorithmus für Computer Vision unverzichtbar ist#

Ein Objekt kann in einem Bild auf viele verschiedene Arten erscheinen. Eine Kaffeetasse kann beispielsweise von oben, von der Seite, bei hellem Sonnenlicht oder unter einer warmen Lampe fotografiert werden. Dieselbe Tasse kann außerdem größer aussehen, wenn sie sich nahe an der Kamera befindet, und kleiner, wenn sie weiter entfernt ist.

All diese Unterschiede machen es zu einer anspruchsvollen Aufgabe, einem Computer die Erkennung eines Objekts beizubringen. Diese als Objekterkennung bekannte Computer-Vision-Aufgabe erfordert, dass Vision-AI-Modelle Objekte auch dann genau identifizieren und lokalisieren, wenn sich ihre Größe, ihr Winkel oder die Beleuchtungsbedingungen ändern.

Damit dies möglich ist, nutzt Computer Vision einen als Merkmalsextraktion oder Merkmalserkennung bezeichneten Prozess. Anstatt zu versuchen, das gesamte Bild auf einmal zu verstehen, sucht ein Modell nach charakteristischen Bildmerkmalen wie scharfen Ecken, einzigartigen Mustern oder Texturen, die über verschiedene Winkel, Maßstäbe und Beleuchtungsbedingungen hinweg erkennbar bleiben.

Genau dafür wurde die skalierungsinvariante Merkmalstransformation, kurz SIFT, entwickelt. SIFT ist ein Algorithmus zur Erkennung und Beschreibung von Merkmalen, der Objekte in Bildern unabhängig davon zuverlässig identifizieren kann, unter welchen Bedingungen sie aufgenommen wurden.

Skalierungsinvarianz erreichen#

Der SIFT-Algorithmus verfügt über einige wichtige Eigenschaften, die ihn für die Objekterkennung nützlich machen. Eine der wichtigsten Eigenschaften ist die sogenannte Skalierungsinvarianz. Das bedeutet, dass SIFT verschiedene Teile eines Objekts erkennen kann, unabhängig davon, ob es groß und nah an der Kamera oder klein und weit entfernt erscheint. Selbst wenn das Objekt nicht vollständig sichtbar ist, kann der Algorithmus dieselben Schlüsselpunkte erkennen.

Dazu verwendet der Algorithmus ein Konzept namens Skalenraumtheorie. Vereinfacht gesagt wird das Bild auf verschiedenen Stufen weichgezeichnet, um mehrere Versionen zu erzeugen. SIFT durchsucht diese Versionen anschließend nach Mustern und Details, die unabhängig davon gleich bleiben, wie sich Größe oder Schärfe des Bildes verändern.

Ein aus einigen Metern Entfernung fotografiertes Verkehrsschild erscheint beispielsweise deutlich größer als dasselbe aus größerer Entfernung aufgenommene Schild. SIFT kann jedoch weiterhin dieselben charakteristischen Merkmale erkennen. Dadurch lassen sich die beiden Bilder korrekt abgleichen, obwohl das Schild in sehr unterschiedlichen Maßstäben erscheint.

Rotationsinvarianz gewährleisten#

Objekte in Bildern können auch gedreht erscheinen, manchmal sogar auf dem Kopf stehen. SIFT bewältigt dies durch eine Eigenschaft namens Rotationsinvarianz. Für jeden erkannten Schlüsselpunkt weist der Algorithmus anhand der lokalen Bildgradienten eine konsistente Orientierung zu. So kann dasselbe Objekt unabhängig davon erkannt werden, wie es gedreht ist.

Du kannst dir das so vorstellen, als würde jeder Schlüsselpunkt mit einem kleinen Pfeil markiert, der seine Ausrichtung anzeigt. Indem die Merkmale an diesen Orientierungen ausgerichtet werden, stellt SIFT sicher, dass die Schlüsselpunkte auch bei einer Drehung des Objekts korrekt übereinstimmen. Ein Wahrzeichen, das beispielsweise in einer Landschaftsaufnahme zu sehen ist, kann auch dann korrekt identifiziert werden, wenn ein weiteres Foto davon mit schräg gehaltener Kamera aufgenommen wurde.

Unempfindlichkeit gegenüber anderen Bildveränderungen#

Neben Größe und Drehung können sich Bilder auch auf andere Weise verändern, etwa durch Änderungen der Beleuchtung. Die Beleuchtung eines Objekts kann von hell zu dunkel wechseln, der Kamerawinkel kann sich leicht verschieben oder das Bild kann unscharf oder verrauscht sein.

SIFT ist darauf ausgelegt, mit solchen Veränderungen umzugehen. Dazu konzentriert sich der Algorithmus auf charakteristische Schlüsselpunkte mit hohem Kontrast, da diese Merkmale weniger durch Beleuchtungsänderungen oder kleine Änderungen des Blickwinkels beeinflusst werden. Dadurch ist SIFT in der Regel zuverlässiger als einfache Verfahren zur Kanten- oder Eckenerkennung, die bei veränderten Bedingungen häufig versagen.

Aus einem Regenbild und dem unverfälschten Eingangsbild extrahierte SIFT-Schlüsselpunkte

Abb. 1. Aus (a) einem Regenbild und (b) dem zugehörigen unverfälschten Eingangsbild extrahierte SIFT-Schlüsselpunkte. (Quelle)

Betrachte ein Gemälde in einer Galerie. Es kann sowohl bei weichem Tageslicht als auch unter hellen künstlichen Scheinwerfern oder sogar bei leichter Bewegungsunschärfe durch eine handgehaltene Kamera erkannt werden. Die Schlüsselpunkte bleiben trotz dieser Unterschiede stabil genug für einen präzisen Abgleich.

Funktionsweise des Algorithmus der skalierungsinvarianten Merkmalstransformation (SIFT)#

Als Nächstes sehen wir uns an, wie der SIFT-Algorithmus funktioniert. Dieser Prozess lässt sich in vier Hauptschritte unterteilen: Schlüsselpunkterkennung, Lokalisierung der Schlüsselpunkte, Orientierungszuweisung und Beschreibung der Schlüsselpunkte.

Schritt 1: Erkennung von Extrema im Skalenraum#

Im ersten Schritt werden Schlüsselpunkte gefunden und erkannt. Dabei handelt es sich um charakteristische Stellen im Bild, etwa Ecken oder starke Änderungen der Textur, die dabei helfen, ein Objekt zu verfolgen oder zu erkennen.

Damit diese potenziellen Schlüsselpunkte bei jeder Größe erkannt werden können, erstellt SIFT einen sogenannten Skalenraum. Dabei handelt es sich um eine Sammlung von Bildern, die durch schrittweises Weichzeichnen des Originalbildes mit einem Gaußfilter, einer Glättungstechnik, erzeugt und in als Oktaven bezeichneten Ebenen gruppiert werden. Jede Oktave enthält dasselbe Bild mit zunehmender Unschärfe, während die nächste Oktave eine kleinere Version des Bildes darstellt.

Durch das Subtrahieren eines weichgezeichneten Bildes von einem anderen berechnet SIFT die Differenz der Gaußfunktionen (DoG), die Bereiche mit starken Helligkeitsänderungen hervorhebt. Diese Bereiche werden als potenzielle Schlüsselpunkte ausgewählt, da sie beim Vergrößern oder Verkleinern des Bildes konsistent bleiben.

DoG hebt wichtige Strukturen hervor, indem Bilder mit unterschiedlichen Unschärfestufen voneinander subtrahiert werden

Abb. 2. DoG hebt wichtige Strukturen hervor, indem Bilder mit unterschiedlichen Unschärfestufen voneinander subtrahiert werden. (Quelle)

Schritt 2: Lokalisierung der Schlüsselpunkte#

Nicht alle potenziellen Schlüsselpunkte sind nützlich, da einige schwach oder instabil sein können. Um sie zu verfeinern, verwendet SIFT eine mathematische Methode namens Taylorreihenentwicklung, mit der sich die genaue Position eines Schlüsselpunktes präziser schätzen lässt.

In diesem Schritt werden unzuverlässige Punkte entfernt. Schlüsselpunkte mit geringem Kontrast, die mit ihrer Umgebung verschmelzen, werden ebenso verworfen wie solche, die direkt auf Kanten liegen, da sie sich zu leicht verschieben können. Durch diese Filterung bleiben nur die stabilsten und charakteristischsten Schlüsselpunkte übrig.

Schritt 3: Orientierungszuweisung#

Sobald stabile Schlüsselpunkte identifiziert wurden, macht SIFT sie rotationsinvariant. Das bedeutet, dass sie auch dann abgeglichen werden können, wenn das Bild seitlich oder auf dem Kopf gedreht wurde. Dazu analysiert SIFT, wie sich die Helligkeit um jeden Schlüsselpunkt herum verändert, was als Gradient bezeichnet wird. Gradienten zeigen sowohl die Richtung als auch die Stärke der Änderung der Pixelintensität und erfassen zusammen die lokale Struktur um den Punkt.

Für jeden Schlüsselpunkt berücksichtigt SIFT die Gradienten innerhalb eines umgebenden Bereichs und gruppiert sie in ein Orientierungshistogramm. Der höchste Ausschlag in diesem Histogramm zeigt die vorherrschende Richtung der Intensitätsänderung an, die anschließend als Orientierung des Schlüsselpunktes festgelegt wird. Sowohl die Gradientenrichtungen, die anzeigen, wo sich die Intensität verändert, als auch die Gradientenbeträge, die die Stärke dieser Veränderung angeben, werden zum Aufbau dieses Histogramms verwendet.

Wenn es weitere Ausschläge gibt, die nahezu ebenso stark sind, weist SIFT demselben Schlüsselpunkt mehrere Orientierungen zu. Dadurch wird verhindert, dass wichtige Merkmale verloren gehen, wenn Objekte in ungewöhnlichen Winkeln erscheinen. Indem jeder Schlüsselpunkt an seiner Orientierung ausgerichtet wird, stellt SIFT sicher, dass die im nächsten Schritt erzeugten Deskriptoren konsistent bleiben.

Mit anderen Worten: Selbst wenn zwei Bilder desselben Objekts unterschiedlich gedreht sind, stimmen die an der Orientierung ausgerichteten Schlüsselpunkte weiterhin korrekt überein. Dieser Schritt verleiht SIFT seine hohe Fähigkeit zur Verarbeitung von Drehungen und macht den Algorithmus deutlich robuster als frühere Verfahren zur Merkmalserkennung.

Nähere Betrachtung von Schritt 3 des SIFT-Algorithmus

Abb. 3. Nähere Betrachtung von Schritt 3 des SIFT-Algorithmus (Quelle)

Schritt 4: Deskriptor des Schlüsselpunktes#

Im letzten SIFT-Schritt wird eine Beschreibung für jeden Schlüsselpunkt erstellt, damit er in anderen Bildern erkannt werden kann.

Dazu betrachtet SIFT einen kleinen quadratischen Ausschnitt um jeden Schlüsselpunkt, der etwa 16 × 16 Pixel groß ist. Dieser Ausschnitt wird zunächst an der Orientierung des Schlüsselpunktes ausgerichtet, damit die Drehung keinen Einfluss darauf hat. Anschließend wird der Ausschnitt in ein Raster aus 4 × 4 kleineren Quadraten unterteilt.

In jedem kleinen Quadrat misst SIFT, wie sich die Helligkeit in verschiedene Richtungen verändert. Diese Veränderungen werden in einem sogenannten Histogramm gespeichert, das einer Darstellung der häufigsten Richtungen entspricht. Jedes Quadrat erhält ein eigenes Histogramm, sodass die 16 Quadrate insgesamt 16 Histogramme ergeben.

Abschließend werden diese Histogramme zu einer einzigen Liste aus insgesamt 128 Zahlen zusammengefasst. Diese Liste wird als Merkmalsvektor bezeichnet und dient als Fingerabdruck des Schlüsselpunktes. Da sie die einzigartige Textur und Struktur in der Umgebung des Punktes erfasst, ermöglicht dieser Fingerabdruck den Abgleich desselben Schlüsselpunktes über verschiedene Bilder hinweg, selbst wenn diese skaliert, gedreht oder unterschiedlich beleuchtet wurden.

Überblick über die Funktionsweise von SIFT

Abb. 4. Überblick über die Funktionsweise von SIFT (Quelle)

Wichtige Anwendungen von SIFT in Computer Vision#

Nachdem wir nun besser verstehen, was SIFT ist und wie der Algorithmus funktioniert, sehen wir uns einige praktische Anwendungen in Computer Vision an.

Objekterkennung und -detektion#

Eine der wichtigsten Anwendungen von SIFT ist die Objektidentifikation und -detektion. Dabei wird einem Computer beigebracht, Objekte in Bildern zu erkennen und zu lokalisieren, selbst wenn sie nicht immer gleich aussehen. SIFT kann beispielsweise ein Buch unabhängig davon erkennen, ob es sich nahe an der Kamera befindet, weiter entfernt ist oder schräg gedreht wurde.

Das funktioniert, weil SIFT sehr charakteristische und stabile Schlüsselpunkte extrahiert. Werden diese Schlüsselpunkte mit SIFT-Deskriptoren kombiniert, bilden sie SIFT-Merkmale, die eine zuverlässige Möglichkeit zum Abgleich desselben Objekts in verschiedenen Bildern bieten. Diese Merkmale erfassen einzigartige Details des Objekts, die konsistent bleiben, und ermöglichen so einen zuverlässigen Merkmalsabgleich über verschiedene Bilder hinweg, selbst wenn sich Größe, Position oder Orientierung des Objekts ändern.

Verwendung von SIFT zur Erkennung eines Buchcovers in einem neuen Bild mit anderer Ausrichtung

Abb. 5. Verwendung von SIFT zur Erkennung eines Buchcovers in einem neuen Bild, das im Vergleich zum Original aus einer anderen Richtung aufgenommen wurde. Bild vom Autor.

Bevor Deep Learning populär wurde, war SIFT eine der zuverlässigsten Methoden zum Aufbau von Objekterkennungssystemen. Die Methode wurde häufig in der Forschung und in Anwendungen eingesetzt, die den Abgleich von Objekten über große Bilddatensätze hinweg erforderten, auch wenn sie oft erhebliche Rechenressourcen benötigte.

Bildzusammenfügung und Erstellung von Panoramabildern#

SIFT kann auch zur Erstellung von Panoramabildern verwendet werden. Dabei handelt es sich um breite Fotos, die durch das Zusammenfügen mehrerer Bilder entstehen. Mithilfe von SIFT werden charakteristische Schlüsselpunkte in den überlappenden Bereichen verschiedener Bilder gefunden und anschließend miteinander abgeglichen. Diese Übereinstimmungen dienen als Ankerpunkte und geben dem Zusammenfügungsprozess vor, wie die Fotos ausgerichtet werden müssen.

Nach Abschluss des Abgleichs können Zusammenfügungsalgorithmen die korrekte Ausrichtung berechnen, häufig mithilfe geometrischer Transformationen, die ein Bild auf ein anderes abbilden. Anschließend werden die Bilder überblendet, sodass die Übergänge verschwinden. Das Ergebnis ist ein nahtloses Panorama, das wie ein einziges breites Foto aussieht, obwohl es aus mehreren Aufnahmen erstellt wurde.

3D-Rekonstruktion und Robotik#

Eine weitere interessante Anwendung von SIFT ist die 3D-Rekonstruktion, bei der mehrere aus unterschiedlichen Winkeln aufgenommene 2D-Fotos zu einem dreidimensionalen Modell kombiniert werden. SIFT findet und verknüpft dazu dieselben Punkte in diesen Bildern.

Nachdem die Übereinstimmungen hergestellt wurden, lassen sich die 3D-Positionen dieser Punkte mithilfe der Triangulation schätzen, einer Methode zur Berechnung der Tiefe aus verschiedenen Blickwinkeln. Dieser Prozess ist Teil der Bewegungsstruktur (SfM), einer Technik, die mehrere überlappende Bilder verwendet, um die 3D-Form einer Szene sowie die Positionen der Kameras zu schätzen, mit denen die Fotos aufgenommen wurden.

Das Ergebnis ist in der Regel eine 3D-Punktwolke, also eine Ansammlung von Punkten im Raum, die das Objekt oder die Umgebung abbildet. SIFT war eines der ersten Werkzeuge, die die Rekonstruktion aus Bewegung praktisch nutzbar machten. Obwohl neuere Techniken heute schneller und verbreiteter sind, wird SIFT weiterhin eingesetzt, wenn Genauigkeit wichtiger ist als Geschwindigkeit.

SIFT wurde auch in der Robotik eingesetzt, insbesondere beim visuellen SLAM (Simultane Lokalisierung und Kartierung). SLAM ermöglicht es einem Roboter, seine Position zu bestimmen und gleichzeitig eine Karte seiner Umgebung zu erstellen.

SIFT-Schlüsselpunkte dienen als zuverlässige Orientierungspunkte, die ein Roboter über mehrere Einzelbilder hinweg wiedererkennen kann, selbst wenn sich Beleuchtung oder Blickwinkel ändern. Durch die Verfolgung dieser Orientierungspunkte kann der Roboter seine Position schätzen und seine Karte laufend aktualisieren. Obwohl in der Robotik heute häufiger schnellere Merkmalserkennungsverfahren eingesetzt werden, spielte SIFT eine wichtige Rolle in frühen SLAM-Systemen und ist weiterhin in Situationen relevant, in denen Robustheit wichtiger ist als Geschwindigkeit.

Vorteile und wichtige Aspekte von SIFT#

Obwohl der SIFT-Algorithmus häufig in Computer Vision eingesetzt wird und als zuverlässige Methode gilt, bringt er auch einige Kompromisse mit sich. Deshalb ist es wichtig, seine Vor- und Nachteile abzuwägen, bevor du entscheidest, ob er für ein Projekt geeignet ist. Im Folgenden sehen wir uns seine wichtigsten Stärken und Einschränkungen an.

Zentrale Vorteile von SIFT#

Hier sind einige Vorteile der Verwendung des SIFT-Algorithmus:

  • Skalierungs- und Rotationsinvarianz: SIFT liefert skalierungsinvariante Schlüsselpunkte, die relativ stabil bleiben, wenn Objekte in unterschiedlichen Größen oder Ausrichtungen erscheinen. Dies stellt im Vergleich zu früheren Merkmalserkennungsverfahren einen bedeutenden Fortschritt dar.
  • Mäßige Robustheit gegenüber Beleuchtungs- und Blickwinkeländerungen: SIFT kann mit Änderungen von Helligkeit und Kontrast sowie kleinen Änderungen des Blickwinkels umgehen, ist unter extremeren Bedingungen jedoch weniger zuverlässig.
  • Fähigkeit, in unübersichtlichen oder teilweise verdeckten Szenen zu arbeiten: Da SIFT zahlreiche lokale Schlüsselpunkte erkennt, kann der Algorithmus ein Objekt häufig auch dann identifizieren, wenn ein Teil davon verdeckt ist oder der Hintergrund komplex ist.

Leistungsaspekte und Alternativen#

Hier sind einige Nachteile der Verwendung des SIFT-Algorithmus:

  • Hoher Rechenaufwand: Der mehrstufige Prozess und die detaillierten Deskriptoren von SIFT machen den Algorithmus langsamer und ressourcenintensiver als moderne Merkmalserkennungsverfahren. Um dies zu verbessern, entwickelten Forschende den SURF-Algorithmus (beschleunigte robuste Merkmale), der schnellere Berechnungen zum Finden und Beschreiben von Merkmalen verwendet. SURF ist in einigen Fällen weniger präzise als SIFT, läuft jedoch deutlich schneller und eignet sich dadurch besser für zeitkritische Aufgaben.
  • Nicht ideal für den Echtzeiteinsatz: Aufgrund seines Rechenaufwands stößt SIFT bei Anwendungen an Grenzen, bei denen Geschwindigkeit entscheidend ist, etwa beim Echtzeit-Tracking oder in der mobilen Robotik.
  • Eingeschränkte Vielseitigkeit: Obwohl SIFT in vielen Fällen robust ist, eignet sich der Algorithmus weniger für extreme Beleuchtungsänderungen, große Veränderungen des Blickwinkels oder stark dynamische Szenen, in denen neuere Algorithmen oder Verfahren des maschinellen Lernens bessere Ergebnisse erzielen.

Wenn du die Vor- und Nachteile von SIFT betrachtest, fällt dir möglicherweise auf, dass viele seiner Einschränkungen den Weg für fortschrittlichere Techniken bereitet haben. Insbesondere entwickelten sich Faltungsneuronale Netze (CNNs) zu einer leistungsstarken Alternative.

Ein CNN ist eine Art Deep-Learning-Modell, das davon inspiriert ist, wie das menschliche visuelle System funktioniert. Es verarbeitet ein Bild in mehreren Schichten: Ausgehend von einfachen Mustern wie Kanten und Texturen arbeitet es sich schrittweise zu komplexeren Formen und Objekten vor. Anders als die von SIFT manuell entwickelten Merkmalsregeln lernen CNNs Merkmalsrepräsentationen direkt aus den Daten.

Durch dieses datenbasierte Lernen können CNNs SIFT bei Aufgaben zum Abgleich von Deskriptoren und bei der Klassifikation übertreffen. CNNs sind außerdem ausdrucksstärker und robuster und können sich besser an die Variabilität und Komplexität visueller Daten anpassen.

Beispielsweise haben CNN-basierte Modelle auf ImageNet, einem umfangreichen Benchmark-Datensatz mit Millionen annotierter Bilder aus Tausenden Kategorien, bahnbrechende Ergebnisse erzielt. ImageNet wurde entwickelt, um zu testen, wie gut Algorithmen Objekte erkennen und klassifizieren können, und macht den Abstand zwischen älteren merkmalsbasierten Methoden und Deep Learning sichtbar.

CNNs übertrafen SIFT schnell, indem sie weitaus reichhaltigere und flexiblere Repräsentationen lernten. Dadurch konnten sie Objekte bei wechselnder Beleuchtung, aus unterschiedlichen Blickwinkeln und sogar bei teilweiser Verdeckung erkennen – in Szenarien, in denen SIFT häufig an seine Grenzen stößt.

Wichtige Erkenntnisse#

Der Algorithmus der skalierungsinvarianten Merkmalstransformation nimmt einen wichtigen Platz in der Geschichte von Computer Vision ein. Er bot eine zuverlässige Möglichkeit, Merkmale auch in wechselnden Umgebungen zu erkennen, und beeinflusste viele der heute verwendeten Methoden.

Obwohl neuere Techniken schneller und effizienter sind, legte SIFT den Grundstein für ihre Entwicklung. SIFT zeigt, wo der heutige Fortschritt in Computer Vision seinen Anfang nahm, und verdeutlicht, wie weit sich hochmoderne KI-Systeme entwickelt haben.

Werde Teil unserer globalen Community und sieh dir unser GitHub-Repository an, um mehr über Computer Vision zu erfahren. Entdecke auf unseren Lösungsseiten Innovationen wie KI in der Landwirtschaft und Computer Vision im Einzelhandel. Informiere dich über unsere Lizenzoptionen und beginne damit, dein eigenes Computer-Vision-Modell zu entwickeln.

Explore solutions

Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren

Lass uns gemeinsam die Zukunft der KI gestalten!

Beginne deine Reise in die Zukunft des maschinellen Lernens