YOLO Vision 2026:
Zurück zum Glossar von Ultralytics

Masked Autoencoders (MAE)

Entdecke, wie maskierte Autoencoder (MAE) das selbstüberwachte Lernen revolutionieren. Erfahre, wie die Rekonstruktion mit MAE die Leistung und Effizienz von Ultralytics YOLO26 verbessert.

Maskierte Autoencoder (MAE) stellen einen äußerst effizienten und skalierbaren Ansatz für selbstüberwachtes Lernen im übergeordneten Bereich der Computer Vision dar. Sie wurden als Methode eingeführt, um neuronale Netze mit sehr vielen Parametern zu trainieren, ohne umfangreich annotierte Datensätze zu benötigen. Dabei verdeckt ein MAE absichtlich einen großen, zufällig ausgewählten Teil eines Eingabebildes und trainiert das Modell darauf, die fehlenden Pixel zu rekonstruieren. Durch die erfolgreiche Vorhersage der verborgenen visuellen Informationen erlernt das Netzwerk implizit ein tiefes semantisches Verständnis von Formen, Texturen und räumlichen Beziehungen.

Diese Technik ist stark vom Erfolg der maskierten Sprachmodellierung in textbasierten Systemen inspiriert, wurde jedoch an die hohe Dimensionalität von Bilddaten angepasst. Die Architektur basiert auf dem äußerst beliebten Transformer-Framework und verwendet eine asymmetrische Struktur aus Encoder und Decoder.

Funktionsweise maskierter Autoencoder#

Die zentrale Innovation des MAE liegt in seiner Verarbeitungseffizienz. Während des Trainings wird das Eingabebild in ein Raster aus Bildausschnitten unterteilt. Ein hoher Prozentsatz dieser Bildausschnitte, oft bis zu 75 %, wird zufällig maskiert und verworfen. Der Encoder, typischerweise ein Vision-Transformer (ViT), verarbeitet nur die sichtbaren, nicht maskierten Bildausschnitte. Da der Encoder die maskierten Bereiche vollständig überspringt, benötigt er deutlich weniger Rechenleistung und Speicher, wodurch der Trainingsprozess bemerkenswert schnell wird.

Nachdem der Encoder latente Repräsentationen der sichtbaren Bildausschnitte erzeugt hat, übernimmt ein kompakter Decoder. Der Decoder erhält die kodierten sichtbaren Bildausschnitte zusammen mit „Maskierungstokens“ (Platzhaltern für die fehlenden Daten) und versucht, das ursprüngliche Bild wiederherzustellen. Da der Decoder nur während dieser Vortrainingsphase verwendet wird, kann er sehr klein gehalten werden, was den Rechenaufwand weiter reduziert. Nach Abschluss des Vortrainings wird der Decoder verworfen, während der leistungsfähige Encoder für nachgelagerte Anwendungen beibehalten wird.

Abgrenzung verwandter Begriffe#

Um MAEs vollständig zu verstehen, ist es hilfreich, sich anzusehen, wie sie sich von älteren oder allgemeineren Konzepten des Deep Learning unterscheiden:

  • Autoencoder: Ein herkömmlicher Autoencoder komprimiert eine vollständige Eingabe in einen kleineren latenten Raum und rekonstruiert sie anschließend, um effiziente Kodierungen von Daten zu erlernen. Ein MAE zwingt das Netzwerk dagegen, fehlende Daten vorherzusagen, anstatt die gesamte Eingabe lediglich zu komprimieren und wieder zu dekomprimieren.
  • Selbstüberwachtes Lernen: Dabei handelt es sich um ein übergeordnetes Trainingsparadigma, bei dem ein Modell aus den Daten selbst lernt, ohne von Menschen annotierte Labels zu benötigen. MAE ist eine spezifische architektonische Umsetzung dieses Konzepts.
  • Basismodell: MAEs werden häufig verwendet, um visuelle Basismodelle vorzutrainieren, die anschließend für spezielle Aufgaben feinabgestimmt werden.

Anwendungen in der Praxis#

Da MAEs äußerst robuste Repräsentationen visueller Daten erlernen, eignen sie sich ideal als Ausgangspunkt für komplexe KI-Systeme in der Praxis.

  • Vortraining für fortgeschrittene Objekterkennung: Die durch das MAE-Vortraining erlernten leistungsfähigen Merkmalsextraktionsfähigkeiten können die Leistung nachgelagerter Systeme zur Objekterkennung deutlich steigern. So können beispielsweise durch MAE erlernte Merkmale beim Training von Modellen wie Ultralytics YOLO26 auf benutzerdefinierten Nischendatensätzen genutzt werden, bei denen nur wenige annotierte Daten verfügbar sind.
  • Medizinische Bildanalyse: In Bereichen wie der Radiologie ist die Erfassung großer Datensätze annotierter MRT- oder CT-Aufnahmen teuer und durch Datenschutzgesetze eingeschränkt. Forschende verwenden MAEs, um Modelle auf großen Sammlungen nicht annotierter medizinischer Bilder vorzutrainieren, die in der aktuellen wissenschaftlichen Literatur auf arXiv veröffentlicht wurden, bevor sie diese mit sehr wenigen annotierten Beispielen zur Erkennung von Tumoren oder Anomalien feinabstimmen.

Datenverwaltung und Bereitstellung#

Sobald ein Backbone mithilfe eines MAE-Ansatzes vortrainiert wurde, besteht der nächste Schritt darin, das Modell für bestimmte Aufgaben wie Bildklassifizierung oder Bildsegmentierung feinabzustimmen und bereitzustellen. Moderne Cloud-Ökosysteme machen diesen Übergang nahtlos. Teams können beispielsweise die Ultralytics Platform nutzen, um aufgabenspezifische Datensätze einfach zu annotieren, das Training in der Cloud zu koordinieren und die daraus entstehenden produktionsreifen Modelle auf Edge-Geräten oder Servern bereitzustellen. Dadurch entfällt ein großer Teil der standardmäßigen Infrastrukturarbeit, die typischerweise mit dem Betrieb von maschinellem Lernen (MLOps) verbunden ist.

Codebeispiel: Simulation der Maskierung von Bildausschnitten#

Für das Training eines vollständigen MAE ist zwar eine komplette Transformer-Architektur erforderlich, doch das grundlegende Konzept der Maskierung von Bildausschnitten lässt sich mithilfe von PyTorch-Tensoroperationen leicht veranschaulichen. Dieses einfache Codebeispiel zeigt, wie zufällig sichtbare Bildausschnitte aus einem Eingabetensor ausgewählt werden können.

import torch


def create_random_mask(batch_size, num_patches, mask_ratio=0.75):
    """Generates a random mask to simulate MAE patch dropping."""
    # Calculate how many patches to keep visible
    num_keep = int(num_patches * (1 - mask_ratio))

    # Generate random noise to determine patch shuffling
    noise = torch.rand(batch_size, num_patches)

    # Sort noise to get random indices
    ids_shuffle = torch.argsort(noise, dim=1)

    # Select the indices of the patches that remain visible
    ids_keep = ids_shuffle[:, :num_keep]

    return ids_keep


# Simulate a batch of 4 images, each divided into 196 patches
visible_patches = create_random_mask(batch_size=4, num_patches=196)
print(f"Visible patch indices shape: {visible_patches.shape}")

Für Entwickler, die leistungsfähige, vortrainierte visuelle Funktionen in ihre Arbeitsabläufe integrieren möchten, ohne Architekturen von Grund auf neu zu schreiben, bietet die umfassende Ultralytics-Dokumentation hervorragende Ausgangspunkte, um modernste Bildverarbeitungsmodelle auf deine individuellen Herausforderungen anzuwenden. Darüber hinaus bieten wichtige Frameworks wie TensorFlow robuste Ökosysteme, um aktuelle Forschung zum maschinellen Lernen in skalierbare Produktionsumgebungen zu integrieren.

Explore solutions

Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren

Lass uns gemeinsam die Zukunft der KI gestalten!

Beginne deine Reise in die Zukunft des maschinellen Lernens