Ultralytics YOLO27:
Anleitungen

Was ist EfficientNet? Ein kurzer Überblick

Verstehe die Architektur von EfficientNet und die Vorteile seiner kombinierten Skalierung! Entdecke EfficientNet B0–B7 für eine besonders effiziente Bildklassifizierung und Segmentierung.

ABAbirami Vina8 min read
Ein Überblick über die Architektur von EfficientNet

Im Jahr 2019 stellten Forschende bei Google AI EfficientNet vor, ein hochmodernes Computervisions-Modell zur Erkennung von Objekten und Mustern in Bildern. Es wurde in erster Linie für die Bildklassifizierung entwickelt, bei der ein Bild einer von mehreren vordefinierten Kategorien zugeordnet wird. Heute dient EfficientNet jedoch auch als Backbone für komplexere Aufgaben wie Objekterkennung, Segmentierung und Transferlernen.

Vor EfficientNet versuchten solche Modelle für maschinelles Lernen und visuelle KI, die Genauigkeit durch zusätzliche Schichten oder größere Schichten zu verbessern. Schichten sind die Verarbeitungsschritte in einem neuronalen Netzwerkmodell (einem vom menschlichen Gehirn inspirierten Modell für Deep Learning), die Daten verarbeiten, um Muster zu lernen und die Genauigkeit zu verbessern.

Diese Änderungen führten zu einem Zielkonflikt: Herkömmliche KI-Modelle wurden größer und langsamer, während der zusätzliche Genauigkeitsgewinn im Vergleich zum erheblichen Anstieg der erforderlichen Rechenleistung oft gering war.

EfficientNet verfolgte einen anderen Ansatz. Es erhöhte Tiefe (Anzahl der Schichten), Breite (Anzahl der Einheiten in jeder Schicht) und Bildauflösung (Detailgrad der Eingabebilder) gemeinsam und ausgewogen. Diese Methode, das sogenannte Compound Scaling, nutzt die verfügbare Rechenleistung zuverlässig vollständig aus. Das Ergebnis ist ein kleineres und schnelleres Modell, das bessere Leistungen als ältere Modelle wie ResNet oder DenseNet erbringen kann.

Heute bieten neuere Computervisionsmodelle wie Ultralytics YOLO11 eine höhere Genauigkeit, Geschwindigkeit und Effizienz. Dennoch bleibt EfficientNet ein wichtiger Meilenstein, der das Design vieler fortschrittlicher Architekturen beeinflusst hat.

In diesem Artikel erklären wir EfficientNet in fünf Minuten und behandeln dabei seine Funktionsweise, seine Besonderheiten und seine anhaltende Bedeutung für die Computer Vision. Legen wir los!

Was ist EfficientNet?#

Bevor EfficientNet entwickelt wurde, verbesserten die meisten Bilderkennungsmodelle ihre Genauigkeit, indem sie ihre Schichten anpassten oder die Größe der Eingabebilder erhöhten, um mehr Details zu erfassen. Diese Strategien verbesserten zwar die Ergebnisse, machten die Modelle aber auch größer und anspruchsvoller. Dadurch benötigten sie mehr Speicher und leistungsfähigere Hardware.

Anstatt einzelne Schichten zu verändern, skaliert EfficientNet Tiefe, Breite und Bildauflösung gemeinsam mithilfe einer Methode namens Compound Scaling. Dieser Ansatz ermöglicht ein effizientes Wachstum des Modells, ohne einen einzelnen Aspekt zu überlasten.

Die EfficientNet-Architektur verarbeitet Bilder durch eine Reihe von Blöcken, die jeweils aus kleineren Modulen aufgebaut sind. Die Anzahl der Module in jedem Block hängt von der Modellgröße ab.

Die Bausteine von EfficientNet

Abb. 1. Die Bausteine von EfficientNet. (Quelle)

Kleinere Varianten verwenden weniger Module, während größere Varianten Module häufiger wiederholen. Dieses flexible Design ermöglicht EfficientNet eine hohe Genauigkeit und Effizienz in einem breiten Anwendungsspektrum – von Mobilgeräten bis hin zu groß angelegten Systemen.

Funktionsweise von Compound Scaling#

Die Methode des Compound Scaling erweitert Tiefe, Breite und Bildauflösung eines Modells, hält sie aber im Gleichgewicht. Dadurch lässt sich die Rechenleistung effizient nutzen. Die Reihe beginnt mit einem kleineren Basismodell namens EfficientNet-B0, das als Grundlage für alle anderen Varianten dient.

Ausgehend von B0 werden die Modelle zu größeren Varianten namens EfficientNet-B1 bis EfficientNet-B7 skaliert. Mit jedem Schritt erhält das Netzwerk zusätzliche Schichten, erhöht die Anzahl der Kanäle (für die Verarbeitung verwendete Einheiten) und verarbeitet Eingabebilder mit höherer Auflösung. Das Wachstum bei jedem Schritt wird durch einen Parameter namens Compound Coefficient bestimmt. Er stellt sicher, dass Tiefe, Breite und Auflösung in festen Proportionen statt unabhängig voneinander zunehmen.

Compound Scaling erhöht Breite, Tiefe und Bildauflösung eines Modells

Abb. 2. Compound Scaling erhöht Breite, Tiefe und Bildauflösung eines Modells. (Quelle)

EfficientNet-Architektur#

Werfen wir als Nächstes einen Blick auf die Architektur von EfficientNet.

Sie baut auf MobileNetV2 auf, einem leichtgewichtigen Computervisionsmodell, das für Mobil- und eingebettete Geräte optimiert ist. Im Kern steht der Mobile-Inverted-Bottleneck-Convolution-Block (MBConv), eine spezielle Schicht, die Bilddaten ähnlich wie eine gewöhnliche Faltung verarbeitet, dabei aber weniger Berechnungen benötigt. Dieser Block macht das Modell sowohl schnell als auch speichereffizient.

In jedem MBConv-Block befindet sich ein Squeeze-and-Excitation-Modul (SE). Dieses Modul passt die Stärke verschiedener Kanäle im Netzwerk an. Es verstärkt wichtige Kanäle und reduziert die Stärke anderer. Dadurch kann sich das Netzwerk auf die wichtigsten Merkmale eines Bildes konzentrieren und den Rest außer Acht lassen. Das EfficientNet-Modell verwendet außerdem eine Swish-Aktivierungsfunktion (eine mathematische Funktion, die das Erlernen von Mustern durch das Netzwerk unterstützt), mit der es Muster in Bildern besser erkennen kann als ältere Methoden.

Darüber hinaus verwendet es DropConnect, bei dem während des Trainings einige Verbindungen innerhalb des Netzwerks zufällig deaktiviert werden. Diese Methode der stochastischen Regularisierung (eine Zufallstechnik, die verhindert, dass sich das Modell Trainingsdaten statt einer allgemeinen Mustererkennung einprägt) reduziert Overfitting, indem sie das Netzwerk zwingt, robustere Merkmalsrepräsentationen (stärkere, allgemeinere Muster in den Daten) zu lernen, die sich besser auf unbekannte Daten übertragen lassen.

Architektur von EfficientNet-B0

Abb. 3. Architektur von EfficientNet-B0 (Quelle)

Ein kurzer Überblick über die Modellvarianten von EfficientNet#

Nachdem wir nun besser verstanden haben, wie EfficientNet-Modelle funktionieren, sehen wir uns die verschiedenen Modellvarianten an.

EfficientNet-Modelle reichen von B0 bis B7, wobei B0 als Basismodell Geschwindigkeit und Genauigkeit ausbalanciert. Jede Variante erhöht Tiefe, Breite und Bildauflösung und verbessert dadurch die Genauigkeit. Gleichzeitig benötigen sie mehr Rechenleistung – von B1 und B2 bis hin zu den leistungsstarken Varianten B6 und B7.

EfficientNet-B3 und EfficientNet-B4 bieten bei größeren Bildern ein ausgewogenes Verhältnis, während B5 häufig für komplexe Datensätze gewählt wird, die hohe Präzision erfordern. Darüber hinaus kann das neueste Modell, EfficientNet V2, die Trainingsgeschwindigkeit erhöhen, kleine Datensätze besser verarbeiten und ist für moderne Hardware optimiert.

Anwendungen von EfficientNet#

EfficientNet kann genaue Ergebnisse liefern und dabei weniger Speicher und Rechenleistung als viele andere Modelle benötigen. Dadurch ist es in zahlreichen Bereichen nützlich – von der wissenschaftlichen Forschung bis hin zu Produkten, die Menschen täglich verwenden.

Analyse medizinischer Bilder#

Medizinische Bilder, etwa CT-Aufnahmen der Lunge, enthalten häufig subtile Details, die für eine genaue Diagnose entscheidend sind. KI-Modelle können bei der Analyse dieser Bilder helfen und Muster aufdecken, die für Menschen schwer zu erkennen sein können. Eine für diesen Zweck entwickelte Variante von EfficientNet ist MONAI (Medizinisches offenes Netzwerk für KI) EfficientNet, das speziell für die Analyse medizinischer Bilder entwickelt wurde.

Auf Grundlage der EfficientNet-Architektur haben Forschende außerdem Lung-EffNet entwickelt, ein Modell zur Klassifizierung von Lungen-CT-Aufnahmen und Erkennung von Tumoren. Es kann Tumoren als gutartig, bösartig oder unauffällig kategorisieren und erreichte unter experimentellen Bedingungen eine angegebene Genauigkeit von über 99 %.

Bildklassifizierung von Tumoren mit Lung-EffNet

Abb. 4. Bildklassifizierung von Tumoren mit Lung-EffNet. (Quelle)

Objekterkennung in Echtzeit#

Objekterkennung bezeichnet das Auffinden von Objekten in einem Bild und die Bestimmung ihrer Positionen. Sie ist ein zentraler Bestandteil von Anwendungen wie Sicherheitssystemen, selbstfahrenden Autos und Drohnen.

EfficientNet wurde in diesem Bereich wichtig, weil es eine sehr effiziente Methode zur Merkmalsextraktion aus Bildern bot. Seine Methode zur Skalierung von Tiefe, Breite und Auflösung zeigte, wie Modelle genau sein können, ohne zu groß oder langsam zu werden. Deshalb verwenden viele Erkennungssysteme wie EfficientDet EfficientNet als Backbone.

Neuere Modelle wie Ultralytics YOLO11 verfolgen dasselbe Ziel, Geschwindigkeit und Genauigkeit zu verbinden. Dieser Trend hin zu effizienten Modellen wurde stark von Ideen aus Architekturen wie EfficientNet beeinflusst.

Vor- und Nachteile von EfficientNet#

Hier sind einige Vorteile der Verwendung von EfficientNet in Computervisionsprojekten:

  • Hohe Genauigkeit mit weniger Parametern: EfficientNet kann eine ähnliche oder bessere Genauigkeit als ältere Modelle wie ResNet oder DenseNet erreichen. Es verwendet jedoch weniger Parameter, wodurch es schneller zu trainieren und einfacher bereitzustellen ist.
  • Skalierbare Modellfamilie: Von B0 bis B7 kannst du eine Variante auswählen, die zu deiner Hardware und deinen Anforderungen an die Präzision passt, ohne das Basismodell des Netzwerks zu ändern.
  • Gut für Transferlernen geeignet: EfficientNet kann beim Transferlernen eine zuverlässige Modellleistung liefern. Dabei wird ein vortrainiertes Modell für eine individuelle Aufgabe weitertrainiert. Es kann als Backbone für verschiedene Computervisionsaufgaben dienen. Auch beim Feinabstimmen hat es starke Ergebnisse erzielt. So erreichte es eine hochmoderne Genauigkeit auf CIFAR-100, einem häufig verwendeten Bildklassifizierungs-Datensatz, und benötigte dabei deutlich weniger Parameter als frühere Modelle.

Die Verwendung von EfficientNet bietet zwar viele Vorteile, dennoch solltest du die folgenden Einschränkungen berücksichtigen:

  • Benötigt mehr Speicher: Varianten wie EfficientNet-B6 und EfficientNet-B7 benötigen viel GPU-Speicher.
  • Skalierung auf ImageNet abgestimmt: Die Skalierungseinstellungen wurden für den ImageNet-Datensatz entwickelt. Daher kann die Leistung bei sehr unterschiedlichen Datensätzen ohne Feinabstimmung abnehmen. Dies gilt insbesondere für kleine Datensätze, da EfficientNet und seine Skalierung für einen großen und vielfältigen Datensatz wie ImageNet entwickelt wurden, der genügend Daten liefert, um Tiefe und Breite zu rechtfertigen.
  • Auf bestimmter Hardware langsamer: EfficientNet verwendet Schichten namens MBConv, die für eine effiziente Verarbeitung auf moderner Hardware entwickelt wurden. Auf älteren GPUs oder CPUs können diese Schichten langsamer laufen.

Wichtige Erkenntnisse#

EfficientNet veränderte die Entwicklung von Computervisionsmodellen, indem es Tiefe, Breite und Bildauflösung im Gleichgewicht hielt. Es ist nach wie vor ein wichtiges Modell und hat auch neuere Architekturen beeinflusst. Insbesondere nimmt es einen bedeutenden Platz in der Geschichte der Computer Vision ein.

Tritt unserer Community und unserem GitHub-Repository bei, um mehr über KI zu erfahren. Sieh dir unsere Lösungsseiten an und lies über KI im Gesundheitswesen und Computer Vision in der Automobilindustrie. Entdecke unsere Lizenzierungsoptionen und beginne noch heute mit der Entwicklung von Computervisionsanwendungen!

Explore solutions

Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren
Computer Vision für Luftbilder

Computer Vision für Luftbilder

Verwandle Drohnen- und Luftbilder mit Ultralytics YOLO in Echtzeiterkenntnisse für Landwirtschaft, Aquakultur, Umweltüberwachung, Naturschutz und Geodatenanalyse.
Mehr erfahren
Computer Vision in der Luft- und Raumfahrt

Computer Vision in der Luft- und Raumfahrt

Bringe KI-gestützte Bildverarbeitung mit Ultralytics YOLO-Modellen in die Luftüberwachung. Unterstütze Drohnen, Luft- und Raumfahrt-Workflows, Umweltschutz und Geodatenbranchen mit Computer-Vision-Lösungen.
Mehr erfahren

Schütze jeden Standort mit Ultralytics YOLO-Modellen. Vision AI unterstützt Perimeterüberwachung, Bedkennung, Kennzeichenerkennung und Arbeitssicherheit.
Mehr erfahren
Computer Vision in der Robotik

Computer Vision in der Robotik

Mache Maschinen mit Ultralytics YOLO-Modellen intelligenter. Vision AI in der Robotik ermöglicht autonome Navigation, Wahrnehmung, Objektverfolgung und Steuerung in Echtzeit.
Mehr erfahren
Computer Vision in der Logistik

Computer Vision in der Logistik

Optimiere die Logistik mit Ultralytics YOLO-Modellen. Vision AI ermöglicht die Paketinspektion, Sortierung, Fahrzeugverfolgung und Überwachung der Lagersicherheit in Echtzeit.
Mehr erfahren
Computer Vision im Einzelhandel

Computer Vision im Einzelhandel

Gestalte den Einzelhandel mit Ultralytics YOLO-Modellen neu. Vision AI ermöglicht Bestandsverfolgung, Regalüberwachung, Warteschlangenmanagement und aussagekräftigere Einblicke in das Kundenverhalten.
Mehr erfahren
Computer Vision im Gesundheitswesen

Computer Vision im Gesundheitswesen

Entwickle Lösungen für das Gesundheitswesen mit Ultralytics YOLO-Modellen. Vision AI im Gesundheitswesen ermöglicht eine schnellere medizinische Bildgebung, intelligentere Diagnosen und die Überwachung von Patienten.
Mehr erfahren
Computer Vision in der Fertigung

Computer Vision in der Fertigung

Optimiere die Fertigung mit Ultralytics YOLO-Modellen. Vision AI ermöglicht Qualitätskontrolle, Fehlererkennung, die Einhaltung von Vorgaben zur persönlichen Schutzausrüstung und die Automatisierung von Montagelinien.
Mehr erfahren
Computer Vision in der Automobilindustrie

Computer Vision in der Automobilindustrie

Setze Computer Vision mit Ultralytics YOLO-Modellen in der Automobilindustrie ein. Vision AI verbessert die Verkehrssicherheit, Fahrerassistenz und Fahrzeugautomatisierung für intelligentere Straßen.
Mehr erfahren
Computer Vision in der Landwirtschaft

Computer Vision in der Landwirtschaft

Bring Vision AI mit Ultralytics YOLO-Modellen in die intelligente Landwirtschaft. Ermögliche die Überwachung von Nutzpflanzen, die Verfolgung von Nutztieren und Präzisionslandwirtschaft für höhere und intelligentere Erträge.
Mehr erfahren

Lass uns gemeinsam die Zukunft der KI gestalten!

Beginne deine Reise in die Zukunft des maschinellen Lernens