Label Smoothing
Erfahre, wie Label Smoothing Overfitting verhindert und die Verallgemeinerungsfähigkeit von Modellen verbessert. Entdecke, wie du diese Technik mit Ultralytics YOLO26 für bessere Ergebnisse implementierst.
Label-Glättung ist eine weit verbreitete Regularisierungstechnik im maschinellen Lernen, die die Generalisierungsfähigkeit von Modellen verbessert und Überanpassung verhindert. Beim Training neuronaler Netze besteht das Ziel typischerweise darin, den Fehler zwischen Vorhersagen und Ground Truth zu minimieren. Wird ein Modell jedoch zu sicher in seinen Vorhersagen und weist einer einzelnen Klasse eine Wahrscheinlichkeit von nahezu 100 % zu, beginnt es häufig, sich den spezifischen Störanteil in den Trainingsdaten zu merken, anstatt robuste Muster zu lernen. Dieses als Überanpassung bezeichnete Phänomen verschlechtert die Leistung bei neuen, bisher unbekannten Beispielen. Label-Glättung wirkt dem entgegen, indem sie das Modell davon abhält, mit absoluter Sicherheit vorherzusagen, und dem Netzwerk im Grunde vermittelt, dass immer ein kleiner Fehlerspielraum besteht.
Die Funktionsweise weicher Zielwerte#
Um zu verstehen, wie Label-Glättung funktioniert, ist ein Vergleich mit standardmäßigen „harten“ Zielwerten hilfreich. Beim herkömmlichen überwachten Lernen werden Klassifikationslabels meist durch One-Hot-Kodierung dargestellt. Bei einer Aufgabe, in der beispielsweise zwischen Katzen und Hunden unterschieden wird, hätte ein Bild eines „Hundes“ den Zielvektor [0, 1]. Um diese Vorgabe exakt zu erfüllen, verschiebt das Modell seine internen Werte, die als Logits bezeichnet werden, in Richtung Unendlich. Dies kann zu instabilen Gradienten und einer eingeschränkten Anpassungsfähigkeit führen.
Label-Glättung ersetzt diese starren Einsen und Nullen durch „weiche“ Zielwerte. Anstelle einer Zielwahrscheinlichkeit von 1.0 kann der korrekten Klasse 0.9 zugewiesen werden, während die verbleibende Wahrscheinlichkeitsmasse (0.1) gleichmäßig auf die falschen Klassen verteilt wird. Diese subtile Änderung modifiziert das Ziel der Verlustfunktion, etwa der Kreuzentropie, und verhindert, dass die Aktivierungsfunktion (in der Regel Softmax) in die Sättigung geht. Das Ergebnis ist ein Modell, das im Merkmalsraum kompaktere Klassencluster lernt und eine bessere Modellkalibrierung liefert. Das bedeutet, dass die vorhergesagten Wahrscheinlichkeiten die tatsächliche Wahrscheinlichkeit einer korrekten Vorhersage genauer widerspiegeln.
Anwendungen in der Praxis#
Diese Technik ist besonders wichtig in Bereichen, in denen Daten inhärent mehrdeutig sind oder Datensätze zu Beschriftungsfehlern neigen.
- Medizinische Diagnostik: Im Bereich der KI im Gesundheitswesen sind klinische Daten nur selten eindeutig. So kann beispielsweise eine Aufnahme in der medizinischen Bildanalyse Merkmale zeigen, die stark auf eine Erkrankung hindeuten, aber keinen eindeutigen Beleg darstellen. Das Training mit harten Labels zwingt das Modell, diese Unsicherheit zu ignorieren. Durch den Einsatz von Label-Glättung bewahrt das Modell ein gewisses Maß an Skepsis. Das ist für Entscheidungsunterstützungssysteme von entscheidender Bedeutung, da übermäßige Sicherheit zu Fehldiagnosen führen kann.
- Bildklassifikation im großen Maßstab: Umfangreiche öffentliche Datensätze wie ImageNet enthalten häufig falsch beschriftete Bilder oder Bilder mit mehreren gültigen Objekten. Wenn ein Modell versucht, diese verrauschten Beispiele mit 100 % Sicherheit zu lernen, entstehen falsche Zuordnungen. Label-Glättung wirkt als Puffer gegen Beschriftungsrauschen und stellt sicher, dass einige fehlerhafte Datenpunkte die endgültigen Modellgewichte nicht stark verzerren.
Implementierung der Label-Glättung mit Ultralytics#
Moderne Frameworks für Deep Learning vereinfachen die Anwendung dieser Technik. Mit dem Paket ultralytics kannst du Label-Glättung problemlos in deine Trainingspipeline für Bildklassifikation oder Erkennungsaufgaben integrieren. Dies wird häufig genutzt, um zusätzliche Leistung aus hochmodernen Modellen wie YOLO26 herauszuholen.
Das folgende Beispiel zeigt, wie du ein Klassifikationsmodell mit aktivierter Label-Glättung trainierst:
from ultralytics import YOLO
# Load a pre-trained YOLO26 classification model
model = YOLO("yolo26n-cls.pt")
# Train with label_smoothing set to 0.1
# The target for the correct class becomes 1.0 - 0.5 * 0.1 = 0.95 (depending on implementation specifics)
model.train(data="mnist", epochs=5, label_smoothing=0.1)Vergleich mit verwandten Konzepten#
Es ist hilfreich, Label-Glättung von anderen Strategien zur Regularisierung abzugrenzen, um zu verstehen, wann sie eingesetzt werden sollte.
- vs. Dropout: Eine Dropout-Schicht deaktiviert während des Trainings zufällig Neuronen, damit das Netzwerk redundante Repräsentationen lernt. Beide Methoden verhindern eine Überanpassung, aber Dropout verändert die Netzwerkarchitektur dynamisch, während Label-Glättung das Optimierungsziel, also die Labels selbst, verändert.
- vs. Wissensdestillation: Beide Techniken umfassen das Training mit weichen Zielwerten. Bei der Wissensdestillation stammen die weichen Zielwerte jedoch von einem „Lehrer“-Modell und enthalten erlernte Informationen (z. B. „das sieht zu 10 % wie eine Katze aus“). Im Gegensatz dazu verwendet Label-Glättung „uninformative“ weiche Zielwerte, die mathematisch abgeleitet werden (z. B. „weise allen anderen Klassen gleichermaßen eine Wahrscheinlichkeit von 10 % zu“).
- vs. Datenerweiterung: Strategien zur Datenerweiterung verändern die Eingabedaten (durch Drehen, Zuschneiden oder Ändern der Farben), um die Vielfalt zu erhöhen. Label-Glättung verändert die Erwartungen an die Ausgabe. Umfassende Trainingsabläufe auf der Ultralytics Platform kombinieren häufig Datenerweiterung, Dropout und Label-Glättung, um eine maximale Genauigkeit zu erreichen.
Indem Label-Glättung das Problem des verschwindenden Gradienten in den letzten Schichten mindert und das Modell dazu anregt, robustere Merkmale zu lernen, bleibt sie ein fester Bestandteil moderner Deep-Learning-Architekturen.









