Label Smoothing
Apprends comment le lissage des étiquettes (label smoothing) empêche le surapprentissage et améliore la généralisation du modèle. Découvre comment implémenter cette technique avec Ultralytics YOLO26 pour de meilleurs résultats.
Le lissage d'étiquettes est une technique de régularisation largement utilisée en apprentissage automatique pour améliorer la généralisation des modèles et éviter le surapprentissage. Lors de l'entraînement de réseaux de neurones, l'objectif est généralement de minimiser l'erreur entre les prédictions et la vérité terrain. Cependant, si un modèle devient trop confiant dans ses prédictions — en attribuant une probabilité proche de 100 % à une seule classe —, il commence souvent à mémoriser le bruit spécifique des données d'entraînement plutôt qu'à apprendre des motifs robustes. Ce phénomène, connu sous le nom de surapprentissage, dégrade les performances sur de nouveaux exemples invisibles. Le lissage d'étiquettes résout ce problème en décourageant le modèle de prédire avec une certitude absolue, indiquant essentiellement au réseau qu'il y a toujours une petite marge d'erreur.
La mécanique des cibles souples#
Pour comprendre comment fonctionne le lissage d'étiquettes, il est utile de le contraster avec des cibles « dures » standard. En apprentissage supervisé traditionnel, les étiquettes de classification sont généralement représentées via un encodage one-hot. Par exemple, dans une tâche distinguant les chats des chiens, une image de « chien » aurait un vecteur cible de [0, 1]. Pour correspondre parfaitement à cela, le modèle pousse ses scores internes, appelés logits, vers l'infini, ce qui peut entraîner des gradients instables et une incapacité à s'adapter.
Le lissage d'étiquettes remplace ces 1 et 0 rigides par des cibles « douces ». Au lieu d'une probabilité cible de 1.0, la classe correcte peut se voir attribuer 0.9, tandis que la masse de probabilité restante (0.1) est distribuée uniformément parmi les classes incorrectes. Ce changement subtil modifie l'objectif de la fonction de perte, telle que l'entropie croisée, empêchant la fonction d'activation (généralement Softmax) de saturer. Le résultat est un modèle qui apprend des clusters de classes plus serrés dans l'espace des caractéristiques et produit une meilleure calibrage du modèle, ce qui signifie que les probabilités prédites reflètent plus précisément la véritable vraisemblance de correction.
Applications concrètes#
Cette technique est particulièrement critique dans les domaines où l'ambiguïté des données est inhérente ou lorsque les jeux de données sont sujets à des erreurs d'étiquetage.
- Diagnostic médical : Dans le domaine de l'IA en santé, les données cliniques sont rarement tout blanc ou tout noir. Par exemple, en analyse d'images médicales, une analyse peut montrer des caractéristiques qui suggèrent fortement une maladie sans pour autant être définitives. L'entraînement avec des étiquettes dures force le modèle à ignorer cette incertitude. En appliquant le lissage d'étiquettes, le modèle conserve un certain degré de scepticisme, ce qui est vital pour les systèmes d'aide à la décision où un excès de confiance pourrait conduire à un mauvais diagnostic.
- Classification d'images à grande échelle : Les grands jeux de données publics comme ImageNet contiennent souvent des images mal étiquetées ou contenant plusieurs objets valides. Si un modèle essaie de s'adapter à ces exemples bruités avec une confiance de 100 %, il apprend des associations incorrectes. Le lissage d'étiquettes agit comme un tampon contre le bruit des étiquettes, garantissant que quelques mauvais points de données ne faussent pas radicalement les poids du modèle finaux.
Mise en œuvre du lissage d'étiquettes avec Ultralytics#
Les frameworks de deep learning modernes simplifient l'application de cette technique. À l'aide du package ultralytics, tu peux facilement intégrer le lissage d'étiquettes dans ton pipeline d'entraînement pour des tâches de classification d'images ou de détection. Cela est souvent fait pour extraire des performances supplémentaires de modèles de pointe comme YOLO26.
L'exemple suivant démontre comment entraîner un modèle de classification avec le lissage d'étiquettes activé :
from ultralytics import YOLO
# Load a pre-trained YOLO26 classification model
model = YOLO("yolo26n-cls.pt")
# Train with label_smoothing set to 0.1
# The target for the correct class becomes 1.0 - 0.5 * 0.1 = 0.95 (depending on implementation specifics)
model.train(data="mnist", epochs=5, label_smoothing=0.1)Comparaison avec des concepts associés#
Il est utile de distinguer le lissage d'étiquettes d'autres stratégies de régularisation pour comprendre quand l'utiliser.
- vs. Dropout : Une couche de dropout désactive aléatoirement des neurones pendant l'entraînement pour forcer le réseau à apprendre des représentations redondantes. Bien que les deux préviennent le surapprentissage, le dropout modifie l'architecture du réseau de manière dynamique, tandis que le lissage d'étiquettes modifie l'objectif d'optimisation (les étiquettes elles-mêmes).
- vs. Distillation de connaissances : Les deux techniques impliquent un entraînement sur des cibles douces. Cependant, en distillation de connaissances, les cibles douces proviennent d'un modèle « enseignant » et contiennent des informations apprises (par exemple, « cela ressemble à 10 % à un chat »). En revanche, le lissage d'étiquettes utilise des cibles douces « non informatives » dérivées mathématiquement (par exemple, « donner une probabilité de 10 % à toutes les autres classes de manière égale »).
- vs. Augmentation de données : Les stratégies d'augmentation de données modifient les données d'entrée (rotation, recadrage, coloration) pour augmenter la variété. Le lissage d'étiquettes modifie les attentes de sortie. Les flux de travail d'entraînement complets sur la Plateforme Ultralytics combinent souvent l'augmentation, le dropout et le lissage d'étiquettes pour atteindre une précision maximale.
En atténuant le problème du gradient fuyant dans les couches finales et en encourageant le modèle à apprendre des caractéristiques plus robustes, le lissage d'étiquettes reste un incontournable des architectures de deep learning modernes.






