Label Smoothing
Apprends comment le lissage des étiquettes empêche le surapprentissage et améliore la généralisation des modèles. Découvre comment implémenter cette technique avec Ultralytics YOLO26 pour obtenir de meilleurs résultats.
Le lissage des étiquettes est une technique de régularisation largement utilisée en apprentissage automatique pour améliorer la généralisation des modèles et éviter le surapprentissage. Lors de l'entraînement de réseaux de neurones, l'objectif est généralement de minimiser l'écart entre les prédictions et la vérité terrain. Toutefois, si un modèle devient trop sûr de ses prédictions — en attribuant une probabilité proche de 100 % à une seule classe — il commence souvent à mémoriser le bruit spécifique des données d'entraînement au lieu d'apprendre des motifs robustes. Ce phénomène, appelé surapprentissage, dégrade les performances sur de nouveaux exemples encore jamais vus. Le lissage des étiquettes remédie à ce problème en décourageant le modèle de prédire avec une certitude absolue, indiquant en substance au réseau qu'il existe toujours une petite marge d'erreur.
Le fonctionnement des cibles souples#
Pour comprendre le fonctionnement du lissage des étiquettes, il est utile de le comparer aux cibles « strictes » standard. Dans l'apprentissage supervisé traditionnel, les étiquettes de classification sont généralement représentées au moyen d'un encodage one-hot. Par exemple, dans une tâche visant à distinguer les chats des chiens, l'image d'un « chien » aurait comme vecteur cible [0, 1]. Pour correspondre parfaitement à cette cible, le modèle pousse ses scores internes, appelés logits, vers l'infini, ce qui peut entraîner des gradients instables et une incapacité à s'adapter.
Le lissage des étiquettes remplace ces 1 et 0 rigides par des cibles « souples ». Au lieu d'une probabilité cible de 1.0, la classe correcte peut se voir attribuer 0.9, tandis que la masse de probabilité restante (0.1) est répartie uniformément entre les classes incorrectes. Cette modification subtile change l'objectif de la fonction de perte, telle que l'entropie croisée, et empêche la fonction d'activation (généralement Softmax) d'atteindre la saturation. Le résultat est un modèle qui apprend des regroupements de classes plus compacts dans l'espace des caractéristiques et produit une meilleure calibration du modèle, ce qui signifie que les probabilités prédites reflètent plus fidèlement la véritable probabilité d'exactitude.
Applications concrètes#
Cette technique est particulièrement importante dans les domaines où l'ambiguïté des données est inhérente ou où les jeux de données sont sujets aux erreurs d'étiquetage.
- Diagnostic médical : Dans le domaine de l'IA dans le secteur de la santé, les données cliniques sont rarement tout à fait tranchées. Par exemple, en analyse d'images médicales, un examen peut présenter des caractéristiques fortement évocatrices d'une maladie sans être concluantes. L'entraînement avec des étiquettes strictes force le modèle à ignorer cette incertitude. En appliquant le lissage des étiquettes, le modèle conserve une certaine réserve, ce qui est essentiel pour les systèmes d'aide à la décision où un excès de confiance pourrait entraîner un diagnostic erroné.
- Classification d'images à grande échelle : Les jeux de données publics massifs comme ImageNet contiennent souvent des images mal étiquetées ou des images comportant plusieurs objets valides. Si un modèle tente d'ajuster ces exemples bruités avec une [confiance](https://ultralytics-translation-1.invalid de 100 %, il apprend des associations incorrectes. Le lissage des étiquettes agit comme un tampon contre le bruit des étiquettes, en veillant à ce que quelques points de données erronés ne faussent pas considérablement les poids du modèle finaux.
Implémenter le lissage des étiquettes avec Ultralytics#
Les frameworks modernes d'apprentissage profond simplifient l'application de cette technique. Avec le paquet ultralytics, tu peux facilement intégrer le lissage des étiquettes à ton pipeline d'entraînement pour des tâches de classification d'images ou de détection. Cette technique est souvent utilisée pour tirer davantage de performances de modèles de pointe comme YOLO26.
L'exemple suivant montre comment entraîner un modèle de classification avec le lissage des étiquettes activé :
from ultralytics import YOLO
# Load a pre-trained YOLO26 classification model
model = YOLO("yolo26n-cls.pt")
# Train with label_smoothing set to 0.1
# The target for the correct class becomes 1.0 - 0.5 * 0.1 = 0.95 (depending on implementation specifics)
model.train(data="mnist", epochs=5, label_smoothing=0.1)Comparaison avec des concepts associés#
Il est utile de distinguer le lissage des étiquettes des autres stratégies de régularisation afin de comprendre quand l'utiliser.
- Par rapport à Dropout : Une couche de dropout désactive aléatoirement des neurones pendant l'entraînement afin de forcer le réseau à apprendre des représentations redondantes. Bien que les deux techniques évitent le surapprentissage, le dropout modifie dynamiquement l'architecture du réseau, tandis que le lissage des étiquettes modifie la cible d'optimisation (les étiquettes elles-mêmes).
- Par rapport à la distillation des connaissances : Les deux techniques impliquent un entraînement sur des cibles souples. Toutefois, dans la distillation des connaissances, les cibles souples proviennent d'un modèle « enseignant » et contiennent des informations apprises (par exemple : « cela ressemble à 10 % à un chat »). En revanche, le lissage des étiquettes utilise des cibles souples « non informatives » dérivées mathématiquement (par exemple : « attribuer une probabilité de 10 % à toutes les autres classes de manière uniforme »).
- Par rapport à l'augmentation des données : Les stratégies d'augmentation des données modifient les données d'entrée (rotation, recadrage, changement de couleur) afin d'accroître la variété. Le lissage des étiquettes modifie les attentes concernant la sortie. Les workflows d'entraînement complets sur l'Ultralytics Platform combinent souvent l'augmentation des données, le dropout et le lissage des étiquettes pour atteindre une précision maximale.
En atténuant le problème du gradient qui disparaît dans les dernières couches et en encourageant le modèle à apprendre des caractéristiques plus robustes, le lissage des étiquettes reste un élément incontournable des architectures modernes d'apprentissage profond.









