CutMix
Découvre comment la technique d’augmentation des données CutMix prévient le surapprentissage. Apprends à l’appliquer facilement pour entraîner des modèles Ultralytics YOLO26 robustes.
CutMix est une technique avancée d'augmentation des données utilisée pour entraîner des modèles robustes de vision par ordinateur en découpant une zone rectangulaire d'une image pour la coller sur une image cible. Contrairement aux augmentations plus simples qui ajustent la luminosité ou la rotation, CutMix modifie la composition fondamentale d'un échantillon d'entraînement. Lorsque les pixels sont échangés, les étiquettes de vérité terrain correspondantes sont également mélangées proportionnellement à la surface de la zone. Cela aide les réseaux neuronaux artificiels à apprendre à identifier les objets à partir de vues partielles, en forçant le modèle à s'appuyer sur plusieurs caractéristiques plutôt qu'à se concentrer uniquement sur les parties les plus discriminantes d'un objet. Présentée pour la première fois dans un article universitaire de 2019, cette technique est devenue une opération standard dans les frameworks d'apprentissage profond afin de prévenir le surapprentissage et d'améliorer la généralisation sur de grands jeux de données.
Fonctionnement de la technique#
Pendant l'entraînement du modèle, l'algorithme sélectionne aléatoirement une coordonnée centrale et une taille de boîte afin d'extraire une région d'une image secondaire. Cette zone est ensuite superposée directement à une image principale au sein du lot actif. Si l'image principale contenait un chien et l'image secondaire un chat, l'image finale présenterait une zone de chat remplaçant une partie du chien. Les étiquettes de classification sont mises à jour par interpolation linéaire en fonction de la surface exacte de la zone — par exemple, avec une étiquette de 0.7 pour le chien et de 0.3 pour le chat. Dans les tâches de détection d'objets, les boîtes englobantes qui conservent au moins un certain pourcentage (souvent 10 %) de leur surface d'origine dans la région collée sont conservées. Cette technique est prise en charge nativement en tant qu'hyperparamètre d'entraînement cutmix dans Ultralytics YOLO, ce qui permet de définir facilement la probabilité de cette transformation.
Différencier MixUp et Cutout#
CutMix est étroitement liée à deux autres techniques majeures d'augmentation des données, mais elle remédie à leurs limites spécifiques :
- Augmentation MixUp : MixUp fusionne globalement deux images en calculant une moyenne pondérée de leurs valeurs de pixels. Bien qu'efficace, cette technique produit souvent des images fantômes semi-transparentes et peu naturelles qui peuvent perturber les modèles en altérant la corrélation spatiale locale. En revanche, CutMix préserve les intensités de pixels d'origine dans les régions découpées, ce que les chercheurs ont encore optimisé dans des approches telles qu'Attentive CutMix.
- Augmentation Cutout : Cutout supprime des informations en masquant une région rectangulaire aléatoire avec des pixels noirs ou la moyenne du jeu de données. Bien qu'elle encourage le modèle à examiner l'objet dans son ensemble, cette technique gaspille de précieux tenseurs d'entraînement. CutMix remplace cet espace manquant par des zones informatives d'images de classification provenant d'autres images, ce qui accroît l'efficacité globale de l'apprentissage.
Applications concrètes#
En entraînant les modèles à reconnaître des objets fortement occultés, CutMix améliore considérablement les performances de l'apprentissage automatique dans divers secteurs.
- IA automobile et conduite autonome : Dans les voitures autonomes, cette technique apprend au système à identifier les piétons ou les véhicules même lorsqu'ils sont partiellement masqués par des panneaux de signalisation, renforçant ainsi la sécurité dans les environnements très fréquentés.
- Diagnostics médicaux et segmentation d'organes : Dans le secteur de la santé, cette méthode est largement utilisée pour la segmentation des organes et des tumeurs, ce qui permet aux modèles de reconnaître des limites tissulaires complexes, même lorsque les structures anatomiques se chevauchent.
- Télédétection pour l'imagerie satellitaire : Cette stratégie préserve les classes denses et superposées, comme les bâtiments et la végétation, dans les vues aériennes. Des variantes avancées font actuellement l'objet de recherches pour améliorer la reconnaissance à longue traîne sur des données fortement déséquilibrées.
Mise en œuvre pratique#
L'intégration de cette augmentation dans un pipeline d'IA est simple. La plupart des bibliothèques de haut niveau la prennent en charge nativement, notamment PyTorch Transforms et Keras Preprocessing Layers.
Lors de l'entraînement d'un modèle tel que YOLO26, la configuration de cette augmentation ne nécessite que la modification d'un seul paramètre. Cela gère automatiquement à la fois le découpage des images et la logique complexe de découpage des boîtes englobantes.
from ultralytics import YOLO
# Initialize the recommended Ultralytics YOLO26 model
model = YOLO("yolo26n.pt")
# Train the model with CutMix enabled at a 50% probability
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, cutmix=0.5)Pour les équipes qui gèrent des workflows de vision à grande échelle, l'Ultralytics Platform simplifie ce processus en permettant aux utilisateurs d'ajuster directement ces bonnes pratiques d'augmentation des données depuis une interface cloud, afin de rationaliser le parcours de l'annotation au déploiement du modèle.









