Comment Ultralytics YOLO26 s’entraîne plus intelligemment avec ProgLoss, STAL et MuSGD
Découvre comment Ultralytics YOLO26 s’entraîne de manière plus fiable grâce à Progressive Loss Balancing, Small-Target-Aware Label Assignment et l’optimiseur MuSGD.

La semaine dernière, nous avons publié Ultralytics YOLO26, établissant une nouvelle référence pour les modèles de vision par ordinateur en temps réel conçus pour l’edge. Comme les précédents modèles Ultralytics YOLO, tels que Ultralytics YOLO11, YOLO26 prend en charge les principales tâches de vision par ordinateur que les utilisateurs connaissent, notamment la détection d’objets, la segmentation d’instances et l’estimation de pose.

Fig. 1. Exemple d’utilisation d’Ultralytics YOLO26 pour segmenter des objets dans une image.
Cependant, Ultralytics YOLO26 n’est pas une simple mise à jour incrémentielle. Même si les tâches prises en charge peuvent sembler familières, ce nouveau modèle représente une avancée innovante dans la manière dont les modèles de vision par ordinateur sont entraînés. Avec YOLO26, l’objectif ne se limite plus à l’efficacité de l’inférence : il s’agit également de rendre l’entraînement plus stable.
Ultralytics YOLO26 a été conçu en tenant compte de l’ensemble du cycle de vie de l’entraînement. Cela signifie une convergence plus rapide, des exécutions d’entraînement plus fiables et un comportement cohérent du modèle. Ces améliorations sont particulièrement importantes dans les workflows réels, où la fiabilité de l’entraînement influe directement sur la rapidité avec laquelle les modèles peuvent être améliorés et déployés.
Pour y parvenir, Ultralytics YOLO26 introduit plusieurs innovations ciblées en matière d’entraînement, telles que l’équilibrage progressif de la loss (ProgLoss), l’assignation de labels tenant compte des petites cibles (STAL) et l’optimiseur MuSGD. Ensemble, ces changements améliorent l’équilibrage de la loss d’apprentissage, l’assignation des labels et le comportement de l’optimisation au fil du temps.
Dans cet article, nous allons examiner le fonctionnement de chacun de ces mécanismes et expliquer pourquoi ils rendent Ultralytics YOLO26 plus facile à entraîner et plus fiable à grande échelle. Commençons !
Ultralytics YOLO26 : conçu pour s’entraîner plus intelligemment, pas seulement pour s’exécuter plus rapidement#
Ultralytics YOLO26 rationalise nativement l’ensemble du pipeline d’inférence en supprimant la dépendance à des étapes de post-traitement telles que la suppression des non-maxima. Au lieu de générer de nombreuses prédictions qui se chevauchent puis de les filtrer, YOLO26 produit directement les détections finales à partir du réseau.
Cela fait de YOLO26 un modèle de bout en bout, dans lequel la prédiction, la résolution des doublons et les sorties finales sont toutes apprises directement au sein du réseau. Cette approche simplifie le déploiement et améliore l’efficacité de l’inférence, tout en influençant la manière dont le modèle apprend pendant l’entraînement.

Fig. 2. YOLO26 offre une inférence de pointe, de bout en bout et sans NMS (Source)
Dans un système de bout en bout comme celui-ci, l’entraînement et l’inférence sont étroitement liés. Puisqu’il n’existe aucune étape externe de post-traitement pour corriger les prédictions ultérieurement, le modèle doit apprendre à prendre des décisions claires et sûres pendant l’entraînement lui-même.
L’alignement entre les objectifs d’entraînement et le comportement en inférence devient donc particulièrement important. Toute divergence entre la manière dont le modèle est entraîné et la manière dont il est utilisé au moment de l’inférence peut entraîner un apprentissage instable ou une convergence plus lente.
Ultralytics YOLO26 gère cela en concevant dès le départ son processus d’entraînement autour des usages réels. Plutôt que de se concentrer uniquement sur la vitesse d’inférence, le système d’entraînement est conçu pour favoriser un apprentissage stable sur de longues exécutions, une convergence cohérente pour toutes les tailles de modèles, de Nano à Extra Large, ainsi que des performances robustes sur des jeux de données variés.
Comment deux têtes d’entraînement améliorent l’apprentissage dans Ultralytics YOLO26#
L’une des principales innovations d’entraînement d’Ultralytics YOLO26 repose sur une approche à deux têtes utilisée dans les modèles YOLO précédents. Dans les modèles de détection d’objets, une tête désigne la partie du réseau chargée d’effectuer les prédictions.
Autrement dit, les têtes de détection apprennent à prédire où se trouvent les objets dans une image et de quels objets il s’agit. Elles y parviennent en régressant les coordonnées des bounding boxes, c’est-à-dire en apprenant à estimer la position et la taille de chaque objet dans l’image d’entrée.
Pendant l’entraînement, le modèle apprend en minimisant une loss, qui est une mesure numérique de l’écart entre ses prédictions et les réponses correctes, ou vérité terrain. Une loss plus faible signifie que les prédictions du modèle sont plus proches de la vérité terrain, tandis qu’une loss plus élevée indique des erreurs plus importantes. Le calcul de la loss guide la mise à jour des paramètres du modèle pendant l’entraînement.
Ultralytics YOLO26 utilise deux têtes de détection pendant l’entraînement. Elles partagent le même modèle sous-jacent, mais remplissent des fonctions différentes. La tête one-to-one est celle utilisée au moment de l’inférence. Elle apprend à associer chaque objet à une seule prédiction fiable, ce qui est essentiel pour la conception de YOLO26 de bout en bout et sans NMS.
La tête one-to-many, quant à elle, est utilisée uniquement pendant l’entraînement. Elle permet d’associer plusieurs prédictions au même objet, fournissant ainsi une supervision plus dense. Ce signal d’apprentissage plus riche contribue à stabiliser l’entraînement et à améliorer la précision, en particulier au début.
Dans Ultralytics YOLO26, les deux têtes utilisent le même calcul de loss pour la régression des boîtes et la classification. Les implémentations précédentes appliquaient un équilibre fixe entre ces deux signaux de loss pendant tout l’entraînement.
En pratique, cependant, l’importance de chaque tête évolue au fil du temps. La supervision dense est surtout utile au début, tandis que l’alignement avec le comportement en inférence devient plus important par la suite. Ultralytics YOLO26 est conçu autour de cette idée, qui mène directement à la manière dont il rééquilibre les signaux d’apprentissage au fur et à mesure de l’entraînement.
Ultralytics YOLO26 utilise l’équilibrage progressif de la loss#
Alors, comment Ultralytics YOLO26 gère-t-il ces besoins d’apprentissage changeants pendant l’entraînement ? Il utilise l’équilibrage progressif de la loss pour ajuster le poids des signaux d’apprentissage au fil du temps.
ProgLoss modifie dynamiquement la contribution de chaque tête à la loss totale au fur et à mesure de l’entraînement. Au début, un poids plus important est accordé à la tête one-to-many afin de stabiliser l’apprentissage et d’améliorer le rappel. À mesure que l’entraînement progresse, l’équilibre se déplace progressivement vers la tête one-to-one, ce qui aligne davantage l’entraînement sur le comportement en inférence.
Cette transition progressive permet à Ultralytics YOLO26 d’apprendre dans le bon ordre. Plutôt que de forcer le modèle à optimiser simultanément des objectifs concurrents, l’équilibrage progressif de la loss donne la priorité au signal d’apprentissage le plus utile à chaque étape de l’entraînement. Il en résulte une convergence plus fluide, moins d’exécutions d’entraînement instables et des performances finales plus cohérentes.
Comment STAL aide Ultralytics YOLO26 à apprendre à partir de petits objets#
Une autre amélioration intéressante de l’entraînement d’Ultralytics YOLO26 concerne la manière dont le modèle associe les cibles d’entraînement aux prédictions, un processus appelé assignation des labels. Ce processus est chargé de faire correspondre les objets de vérité terrain aux prédictions candidates, souvent appelées ancres.
Ces correspondances déterminent quelles prédictions reçoivent une supervision et contribuent à la loss. Ultralytics YOLO26 s’appuie sur une méthode d’assignation des labels existante appelée apprentissage de l’alignement des tâches (TAL), conçue pour mieux aligner la classification et la localisation pendant l’entraînement.
Bien que TAL fonctionne bien pour la plupart des objets, l’entraînement a révélé une limite importante. Pendant le processus de mise en correspondance, les objets très petits pouvaient être complètement ignorés. En pratique, les objets mesurant moins d’environ 8 pixels dans une image d’entrée de 640 pixels ne recevaient souvent aucune assignation d’ancre. Dans ce cas, le modèle reçoit peu ou pas de supervision pour ces objets, ce qui rend difficile l’apprentissage d’une détection fiable.
Pour résoudre ce problème, Ultralytics YOLO26 introduit l’assignation des labels tenant compte des petites cibles (STAL). STAL modifie le processus d’assignation afin de garantir que les petits objets ne soient pas ignorés pendant l’entraînement. Plus précisément, il impose au moins quatre assignations d’ancres pour les objets mesurant moins de 8 pixels. Ainsi, même les objets minuscules contribuent systématiquement à la loss d’entraînement.
En renforçant la supervision des petites cibles, STAL améliore la stabilité de l’apprentissage et les performances de détection dans les scénarios où les objets petits ou éloignés sont fréquents. Cette amélioration est particulièrement importante pour les applications YOLO26 orientées edge, telles que l’imagerie aérienne, la robotique et les systèmes de l’Internet des objets (IoT), où les objets sont souvent petits, éloignés ou partiellement visibles et où une détection fiable est essentielle.
Ultralytics YOLO26 introduit l’optimiseur MuSGD#
Pour favoriser un entraînement plus stable et prévisible, Ultralytics YOLO26 introduit également un nouvel optimiseur appelé MuSGD. Cet optimiseur est conçu pour améliorer la convergence et la fiabilité de l’entraînement dans les modèles de détection de bout en bout, en particulier lorsque la taille du modèle et la complexité de l’entraînement augmentent.
Pour qu’un réseau neuronal apprenne et modifie en conséquence ses poids pendant l’entraînement, nous calculons une erreur, également appelée « loss ». Le modèle mesure donc l’écart de ses prédictions à l’aide d’une valeur de loss, calcule des gradients qui indiquent comment ses paramètres doivent évoluer, puis met à jour ces paramètres afin de réduire l’erreur. La descente de gradient stochastique (SGD) est un optimiseur largement utilisé qui effectue ces mises à jour, rendant l’entraînement efficace et évolutif.

Fig. 3. Descente de gradient stochastique par rapport à la descente de gradient (Source)
MuSGD s’appuie sur cette base familière en intégrant des idées d’optimisation inspirées de Muon, une méthode utilisée pour l’entraînement de grands modèles de langage. Ces idées ont été influencées par des avancées récentes telles que Kimi K2 de Moonshot AI, qui a démontré un comportement d’entraînement amélioré grâce à des mises à jour de paramètres plus structurées.
Ultralytics YOLO26 utilise une stratégie de mise à jour hybride. Certains paramètres sont mis à jour au moyen d’une combinaison de mises à jour inspirées de Muon et de SGD, tandis que d’autres utilisent uniquement SGD. YOLO26 peut ainsi introduire une structure supplémentaire dans le processus d’optimisation tout en conservant la robustesse et les propriétés de généralisation qui ont rendu SGD efficace.
Il en résulte une optimisation plus fluide, une convergence plus rapide et un comportement d’entraînement plus prévisible pour toutes les tailles de modèles, ce qui fait de MuSGD un élément clé de la facilité d’entraînement et de la fiabilité à grande échelle d’Ultralytics YOLO26.
L’importance des innovations d’entraînement d’Ultralytics YOLO26#
Les innovations d’entraînement d’Ultralytics YOLO26, combinées à des fonctionnalités clés telles que sa conception de bout en bout, sans NMS et orientée edge, rendent le modèle plus facile à entraîner et plus fiable à grande échelle. Tu te demandes peut-être ce que cela signifie réellement pour les applications de vision par ordinateur.

Fig. 4. Aperçu des principales fonctionnalités de YOLO26 (Source)
En pratique, cela facilite considérablement l’utilisation de la vision par ordinateur là où elle s’exécute réellement. Les modèles s’entraînent de manière plus prévisible, changent d’échelle plus régulièrement entre les différentes tailles et sont plus simples à adapter à de nouveaux jeux de données. Cela réduit les frictions entre l’expérimentation et le déploiement, en particulier dans les environnements où la fiabilité et l’efficacité comptent autant que les performances brutes.
Par exemple, dans les applications de robotique et de vision industrielle, les modèles doivent souvent être réentraînés à mesure que les environnements, les capteurs ou les tâches évoluent. Avec Ultralytics YOLO26, les équipes peuvent itérer plus rapidement sans avoir à se soucier d’exécutions d’entraînement instables ou d’un comportement incohérent entre les tailles de modèles.
Points clés à retenir#
Les systèmes de vision par ordinateur fiables dépendent autant de la manière dont les modèles sont entraînés que de leurs performances au moment de l’inférence. En améliorant l’équilibrage des signaux d’apprentissage, la gestion des petits objets et la progression de l’optimisation, Ultralytics YOLO26 rend l’entraînement plus stable et plus facile à mettre à l’échelle. Cette priorité accordée à la fiabilité de l’entraînement aide les équipes à passer plus facilement de l’expérimentation au déploiement réel, en particulier dans les applications orientées edge.
Tu veux en savoir plus sur l’IA ? Consulte notre dépôt GitHub pour en découvrir davantage. Rejoins notre communauté active et découvre les innovations dans des secteurs tels que l’IA dans la logistique et l’IA de vision dans le secteur automobile. Pour commencer dès aujourd’hui avec la vision par ordinateur, consulte nos options de licence.









