YOLO Vision 2026 :
Retour au glossaire Ultralytics

Diffusion Models

Découvre comment les modèles de diffusion utilisent l’IA générative pour créer des données haute fidélité. Apprends à améliorer dès aujourd’hui l’entraînement d’Ultralytics YOLO26 avec des données synthétiques réalistes.

Les modèles de diffusion sont une catégorie d’algorithmes d’IA générative qui apprennent à créer de nouveaux échantillons de données en inversant un processus progressif d’ajout de bruit. Contrairement aux modèles discriminatifs traditionnels utilisés pour des tâches comme la détection d’objets ou la classification, qui prédisent des étiquettes à partir de données, les modèles de diffusion se concentrent sur la génération de contenu haute fidélité — notamment des images, de l’audio et des vidéos — qui imite étroitement les propriétés statistiques des données du monde réel. Ils sont rapidement devenus la solution à la pointe de la technologie pour la synthèse d’images haute résolution, dépassant les anciens leaders comme les réseaux antagonistes génératifs (GANs) grâce à leur stabilité d’entraînement et à leur capacité à générer des sorties diversifiées.

Fonctionnement des modèles de diffusion#

Le mécanisme central d’un modèle de diffusion repose sur la thermodynamique hors équilibre. Le processus d’entraînement comporte deux phases distinctes : le processus direct (diffusion) et le processus inverse (débruitage).

  • Processus direct : cette phase détruit systématiquement la structure d’une image d’entraînement en ajoutant de petites quantités de bruit gaussien au fil d’une série d’étapes temporelles. À mesure que le processus se poursuit, les données complexes (comme la photo d’un chat) se transforment progressivement en bruit aléatoire pur et non structuré.
  • Processus inverse : l’objectif du réseau de neurones est d’apprendre à inverser cette corruption. En partant d’un bruit aléatoire, le modèle prédit le bruit ajouté à chaque étape et le soustrait. En supprimant le bruit de manière itérative, le modèle « débruite » le signal aléatoire jusqu’à ce qu’une image cohérente et de haute qualité apparaisse.

Ce raffinement itératif permet un contrôle exceptionnel des détails fins et des textures, ce qui constitue un avantage majeur par rapport aux méthodes de génération en une seule étape.

Applications concrètes#

Les modèles de diffusion ont dépassé le cadre de la recherche universitaire pour devenir des outils pratiques de qualité production dans divers secteurs.

  • Génération de données synthétiques : l’une des applications les plus utiles pour les ingénieurs en vision par ordinateur est la création de données synthétiques pour enrichir les jeux de données d’entraînement. Si un jeu de données manque de diversité — par exemple s’il ne contient pas d’images de voitures dans des conditions enneigées — un modèle de diffusion peut générer des variations réalistes. Cela contribue à améliorer la robustesse des modèles de vision comme YOLO26 lorsqu’ils sont déployés dans des environnements imprévisibles.
  • Remplissage et édition d’images : les modèles de diffusion alimentent des outils d’édition avancés qui permettent de modifier des régions spécifiques d’une image. Cette technique, appelée remplissage, peut supprimer des objets indésirables ou compléter les parties manquantes d’une photo en se basant sur le contexte environnant. Les architectes et les designers l’utilisent pour réaliser rapidement des prototypes et visualiser des modifications apportées à des produits ou à des environnements sans devoir effectuer manuellement un rendu 3D.

Différenciation des principaux termes#

Il est utile de distinguer les modèles de diffusion des autres architectures génératives :

  • Modèles de diffusion et GANs : bien que les GANs utilisent deux réseaux concurrents (un générateur et un discriminateur) et soient connus pour leur échantillonnage rapide, ils souffrent souvent d’un « effondrement des modes », lorsque le modèle ne produit qu’une variété limitée de sorties. Les modèles de diffusion sont généralement plus stables pendant l’entraînement et couvrent plus complètement la distribution des données, même s’ils peuvent être plus lents au moment de l’inférence.
  • Modèles de diffusion et VAEs : les autoencodeurs variationnels (VAEs) compressent les données dans un espace latent, puis les reconstruisent. Bien que les VAEs soient rapides, les images qu’ils génèrent peuvent parfois sembler floues par rapport aux détails nets produits par les processus de diffusion.

Mise en œuvre pratique#

Bien que l’entraînement d’un modèle de diffusion à partir de zéro nécessite une puissance de calcul importante, les ingénieurs peuvent exploiter des modèles préentraînés ou les intégrer à des workflows aux côtés de détecteurs efficaces. Par exemple, tu peux utiliser un modèle de diffusion pour générer des variations d’arrière-plan pour un jeu de données, puis utiliser la Ultralytics Platform pour annoter ces données enrichies et entraîner un modèle de détection.

Voici un exemple conceptuel utilisant torch pour simuler une simple étape de diffusion directe (ajout de bruit), qui constitue la base de l’entraînement de ces systèmes.

import torch


def add_noise(image_tensor, noise_level=0.1):
    """Simulates a single step of the forward diffusion process by adding Gaussian noise."""
    # Generate Gaussian noise with the same shape as the input image
    noise = torch.randn_like(image_tensor) * noise_level

    # Add noise to the original image
    noisy_image = image_tensor + noise

    # Clamp values to ensure they remain valid image data (e.g., 0.0 to 1.0)
    return torch.clamp(noisy_image, 0.0, 1.0)


# Create a dummy image tensor (3 channels, 64x64 pixels)
dummy_image = torch.rand(1, 3, 64, 64)
noisy_result = add_noise(dummy_image)

print(f"Original shape: {dummy_image.shape}, Noisy shape: {noisy_result.shape}")

Orientations futures#

Le domaine évolue rapidement vers les modèles de diffusion latente (LDMs), qui opèrent dans un espace latent compressé plutôt que dans l’espace des pixels afin de réduire les coûts de calcul. Cette efficacité permet d’exécuter de puissants modèles génératifs sur du matériel grand public. À mesure que la recherche progresse, nous nous attendons à une intégration plus étroite entre les entrées génératives et les tâches discriminatives, par exemple en utilisant des scénarios générés par diffusion pour valider la sécurité des véhicules autonomes ou améliorer l’analyse d’images médicales en simulant des pathologies rares.

Explore solutions

Real-time AI that works with your team

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
Real-time AI that works with your team

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
Real-time AI that works with your team

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Real-time AI that works with your operation

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Real-time AI that works with your team

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
Real-time AI that works with your team

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
Real-time AI that works with your team

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Real-time AI that works with your operation

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Real-time AI that works with your team

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
Real-time AI that works with your team

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
Real-time AI that works with your team

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Real-time AI that works with your operation

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus

Construisons ensemble l'avenir de l'IA !

Commence ton parcours vers l'avenir de l'apprentissage automatique