Sécurité prête pour l'entreprise : Conforme ISO 27001 + SOC 2 Type I.
Retour au glossaire Ultralytics

Diffusion Language Models

Apprends comment les modèles de langage par diffusion génèrent et modifient du texte grâce au débruitage itératif, avec des aperçus sur les Transformer, les applications, les avantages et les limitations.

Les modèles de langage de diffusion sont des modèles génératifs qui produisent ou modifient du texte par débruitage itératif plutôt que de générer chaque token strictement de gauche à droite. Ils commencent par une séquence corrompue — contenant souvent des tokens masqués, remplacés ou incertains — et affinent à plusieurs reprises de nombreuses positions jusqu'à ce que le texte devienne cohérent. Cette approche associe des concepts issus de la modélisation du langage et des modèles de diffusion, offrant une alternative à la génération conventionnelle de tokens suivants.

Link to this sectionFonctionnement des modèles de langage de diffusion#

Le texte est d'abord divisé par tokenisation en mots, sous-mots, caractères ou autres unités discrètes. Durant l'entraînement, un processus de corruption progressif supprime peu à peu les informations des séquences de tokens. Selon l'implémentation, les tokens peuvent être remplacés par des symboles de masquage, des alternatives échantillonnées ou des représentations continues bruitées appelées embeddings.

Le modèle apprend le processus inverse : prédire des versions plus nettes des séquences corrompues. Au moment de l'inférence, il part d'un bloc fortement masqué ou bruité et effectue plusieurs étapes de raffinement. Les premières étapes établissent le sens général et la structure, tandis que les dernières corrigent le vocabulaire, la grammaire, la mise en forme et la cohérence locale.

De nombreux modèles de langage de diffusion utilisent un transformer pour traiter la séquence. Les transformers conviennent parfaitement à cette tâche car leur mécanisme d'attention permet de relier chaque token au contexte environnant. La documentation du Transformer PyTorch fournit une vue d'ensemble utile de cette architecture sous-jacente.

Contrairement à un système de texte à trous fixe, la génération par diffusion peut réévaluer ses prédictions de manière répétée. Un token sélectionné lors d'une étape n'est pas nécessairement définitif ; des itérations ultérieures peuvent le modifier lorsque le reste de la séquence fournit un meilleur contexte. La présentation de la diffusion de texte par Google DeepMind illustre ce modèle de génération itératif par blocs.

Link to this sectionModèles de diffusion vs concepts apparentés#

Plusieurs termes étroitement liés décrivent différents objectifs ou architectures :

  • Les grands modèles de langage autorégressifs génèrent des tokens en séquence, chaque prédiction étant conditionnée par les sorties précédentes. Ce processus causal est démontré dans le tutoriel de génération de texte autorégressif de TensorFlow. Les modèles de diffusion peuvent quant à eux actualiser de nombreuses positions au cours de chaque étape de raffinement.
  • Les modèles de langage masqués prédisent des tokens délibérément cachés en s'appuyant sur le contexte des deux côtés. L'exemple de modélisation du langage masqué de Keras illustre cet objectif d'entraînement. Les modèles de langage de diffusion étendent cette idée pour en faire un processus de génération complet doté de plusieurs niveaux de corruption et d'itérations de débruitage.
  • Stable Diffusion est un système de génération d'images, et non un grand modèle de langage. Les services d'images Stable Diffusion de Stability AI génèrent et modifient du contenu visuel, tandis que les modèles de langage de diffusion opèrent sur des tokens textuels ou leurs représentations.
  • Les transformers de diffusion décrivent l'utilisation de transformers au sein de systèmes de diffusion, généralement pour la génération d'images ou de vidéos. Un modèle de langage de diffusion se définit par son objectif de génération de texte, et non uniquement par son architecture de réseau de neurones.

Link to this sectionApplications concrètes#

Une application concrète est l'édition de documents et de code. Au lieu d'ajouter du texte après un curseur, un modèle de langage de diffusion peut affiner un brouillon complet ou une plage sélectionnée. Par exemple, il peut reconstruire une fonction manquante tout en modifiant les noms de variables, les importations et les commentaires dans tout le bloc. La capacité à utiliser à la fois le contexte précédent et suivant est précieuse lorsque des corrections à un endroit en affectent un autre.

Une seconde application est l'analyse multimodale. Un système de vision peut extraire des informations factuelles d'une image, après quoi un modèle de langage de diffusion peut composer de manière itérative un rapport, une légende ou une réponse ancrée dans ces observations. Par exemple, la détection d'objets peut identifier des véhicules et des personnes dans une scène de circulation avant que le composant textuel ne rédige un résumé de l'incident.

Le flux de travail suivant utilise Ultralytics YOLO26 pour créer un contexte visuel structuré destiné à la génération de langage en aval :

from ultralytics import YOLO

# Run object detection on a sample image
model = YOLO("yolo26n.pt")
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]

# Convert detections into compact language-model context
detections = result.summary()
object_names = sorted({item["name"] for item in detections})

visual_context = ", ".join(object_names)
print(visual_context)

Le flux de travail de prédiction YOLO renvoie des sorties structurées, tandis que la méthode Results.summary() convertit les détections en dictionnaires plus faciles à transmettre à un pipeline linguistique. Cette séparation permet au modèle de vision de fournir des observations ancrées tandis que le modèle de langage gère la composition itérative.

Link to this sectionAvantages, limitations et conseils pratiques#

Les modèles de langage de diffusion peuvent proposer plusieurs tokens en parallèle, réviser des choix antérieurs et prendre naturellement en charge le remplissage ou l'édition contrainte. Cependant, la prédiction en parallèle ne garantit pas une latence de bout en bout plus faible : la génération nécessite toujours plusieurs étapes de débruitage, et la vitesse dépend de la longueur de la séquence, de la taille du modèle, du matériel et de la stratégie d'échantillonnage.

Le texte est également discret, ce qui rend la corruption progressive moins naturelle que l'ajout de bruit à des pixels d'image continus. Des systèmes mal configurés peuvent produire des répétitions, omettre des détails requis, modifier inutilement du texte correct ou avoir du mal à déterminer la longueur de la sortie.

Les équipes doivent évaluer l'exactitude des tâches, la véracité des faits, la stabilité de l'édition, la latence et l'utilisation des ressources sur des invites représentatives. Les recommandations de Google Cloud sur l'évaluation de l'IA générative conseillent de combiner des métriques automatisées et une évaluation humaine, car la qualité du langage dépend du contexte. Les déploiements à fort impact doivent également suivre un processus structuré tel que le cadre de gestion des risques liés à l'IA du NIST.

Pour les applications visuelles, la plateforme Ultralytics prend en charge l'annotation de jeux de données, l'entraînement de modèles, le déploiement et la supervision, aidant les équipes à concevoir le composant de perception capable d'ancrer les flux de travail linguistiques basés sur la diffusion en aval.

Explore solutions

Real-time AI that works with your team

IA dans la robotique

Équipe tes machines plus intelligentes avec les modèles Ultralytics YOLO. La vision par IA dans la robotique propulse la navigation autonome, la perception, le suivi d'objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans la logistique

Simplifie la logistique avec les modèles Ultralytics YOLO. La vision par IA permet l'inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA alimente le suivi des stocks, la surveillance des étagères, la gestion des files d'attente et des informations plus intelligentes sur les clients.
En savoir plus
Real-time AI that works with your team

IA dans la santé

Construis des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans la santé permet une imagerie médicale plus rapide, des diagnostics plus intelligents et une surveillance des patients.
En savoir plus
Real-time AI that works with your team

IA dans la fabrication

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA favorise le contrôle qualité, la détection des défauts, la conformité aux EPI et l'automatisation des chaînes de montage.
En savoir plus
Real-time AI that works with your operation

IA dans l'automobile

Applique la vision par ordinateur dans l'automobile avec les modèles Ultralytics YOLO. L'IA de vision améliore la sécurité routière, l'assistance à la conduite et l'automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

IA en agriculture

Intègre l'IA de vision à l'agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l'agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Real-time AI that works with your team

IA dans la robotique

Équipe tes machines plus intelligentes avec les modèles Ultralytics YOLO. La vision par IA dans la robotique propulse la navigation autonome, la perception, le suivi d'objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans la logistique

Simplifie la logistique avec les modèles Ultralytics YOLO. La vision par IA permet l'inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA alimente le suivi des stocks, la surveillance des étagères, la gestion des files d'attente et des informations plus intelligentes sur les clients.
En savoir plus
Real-time AI that works with your team

IA dans la santé

Construis des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans la santé permet une imagerie médicale plus rapide, des diagnostics plus intelligents et une surveillance des patients.
En savoir plus
Real-time AI that works with your team

IA dans la fabrication

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA favorise le contrôle qualité, la détection des défauts, la conformité aux EPI et l'automatisation des chaînes de montage.
En savoir plus
Real-time AI that works with your operation

IA dans l'automobile

Applique la vision par ordinateur dans l'automobile avec les modèles Ultralytics YOLO. L'IA de vision améliore la sécurité routière, l'assistance à la conduite et l'automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

IA en agriculture

Intègre l'IA de vision à l'agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l'agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Real-time AI that works with your team

IA dans la robotique

Équipe tes machines plus intelligentes avec les modèles Ultralytics YOLO. La vision par IA dans la robotique propulse la navigation autonome, la perception, le suivi d'objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans la logistique

Simplifie la logistique avec les modèles Ultralytics YOLO. La vision par IA permet l'inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA alimente le suivi des stocks, la surveillance des étagères, la gestion des files d'attente et des informations plus intelligentes sur les clients.
En savoir plus
Real-time AI that works with your team

IA dans la santé

Construis des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans la santé permet une imagerie médicale plus rapide, des diagnostics plus intelligents et une surveillance des patients.
En savoir plus
Real-time AI that works with your team

IA dans la fabrication

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA favorise le contrôle qualité, la détection des défauts, la conformité aux EPI et l'automatisation des chaînes de montage.
En savoir plus
Real-time AI that works with your operation

IA dans l'automobile

Applique la vision par ordinateur dans l'automobile avec les modèles Ultralytics YOLO. L'IA de vision améliore la sécurité routière, l'assistance à la conduite et l'automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

IA en agriculture

Intègre l'IA de vision à l'agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l'agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus

Construisons ensemble le futur de l'IA !

Commence ton aventure avec le futur de l'apprentissage automatique