Transformer
Explore l’architecture Transformer et le mécanisme d’auto-attention. Apprends comment ils alimentent des modèles d’IA comme RT-DETR et Ultralytics YOLO26 pour une précision supérieure.
Un Transformer est une architecture d'apprentissage profond qui s'appuie sur un mécanisme appelé attention automatique pour traiter des données d'entrée séquentielles, comme le langage naturel ou les caractéristiques visuelles. Initialement présenté par des chercheurs de Google dans l'article fondateur Attention Is All You Need, le Transformer a révolutionné le domaine de l'intelligence artificielle (AI) en éliminant les limitations du traitement séquentiel des précédents réseaux de neurones récurrents (RNNs). À l'inverse, les Transformers analysent simultanément des séquences entières de données, ce qui permet une parallélisation massive et réduit considérablement les temps d'entraînement sur du matériel moderne comme les GPU.
Fonctionnement des Transformers#
L'innovation centrale du Transformer est le mécanisme d'attention automatique. Celui-ci permet au modèle de pondérer l'importance des différentes parties des données d'entrée les unes par rapport aux autres. Par exemple, dans une phrase, le modèle peut apprendre que le mot « banque » est davantage lié à « argent » qu'à « rivière », en fonction du contexte environnant.
Cette architecture se compose généralement de deux composants principaux :
- Encodeur : Traite les données d'entrée pour produire une représentation numérique riche, ou un embedding.
- Décodeur : Utilise la sortie de l'encodeur pour générer le résultat final, comme une phrase traduite ou une boîte englobante prédite.
Dans le domaine de la vision par ordinateur (CV), les modèles utilisent généralement une variante appelée Vision Transformer (ViT). Au lieu de traiter des tokens textuels, l'image est divisée en patchs de taille fixe (par exemple, 16x16 pixels). Ces patchs sont aplatis et traités comme une séquence, ce qui permet au modèle de capturer le « contexte global » — en comprenant plus efficacement les relations entre les parties éloignées d'une image — qu'un réseau de neurones convolutifs (CNN) standard.
Transformers et concepts associés#
Il est important de distinguer l'architecture Transformer des termes associés :
- Mécanisme d'attention : Il s'agit du concept général qui consiste à se concentrer sur des parties spécifiques des données. Le Transformer est une architecture spécifique entièrement fondée sur des couches d'attention, tandis que d'autres modèles peuvent utiliser l'attention uniquement comme fonctionnalité complémentaire limitée.
- Grand modèle de langage (LLM) : Des termes comme « GPT » désignent des modèles spécifiques entraînés sur de très grandes quantités de texte. Presque tous les LLM modernes utilisent l'architecture Transformer comme moteur sous-jacent.
Applications concrètes#
La polyvalence des Transformers a conduit à leur adoption dans divers secteurs :
-
Imagerie médicale : Dans le domaine de l'IA dans la santé, les Transformers sont utilisés pour des tâches complexes comme l'analyse d'images médicales. Leur capacité à comprendre les relations spatiales globales facilite la détection d'anomalies subtiles dans des images IRM ou des scanners CT haute résolution, que les CNN axés sur les caractéristiques locales pourraient ne pas détecter.
-
Systèmes autonomes : Pour les véhicules autonomes, il est essentiel de comprendre la trajectoire des piétons et des autres véhicules. Les Transformers excellent dans la compréhension vidéo en suivant les objets au fil des images et en prédisant leurs mouvements futurs afin de garantir une navigation sûre.
Détection d'objets avec les Transformers#
Alors que les CNN ont traditionnellement dominé la détection d'objets, des modèles fondés sur les Transformers comme le Transformer de détection en temps réel (RT-DETR) se sont imposés comme des alternatives puissantes. RT-DETR combine la vitesse des backbones CNN avec la précision des têtes de décodage Transformer.
Cependant, les modèles Transformer purs peuvent être gourmands en ressources de calcul. Pour de nombreuses applications edge, des modèles hybrides hautement optimisés comme YOLO26 — qui intègrent des mécanismes d'attention efficaces à un traitement convolutif rapide — offrent un meilleur équilibre entre vitesse et précision. Tu peux facilement gérer l'entraînement et le déploiement de ces modèles via la plateforme Ultralytics, qui rationalise le flux de travail, de l'annotation du jeu de données à l'exportation du modèle.
Exemple Python : utiliser RT-DETR#
L'exemple suivant montre comment effectuer une inférence à l'aide d'un modèle fondé sur un Transformer dans le package ultralytics. Ce code charge un modèle RT-DETR préentraîné et détecte les objets présents dans une image.
from ultralytics import RTDETR
# Load a pre-trained Real-Time Detection Transformer (RT-DETR) model
model = RTDETR("rtdetr-l.pt")
# Run inference on an image URL
# The model uses self-attention to identify objects with high accuracy
results = model("https://ultralytics.com/images/bus.jpg")
# Display the detection results with bounding boxes
results[0].show()Pour approfondir les fondements mathématiques, la documentation PyTorch sur les couches Transformer fournit des explications techniques détaillées, tandis que le guide d'IBM sur les Transformers propose une perspective métier générale.









