Qu’est-ce que la mise en correspondance d’images en IA appliquée à la vision ? Une introduction rapide
Découvre le fonctionnement de la mise en correspondance d’images dans l’IA de vision et explore les technologies fondamentales qui aident les machines à détecter, comparer et comprendre les données visuelles.

Lorsque tu regardes deux images du même objet, comme un tableau et une photographie d’une voiture, il est facile de remarquer ce qu’elles ont en commun. Pour les machines, en revanche, ce n’est pas aussi simple.
Pour effectuer de telles comparaisons, les machines s’appuient sur la vision par ordinateur, une branche de l’intelligence artificielle (AI) qui les aide à interpréter et à comprendre les informations visuelles. La vision par ordinateur permet aux systèmes de détecter des objets, de comprendre des scènes et d’extraire des motifs à partir d’images ou de vidéos.
Certaines tâches visuelles vont notamment au-delà de l’analyse d’une seule image. Elles consistent à comparer des images pour trouver des similitudes, repérer des différences ou suivre des changements au fil du temps.
L’IA visuelle couvre un vaste ensemble de techniques, et une capacité essentielle, appelée mise en correspondance d’images, consiste à identifier les similitudes entre des images, même lorsque l’éclairage, les angles ou les arrière-plans varient. Cette technique peut être utilisée dans diverses applications, notamment la robotique, la réalité augmentée et la cartographie géographique.
Dans cet article, nous allons découvrir ce qu’est la mise en correspondance d’images, ses principales techniques et certaines de ses applications concrètes. C’est parti !
Qu’est-ce que la mise en correspondance d’images ?#
La mise en correspondance d’images permet à un système informatique de déterminer si deux images contiennent un contenu similaire. Les humains le font intuitivement en remarquant les formes, les couleurs et les motifs.
Les ordinateurs, en revanche, s’appuient sur des données numériques. Ils analysent les images en examinant chaque pixel, qui est la plus petite unité d’une image numérique.
Chaque image est stockée sous forme de grille de pixels, et chaque pixel contient généralement des valeurs pour le rouge, le vert et le bleu (RGB). Ces valeurs peuvent changer lorsqu’une image est tournée, redimensionnée, observée sous un angle différent ou capturée dans des conditions d’éclairage différentes. En raison de ces variations, la comparaison des images pixel par pixel est souvent peu fiable.
Pour rendre les comparaisons plus cohérentes, la mise en correspondance d’images se concentre sur des caractéristiques locales, comme les coins, les contours et les régions texturées, qui ont tendance à rester stables même lorsqu’une image change légèrement. En détectant ces caractéristiques, ou points d’intérêt, dans plusieurs images, un système peut les comparer avec une bien plus grande précision.
Ce processus est largement utilisé dans des cas d’usage tels que la navigation, la localisation, la réalité augmentée, la cartographie, la reconstruction 3D et la recherche visuelle. Lorsque les systèmes identifient les mêmes points dans différentes images ou plusieurs images successives, ils peuvent suivre les mouvements, comprendre la structure d’une scène et prendre des décisions fiables dans des environnements dynamiques.

Fig. 1. Exemple de mise en correspondance d’images d’une voiture où des points d’intérêt similaires sont identifiés. (Source)
Comprendre le fonctionnement de la mise en correspondance d’images#
La mise en correspondance d’images comprend plusieurs étapes clés qui aident les systèmes à identifier et à comparer des régions similaires au sein des images. Chaque étape améliore la précision, la cohérence et la robustesse dans différentes conditions.
Voici, étape par étape, comment fonctionne la mise en correspondance d’images :
- Détection des caractéristiques : Le système identifie d’abord les points d’intérêt distinctifs d’une image qui restent fixes même lorsque l’éclairage, l’échelle ou l’angle de vue changent. Ils mettent en évidence des zones telles que les coins, les contours ou les régions texturées qui se distinguent visuellement.
- Description des caractéristiques : Chaque point d’intérêt est ensuite converti en un descripteur, c’est-à-dire un vecteur numérique compact qui capture le motif visuel autour de ce point. Ces descripteurs offrent un moyen fiable de comparer les caractéristiques entre différentes images.
- Mise en correspondance des caractéristiques : Les descripteurs de deux images sont comparés à l’aide d’algorithmes de mise en correspondance qui calculent leur degré de similarité. Cette étape associe les points d’intérêt qui semblent correspondre et élimine les correspondances faibles ou peu fiables.
- Vérification géométrique : Enfin, le système vérifie si les points d’intérêt mis en correspondance forment une relation géométrique réaliste. Il élimine les correspondances incorrectes, appelées valeurs aberrantes, à l’aide d’une méthode connue sous le nom de RANSAC (Consensus d’échantillons aléatoires), afin de ne conserver que les paires de points fiables. Une fois les bonnes correspondances identifiées, le système estime la transformation qui relie au mieux les deux images. Il s’agit souvent d’une transformation affine, qui compense les changements d’échelle, de rotation et de position, ou d’une homographie, qui peut également gérer les changements de perspective. Ces transformations permettent au système d’aligner précisément les images, même lorsqu’elles ont été capturées depuis des points de vue légèrement différents.

Fig. 2. (a) Extraction de points caractéristiques et (b) mise en correspondance des caractéristiques. (Source)
Principales techniques utilisées pour la mise en correspondance d’images#
Avant d’examiner les applications concrètes de la mise en correspondance d’images, intéressons-nous d’abord aux techniques de mise en correspondance d’images utilisées dans les systèmes de vision par ordinateur.
Mise en correspondance d’images fondée sur la mise en correspondance de modèles#
La mise en correspondance de modèles est l’une des méthodes de mise en correspondance d’images les plus simples. Elle est généralement considérée comme une technique de traitement d’images plutôt que comme une méthode moderne de vision par ordinateur, car elle repose sur des comparaisons directes de pixels et n’extrait pas de caractéristiques visuelles de niveau supérieur.
Elle sert à localiser une petite image de référence, ou modèle, au sein d’une scène plus vaste. Elle fonctionne au moyen d’un algorithme qui fait glisser un modèle sur l’image principale et calcule un score de similarité à chaque position afin de mesurer le degré de correspondance entre les deux régions. La zone obtenant le score le plus élevé est considérée comme la meilleure correspondance, ce qui indique l’endroit où l’objet a le plus de chances d’apparaître dans la scène.

Fig. 3. Exemple d’utilisation de la mise en correspondance de modèles. (Source)
Cette technique fonctionne bien lorsque l’échelle, la rotation et l’éclairage de l’objet restent cohérents, ce qui en fait un bon choix pour les environnements contrôlés ou les comparaisons de référence. Cependant, ses performances diminuent lorsque l’objet semble différent du modèle, par exemple lorsque sa taille change, qu’il est tourné, partiellement occulté ou placé devant un arrière-plan bruité ou complexe.
Techniques classiques de mise en correspondance d’images fondées sur les caractéristiques#
Avant l’adoption généralisée de l’apprentissage profond, la mise en correspondance d’images reposait principalement sur des algorithmes classiques de vision par ordinateur qui détectaient les points d’intérêt distinctifs d’une image. Au lieu de comparer chaque pixel, ces méthodes analysent les gradients de l’image, c’est-à-dire les variations d’intensité, afin de mettre en évidence les coins, les contours et les régions texturées qui se distinguent.
Chaque point d’intérêt détecté est ensuite représenté par un résumé numérique compact appelé descripteur. Lors de la comparaison de deux images, un outil de mise en correspondance évalue ces descripteurs pour trouver les paires les plus similaires.
Un score de similarité élevé indique généralement que le même point physique apparaît dans les deux images. Les outils de mise en correspondance utilisent également des métriques de distance ou des règles de notation spécifiques pour évaluer le degré d’alignement des caractéristiques, ce qui améliore la fiabilité globale.
Voici quelques-uns des principaux algorithmes classiques de vision par ordinateur utilisés pour la mise en correspondance d’images :
-
SIFT (Transformation de caractéristiques invariante à l’échelle) : Il identifie les points d’intérêt en analysant les gradients d’intensité de l’image, ce qui leur permet de rester reconnaissables lorsqu’une image est agrandie, réduite ou tournée.
-
SURF (Caractéristiques robustes accélérées) : Cet algorithme ressemble à SIFT, mais il est optimisé pour la vitesse. Il utilise des approximations rapides d’opérations fondées sur les gradients, ce qui le rend adapté aux applications nécessitant des temps de réponse courts.
-
ORB (FAST orienté et BRIEF tourné) : Il combine deux algorithmes appelés FAST et BRIEF. FAST trouve rapidement les points ressemblant à des coins dans une image, tandis que BRIEF crée une description compacte de chaque point afin de permettre leur mise en correspondance entre plusieurs images. ORB améliore également ces deux étapes en gérant la rotation, ce qui le rend rapide et fiable.

Fig. 4. Points caractéristiques SURF extraits et mis en correspondance entre deux images. (Source)
Techniques de mise en correspondance d’images fondées sur l’apprentissage profond#
Contrairement aux méthodes classiques qui reposent sur des règles spécifiques, l’apprentissage profond apprend automatiquement les caractéristiques à partir de vastes jeux de données, c’est-à-dire des collections de données visuelles à partir desquelles les modèles d’IA apprennent des motifs. Ces modèles s’exécutent généralement sur des GPU (unités de traitement graphique), qui fournissent la puissance de calcul élevée nécessaire pour traiter de grands lots d’images et entraîner efficacement des réseaux neuronaux complexes.
Les modèles d’IA peuvent ainsi gérer des changements réels tels que l’éclairage, les angles de caméra et les occultations. Certains modèles combinent également toutes les étapes en un seul flux de travail, offrant des performances robustes dans des conditions difficiles.
Voici quelques approches fondées sur l’apprentissage profond pour l’extraction et la mise en correspondance de caractéristiques d’images :
-
Extraction de caractéristiques fondée sur les CNN : Ces modèles apprennent automatiquement les principaux motifs visuels à partir de vastes jeux de données. Ils reconnaissent des caractéristiques peu susceptibles de changer, ce qui les rend fiables pour mettre en correspondance des objets dans différentes scènes.
-
Mise en correspondance fondée sur les embeddings : Au lieu de comparer directement les pixels, cette méthode transforme les images en représentations numériques compactes appelées embeddings. L’outil de mise en correspondance compare ensuite ces embeddings pour trouver des visuels similaires. Des modèles comme FaceNet, qui génère des embeddings pour reconnaître et comparer des visages, et CLIP, qui projette les images et le texte dans un espace commun pour des tâches telles que la recherche d’images et la mise en correspondance sémantique, suivent cette approche.
-
Pipelines de mise en correspondance de bout en bout : Les systèmes d’apprentissage profond de pointe combinent souvent la détection, la description et la mise en correspondance des points d’intérêt au sein d’un flux de travail unifié. Des modèles comme SuperPoint et D2-Net apprennent directement les points d’intérêt et les descripteurs à partir des cartes de caractéristiques des CNN, tandis que SuperGlue agit comme un outil de mise en correspondance appris qui associe ces descripteurs de manière plus fiable que les méthodes traditionnelles. Ensemble, ces composants forment un pipeline de bout en bout qui offre une précision et une robustesse supérieures dans les conditions difficiles par rapport aux approches classiques fondées sur les caractéristiques.
-
Mise en correspondance fondée sur les Transformers : Cette méthode utilise des mécanismes d’attention pour relier les régions correspondantes de deux images, ce qui lui permet d’aligner des zones même en présence de fortes variations de point de vue, d’éclairage ou de texture. Des modèles comme LoFTR (Transformer de caractéristiques locales) atteignent une précision bien supérieure, car le champ réceptif global du Transformer permet une mise en correspondance fiable dans les zones peu texturées, floues ou répétitives où les détecteurs traditionnels échouent. LoFTR produit des correspondances semi-denses et hautement fiables, et surpasse largement les méthodes de pointe précédentes sur les benchmarks intérieurs comme extérieurs.
-
Modèles axés sur l’efficacité : Les modèles plus récents de mise en correspondance d’images cherchent à offrir une grande précision tout en s’exécutant plus rapidement. Des modèles comme LightGlue sont conçus pour fonctionner efficacement sur des appareils disposant d’une puissance de calcul limitée, tout en conservant une bonne qualité de mise en correspondance.
Applications concrètes de la mise en correspondance d’images#
Maintenant que nous comprenons mieux le fonctionnement de la mise en correspondance d’images, examinons quelques applications concrètes dans lesquelles elle joue un rôle important.
Une robotique plus intelligente grâce à la mise en correspondance d’images#
Les robots opèrent souvent dans des environnements animés et changeants, où ils doivent comprendre quels objets sont présents et comment ils sont disposés. La mise en correspondance d’images peut aider les robots à comprendre les objets qu’ils voient en les comparant à des images enregistrées ou de référence. Il leur est ainsi plus facile de reconnaître les objets, de suivre leurs mouvements et de s’adapter même lorsque l’éclairage ou les angles de caméra changent.
Par exemple, dans un entrepôt, un système robotisé de préhension et de dépose peut utiliser la mise en correspondance d’images pour identifier et manipuler différents articles. Le robot saisit d’abord un objet, puis compare son image à des échantillons de référence pour l’identifier.

Fig. 5. Un robot reconnaît et saisit des objets en les comparant à des images de référence. (Source)
Une fois la correspondance trouvée, le robot sait comment trier ou placer correctement l’objet. Cette approche permet aux robots de reconnaître à la fois des objets familiers et de nouveaux objets sans réentraîner l’ensemble du système. Elle les aide également à prendre de meilleures décisions en temps réel, comme organiser des étagères, assembler des pièces ou réorganiser des articles.
Améliorer la reconstruction 3D grâce à une meilleure mise en correspondance d’images#
Dans des domaines tels que la cartographie par drone, la réalité virtuelle et l’inspection de bâtiments, les systèmes doivent souvent reconstruire un modèle 3D à partir de plusieurs images 2D. Pour cela, ils s’appuient sur la mise en correspondance d’images afin d’identifier les points d’intérêt communs, comme les coins ou les régions texturées, qui apparaissent dans plusieurs images.
Ces points communs aident le système à comprendre comment les images sont liées les unes aux autres dans l’espace 3D. Cette idée est étroitement liée à la Structure from Motion (SfM), une technique qui construit des structures 3D en identifiant et en mettant en correspondance des points d’intérêt sur des images capturées depuis différents points de vue.
Si la mise en correspondance n’est pas précise, le modèle 3D obtenu peut sembler déformé ou incomplet. C’est pourquoi les chercheurs s’efforcent d’améliorer la fiabilité de la mise en correspondance d’images pour la reconstruction 3D, et les avancées récentes ont donné des résultats prometteurs.
Un exemple intéressant est HashMatch, un algorithme de mise en correspondance d’images plus rapide et plus robuste. HashMatch convertit les détails de l’image en motifs compacts appelés codes de hachage, ce qui facilite l’identification des correspondances correctes et la suppression des valeurs aberrantes, même lorsque l’éclairage ou les points de vue varient.
Lors de tests réalisés sur des jeux de données à grande échelle, HashMatch a produit des modèles de reconstruction 3D plus propres et plus réalistes, avec moins d’erreurs d’alignement. Cela le rend particulièrement utile pour des applications telles que la cartographie par drone, les systèmes de RA et la préservation du patrimoine culturel, où la précision est essentielle.
Le rôle de la mise en correspondance d’images dans la réalité augmentée#
Dans le domaine de la réalité augmentée (AR), maintenir l’alignement des objets virtuels avec le monde réel constitue souvent un défi. Les environnements extérieurs peuvent changer constamment en fonction des conditions environnementales, comme la lumière du soleil et la météo. De subtiles différences dans le monde réel peuvent rendre les éléments virtuels instables ou légèrement mal positionnés.
Pour résoudre ce problème, les systèmes de RA utilisent la mise en correspondance d’images afin d’interpréter leur environnement. En comparant les images capturées en direct par la caméra à des images de référence enregistrées, ils peuvent comprendre où se trouve l’utilisateur et comment la scène a changé.

Fig. 6. Points caractéristiques mis en correspondance entre deux images. (Source : theijes.com)
Par exemple, dans une étude portant sur un entraînement en RA en extérieur de type militaire avec des lunettes XR (Réalité étendue), les chercheurs ont utilisé SIFT et d’autres méthodes fondées sur les caractéristiques pour mettre en correspondance les détails visuels entre des images réelles et des images de référence. Des correspondances précises ont maintenu les éléments virtuels correctement alignés avec le monde réel, même lorsque l’utilisateur se déplaçait rapidement ou que l’éclairage changeait.
Points clés à retenir#
La mise en correspondance d’images est un composant essentiel de la vision par ordinateur. Elle permet aux systèmes de comprendre comment différentes images sont liées les unes aux autres ou comment une scène évolue au fil du temps. Elle joue un rôle crucial dans la robotique, la réalité augmentée, la reconstruction 3D, la navigation autonome et de nombreuses autres applications concrètes où la précision et la stabilité sont essentielles.
Grâce à des modèles d’IA avancés comme SuperPoint et LoFTR, les systèmes actuels deviennent bien plus robustes que les méthodes précédentes. À mesure que les techniques d’apprentissage automatique, les modules de vision spécialisés, les réseaux neuronaux et les jeux de données continuent d’évoluer, la mise en correspondance d’images deviendra probablement plus rapide, plus précise et plus adaptable.
Rejoins notre communauté grandissante et explore notre dépôt GitHub pour accéder à des ressources pratiques en IA. Pour créer dès aujourd’hui avec l’IA visuelle, découvre nos options de licence. Découvre comment l’IA dans l’agriculture transforme le secteur agricole et comment l’IA visuelle dans le secteur de la santé façonne l’avenir en consultant nos pages consacrées aux solutions.









