Computer Vision (CV)
Explore comment la vision par ordinateur permet aux machines d'interpréter les images et les vidéos. Découvre les tâches fondamentales, les applications sectorielles et comment débuter avec Ultralytics YOLO.
La vision par ordinateur (CV) est le domaine de l’intelligence artificielle (AI) qui permet aux ordinateurs et aux systèmes de tirer des informations pertinentes d’images numériques, de vidéos et d’autres entrées visuelles. Si l’AI permet aux machines de penser, la vision par ordinateur leur permet de voir, d’observer et de comprendre. Contrairement aux outils de traitement d’image fondés sur des règles, les systèmes modernes apprennent directement à partir des données : on ne leur indique jamais explicitement à quoi ressemble une voiture ou une tumeur ; ils identifient plutôt les structures sous-jacentes dans des milliers d’exemples annotés et généralisent ces connaissances à des images qu’ils n’ont jamais rencontrées. En appliquant l’apprentissage automatique (ML) et l’apprentissage profond (DL), la vision par ordinateur transforme des données visuelles non structurées en décisions que les logiciels peuvent exécuter.
Fonctionnement de la vision par ordinateur#
Un ordinateur voit une image comme un tableau de valeurs numériques représentant des pixels. La transformation de ce tableau en action suit un pipeline en cinq étapes.

Acquisition d’image. Le processus commence par du matériel — capteurs CMOS, caméras infrarouges ou scanners LiDAR — qui capture la lumière et la convertit en une grille numérique de pixels. L’étalonnage de la caméra tient compte de la géométrie de l’objectif avant le début de l’analyse.
Prétraitement. Les données capturées sont normalisées afin que le modèle reçoive des entrées cohérentes : redimensionnement, réduction du bruit et ajustement du contraste.
Extraction de caractéristiques. Le système identifie des caractéristiques de bas niveau telles que les contours, les gradients et les angles. À mesure que les données avancent dans le réseau, ces primitives se combinent en caractéristiques de haut niveau — textures, motifs et géométries complexes. Un système peut détecter des lignes verticales, les reconnaître comme des poteaux de clôture, puis comprendre que la scène représente une limite de périmètre. Ce processus est appelé extraction de caractéristiques.
Inférence du modèle. Le moteur de la vision par ordinateur moderne est le réseau neuronal convolutif (CNN). Contrairement à un réseau neuronal classique qui traite une image comme une liste plate de nombres, les CNN préservent la relation spatiale entre les pixels grâce à des filtres qui parcourent l’image pour détecter des motifs, où qu’ils apparaissent dans le cadre. Plus récemment, les Transformers de vision (ViTs) se sont imposés comme une alternative puissante, en appliquant le mécanisme d’attention du traitement automatique du langage naturel aux données d’image.
Sortie et action. Le modèle renvoie un résultat structuré — une étiquette, un ensemble de boîtes englobantes ou un masque de pixels — sur lequel le système environnant agit : rejet d’une pièce défectueuse, freinage d’un véhicule ou déclenchement d’une alerte.
Comment un modèle apprend#
Un modèle n’est jamais meilleur que les données qu’il consomme. L’apprentissage supervisé nécessite de grands volumes de données d’entraînement, et des benchmarks tels qu’ImageNet et COCO fournissent des millions d’exemples annotés. Pendant l’entraînement, le modèle effectue une prédiction, la compare à l’étiquette de référence, puis ajuste ses poids internes afin de réduire l’erreur. Une fois entraîné, ce même modèle réalise l’étape d’inférence décrite ci-dessus.
Le passage des systèmes fondés sur des règles à l’apprentissage profond#

Les premiers systèmes de vision par ordinateur reposaient sur une ingénierie manuelle des caractéristiques : les ingénieurs définissaient des paramètres géométriques rigides pour aider les machines à reconnaître les objets. Ces systèmes étaient fragiles et échouaient dès que l’éclairage changeait ou qu’un objet apparaissait sous un angle inhabituel. La publication d’AlexNet en 2012, entraîné sur plus d’un million d’images ImageNet annotées, a marqué un tournant en démontrant que les réseaux convolutifs pouvaient surpasser à grande échelle les approches conçues manuellement. L’apprentissage profond a remplacé les règles ajustées à la main par des architectures qui apprennent elles-mêmes leurs caractéristiques — suffisamment flexibles pour fonctionner dans des conditions réelles jamais parfaitement maîtrisées.
Vision par ordinateur, traitement d’image et vision industrielle#
Il est important de distinguer la vision par ordinateur des domaines voisins avec lesquels elle est régulièrement confondue.
- Le traitement d’image manipule une image pour l’améliorer ou en extraire un signal — en ajustant la luminosité, le contraste ou en appliquant des filtres. Sa sortie est généralement une autre image. La vision par ordinateur reçoit une image en entrée et produit une interprétation (« il y a trois personnes dans cette pièce »). Elle utilise régulièrement le traitement d’image comme étape de préparation.
- La vision industrielle désigne les systèmes d’inspection industriels fonctionnant dans des environnements étroitement contrôlés, avec un éclairage fixe et des positions de pièces connues. La vision par ordinateur est la discipline plus large, conçue pour gérer des conditions imprévisibles et non contrôlées.
- Le traitement automatique du langage naturel traite le texte et la parole. La vision par ordinateur se concentre entièrement sur les données visuelles, même si les modèles de vision et de langage rapprochent de plus en plus ces deux domaines.
Principales tâches de vision par ordinateur#
La vision par ordinateur n’est pas une fonction unique, mais un ensemble de tâches distinctes, chacune répondant à un problème différent. Pour une présentation approfondie de chacune d’elles, consulte le guide complet sur les tâches de vision par ordinateur.
- Classification d’image : attribue une seule étiquette à une image entière, en répondant à la question « que contient cette image ? » — par exemple, trier les produits comme défectueux ou non défectueux. La reconnaissance d’image, qui identifie ce qui est présent, est une tâche étroitement liée.
- Détection d’objets : identifie les objets distincts et trace une boîte englobante autour de chacun, ce qui permet aux systèmes de compter et de localiser plusieurs objets dans une même image.
- Segmentation d’instances : produit un masque au niveau du pixel pour chaque objet détecté et sépare les instances individuelles d’une même classe. La segmentation sémantique attribue quant à elle une classe à chaque pixel sans distinguer les instances.
- Estimation de pose : détecte les points clés d’un objet, tels que les articulations du corps humain, afin de suivre les mouvements et la posture.
- Boîtes englobantes orientées : ajustent des boîtes pivotées aux objets qui ne sont pas alignés sur les axes — une fonction essentielle pour les images aériennes et satellitaires.
- Suivi d’objets : suit un objet dans un flux vidéo en conservant un ID cohérent entre les images. Le flux optique complète cette approche en analysant le mouvement apparent entre des images consécutives.
- Reconnaissance optique de caractères (OCR) : convertit des images de texte imprimé ou manuscrit en données lisibles par une machine, automatisant le traitement de documents à grande échelle.
Choisir la bonne tâche#
Aligner dès le départ la tâche technique sur l’objectif métier évite des reprises coûteuses.
| Objectif métier | Tâche à utiliser |
|---|---|
| Trier les produits par catégorie | Classification d’images |
| Compter les articles ou localiser leur position | Détection d’objets |
| Analyser la forme exacte ou le contour d’un objet | Segmentation d’instances |
| Suivre les mouvements entre les images vidéo | Suivi d’objets |
| Mesurer la position du corps ou les angles des articulations | Estimation de pose |
| Détecter les objets pivotés dans des images aériennes | Boîtes englobantes orientées |
| Lire le texte de documents ou d’étiquettes | Reconnaissance optique de caractères |
Applications concrètes#
La vision par ordinateur est désormais au cœur des systèmes de production de la plupart des grands secteurs industriels.

- Industrie manufacturière et contrôle qualité. Les lignes de production modernes fonctionnent plus vite que les capacités visuelles humaines. Les systèmes de vision réalisent une inspection qualité instantanée, identifiant des fissures microscopiques ou des composants mal alignés à la cadence de la ligne, sans la fatigue qui s’accumule chez un inspecteur humain. La surveillance des signes d’usure des machines permet également une maintenance prédictive — en détectant les indices d’une défaillance avant qu’une panne n’entraîne un arrêt imprévu. Consulte la vision par ordinateur dans l’industrie manufacturière et la détection de défauts.
- Santé et diagnostic. Les algorithmes d’analyse d’images médicales traitent les radiographies, les IRM et les scanners CT pour détecter des tumeurs à un stade précoce, des microfractures et des anomalies rétiniennes faciles à manquer sous la pression du temps. Au bloc opératoire, les systèmes de vision fournissent une cartographie spatiale en temps réel pendant les interventions mini-invasives. Consulte la vision par ordinateur dans le domaine de la santé.
- Commerce de détail. Les magasins sans caisse utilisent la fusion de capteurs et des algorithmes de vision pour suivre les articles retirés des rayons et facturer automatiquement les clients. Ces mêmes systèmes surveillent en temps réel les niveaux en rayon afin de déclencher des alertes de réapprovisionnement, favorisant la gestion des stocks et la prévention des pertes dans le commerce de détail. Consulte la vision par ordinateur dans le commerce de détail.
- Transport autonome. La couche de perception est le composant le plus critique pour la sécurité d’une voiture autonome. Les systèmes de vision identifient en temps réel les marquages au sol, les panneaux de signalisation, les piétons et les autres véhicules, en combinant les données des caméras avec celles du radar et du LiDAR pour construire un modèle à 360 degrés de l’environnement du véhicule grâce à la détection d’objets en 3D. Consulte les véhicules autonomes.
- Sécurité et surveillance. Les infrastructures de sécurité sont passées de l’enregistrement passif à l’intervention proactive — détection des personnes qui s’attardent dans des zones réglementées, signalement des comportements inhabituels au moment où ils se produisent et prise en charge de la gestion des files d’attente dans les espaces publics. La détection d’anomalies en est la capacité sous-jacente.
- Agriculture. Les drones et les tracteurs évaluent la santé des cultures au niveau de chaque plante, en analysant des images multispectrales pour détecter la déshydratation, les infestations de parasites ou les carences en nutriments. L’eau, les pesticides et les engrais sont ensuite appliqués uniquement là où ils sont nécessaires, plutôt que sur des champs entiers. Consulte la vision par ordinateur dans l’agriculture.
La vision par ordinateur à la périphérie du réseau#
L’analyse visuelle en temps réel s’exécute de plus en plus à la périphérie du réseau — directement sur la caméra ou une passerelle locale — plutôt que d’acheminer la vidéo vers un serveur cloud centralisé. Cela est important pour deux raisons.
La latence devient presque nulle, ce qui est indispensable pour la robotique autonome ou l’inspection de lignes industrielles, où un délai de quelques millisecondes provoque des erreurs. De plus, seuls les métadonnées transitent sur le réseau, et non la vidéo brute : les besoins en bande passante diminuent fortement et la confidentialité s’améliore, puisque les séquences sensibles ne quittent jamais l’appareil local. L’AI en périphérie et l’inférence en temps réel rendent cela possible, tandis que les options de déploiement de modèles telles qu’ONNX et TensorRT permettent à un même modèle entraîné de fonctionner sur des matériels variés.
Défis et limites#
Qualité des données. Un modèle reflète la qualité de ses données d’entraînement. Les jeux de données basse résolution, mal annotés ou non représentatifs produisent des modèles peu fiables, et la constitution d’un jeu de données annoté et diversifié demande souvent davantage de travail que la conception de l’algorithme. Consulte l’annotation des données.
Variables environnementales. Les fortes pluies, les reflets parasites de l’objectif, les occultations partielles et les variations d’échelle des objets dégradent tous les performances. Les systèmes robustes s’appuient sur l’augmentation des données pendant l’entraînement pour simuler ces conditions et renforcer leur résilience avant le déploiement, ainsi que sur une validation rigoureuse pour éviter le surapprentissage.
Considérations éthiques et biais. Un modèle entraîné sur un jeu de données manquant de diversité démographique donnera des résultats inégaux selon les groupes de population. Les organisations qui déploient des systèmes analysant des personnes — dans l’imagerie médicale, la sécurité au travail ou les espaces publics — doivent auditer leurs jeux de données sous l’angle de l’équité et respecter les nouvelles réglementations encadrant la prise de décision automatisée.
L’avenir de la vision par ordinateur#
Les Transformers de vision transforment les possibilités pour les tâches qui nécessitent de comprendre les relations entre des parties éloignées d’une image. Au-delà de cela, l’apprentissage multimodal combine les données visuelles avec le texte, l’audio et la profondeur afin de créer des systèmes dotés d’une compréhension contextuelle plus riche — les modèles de vision et de langage capables de répondre à des questions sur des images en sont un premier exemple.
L’AI générative s’attaque directement à la pénurie de données. Les données synthétiques permettent de créer des images hyperréalistes de scénarios rares — modes de défaillance spécifiques ou manifestations inhabituelles de maladies — qu’il est impossible de collecter en quantité suffisante dans le monde réel. Parallèlement, les caméras de détection de profondeur et le LiDAR font évoluer les systèmes au-delà de l’analyse d’images planes vers l’informatique spatiale, où des informations numériques sont superposées au monde physique pour des applications telles que la maintenance guidée par AR et la cartographie des structures.
Mettre en œuvre la vision par ordinateur avec Ultralytics#
Pour les équipes qui expérimentent un projet de vision par ordinateur, Ultralytics YOLO26 constitue un point de départ pratique pour la détection d’objets en temps réel : open source, abondamment documenté et suffisamment rapide pour fonctionner à la périphérie du réseau. Les mesures de précision et de latence sur différents matériels sont publiées sur la page des benchmarks, avec des comparaisons de modèles côte à côte dans la documentation. L’écosystème élargi comprend OpenCV pour le traitement d’image classique et PyTorch comme framework d’entraînement principal.
from ultralytics import YOLO
# Load the YOLO26n model (nano version for speed)
model = YOLO("yolo26n.pt")
# Run inference on a standard example image
# The model identifies objects and their locations
results = model("https://ultralytics.com/images/bus.jpg")
# Display the resulting image with bounding boxes
results[0].show()Ce script utilise un modèle préentraîné pour effectuer une inférence en quelques lignes. Les équipes qui passent du prototype à la production peuvent utiliser l’Ultralytics Platform pour annoter des jeux de données, entraîner des modèles dans le cloud et gérer le déploiement, ou appliquer l’apprentissage par transfert afin d’adapter un modèle préentraîné à un jeu de données personnalisé avec bien moins de données annotées qu’un entraînement à partir de zéro.
Foire aux questions#
Quelle est la différence entre la vision par ordinateur et l’apprentissage automatique ? L’apprentissage automatique est la discipline plus large qui consiste à créer des systèmes apprenant à partir de données. La vision par ordinateur est l’application de cette discipline — généralement au moyen de l’apprentissage profond — à des entrées visuelles telles que des images et des vidéos. Presque toute la vision par ordinateur moderne repose sur l’apprentissage automatique, mais celui-ci couvre également le texte, l’audio et les données tabulaires.
La vision par ordinateur est-elle identique à la reconnaissance d’image ? Non. La reconnaissance d’image est une tâche de la vision par ordinateur : elle consiste à identifier ce qui apparaît dans une image. La vision par ordinateur couvre également la détection d’objets, la segmentation, l’estimation de pose, le suivi et la compréhension de scène.
Quelle quantité de données faut-il pour entraîner un modèle de vision par ordinateur ? Cela dépend de la complexité de la tâche et de la variation que le modèle doit gérer. L’apprentissage par transfert à partir d’un modèle préentraîné tel qu’Ultralytics YOLO26 réduit considérablement les besoins, et des détecteurs personnalisés utiles sont souvent entraînés sur quelques centaines à quelques milliers d’images annotées par classe, plutôt que sur les millions utilisées pour entraîner des modèles de fondation.
La vision par ordinateur peut-elle fonctionner sans connexion Internet ? Oui. Les modèles peuvent être déployés directement sur des appareils en périphérie et fonctionner entièrement hors ligne, ce qui est une pratique standard lorsque la latence, la bande passante ou les règles de confidentialité des données empêchent l’envoi de vidéos vers le cloud.
Quel langage de programmation utilise-t-on pour la vision par ordinateur ? Python domine grâce à la maturité de son écosystème — le package ultralytics, PyTorch et OpenCV. Le C++ est utilisé lorsqu’il faut obtenir des performances d’inférence maximales, généralement dans les systèmes embarqués et automobiles.









