YOLO Vision 2026 :
Retour au glossaire Ultralytics

Computer Vision (CV)

Découvre comment la vision par ordinateur permet aux machines d'interpréter les images et les vidéos. Apprends les tâches fondamentales, les applications industrielles et comment démarrer avec Ultralytics YOLO.

La vision par ordinateur (CV) est le domaine de l'intelligence artificielle (IA) qui permet aux ordinateurs et aux systèmes de tirer des informations significatives d'images numériques, de vidéos et d'autres entrées visuelles. Si l'IA permet aux machines de penser, la vision par ordinateur leur permet de voir, d'observer et de comprendre. Contrairement aux outils de traitement d'images basés sur des règles, les systèmes modernes apprennent directement à partir des données : on ne leur dit jamais explicitement à quoi ressemble une voiture ou une tumeur, mais ils identifient plutôt les schémas sous-jacents parmi des milliers d'exemples étiquetés et généralisent cette connaissance à des images qu'ils n'ont jamais rencontrées. En appliquant l'apprentissage automatique (ML) et l'apprentissage profond (DL), la vision par ordinateur transforme des données visuelles non structurées en décisions sur lesquelles le logiciel peut agir.

Comment fonctionne la vision par ordinateur#

Un ordinateur voit une image comme un tableau de valeurs numériques représentant des pixels. Transformer ce tableau en action suit un pipeline en cinq étapes.

Les cinq étapes d'un pipeline de vision par ordinateur : acquisition d'images, prétraitement, extraction de caractéristiques, inférence de modèle et sortie ou action

Acquisition d'images. Le flux de travail commence par le matériel — capteurs CMOS, caméras infrarouges ou scanners LiDAR — qui capture la lumière et la convertit en une grille de pixels numérique. L'étalonnage de la caméra tient compte de la géométrie de l'objectif avant que l'analyse ne commence.

Prétraitement. Les données capturées sont normalisées afin que le modèle reçoive une entrée cohérente : redimensionnement, réduction du bruit et ajustement du contraste.

Extraction de caractéristiques. Le système identifie des caractéristiques de bas niveau telles que les contours, les gradients et les coins. À mesure que les données progressent dans le réseau, ces éléments primitifs se combinent en caractéristiques de haut niveau — textures, motifs et géométries complexes. Un système peut détecter des lignes verticales, les reconnaître comme des poteaux de clôture, puis comprendre la scène comme une limite périmétrique. Ce processus est connu sous le nom d'extraction de caractéristiques.

Inférence de modèle. Le moteur de la vision par ordinateur moderne est le réseau de neurones convolutifs (CNN). Contrairement à un réseau de neurones standard qui traite une image comme une liste plate de nombres, les CNN préservent la relation spatiale entre les pixels, en utilisant des filtres qui glissent sur l'image pour détecter des motifs quel que soit leur emplacement dans le cadre. Plus récemment, les Vision Transformers (ViTs) sont apparus comme une alternative puissante, appliquant le mécanisme d'attention issu du traitement automatique du langage naturel aux données d'images.

Sortie et action. Le modèle renvoie un résultat structuré — une étiquette, un ensemble de boîtes englobantes ou un masque de pixels — sur lequel le système environnant agit : rejeter une pièce défectueuse, freiner un véhicule ou déclencher une alerte.

Comment un modèle apprend#

Un modèle n'est aussi bon que les données qu'il consomme. L'apprentissage supervisé nécessite de grands volumes de données d'entraînement, et des repères tels que ImageNet et COCO fournissent des millions d'exemples annotés. Pendant l'entraînement, le modèle prédit, compare sa prédiction à l'étiquette de vérité terrain et ajuste ses poids internes pour réduire l'erreur. Une fois entraîné, ce même modèle effectue l'étape d'inférence ci-dessus.

Le passage des systèmes basés sur des règles à l'apprentissage profond#

Chronologie de la vision par ordinateur, des systèmes basés sur des règles dans les années 1960 en passant par l'apprentissage automatique et l'apprentissage profond jusqu'aux transformateurs et aux modèles de fondation

La vision par ordinateur primitive dépendait de l'ingénierie manuelle des caractéristiques : les ingénieurs définissaient des paramètres géométriques rigides pour aider les machines à reconnaître des objets. Ces systèmes étaient fragiles et échouaient dès que l'éclairage changeait ou qu'un objet apparaissait sous un angle inhabituel. La publication en 2012 d'AlexNet, entraîné sur plus d'un million d'images ImageNet étiquetées, a marqué un tournant en démontrant que les réseaux convolutifs pouvaient surpasser les approches conçues à la main à grande échelle. L'apprentissage profond a remplacé les règles ajustées à la main par des architectures qui apprennent leurs propres caractéristiques — suffisamment flexibles pour résister à des conditions du monde réel qui ne sont jamais parfaitement contrôlées.

Vision par ordinateur vs traitement d'images vs vision industrielle#

Il est important de distinguer la vision par ordinateur des domaines adjacents avec lesquels elle est régulièrement confondue.

  • Le traitement d'images manipule une image pour l'améliorer ou en extraire un signal — en ajustant la luminosité, le contraste ou en appliquant des filtres. Son résultat est généralement une autre image. La vision par ordinateur prend une image en entrée et produit une interprétation (« il y a trois personnes dans cette pièce »). La vision par ordinateur utilise régulièrement le traitement d'images comme étape de préparation.
  • La vision industrielle désigne les systèmes d'inspection industrielle fonctionnant dans des environnements strictement contrôlés avec un éclairage fixe et des positions de pièces connues. La vision par ordinateur est la discipline plus large, conçue pour gérer des conditions imprévisibles et non contrôlées.
  • Le traitement automatique du langage naturel gère le texte et la parole. La vision par ordinateur se concentre entièrement sur les données visuelles, bien que les modèles de vision-langage fassent de plus en plus le lien entre les deux.

Tâches clés de la vision par ordinateur#

La vision par ordinateur n'est pas une fonction unique mais un ensemble de tâches distinctes, chacune résolvant un problème différent. Pour un aperçu plus approfondi de chacune d'elles, consulte le guide complet des tâches de vision par ordinateur.

Choisir la bonne tâche#

Aligner la tâche technique sur l'objectif commercial dès le départ évite des retouches coûteuses.

Objectif commercialTâche à utiliser
Trier les produits par catégoriesClassification d'images
Compter les articles ou localiser leur positionDétection d'objets
Analyser la forme exacte ou la limite d'un objetSegmentation d'instance
Suivre le mouvement à travers les images vidéoSuivi d'objets
Mesurer la position du corps ou les angles des articulationsEstimation de pose
Détecter des objets pivotés dans l'imagerie aérienneBoîtes englobantes orientées
Lire du texte à partir de documents ou d'étiquettesReconnaissance optique de caractères

Applications concrètes#

La vision par ordinateur sous-tend désormais les systèmes de production dans la plupart des grands secteurs.

Graphique comparant l'adoption de la vision par ordinateur selon les secteurs, la fabrication étant le segment le plus important devant la santé et la vente au détail

  • Fabrication et contrôle qualité. Les lignes de production modernes fonctionnent plus rapidement que la capacité visuelle humaine. Les systèmes de vision effectuent un contrôle qualité instantané, identifiant des fissures microscopiques ou des composants mal alignés à la vitesse de la ligne sans aucune de la fatigue qu'accumule un inspecteur humain. La surveillance des profils d'usure sur les machines permet également une maintenance prédictive — repérant les signatures de panne avant qu'une défaillance ne provoque un temps d'arrêt imprévu. Voir la vision par ordinateur dans la fabrication et la détection de défauts.
  • Santé et diagnostics. Les algorithmes d'analyse d'images médicales traitent les radiographies, les IRM et les scanners pour détecter des tumeurs à un stade précoce, des micro-fractures et des anomalies rétiniennes faciles à manquer sous la pression du temps. En salle d'opération, les systèmes de vision fournissent une cartographie spatiale en temps réel lors de procédures mini-invasives. Voir la vision par ordinateur dans la santé.
  • Vente au détail. Les magasins sans caisse utilisent la fusion de capteurs et des algorithmes de vision pour suivre les articles quittant les rayons et facturer automatiquement les clients. Les mêmes systèmes surveillent les niveaux des rayons en temps réel pour déclencher des alertes de réapprovisionnement, soutenant la gestion des stocks et la prévention des pertes dans le commerce de détail. Voir la vision par ordinateur dans la vente au détail.
  • Transport autonome. La couche de perception est le composant le plus critique pour la sécurité d'une voiture autonome. Les systèmes de vision identifient les marquages au voie, les panneaux de signalisation, les piétons et les autres véhicules en temps réel, combinant l'entrée des caméras avec le radar et le LiDAR pour construire un modèle à 360 degrés de l'environnement du véhicule grâce à la détection d'objets 3D. Voir les véhicules autonomes.
  • Sécurité et surveillance. L'infrastructure de sécurité est passée de l'enregistrement passif à l'intervention proactive — détecter le vagabondage dans des zones réglementées, signaler des schémas comportementaux inhabituels dès qu'ils se produisent et soutenir la gestion des files d'attente dans les espaces publics. La détection d'anomalies en est la capacité sous-jacente.
  • Agriculture. Les drones et les tracteurs évaluent la santé des cultures au niveau de la plante individuelle, analysant l'imagerie multispectrale pour détecter la déshydratation, les infestations de nuisibles ou les carences en nutriments. L'eau, les pesticides et les engrais sont ensuite appliqués uniquement là où c'est nécessaire plutôt que sur des champs entiers. Voir la vision par ordinateur en agriculture.

La vision par ordinateur en périphérie (Edge)#

L'analyse visuelle en temps réel s'exécute de plus en plus en périphérie (edge) — directement sur la caméra ou une passerelle locale — plutôt que de router la vidéo vers un serveur cloud centralisé. Cela compte pour deux raisons.

La latence chute presque à zéro, ce qui est non négociable pour la robotique autonome ou l'inspection de lignes industrielles où un retard de quelques millisecondes produit des erreurs. Et comme seule la métadonnée traverse le réseau plutôt que la vidéo brute, les exigences en matière de bande passante chutent fortement tandis que la confidentialité s'améliore, puisque les séquences sensibles ne quittent jamais l'appareil local. L'IA en périphérie (Edge AI) et l'inférence en temps réel rendent cela possible en pratique, et les options de déploiement de modèles telles que ONNX et TensorRT permettent à un seul modèle entraîné de s'exécuter sur divers matériels.

Défis et limitations#

Qualité des données. Un modèle reflète la qualité de ses données d'entraînement. Des ensembles de données de basse résolution, mal étiquetés ou non représentatifs produisent des modèles peu fiables, et la construction d'un ensemble de données annoté diversifié demande fréquemment plus de travail que la conception de l'algorithme. Voir l'étiquetage des données.

Variables environnementales. Des pluies abondantes, des reflets de lumière sur l'objectif, des occlusions partielles et des échelles d'objets variables dégradent toutes les performances. Les systèmes robustes s'appuient sur l'augmentation des données pendant l'entraînement pour simuler ces conditions et renforcer la résilience avant le déploiement, ainsi que sur une validation minutieuse pour éviter le surapprentissage (overfitting).

Considérations éthiques et biais. Un modèle entraîné sur un ensemble de données manquant de diversité démographique fonctionnera de manière inégale selon les groupes de population. Les organisations déployant des systèmes qui analysent des personnes — dans l'imagerie médicale, la sécurité au travail ou les espaces publics — doivent auditer leurs ensembles de données pour en assurer l'équité et se conformer aux réglementations émergentes concernant la prise de décision automatisée.

L'avenir de la vision par ordinateur#

Les Vision Transformers redéfinissent ce qui est réalisable sur des tâches nécessitant une compréhension des relations entre des parties distantes d'une image. Au-delà de cela, l'apprentissage multimodal combine des données visuelles avec du texte, de l'audio et de la profondeur pour construire des systèmes dotés d'une compréhension contextuelle plus riche — les modèles de vision-langage qui répondent à des questions sur des images en sont un premier exemple.

L'IA générative répond directement à la pénurie de données. Les données synthétiques permettent de créer des images hyper-réalistes de scénarios rares — modes de défaillance spécifiques, présentations de maladies rares — qui ne peuvent pas être collectées en volume suffisant dans le monde réel. Pendant ce temps, les caméras à détection de profondeur et le LiDAR poussent les systèmes au-delà de l'analyse d'images planes vers l'informatique spatiale, où les informations numériques sont superposées au monde physique pour des applications telles que la maintenance guidée par RA et la cartographie structurelle.

Mise en œuvre de la vision par ordinateur avec Ultralytics#

Pour les équipes menant un projet pilote de vision par ordinateur, Ultralytics YOLO26 constitue un point de départ pratique pour la détection d'objets en temps réel — open source, largement documenté et suffisamment rapide pour s'exécuter en périphérie. Les chiffres de précision et de latence sur différents matériels sont publiés sur la page des benchmarks, avec des comparaisons de modèles côte à côte dans la documentation. L'écosystème plus large comprend OpenCV pour le traitement d'images classique et PyTorch comme principal framework d'entraînement.

from ultralytics import YOLO

# Load the YOLO26n model (nano version for speed)
model = YOLO("yolo26n.pt")

# Run inference on a standard example image
# The model identifies objects and their locations
results = model("https://ultralytics.com/images/bus.jpg")

# Display the resulting image with bounding boxes
results[0].show()

Ce script utilise un modèle pré-entraîné pour effectuer une inférence en quelques lignes. Les équipes passant d'un projet pilote à la production peuvent utiliser la plateforme Ultralytics pour annoter des ensembles de données, entraîner des modèles dans le cloud et gérer le déploiement, ou appliquer l'apprentissage par transfert pour adapter un modèle pré-entraîné à un ensemble de données personnalisé avec beaucoup moins de données étiquetées qu'un entraînement à partir de zéro.

Foire aux questions#

Quelle est la différence entre la vision par ordinateur et l'apprentissage automatique ? L'apprentissage automatique est la discipline plus large qui consiste à construire des systèmes qui apprennent à partir de données. La vision par ordinateur est l'application de cette discipline — généralement via l'apprentissage profond — à des entrées visuelles telles que les images et les vidéos. Presque toute la vision par ordinateur moderne repose sur l'apprentissage automatique, mais l'apprentissage automatique couvre également le texte, l'audio et les données tabulaires.

La vision par ordinateur est-elle la même chose que la reconnaissance d'images ? Non. La reconnaissance d'images est une tâche parmi d'autres dans la vision par ordinateur : elle consiste à identifier ce qui apparaît dans une image. La vision par ordinateur couvre également la détection d'objets, la segmentation, l'estimation de pose, le suivi et la compréhension de scènes.

De combien de données as-tu besoin pour entraîner un modèle de computer vision ? Cela dépend de la complexité de la tâche et des variations que le modèle doit gérer. Le transfer learning à partir d'un modèle pré-entraîné comme Ultralytics YOLO26 réduit considérablement ce besoin, et des détecteurs personnalisés utiles sont souvent entraînés sur quelques centaines à quelques milliers d'images étiquetées par classe plutôt que sur les millions nécessaires pour entraîner des modèles de base.

La vision par ordinateur peut-elle fonctionner sans connexion Internet ? Oui. Les modèles peuvent être déployés directement sur des appareils en périphérie et fonctionner entièrement hors ligne, ce qui est la pratique standard lorsque la latence, la bande passante ou les règles de confidentialité des données interdisent d'envoyer la vidéo vers le cloud.

Quel langage de programmation est utilisé pour la vision par ordinateur ? Python domine, en raison de la maturité de son écosystème — le paquet ultralytics, PyTorch et OpenCV. C++ est utilisé là où des performances d'inférence maximales sont requises, généralement dans les systèmes embarqués et automobiles.

Explore solutions

Real-time AI that works with your team

IA dans la robotique

Équipe tes machines plus intelligentes avec les modèles Ultralytics YOLO. La vision par IA dans la robotique propulse la navigation autonome, la perception, le suivi d'objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans la logistique

Simplifie la logistique avec les modèles Ultralytics YOLO. La vision par IA permet l'inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA alimente le suivi des stocks, la surveillance des étagères, la gestion des files d'attente et des informations plus intelligentes sur les clients.
En savoir plus
Real-time AI that works with your team

IA dans la santé

Construis des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans la santé permet une imagerie médicale plus rapide, des diagnostics plus intelligents et une surveillance des patients.
En savoir plus
Real-time AI that works with your team

IA dans la fabrication

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA favorise le contrôle qualité, la détection des défauts, la conformité aux EPI et l'automatisation des chaînes de montage.
En savoir plus
Real-time AI that works with your operation

IA dans l'automobile

Applique la vision par ordinateur dans l'automobile avec les modèles Ultralytics YOLO. L'IA de vision améliore la sécurité routière, l'assistance à la conduite et l'automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

IA en agriculture

Intègre l'IA de vision à l'agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l'agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Real-time AI that works with your team

IA dans la robotique

Équipe tes machines plus intelligentes avec les modèles Ultralytics YOLO. La vision par IA dans la robotique propulse la navigation autonome, la perception, le suivi d'objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans la logistique

Simplifie la logistique avec les modèles Ultralytics YOLO. La vision par IA permet l'inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA alimente le suivi des stocks, la surveillance des étagères, la gestion des files d'attente et des informations plus intelligentes sur les clients.
En savoir plus
Real-time AI that works with your team

IA dans la santé

Construis des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans la santé permet une imagerie médicale plus rapide, des diagnostics plus intelligents et une surveillance des patients.
En savoir plus
Real-time AI that works with your team

IA dans la fabrication

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA favorise le contrôle qualité, la détection des défauts, la conformité aux EPI et l'automatisation des chaînes de montage.
En savoir plus
Real-time AI that works with your operation

IA dans l'automobile

Applique la vision par ordinateur dans l'automobile avec les modèles Ultralytics YOLO. L'IA de vision améliore la sécurité routière, l'assistance à la conduite et l'automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

IA en agriculture

Intègre l'IA de vision à l'agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l'agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Real-time AI that works with your team

IA dans la robotique

Équipe tes machines plus intelligentes avec les modèles Ultralytics YOLO. La vision par IA dans la robotique propulse la navigation autonome, la perception, le suivi d'objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans la logistique

Simplifie la logistique avec les modèles Ultralytics YOLO. La vision par IA permet l'inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA alimente le suivi des stocks, la surveillance des étagères, la gestion des files d'attente et des informations plus intelligentes sur les clients.
En savoir plus
Real-time AI that works with your team

IA dans la santé

Construis des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans la santé permet une imagerie médicale plus rapide, des diagnostics plus intelligents et une surveillance des patients.
En savoir plus
Real-time AI that works with your team

IA dans la fabrication

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA favorise le contrôle qualité, la détection des défauts, la conformité aux EPI et l'automatisation des chaînes de montage.
En savoir plus
Real-time AI that works with your operation

IA dans l'automobile

Applique la vision par ordinateur dans l'automobile avec les modèles Ultralytics YOLO. L'IA de vision améliore la sécurité routière, l'assistance à la conduite et l'automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

IA en agriculture

Intègre l'IA de vision à l'agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l'agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus

Construisons ensemble le futur de l'IA !

Commence ton aventure avec le futur de l'apprentissage automatique