Ultralytics YOLO27 :
Vision par IA

Une histoire des modèles de vision

Explore l’histoire, les réalisations, les défis et les orientations futures des modèles de vision.

MOMostafa Ibrahim10 min read
Une histoire des modèles de vision

Qu’est-ce que la vision par ordinateur ?#

Imagine que tu entres dans un magasin où une caméra identifie ton visage, analyse ton humeur et te suggère des produits adaptés à tes préférences, le tout en temps réel. Ce n’est pas de la science-fiction, mais une réalité rendue possible par les modèles de vision modernes. Selon un rapport de Fortune Business Insight, la taille du marché mondial de la vision par ordinateur était évaluée à 20,31 milliards de dollars en 2023 et devrait passer de 25,41 milliards de dollars en 2024 à 175,72 milliards de dollars d’ici 2032, ce qui témoigne des progrès rapides et de l’adoption croissante de cette technologie dans différents secteurs.

Le domaine de la vision par ordinateur permet aux ordinateurs de détecter, d’identifier et d’analyser des objets dans des images. Comme d’autres domaines liés à l’IA, la vision par ordinateur a connu une évolution rapide au cours des dernières décennies, avec des avancées remarquables.

L’histoire de la vision par ordinateur est vaste. À ses débuts, les modèles de vision par ordinateur étaient capables de détecter des formes et des contours simples, souvent limités à des tâches élémentaires comme la reconnaissance de motifs géométriques ou la distinction entre les zones claires et sombres. Aujourd’hui, cependant, les modèles peuvent effectuer des tâches complexes telles que la détection d’objets en temps réel, la reconnaissance faciale et même l’interprétation des émotions à partir des expressions du visage, avec une précision et une efficacité exceptionnelles. Cette progression spectaculaire met en évidence les avancées considérables réalisées en matière de puissance de calcul, de sophistication algorithmique et de disponibilité de vastes quantités de données pour l’entraînement.

Dans cet article, nous allons explorer les principales étapes de l’évolution de la vision par ordinateur. Nous reviendrons sur ses débuts, nous examinerons l’impact transformateur des réseaux neuronaux convolutifs (CNNs), puis nous étudierons les avancées majeures qui ont suivi.

Les débuts de la vision par ordinateur#

Comme dans d’autres domaines de l’IA, les premiers développements de la vision par ordinateur ont commencé par des recherches fondamentales et des travaux théoriques. Une étape importante a été le travail pionnier de Lawrence G. Roberts sur la reconnaissance d’objets en 3D, présenté dans sa thèse « Machine Perception of Three-Dimensional Solids » au début des années 1960. Ses contributions ont posé les bases des avancées futures dans ce domaine.

Les premiers algorithmes : la détection des contours#

Les premières recherches en vision par ordinateur se concentraient sur des techniques de traitement d’images, comme la détection des contours et l’extraction de caractéristiques. Des algorithmes comme l’opérateur de Sobel, développé à la fin des années 1960, figuraient parmi les premiers à détecter les contours en calculant le gradient de l’intensité de l’image.

Une image illustrant la détection des contours

Fig 1. Une image illustrant la détection des contours, où le côté gauche montre l’objet original et le côté droit affiche la version après détection des contours.

Des techniques comme les détecteurs de contours de Sobel et de Canny ont joué un rôle essentiel dans l’identification des limites au sein des images, indispensables pour reconnaître les objets et comprendre les scènes.

L’apprentissage automatique et la vision par ordinateur#

Reconnaissance des motifs#

Dans les années 1970, la reconnaissance des motifs s’est imposée comme un domaine clé de la vision par ordinateur. Les chercheurs ont développé des méthodes pour reconnaître les formes, les textures et les objets dans les images, ouvrant la voie à des tâches de vision plus complexes.

Reconnaissance des motifs

Fig 2. Reconnaissance des motifs.

L’une des premières méthodes de reconnaissance des motifs reposait sur la mise en correspondance de modèles, qui consiste à comparer une image à un ensemble de modèles pour trouver la meilleure correspondance. Cette approche était limitée par sa sensibilité aux variations d’échelle, de rotation et au bruit.

Mise en correspondance d’un modèle dans une image

Fig 3. Un modèle situé à gauche retrouvé dans l’image de droite.

Les premiers systèmes de vision par ordinateur étaient limités par la puissance de calcul réduite de l’époque. Dans les années 1960 et 1970, les ordinateurs étaient volumineux, coûteux et disposaient de capacités de traitement limitées.

Le Deep Learning change la donne#

Deep Learning et réseaux neuronaux convolutifs#

Le deep learning et les réseaux neuronaux convolutifs (CNNs) ont marqué un tournant décisif dans le domaine de la vision par ordinateur. Ces avancées ont profondément transformé la manière dont les ordinateurs interprètent et analysent les données visuelles, en permettant un large éventail d’applications auparavant considérées comme impossibles.

Comment fonctionnent les CNNs ?#

Architecture d’un réseau neuronal convolutif (CNN)

Fig 4. Architecture d’un réseau neuronal convolutif (CNN).

  1. Couches convolutives : les CNNs utilisent des couches convolutives, un type de modèle de deep learning conçu pour traiter des données structurées en grille, comme des images ou des séquences, en apprenant automatiquement des motifs hiérarchiques afin de parcourir une image à l’aide de filtres ou de noyaux. Ces filtres détectent diverses caractéristiques, comme les contours, les textures et les couleurs, en se déplaçant sur l’image et en calculant des produits scalaires. Chaque filtre active des motifs spécifiques dans l’image, ce qui permet au modèle d’apprendre des caractéristiques hiérarchiques.
  2. Fonctions d’activation : après la convolution, des fonctions d’activation comme ReLU (Rectified Linear Unit), une fonction d’activation courante en deep learning qui renvoie directement l’entrée si elle est positive et zéro dans le cas contraire, aident les réseaux neuronaux à apprendre efficacement les relations non linéaires dans les données. Cela permet au réseau d’apprendre des motifs et des représentations complexes.
  3. Couches de pooling : les couches de pooling réalisent une opération de sous-échantillonnage qui réduit la dimensionnalité de la carte de caractéristiques, contribuant à extraire les caractéristiques les plus pertinentes tout en réduisant le coût de calcul et le surapprentissage.
  4. Couches entièrement connectées : les dernières couches d’un CNN sont des couches entièrement connectées qui interprètent les caractéristiques extraites par les couches convolutives et de pooling afin d’effectuer des prédictions. Ces couches sont similaires à celles des réseaux neuronaux traditionnels.

Évolution des modèles de vision CNN#

Le parcours des modèles de vision a été long et riche, avec notamment les modèles les plus remarquables suivants :

  • LeNet (1989) : LeNet était l’une des premières architectures CNN, principalement utilisée pour la reconnaissance des chiffres sur des chèques manuscrits. Son succès a posé les bases de CNNs plus complexes, démontrant le potentiel du deep learning pour le traitement d’images.

  • AlexNet (2012) : AlexNet a largement surpassé les modèles existants lors de la compétition ImageNet, démontrant la puissance du deep learning. Ce modèle utilisait des activations ReLU, du dropout et l’augmentation des données, établissant de nouvelles références en classification d’images et suscitant un vaste intérêt pour les CNNs.

  • VGGNet (2014) : en utilisant des filtres convolutifs plus petits (3x3), VGGNet a obtenu des résultats impressionnants sur les tâches de classification d’images, confirmant l’importance de la profondeur du réseau pour atteindre une meilleure précision.

  • ResNet (2015) : ResNet a résolu le problème de dégradation des réseaux profonds en introduisant l’apprentissage résiduel. Cette innovation a permis d’entraîner des réseaux beaucoup plus profonds, menant à des performances de pointe dans diverses tâches de vision par ordinateur.

  • YOLO (You Only Look Once) : YOLO a révolutionné la détection d’objets en la formulant comme un unique problème de régression, prédisant directement les boîtes englobantes et les probabilités de classe à partir d’images complètes en une seule évaluation. Cette approche a permis une détection d’objets en temps réel avec une vitesse et une précision sans précédent, ce qui la rend adaptée aux applications nécessitant un traitement instantané, comme la conduite autonome et la vidéosurveillance.

Applications de la vision par ordinateur#

Santé#

Les usages de la vision par ordinateur sont nombreux. Par exemple, des modèles de vision comme Ultralytics YOLOv8 sont utilisés en imagerie médicale pour détecter des maladies comme le cancer et la rétinopathie diabétique. Ils analysent les radiographies, les IRM et les scanners avec une grande précision, en identifiant rapidement les anomalies. Cette capacité de détection précoce permet des interventions rapides et améliore les résultats pour les patients.

Détection d’une tumeur cérébrale avec Ultralytics YOLOv8

Fig 5. Détection d’une tumeur cérébrale avec Ultralytics YOLOv8.

Préservation de l’environnement#

Les modèles de vision par ordinateur contribuent à surveiller et à protéger les espèces menacées en analysant les images et les vidéos de leurs habitats naturels. Ils identifient et suivent le comportement des animaux, fournissant des données sur leurs populations et leurs déplacements. Cette technologie guide les stratégies de conservation et les décisions politiques visant à protéger des espèces comme les tigres et les éléphants.

Grâce à l’IA de vision, d’autres menaces environnementales comme les incendies de forêt et la déforestation peuvent être surveillées, ce qui garantit des temps de réaction rapides de la part des autorités locales.

Une image satellite d’un incendie de forêt

Fig 6. Une image satellite d’un incendie de forêt.

Défis et orientations futures#

Même s’ils ont déjà accompli des avancées importantes, les modèles de vision font face à de nombreux défis qui nécessitent des recherches continues et de futurs progrès, en raison de leur complexité extrême et de la nature exigeante de leur développement.

Interprétabilité et explicabilité#

Les modèles de vision, en particulier ceux fondés sur le deep learning, sont souvent considérés comme des « boîtes noires » offrant une transparence limitée. Cela s’explique par leur complexité exceptionnelle. Le manque d’interprétabilité nuit à la confiance et à la responsabilité, notamment dans des applications critiques comme les soins de santé.

Besoins en calcul#

L’entraînement et le déploiement de modèles d’IA de pointe nécessitent d’importantes ressources de calcul. Cela est particulièrement vrai pour les modèles de vision, qui doivent souvent traiter de grandes quantités de données d’images et de vidéos. Les images et vidéos haute définition, qui figurent parmi les entrées d’entraînement les plus gourmandes en données, accroissent la charge de calcul. Par exemple, une seule image HD peut occuper plusieurs mégaoctets de stockage, ce qui rend le processus d’entraînement exigeant en ressources et chronophage.

Cela nécessite un matériel puissant et des algorithmes de vision par ordinateur optimisés pour traiter les grandes quantités de données et les calculs complexes impliqués dans le développement de modèles de vision efficaces. Les recherches sur des architectures plus efficaces, la compression des modèles et les accélérateurs matériels comme les GPUs et les TPUs constituent des axes clés qui feront progresser l’avenir des modèles de vision.

Ces améliorations visent à réduire les besoins en calcul et à accroître l’efficacité du traitement. En outre, l’utilisation de modèles préentraînés avancés comme Ultralytics YOLOv8 peut réduire considérablement le besoin d’un entraînement approfondi, simplifiant le processus de développement et améliorant l’efficacité.

Un domaine en constante évolution#

Aujourd’hui, les applications des modèles de vision sont très répandues, allant des soins de santé, comme la détection de tumeurs, à des usages quotidiens comme la surveillance du trafic. Ces modèles avancés ont favorisé l’innovation dans d’innombrables secteurs en offrant une précision, une efficacité et des capacités améliorées, auparavant inimaginables.

À mesure que la technologie progresse, le potentiel des modèles de vision pour innover et améliorer différents aspects de la vie et de l’industrie reste illimité. Cette évolution continue souligne l’importance de poursuivre la recherche et le développement dans le domaine de la vision par ordinateur.

Tu es curieux de connaître l’avenir de l’IA de vision ? Pour en savoir plus sur les dernières avancées, consulte les Ultralytics Docs et découvre leurs projets sur le GitHub d’Ultralytics et le GitHub de YOLOv8. En outre, pour obtenir des informations sur les applications de l’IA dans différents secteurs, les pages de solutions consacrées aux voitures autonomes et à la fabrication proposent des informations particulièrement utiles.

Explore solutions

Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus

Construisons ensemble l'avenir de l'IA !

Commence ton parcours vers l'avenir de l'apprentissage automatique