L'IA générative transforme l'avenir de la vision par ordinateur
Découvre des informations intéressantes issues d'une table ronde de YOLO Vision 2024. Explore comment l'IA générative façonne l'avenir des modèles de vision IA en temps réel.

L’IA générative est une branche de l’intelligence artificielle (AI) qui crée de nouveaux contenus, comme des images, du texte ou de l’audio, en apprenant les schémas à partir de données existantes. Grâce aux avancées récentes, elle peut désormais produire des contenus très réalistes qui imitent souvent la créativité humaine.
Cependant, l’impact de l’IA générative va au-delà de la simple création de contenu. Alors que les modèles de vision par ordinateur en temps réel, comme les modèles Ultralytics YOLO, continuent d’évoluer, l’IA générative redéfinit également la manière dont les données visuelles sont traitées et enrichies, ouvrant la voie à des applications innovantes dans des scénarios réels.
Cette nouvelle évolution technologique a constitué un sujet de discussion intéressant lors de YOLO Vision 2024 (YV24), un événement hybride annuel organisé par Ultralytics. YV24 a réuni des passionnés d’IA et des leaders du secteur pour discuter des dernières avancées en vision par ordinateur. L’événement était axé sur l’innovation, l’efficacité et l’avenir des solutions d’IA en temps réel.
L’un des temps forts de l’événement a été une table ronde sur YOLO à l’ère de l’IA générative. La table ronde réunissait Glenn Jocher, fondateur et PDG d’Ultralytics, Jing Qiu, ingénieur senior en apprentissage automatique chez Ultralytics, et Ao Wang de l’université Tsinghua. Ils ont étudié l’influence de l’IA générative sur la vision par ordinateur ainsi que les défis liés à la création de modèles d’IA pratiques.
Dans cet article, nous reviendrons sur les principaux enseignements de leur discussion et examinerons de plus près comment l’IA générative transforme la Vision AI.
Développer les modèles Ultralytics YOLO#
Aux côtés de Glenn Jocher, de nombreux ingénieurs talentueux ont joué un rôle essentiel dans le développement des modèles Ultralytics YOLO. Jing Qiu est l’un d’eux. Il a raconté ses débuts inattendus avec YOLO. Il a expliqué que sa passion pour l’IA avait commencé pendant ses études universitaires. Il a consacré beaucoup de temps à explorer ce domaine et à se former. Jing Qiu a raconté comment il avait rencontré Glenn Jocher sur GitHub et participé à divers projets d’IA.
En complément des propos de Jing Qiu, Glenn Jocher a décrit GitHub comme « un moyen incroyable de partager : des personnes que vous n’avez jamais rencontrées se réunissent pour s’entraider et contribuer au travail des autres. C’est une excellente communauté et une très bonne façon de débuter dans l’IA. »

Fig. 1. Glenn Jocher et Jing Qiu s’exprimant sur scène lors de YV24.
L’intérêt de Jing Qiu pour l’IA et son travail sur Ultralytics YOLOv5 ont contribué à perfectionner le modèle. Plus tard, il a joué un rôle clé dans le développement de Ultralytics YOLOv8, qui a apporté d’autres améliorations. Il a décrit cette expérience comme un parcours incroyable. Aujourd’hui, Jing Qiu continue d’améliorer et de développer des modèles comme Ultralytics YOLO11.
YOLOv10 : optimisé pour les performances en conditions réelles#
Participant à distance à la table ronde depuis la Chine, Ao Wang s’est présenté comme doctorant. Il avait d’abord étudié le génie logiciel, mais sa passion pour l’IA l’a conduit à se tourner vers la vision par ordinateur et l’apprentissage profond.
Il a découvert le célèbre modèle YOLO alors qu’il expérimentait différentes techniques et différents modèles d’IA. Il a été impressionné par sa vitesse et sa précision, ce qui l’a incité à approfondir des tâches de vision par ordinateur comme la détection d’objets. Récemment, Ao Wang a contribué à YOLOv10, une version récente du modèle YOLO. Ses recherches se sont concentrées sur l’optimisation du modèle afin de le rendre plus rapide et plus précis.
La différence essentielle entre l’IA générative et la Vision AI#
La table ronde s’est ensuite intéressée à l’IA générative, et Jing Qiu a souligné que l’IA générative et la Vision AI avaient des objectifs très différents. L’IA générative crée ou génère des éléments comme du texte, des images et des vidéos, tandis que la Vision AI analyse ce qui existe déjà, principalement des images.
Glenn Jocher a également souligné que la taille constituait une différence importante. Les modèles d’IA générative sont gigantesques et contiennent souvent des milliards de paramètres, c’est-à-dire des réglages internes qui aident le modèle à apprendre à partir des données. Les modèles de vision par ordinateur sont beaucoup plus petits. Il a déclaré : « Le plus petit modèle YOLO que nous ayons est environ mille fois plus petit que le plus petit LLM [grand modèle de langage]. Cela représente donc 3 millions de paramètres contre trois milliards. »

Fig. 2. La discussion de la table ronde sur l’IA générative et la Vision AI lors de YV24.
Jing Qiu a ajouté que les processus d’entraînement et de déploiement de l’IA générative et de la vision par ordinateur étaient également très différents. L’IA générative a besoin de serveurs très puissants et dotés de grandes capacités pour fonctionner. Les modèles comme YOLO, en revanche, sont conçus pour être efficaces et peuvent être entraînés et déployés sur du matériel standard. Cela rend les modèles Ultralytics YOLO plus pratiques pour une utilisation en conditions réelles.
Même si ces domaines sont différents, ils commencent à s’entrecroiser. Glenn Jocher a expliqué que l’IA générative apportait de nouvelles avancées à la Vision AI, rendant les modèles plus intelligents et plus efficaces.
L’impact de l’IA générative sur la vision par ordinateur#
L’IA générative a progressé rapidement, et ces avancées influencent de nombreux autres domaines de l’intelligence artificielle, notamment la vision par ordinateur. Examinons maintenant quelques réflexions fascinantes de la table ronde à ce sujet.
Les avancées matérielles favorisent les innovations en IA#
Au début de la table ronde, Glenn Jocher a expliqué que les concepts de l’apprentissage automatique existaient depuis longtemps, mais que les ordinateurs n’étaient pas suffisamment puissants pour les mettre en œuvre. Les idées liées à l’IA avaient besoin d’un matériel plus performant pour devenir réalité.
L’essor des GPU (unités de traitement graphique) au cours des 20 dernières années, grâce à leurs capacités de traitement parallèle, a tout changé. Ils ont rendu l’entraînement des modèles d’IA beaucoup plus rapide et efficace, permettant à l’apprentissage profond de se développer à un rythme soutenu.
De nos jours, les puces d’IA comme les TPU (unités de traitement tensoriel) et les GPU optimisés consomment moins d’énergie tout en gérant des modèles plus volumineux et plus complexes. L’IA est ainsi devenue plus accessible et plus utile dans les applications concrètes.
À chaque nouvelle amélioration matérielle, les applications d’IA générative et de vision par ordinateur deviennent plus puissantes. Ces avancées rendent l’IA en temps réel plus rapide, plus efficace et prête à être utilisée dans davantage de secteurs.
Comment l’IA générative façonne les modèles de détection d’objets#
Interrogé sur l’influence de l’IA générative sur la vision par ordinateur, Jing Qiu a expliqué que les Transformers, des modèles qui aident l’IA à se concentrer sur les parties les plus importantes d’une image, avaient changé la manière dont l’IA comprend et traite les images. La première avancée majeure a été DETR (Transformer de détection), qui a utilisé cette nouvelle approche pour la détection d’objets. Elle a amélioré la précision, mais présentait des problèmes de performances qui la rendaient plus lente dans certains cas.
Pour résoudre ce problème, les chercheurs ont créé des modèles hybrides comme RT-DETR. Ces modèles combinent des réseaux neuronaux convolutionnels (CNNs, des modèles d’apprentissage profond qui apprennent et extraient automatiquement les caractéristiques des images) et des Transformers, afin d’équilibrer vitesse et précision. Cette approche tire parti des avantages des Transformers tout en accélérant la détection d’objets.
Fait intéressant, YOLOv10 utilise des couches d’attention fondées sur les Transformers, c’est-à-dire des parties du modèle qui fonctionnent comme un projecteur pour mettre en évidence les zones les plus importantes d’une image tout en ignorant les détails moins pertinents, afin d’améliorer ses performances.
Ao Wang a également expliqué comment l’IA générative transformait la manière dont les modèles sont entraînés. Des techniques comme la modélisation d’images masquées aident l’IA à apprendre plus efficacement à partir des images, réduisant le besoin de jeux de données volumineux annotés manuellement. Cela rend l’entraînement en vision par ordinateur plus rapide et moins gourmand en ressources.
L’avenir de l’IA générative et de la Vision AI#
Une autre idée clé abordée par la table ronde concernait la manière dont l’IA générative et la Vision AI pourraient se réunir pour créer des modèles plus performants. Glenn Jocher a expliqué que, bien que ces deux approches aient des points forts différents, leur combinaison pourrait ouvrir de nouvelles possibilités.
Par exemple, les modèles de Vision AI comme YOLO découpent souvent une image en grille pour identifier les objets. Cette méthode fondée sur une grille pourrait aider les modèles de langage à améliorer leur capacité à repérer les détails et à les décrire, un défi auquel de nombreux modèles de langage sont confrontés aujourd’hui. En définitive, la fusion de ces techniques pourrait donner naissance à des systèmes capables de détecter avec précision ce qu’ils voient et de l’expliquer clairement.

Fig. 3. L’avenir de l’IA générative et de la Vision AI. Image réalisée par l’auteur.
Points clés à retenir#
L’IA générative et la vision par ordinateur progressent ensemble. Si l’IA générative crée des images et des vidéos, elle améliore également l’analyse des images et des vidéos en apportant de nouvelles idées innovantes qui pourraient rendre les modèles de Vision AI plus précis et plus efficaces.
Lors de cette table ronde enrichissante de YV24, Glenn Jocher, Jing Qiu et Ao Wang ont partagé leurs réflexions sur la manière dont ces technologies façonnent l’avenir. Grâce à un matériel d’IA plus performant, l’IA générative et la Vision AI continueront d’évoluer, donnant lieu à des innovations toujours plus importantes. Ces deux domaines travaillent ensemble pour créer une IA plus intelligente, plus rapide et plus utile au quotidien.
Rejoins notre communauté et explore notre dépôt GitHub pour en savoir plus sur la Vision AI. Consulte nos options de licence pour démarrer tes projets de vision par ordinateur. Tu t’intéresses à des innovations comme l’IA dans l’industrie ou la vision par ordinateur pour les véhicules autonomes ? Consulte nos pages dédiées aux solutions pour en découvrir davantage.









