Propulser la vision par ordinateur open source avec les transformers de Hugging Face
Plonge dans la vision par ordinateur open source avec Hugging Face ! Découvre l’apprentissage par transfert et les transformers, puis explore plus de 8 000 modèles. Rejoins Merve Noyan pour découvrir des informations clés et des démonstrations pratiques qui aideront les développeurs à innover dans l’exploration de l’AI.

Alors que nous continuons à explorer les temps forts de l’événement YOLO VISION 2023 (YV23), faisons connaissance avec Merve Noyan, ingénieure en relations avec les développeurs chez Hugging Face, la principale plateforme de NLP proposant des modèles pré-entraînés pour le développement efficace d’applications linguistiques. Lors de son intervention, Merve a partagé des informations remarquables sur l’univers de la vision par ordinateur open source.
Rejoins-nous pour un voyage à travers l’univers fascinant de l’apprentissage par transfert, des transformers et de l’écosystème open source de la vision par ordinateur.
L’apprentissage par transfert dévoilé : un bref rappel#
Merve a commencé par une rapide introduction à l’apprentissage par transfert, cette baguette magique qui nous permet de transférer les connaissances d’un réseau neuronal à un autre. Imagine que tu entraînes un modèle sur les caractéristiques universelles des premières couches, comme les contours et les angles, puis que tu l’affines pour des tâches spécifiques. C’est l’essence de l’apprentissage par transfert : réduire la dépendance aux données et améliorer la précision.
Merve a présenté des architectures convolutives classiques comme ResNet et Inception, ouvrant la voie au parcours transformationnel à venir.
Place aux transformers : une énigme dévoilée#
Qu’est-ce qui rend les Transformers si particuliers ? Merve les a comparés à une énigme, en montrant en quoi ils diffèrent des modèles traditionnels fondés sur les convolutions. Leur secret réside dans leur capacité à effectuer un apprentissage auto-supervisé et à extraire des caractéristiques sans données annotées. Vision Transformer, Data Efficient Transformer, CLIP et Swin Transformer figuraient parmi les modèles stars fondés sur les transformers qu’elle a présentés.
Établissons quelques bases communes avec Ultralytics, qui fournit un modèle transformer conçu pour la détection d’objets. Ce modèle dispose d’un encodeur hybride efficace, d’une sélection de requêtes prenant en compte l’IOU et d’une vitesse d’inférence ajustable. Il suit notamment le schéma familier des autres modèles Ultralytics YOLOv8, avec des options de prédiction, d’entraînement, de validation et d’exportation.
Tout-en-un#
Merve s’est ensuite plongée dans le trésor d’offres de Hugging Face, avec plus de 8 000 modèles pour les tâches classiques de vision par ordinateur et 10 000 modèles pour les applications multimodales. Le Hub de Hugging Face propose plus de 3 000 jeux de données, ce qui en fait un terrain de jeu pour les développeurs comme pour les passionnés. Merve a souligné la fluidité de l’expérience, rendue possible par l’API cohérente de Hugging Face, qui propose des modèles prêts à l’emploi pour différents cas d’usage.
La magie pratique avec Hugging Face#
L’intervention s’est poursuivie avec des démonstrations pratiques montrant à quel point il est facile de travailler avec des modèles. De l’instanciation des modèles et des processeurs à l’affinage avec la Trainer API, Merve a clairement montré que la bibliothèque Hugging Face Transformers est la meilleure alliée des développeurs. Elle a également présenté la Pipeline API, l’une de ses préférées, qui simplifie le flux de travail des utilisateurs.

Fig. 1. Merve Noyan présentant son intervention lors de YV23 au Google for Startups Campus de Madrid.
Un aperçu des applications#
Merve a conclu son intervention en présentant quelques applications remarquables, notamment le modèle Plot pour la réponse visuelle aux questions, Blip pour le sous-titrage d’images et le puissant modèle Segment Anything pour la segmentation d’images. La Pipeline API de l’écosystème Hugging Face a occupé le devant de la scène, facilitant l’utilisation des modèles sans avoir à plonger dans les détails techniques.
La cerise sur le gâteau a été la démonstration par Merve de la création d’illusions d’optique avec Elysian Diffusion, une expérience captivante qui apporte une touche ludique à l’univers de l’IA.
En bref !#
En conclusion, l’intervention de Merve nous a inspirés et donné envie d’explorer les possibilités infinies de la vision par ordinateur open source. Hugging Face a véritablement rendu l’IA accessible, ludique et passionnante, en permettant aux développeurs de libérer leur créativité. Vive l’avenir de la communauté open source et les incroyables innovations qu’elle nous réserve !
Regarde l’intégralité de l’intervention de Hugging Face sur la vision par ordinateur !






