Propulser les projets de CV grâce aux outils open source de Hugging Face
Reviens avec nous sur une conférence principale de YOLO Vision 2024 consacrée à la manière dont les outils open source de Hugging Face font progresser le développement de l’IA.

Choisir les bons algorithmes n’est qu’une partie de la création de solutions de vision par ordinateur efficaces. Les ingénieurs en IA travaillent souvent avec de grands jeux de données, ajustent finement les modèles pour des tâches spécifiques et optimisent les systèmes d’IA pour obtenir des performances adaptées aux conditions réelles. À mesure que les applications d’IA sont adoptées plus rapidement, le besoin d’outils simplifiant ces processus augmente également.
Lors de YOLO Vision 2024 (YV24), l’événement hybride annuel organisé par Ultralytics, des experts en IA et des passionnés de technologie se sont réunis pour découvrir les dernières innovations en vision par ordinateur. L’événement a suscité des discussions sur divers sujets, notamment les moyens d’accélérer le développement d’applications d’IA.
L’un des moments forts de l’événement a été une conférence sur Hugging Face, une plateforme d’IA open source qui simplifie l’entraînement, l’optimisation et le déploiement des modèles. Pavel Iakubovskii, ingénieur en apprentissage automatique chez Hugging Face, a expliqué comment ses outils améliorent les workflows pour des tâches de vision par ordinateur telles que la détection d’objets dans des images, le classement des images en différents groupes et la réalisation de prédictions sans entraînement préalable sur des exemples spécifiques (apprentissage zero-shot).
Hugging Face Hub héberge et fournit un accès à divers modèles d’IA et de vision par ordinateur, comme Ultralytics YOLO11. Dans cet article, nous récapitulerons les principaux enseignements de l’intervention de Pavel et verrons comment les développeurs peuvent utiliser les outils open source de Hugging Face pour créer et déployer rapidement des modèles d’IA.

Fig. 1. Pavel sur scène lors de YV24.
Hugging Face Hub accélère le développement de l’IA#
Pavel a commencé son intervention en présentant Hugging Face comme une plateforme d’IA open source proposant des modèles préentraînés pour diverses applications. Ces modèles sont conçus pour différents domaines de l’IA, notamment le traitement du langage naturel (NLP), la vision par ordinateur et l’IA multimodale, ce qui permet aux systèmes de traiter différents types de données, comme du texte, des images et de l’audio.
Pavel a indiqué que Hugging Face Hub héberge désormais plus d’un million de modèles et que les développeurs peuvent facilement trouver ceux qui correspondent à leurs projets spécifiques. Hugging Face cherche à simplifier le développement de l’IA en proposant des outils pour l’entraînement, l’ajustement fin et le déploiement des modèles. Lorsque les développeurs peuvent expérimenter avec différents modèles, le processus d’intégration de l’IA dans des applications concrètes est simplifié.
Alors que Hugging Face était initialement connu pour le NLP, la plateforme s’est depuis étendue à la vision par ordinateur et à l’IA multimodale, permettant aux développeurs de s’attaquer à un éventail plus large de tâches d’IA. Elle dispose également d’une communauté active au sein de laquelle les développeurs peuvent collaborer, partager leurs connaissances et obtenir de l’aide via les forums, Discord et GitHub.
Découvrir les modèles Hugging Face pour les applications de vision par ordinateur#
En entrant davantage dans les détails, Pavel a expliqué comment les outils de Hugging Face facilitent la création d’applications de vision par ordinateur. Les développeurs peuvent les utiliser pour des tâches comme la classification d’images, la détection d’objets et les applications associant vision et langage.
Il a également souligné que nombre de ces tâches de vision par ordinateur peuvent être réalisées avec des modèles préentraînés disponibles sur Hugging Face Hub, ce qui fait gagner du temps en réduisant la nécessité d’entraîner les modèles à partir de zéro. En fait, Hugging Face propose plus de 13 000 modèles préentraînés pour les tâches de classification d’images, notamment des modèles pour la classification d’aliments, la classification d’animaux de compagnie et la détection des émotions.
Soulignant l’accessibilité de ces modèles, il a déclaré : « Vous n’aurez probablement même pas besoin d’entraîner un modèle pour votre projet : vous pourrez peut-être en trouver un sur le Hub qui a déjà été entraîné par un membre de la communauté. »
Modèles Hugging Face pour la détection d’objets#
Donnant un autre exemple, Pavel a expliqué comment Hugging Face peut aider à la détection d’objets, une fonction essentielle de la vision par ordinateur utilisée pour identifier et localiser des objets dans des images. Même avec une quantité limitée de données annotées, les modèles préentraînés disponibles sur Hugging Face Hub peuvent rendre la détection d’objets plus efficace.
Il a également présenté brièvement plusieurs modèles conçus pour cette tâche et disponibles sur Hugging Face :
- Modèles de détection d’objets en temps réel : dans les environnements dynamiques où la rapidité est essentielle, des modèles comme le Transformer de détection (DETR) offrent des capacités de détection d’objets en temps réel. DETR est entraîné sur le jeu de données COCO et conçu pour traiter efficacement des caractéristiques multi-échelles, ce qui le rend adapté aux applications sensibles au facteur temps.
- Modèles associant vision et langage : ces modèles combinent le traitement des images et du texte, permettant aux systèmes d’IA d’associer des images à des descriptions ou de reconnaître des objets qui ne faisaient pas partie de leurs données d’entraînement. Parmi les exemples figurent CLIP et SigLIP, qui améliorent la recherche d’images en reliant le texte aux éléments visuels et permettent aux solutions d’IA d’identifier de nouveaux objets en comprenant leur contexte.
- Modèles de détection d’objets zero-shot : ils peuvent identifier des objets qu’ils n’ont jamais vus en comprenant la relation entre les images et le texte. Parmi les exemples figurent OwlVit, GroundingDINO et OmDet, qui utilisent l’apprentissage zero-shot pour détecter de nouveaux objets sans données d’entraînement annotées.
Comment utiliser les modèles Hugging Face#
Pavel s’est ensuite intéressé à l’utilisation pratique des modèles Hugging Face, en expliquant trois façons dont les développeurs peuvent les exploiter : explorer les modèles, les tester rapidement et les personnaliser davantage.
Il a montré comment les développeurs peuvent parcourir directement les modèles sur Hugging Face Hub sans écrire de code, ce qui permet de les tester instantanément via une interface interactive. « Vous pouvez l’essayer sans écrire la moindre ligne de code ni télécharger le modèle sur votre ordinateur », a ajouté Pavel. Comme certains modèles sont volumineux, les exécuter sur le Hub permet d’éviter les limitations de stockage et de traitement.

Fig. 2. Comment utiliser les modèles Hugging Face.
Par ailleurs, l’API d’inférence de Hugging Face permet aux développeurs d’exécuter des modèles d’IA à l’aide de simples appels API. Elle est idéale pour les tests rapides, les projets de validation de concept et le prototypage rapide, sans configuration complexe.
Pour les cas d’utilisation plus avancés, les développeurs peuvent utiliser le framework Hugging Face Transformers, un outil open source qui fournit des modèles préentraînés pour des tâches liées au texte, à la vision et à l’audio, tout en prenant en charge PyTorch et TensorFlow. Pavel a expliqué qu’avec seulement deux lignes de code, les développeurs peuvent récupérer un modèle depuis Hugging Face Hub et le relier à un outil de prétraitement, comme un processeur d’images, afin d’analyser des données d’image pour des applications de vision par IA.
Optimiser les workflows d’IA avec Hugging Face#
Pavel a ensuite expliqué comment Hugging Face peut simplifier les workflows d’IA. L’un des principaux sujets abordés était l’optimisation du mécanisme d’attention dans les Transformers, une fonctionnalité centrale des modèles d’apprentissage profond qui les aide à se concentrer sur les parties les plus pertinentes des données d’entrée. Cela améliore la précision des tâches de traitement du langage et de vision par ordinateur. Cependant, ce mécanisme peut être gourmand en ressources.
L’optimisation du mécanisme d’attention peut réduire considérablement l’utilisation de la mémoire tout en améliorant la vitesse. Pavel a souligné : « Par exemple, en adoptant une implémentation de l’attention plus efficace, vous pourriez obtenir des performances jusqu’à 1,8 fois supérieures. »
Hugging Face fournit une prise en charge intégrée d’implémentations plus efficaces de l’attention dans le framework Transformers. Les développeurs peuvent activer ces optimisations en spécifiant simplement une autre implémentation de l’attention lors du chargement d’un modèle.
Optimum et Torch Compile#
Il a également parlé de la quantification, une technique qui réduit la taille des modèles d’IA en diminuant la précision des nombres qu’ils utilisent, sans trop affecter leurs performances. Les modèles utilisent ainsi moins de mémoire et s’exécutent plus rapidement, ce qui les rend mieux adaptés aux appareils disposant d’une puissance de traitement limitée, comme les smartphones et les systèmes embarqués.
Pour améliorer davantage l’efficacité, Pavel a présenté la bibliothèque Hugging Face Optimum, un ensemble d’outils conçus pour optimiser et déployer les modèles. En seulement quelques lignes de code, les développeurs peuvent appliquer des techniques de quantification et convertir les modèles dans des formats efficaces comme ONNX (échange de réseaux neuronaux ouverts), ce qui leur permet de fonctionner correctement sur différents types de matériel, notamment les serveurs cloud et les appareils edge.

Fig. 3. Pavel a présenté la bibliothèque Optimum et ses fonctionnalités.
Enfin, Pavel a mentionné les avantages de Torch Compile, une fonctionnalité de PyTorch qui optimise la manière dont les modèles d’IA traitent les données afin de les rendre plus rapides et plus efficaces. Hugging Face intègre Torch Compile à ses bibliothèques Transformers et Optimum, permettant aux développeurs de profiter de ces améliorations de performances avec un minimum de modifications du code.
En optimisant la structure de calcul du modèle, Torch Compile peut accélérer les temps d’inférence et augmenter la fréquence d’images de 29 à 150 images par seconde sans compromettre la précision ni la qualité.
Déployer des modèles avec les outils Hugging Face#
Pavel a ensuite brièvement abordé la manière dont les développeurs peuvent étendre et déployer des modèles de vision par IA à l’aide des outils Hugging Face, après avoir sélectionné le bon modèle et choisi la meilleure approche de développement.
Par exemple, les développeurs peuvent déployer des applications d’IA interactives avec Gradio et Streamlit. Gradio permet de créer des interfaces web pour les modèles d’apprentissage automatique, tandis que Streamlit aide à créer des applications de données interactives à l’aide de simples scripts Python.
Pavel a également souligné : « Vous n’avez pas besoin de tout commencer à écrire à partir de zéro », en faisant référence aux guides, notebooks d’entraînement et scripts d’exemple fournis par Hugging Face. Ces ressources permettent aux développeurs de démarrer rapidement sans devoir tout construire depuis le début.

Fig. 4. Pavel discutant des capacités de Hugging Face lors de YV24.
Avantages de Hugging Face Hub#
Pour conclure sa conférence, Pavel a résumé les avantages de l’utilisation de Hugging Face Hub. Il a insisté sur la manière dont la plateforme simplifie la gestion et la collaboration autour des modèles. Il a également attiré l’attention sur la disponibilité de guides, de notebooks et de tutoriels, qui peuvent aider les débutants comme les experts à comprendre et à mettre en œuvre des modèles d’IA.
« Il existe déjà de nombreux espaces intéressants sur le Hub. Vous pouvez en trouver de similaires, cloner le code partagé, modifier quelques lignes, remplacer le modèle par le vôtre et le republier », a-t-il expliqué, encourageant les développeurs à tirer parti de la flexibilité de la plateforme.
Points clés à retenir#
Lors de son intervention à YV24, Pavel a expliqué comment Hugging Face fournit des outils qui prennent en charge l’entraînement, l’optimisation et le déploiement des modèles d’IA. Par exemple, des innovations comme Transformers, Optimum et Torch Compile peuvent aider les développeurs à améliorer les performances des modèles.
À mesure que les modèles d’IA deviennent plus efficaces, les progrès de la quantification et du déploiement edge facilitent leur exécution sur des appareils aux ressources limitées. Ces améliorations, combinées à des outils comme Hugging Face et à des modèles avancés de vision par ordinateur comme Ultralytics YOLO11, sont essentielles pour créer des applications de vision par IA évolutives et performantes.
Rejoins notre communauté grandissante ! Explore notre dépôt GitHub pour en apprendre davantage sur l’IA, et consulte nos licences YOLO pour commencer tes projets de vision par IA. Tu t’intéresses à des innovations comme la vision par ordinateur dans le domaine de la santé ou la vision par ordinateur dans l’agriculture ? Consulte nos pages de solutions pour en découvrir davantage !









