Neural Processing Unit (NPU)
Découvre comment une unité de traitement neuronal (NPU) accélère l’IA. Apprends à déployer Ultralytics YOLO26 sur des NPU pour une informatique et une inférence en périphérie efficaces et peu énergivores.
Une unité de traitement neuronal (NPU) est un circuit matériel spécialisé conçu spécifiquement pour accélérer l’exécution des algorithmes d’intelligence artificielle et d’apprentissage automatique. Contrairement aux processeurs polyvalents, les NPU sont conçues avec une architecture qui gère nativement les opérations matricielles complexes et parallèles au cœur des modèles d’apprentissage profond. En exécutant ces calculs avec une efficacité extrême, une NPU réduit considérablement la consommation d’énergie tout en améliorant significativement la latence d’inférence. Cela en fait un composant essentiel des téléphones mobiles, ordinateurs portables et appareils IoT spécialisés modernes, pour lesquels il est essentiel de déployer efficacement des modèles complexes sans épuiser rapidement la batterie.
NPU par rapport aux autres processeurs#
Pour comprendre l’intérêt d’une NPU, il est utile de la distinguer des autres accélérateurs matériels courants dans le domaine de l’IA :
- Unité centrale de traitement (CPU) : Le « cerveau » polyvalent d’un ordinateur. Bien que les CPU soient capables d’exécuter du code d’apprentissage automatique, ils traitent les tâches séquentiellement, ce qui les rend lents et inefficaces pour les multiplications matricielles intensives requises par les modèles modernes de vision.
- Unité de traitement graphique (GPU) : Conçus pour le traitement parallèle, les GPU excellent dans la gestion de charges de travail massives d’apprentissage profond. Cependant, ils consomment beaucoup d’énergie et génèrent une chaleur considérable, ce qui les rend plus adaptés à l’entraînement dans le cloud qu’à l’informatique en périphérie alimentée par batterie.
- Unité de traitement tensoriel (TPU) : Un circuit intégré spécifique à une application développé par Google pour l’apprentissage automatique. Bien que similaires dans leur concept aux NPU, les TPU sont généralement associés aux vastes baies de serveurs d’informatique en nuage, tandis que les NPU sont généralement intégrées directement aux systèmes sur puce (SoCs) grand public.
Applications concrètes des NPU#
L’essor des NPU a permis d’exécuter l’intelligence artificielle (AI) directement sur les appareils des utilisateurs sans dépendre d’une connexion permanente au cloud.
- Smartphones et vision mobile : Les appareils mobiles modernes exploitent largement leurs NPU internes, comme l’Apple Neural Engine ou le Qualcomm Hexagon NPU, pour la photographie computationnelle, la reconnaissance faciale en temps réel et la traduction locale de textes. En traitant les données d’image sur l’appareil, ils préservent l’autonomie de la batterie et garantissent la confidentialité des données.
- Ordinateurs portables dotés de l’IA : Les processeurs PC avancés intègrent désormais des NPU pour gérer des tâches en arrière-plan telles que le floutage de l’arrière-plan et la correction du regard pendant les visioconférences, sans solliciter le CPU principal, ce qui permet aux utilisateurs d’effectuer plusieurs tâches simultanément de manière fluide.
- Déploiements d’IA en périphérie : Les caméras de surveillance intelligentes et les systèmes robotiques utilisent des NPU spécialisées, telles que la Google Coral Edge TPU ou le matériel Intel intégré, pour effectuer la détection d’objets instantanément, directement à la source. Cela élimine les goulots d’étranglement liés à la bande passante et permet de prendre des décisions en une fraction de seconde.
Utiliser les NPU avec Ultralytics YOLO#
Pour les développeurs qui souhaitent exploiter les NPU, le déploiement de modèles de vision par ordinateur est devenu extrêmement simple. Avec le puissant modèle Ultralytics YOLO26, tu peux exporter ton réseau entraîné dans des formats optimisés pour différents accélérateurs matériels. Pour simplifier l’ensemble de ce cycle de vie, l’Ultralytics Platform fournit des outils robustes pour la gestion des jeux de données dans le cloud, l’annotation automatisée et le déploiement de modèles optimisés dans pratiquement n’importe quel environnement de déploiement de modèles.
Lorsque tu travailles en local, tu peux utiliser des intégrations de frameworks comme ONNX Runtime, PyTorch ExecuTorch ou TensorFlow Lite pour cibler la NPU. Voici un exemple rapide en Python montrant comment exporter un modèle YOLO au format OpenVINO, qui délègue de manière transparente les charges de calcul aux NPU Intel afin d’accélérer l’inférence en temps réel.
from ultralytics import YOLO
# Load the highly recommended Ultralytics YOLO26 Nano model
model = YOLO("yolo26n.pt")
# Export to OpenVINO with int8 quantization for optimal NPU performance
model.export(format="openvino", int8=True)
# Run highly efficient, accelerated inference on the edge device
results = model("path/to/environment_image.jpg")





