Exporter Ultralytics YOLO avec LiteRT
Découvre comment la nouvelle intégration d’export LiteRT apporte l’inférence Ultralytics YOLO aux environnements mobiles, embarqués, edge et aux navigateurs dans un format unique et unifié.

Chez Ultralytics, nous constatons une évolution croissante vers l'exécution des modèles de vision par ordinateur directement sur les appareils où ils sont nécessaires, plutôt que de dépendre d'une connexion au cloud. Les applications mobiles, les systèmes embarqués, les capteurs IoT et les outils basés sur un navigateur doivent de plus en plus exécuter l'inférence localement, souvent sur du matériel soumis à des contraintes strictes en matière d'énergie et de puissance de calcul. C'est pourquoi nous sommes ravis d'annoncer que les modèles Ultralytics YOLO peuvent désormais être exportés directement vers LiteRT.
Répondre à cette demande nécessite un format de modèle capable de fonctionner dans tous ces environnements sans obliger les développeurs à gérer des pipelines d'export distincts pour chacun d'eux.
Cette fonctionnalité était déjà disponible via un package tiers non officiel, mais cette nouvelle intégration est le fruit d'une collaboration officielle avec Google. Nous avons travaillé en étroite collaboration avec l'équipe LiteRT pour créer un pipeline de bout en bout permettant d'exporter les modèles Ultralytics YOLO vers TFLite via LiteRT. Grâce à cette intégration, un seul modèle Ultralytics YOLO exporté peut être déployé sur des environnements mobiles, embarqués, edge et des navigateurs, réunissant dans un format rationalisé unique ce que les anciens formats d'export TFLite et TF.js géraient auparavant séparément.
Qu'est-ce que LiteRT ?#
LiteRT (abréviation de Lite Runtime) est le runtime haute performance de Google pour l'IA sur appareil. Il s'agit de la nouvelle génération et du nouveau nom de TensorFlow Lite (TFLite), et il utilise le même format de modèle .tflite que les développeurs connaissent déjà.
LiteRT est un framework open source conçu spécifiquement pour l'inférence sur appareil, également appelée informatique en périphérie. Il fournit aux développeurs les outils nécessaires pour exécuter des modèles entraînés sur des appareils mobiles, embarqués et IoT, des ordinateurs traditionnels et, grâce à LiteRT.js, directement dans les navigateurs web et Node.js. Le format d'export LiteRT optimise les modèles pour des tâches telles que la détection d'objets, la segmentation, l'estimation de pose et la classification, afin qu'ils s'exécutent rapidement et hors ligne sur une large gamme d'appareils.
Pourquoi exporter les modèles Ultralytics YOLO vers LiteRT ?#
Un seul format de modèle couvre désormais toutes les cibles de déploiement :
• Mobile et systèmes embarqués. Android, iOS, Desktop, Linux embarqué et microcontrôleurs (MCU).
• Accélérateurs edge. Compatible avec le Coral Edge TPU pour une accélération supplémentaire.
• Navigateur et Node.js. LiteRT.js exécute le même modèle .tflite sur le web avec l'accélération WebGPU/WASM, ce qui évite d'avoir besoin d'un export TensorFlow.js distinct.
• Desktop
Cette consolidation est importante, car elle élimine une véritable source de friction dans les déploiements en production. Au lieu de gérer un pipeline d'export pour le mobile, un autre pour le navigateur et un troisième pour les accélérateurs edge, les équipes peuvent désormais exporter une seule fois et déployer partout où LiteRT s'exécute.
Fonctionnalités clés des modèles LiteRT#
• Optimisation sur appareil. Réduit la latence en traitant les données localement, renforce la confidentialité en évitant de transmettre les données personnelles et minimise la taille du modèle pour économiser de l'espace.
• Prise en charge de plusieurs plateformes. Fonctionne sur Android, iOS, Linux embarqué, les microcontrôleurs et les navigateurs web modernes.
• Accélération matérielle. Exploite XNNPACK sur CPU et l'accélération GPU via OpenCL, Metal et WebGPU. L'accélération GPU s'exécute par défaut en FP16 pour offrir davantage de rapidité.
• Quantification. Prend en charge FP32, INT8 statique, INT16-activation statique et INT8 dynamique pour compresser les modèles et accélérer l'inférence avec une perte minimale de précision.
• Prise en charge de nombreux langages. Compatible avec Java/Kotlin, Swift, Objective-C, C++, Python et JavaScript.
Démarrer avec l'export LiteRT#
Le package Python Ultralytics et Ultralytics Platform fournissent un environnement complet et unifié pour entraîner, évaluer et déployer des modèles YOLO dans les cinq tâches de vision par ordinateur. Le format d'export LiteRT prend en charge les modes Export, Predict et Validate, de sorte qu'un modèle peut être exporté, puis immédiatement utilisé pour l'inférence ou la validation de la précision localement.
L'export d'un modèle s'effectue avec une seule commande :
from ultralytics import YOLO
# Load a YOLO26 model
model = YOLO("yolo26n.pt")
# Export the model to LiteRT format
model.export(format="litert") # creates 'yolo26n.tflite'Pour les équipes qui déploient leurs modèles sur du matériel aux ressources limitées, LiteRT prend également en charge l'export quantifié, ce qui permet de compresser les modèles pour accélérer l'inférence avec une perte minimale de précision :
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
# Dynamic INT8: int8 weights, FP32 activations - no calibration data needed
model.export(format="litert", quantize="w8a32")
# Static INT8: int8 weights + int8 activations - needs calibration data
model.export(format="litert", quantize=8, data="coco8.yaml")Une fois exporté, le modèle peut être chargé et exécuté directement pour l'inférence :
from ultralytics import YOLO
# Load the exported LiteRT model
model = YOLO("yolo26n.tflite")
# Run inference
results = model("https://ultralytics.com/images/bus.jpg")L'export LiteRT est actuellement pris en charge sur Linux x86_64 et macOS. Le modèle .tflite exporté lui-même fonctionne sur toutes les plateformes compatibles avec LiteRT, notamment les environnements mobiles, embarqués, edge et les navigateurs.
Fig. 1. Comparaison des performances entre ONNX et LiteRT.
L'image ci-dessus présente une comparaison du temps d'inférence moyen pour la détection, la segmentation et l'estimation de pose avec YOLO26n, exécuté dans le navigateur via @ultralytics/yolo, le package npm d'Ultralytics destiné à l'inférence côté client sur WebGPU/WASM via ONNX Runtime Web. Tests réalisés sur un Apple MacBook Pro de 2024 (Apple Silicon M4) dans un environnement de navigateur contrôlé.
Amener Ultralytics YOLO en périphérie#
Avec LiteRT, le déploiement des modèles Ultralytics YOLO sur des environnements mobiles, embarqués, edge et des navigateurs ne nécessite plus de pipelines d'export distincts pour chaque cible. Un export, un format de modèle et un parcours cohérent de l'entraînement à la production, où que l'inférence doive être exécutée.
Tu t'intéresses à l'IA appliquée à la vision ? Découvre nos options de licence pour intégrer la vision par ordinateur à tes projets. Consulte notre dépôt GitHub pour explorer toute la gamme d'intégrations d'export Ultralytics, et découvre Ultralytics Platform pour commencer à créer tes propres workflows de vision par ordinateur de bout en bout.






