Esportare Ultralytics YOLO su LiteRT
Scopri come la nuova integrazione di esportazione LiteRT porta l'inferenza di Ultralytics YOLO su ambienti mobile, embedded, edge e browser in un unico formato unificato.

Noi di Ultralytics stiamo assistendo a un crescente passaggio all'esecuzione dei modelli di computer vision direttamente sui dispositivi in cui sono necessari, invece di fare affidamento su una connessione al cloud. Le app mobili, i sistemi embedded, i sensori IoT e gli strumenti basati sul browser devono sempre più spesso eseguire l'inferenza localmente, spesso su hardware con risorse energetiche e di calcolo limitate. Ecco perché siamo entusiasti di annunciare che i modelli Ultralytics YOLO possono ora essere esportati direttamente in LiteRT.
Soddisfare questa esigenza richiede un formato per modelli che funzioni in tutti questi ambienti senza costringere gli sviluppatori a mantenere pipeline di esportazione separate per ciascuno di essi.
Questa funzionalità era già disponibile tramite un pacchetto di terze parti non ufficiale, ma questa nuova integrazione è il risultato della collaborazione ufficiale con Google. Abbiamo lavorato a stretto contatto con il team di LiteRT per creare una pipeline end-to-end per esportare i modelli Ultralytics YOLO in TFLite tramite LiteRT. Con questa integrazione, un singolo modello Ultralytics YOLO esportato può essere distribuito in ambienti mobili, embedded, edge e browser, unificando in un unico formato ottimizzato ciò che i precedenti formati di esportazione TFLite e TF.js gestivano separatamente.
Che cos'è LiteRT?#
LiteRT (abbreviazione di Lite Runtime) è il runtime ad alte prestazioni di Google per l'AI on-device. È la generazione successiva e il nuovo nome di TensorFlow Lite (TFLite) e utilizza lo stesso formato di modello .tflite che gli sviluppatori già conoscono.
LiteRT è un framework open source progettato specificamente per l'inferenza on-device, nota anche come edge computing. Fornisce agli sviluppatori gli strumenti per eseguire modelli addestrati su dispositivi mobili, embedded e IoT, computer tradizionali e, tramite LiteRT.js, direttamente nei browser web e in Node.js. Il formato di esportazione LiteRT ottimizza i modelli per attività come il rilevamento degli oggetti, la segmentazione, la stima della posa e la classificazione, consentendo loro di funzionare rapidamente e offline su un'ampia gamma di dispositivi.
Perché esportare i modelli Ultralytics YOLO in LiteRT?#
Un unico formato per modelli copre ora ogni destinazione di deployment:
• Dispositivi mobili ed embedded. Android, iOS, desktop, Linux embedded e microcontrollori (MCU).
• Acceleratori edge. Compatibile con Coral Edge TPU per un'ulteriore accelerazione.
• Browser e Node.js. LiteRT.js esegue lo stesso modello .tflite sul web con accelerazione WebGPU/WASM, eliminando la necessità di un'esportazione TensorFlow\.js separata.
• Desktop
Questa unificazione è importante perché elimina una reale fonte di attrito nei deployment in produzione. Invece di mantenere una pipeline di esportazione per i dispositivi mobili, un'altra per il browser e una terza per gli acceleratori edge, i team possono ora esportare una volta sola e distribuire ovunque venga eseguito LiteRT.
Funzionalità principali dei modelli LiteRT#
• Ottimizzazione on-device. Riduce la latenza elaborando i dati localmente, migliora la privacy evitando di trasmettere dati personali e minimizza le dimensioni del modello per risparmiare spazio.
• Supporto per più piattaforme. Funziona su Android, iOS, Linux embedded, microcontrollori e browser web moderni.
• Accelerazione hardware. Sfrutta XNNPACK su CPU e l'accelerazione GPU tramite OpenCL, Metal e WebGPU. L'accelerazione GPU viene eseguita in FP16 per impostazione predefinita, per una velocità aggiuntiva.
• Quantizzazione. Supporta FP32, INT8 statico, attivazioni INT16 statiche e INT8 dinamico per comprimere i modelli e velocizzare l'inferenza con una perdita minima di accuratezza.
• Supporto per diversi linguaggi. Compatibile con Java/Kotlin, Swift, Objective-C, C++, Python e JavaScript.
Iniziare a usare l'esportazione LiteRT#
Il pacchetto Python di Ultralytics e Ultralytics Platform forniscono un ambiente completo e unificato per addestrare, valutare e distribuire modelli YOLO in tutte e cinque le attività di computer vision. Il formato di esportazione LiteRT supporta le modalità Export, Predict e Validate, quindi un modello può essere esportato e poi utilizzato immediatamente per l'inferenza o la validazione locale dell'accuratezza.
L'esportazione di un modello richiede un solo comando:
from ultralytics import YOLO
# Load a YOLO26 model
model = YOLO("yolo26n.pt")
# Export the model to LiteRT format
model.export(format="litert") # creates 'yolo26n.tflite'Per i team che eseguono il deployment su hardware con risorse limitate, LiteRT supporta anche l'esportazione quantizzata, consentendo di comprimere i modelli per un'inferenza più rapida con una perdita minima di accuratezza:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
# Dynamic INT8: int8 weights, FP32 activations - no calibration data needed
model.export(format="litert", quantize="w8a32")
# Static INT8: int8 weights + int8 activations - needs calibration data
model.export(format="litert", quantize=8, data="coco8.yaml")Una volta esportato, il modello può essere caricato ed eseguito direttamente per l'inferenza:
from ultralytics import YOLO
# Load the exported LiteRT model
model = YOLO("yolo26n.tflite")
# Run inference
results = model("https://ultralytics.com/images/bus.jpg")L'esportazione LiteRT è attualmente supportata su Linux x86\_64 e macOS. Il modello .tflite esportato può essere eseguito su tutte le piattaforme supportate da LiteRT, inclusi dispositivi mobili, sistemi embedded, dispositivi edge e browser.
Fig. 1. Confronto delle prestazioni tra ONNX e LiteRT.
L'immagine precedente mostra un confronto del tempo medio di inferenza per il rilevamento, la segmentazione e la stima della posa su YOLO26n, eseguito nel browser tramite @ultralytics/yolo, il pacchetto npm di Ultralytics per l'inferenza lato client su WebGPU/WASM tramite ONNX Runtime Web. Test eseguito su un Apple MacBook Pro del 2024 (Apple Silicon M4) in un ambiente browser controllato.
Portare Ultralytics YOLO sull'edge#
Con LiteRT, la distribuzione dei modelli Ultralytics YOLO in ambienti mobili, embedded, edge e browser non richiede più pipeline di esportazione separate per ogni destinazione. Una sola esportazione, un solo formato per modelli e un percorso coerente dall'addestramento alla produzione, ovunque sia necessario eseguire l'inferenza.
Ti interessa l'AI per la computer vision? Scopri le nostre opzioni di licenza per portare la computer vision nei tuoi progetti. Visita il nostro repository GitHub per esplorare l'intera gamma di integrazioni di esportazione di Ultralytics e dai un'occhiata a Ultralytics Platform per iniziare a creare i tuoi workflow end-to-end di AI per la computer vision.






