Exportar o Ultralytics YOLO com LiteRT
Descobre como a nova integração de exportação LiteRT disponibiliza a inferência do Ultralytics YOLO em ambientes móveis, incorporados, edge e de navegador num único formato unificado.

Na Ultralytics, estamos a observar uma mudança crescente no sentido de executar modelos de visão computacional diretamente nos dispositivos onde são necessários, em vez de depender de uma ligação à cloud. As aplicações móveis, os sistemas incorporados, os sensores IoT e as ferramentas baseadas no navegador precisam cada vez mais de executar a inferência localmente, muitas vezes em hardware com limites rigorosos de energia e capacidade de computação. É por isso que temos o prazer de anunciar que os modelos Ultralytics YOLO podem agora ser exportados diretamente para LiteRT.
Satisfazer essa necessidade exige um formato de modelo que funcione em todos estes ambientes sem obrigar os programadores a manter pipelines de exportação separados para cada um deles.
Esta capacidade já existia através de um pacote não oficial de terceiros, mas esta nova integração resulta de uma colaboração oficial com a Google. Trabalhámos em estreita colaboração com a equipa do LiteRT para criar um pipeline completo para exportar modelos Ultralytics YOLO para TFLite através do LiteRT. Com esta integração, um único modelo Ultralytics YOLO exportado pode ser implementado em ambientes móveis, incorporados, edge e de navegador, unificando num só formato otimizado aquilo que os formatos de exportação TFLite e TF.js anteriores tratavam separadamente.
O que é o LiteRT?#
LiteRT (abreviatura de Lite Runtime) é o runtime de alto desempenho da Google para IA no dispositivo. É a próxima geração e o novo nome do TensorFlow Lite (TFLite), e utiliza o mesmo formato de modelo .tflite que os programadores já conhecem.
O LiteRT é uma framework de código aberto concebida especificamente para inferência no dispositivo, também conhecida como computação edge. Fornece aos programadores as ferramentas para executar modelos treinados em dispositivos móveis, incorporados e IoT, computadores tradicionais e, através do LiteRT.js, diretamente em navegadores Web e no Node.js. O formato de exportação LiteRT otimiza os modelos para tarefas como deteção de objetos, segmentação, estimativa de pose e classificação, para que sejam executados rapidamente e offline numa vasta gama de dispositivos.
Porquê exportar modelos Ultralytics YOLO para LiteRT?#
Um único formato de modelo abrange agora todos os destinos de implementação:
• Móvel e incorporado. Android, iOS, computadores, Linux incorporado e microcontroladores (MCUs).
• Aceleradores edge. Compatível com o Coral Edge TPU para aceleração adicional.
• Navegador e Node.js. O LiteRT.js executa o mesmo modelo .tflite na Web com aceleração WebGPU/WASM, eliminando a necessidade de uma exportação TensorFlow.js separada.
• Computador
Esta consolidação é importante porque elimina uma fonte real de atrito nas implementações em produção. Em vez de manter um pipeline de exportação para dispositivos móveis, outro para o navegador e um terceiro para aceleradores edge, as equipas podem agora exportar uma vez e implementar em qualquer ambiente onde o LiteRT seja executado.
Principais funcionalidades dos modelos LiteRT#
• Otimização no dispositivo. Reduz a latência ao processar os dados localmente, melhora a privacidade ao não transmitir dados pessoais e minimiza o tamanho do modelo para poupar espaço.
• Suporte a várias plataformas. Funciona em Android, iOS, Linux incorporado, microcontroladores e navegadores Web modernos.
• Aceleração de hardware. Utiliza XNNPACK na CPU e aceleração da GPU através de OpenCL, Metal e WebGPU. A aceleração da GPU é executada em FP16 por predefinição para proporcionar velocidade adicional.
• Quantização. Suporta FP32, INT8 estático, ativação INT16 estática e INT8 dinâmico para comprimir os modelos e acelerar a inferência com uma perda mínima de precisão.
• Suporte a várias linguagens. Compatível com Java/Kotlin, Swift, Objective-C, C++, Python e JavaScript.
Como começar a exportar para LiteRT#
O pacote Python da Ultralytics e a Ultralytics Platform fornecem um ambiente completo e unificado para treinar, avaliar e implementar modelos YOLO nas cinco tarefas de visão computacional. O formato de exportação LiteRT suporta os modos Export, Predict e Validate, permitindo exportar um modelo e utilizá-lo imediatamente para inferência ou validação local da precisão.
Exportar um modelo requer um único comando:
from ultralytics import YOLO
# Load a YOLO26 model
model = YOLO("yolo26n.pt")
# Export the model to LiteRT format
model.export(format="litert") # creates 'yolo26n.tflite'Para as equipas que implementam modelos em hardware com recursos limitados, o LiteRT também suporta a exportação quantizada, permitindo comprimir os modelos para uma inferência mais rápida com uma perda mínima de precisão:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
# Dynamic INT8: int8 weights, FP32 activations - no calibration data needed
model.export(format="litert", quantize="w8a32")
# Static INT8: int8 weights + int8 activations - needs calibration data
model.export(format="litert", quantize=8, data="coco8.yaml")Depois de exportado, o modelo pode ser carregado e executado diretamente para inferência:
from ultralytics import YOLO
# Load the exported LiteRT model
model = YOLO("yolo26n.tflite")
# Run inference
results = model("https://ultralytics.com/images/bus.jpg")A exportação para LiteRT é atualmente suportada em Linux x86_64 e macOS. O próprio modelo .tflite exportado é executado em todas as plataformas compatíveis com LiteRT, incluindo dispositivos móveis, sistemas incorporados, edge e o navegador.
Fig. 1. Comparação de desempenho entre ONNX e LiteRT.
A imagem acima apresenta uma comparação do tempo médio de inferência para deteção, segmentação e estimativa de pose no YOLO26n, executado no navegador através de @ultralytics/yolo, o pacote npm da Ultralytics para inferência do lado do cliente em WebGPU/WASM através do ONNX Runtime Web. O teste foi realizado num Apple MacBook Pro de 2024 (Apple Silicon M4), num ambiente de navegador controlado.
A levar o Ultralytics YOLO para a edge#
Com o LiteRT, implementar modelos Ultralytics YOLO em ambientes móveis, incorporados, edge e de navegador já não exige pipelines de exportação separados para cada destino. Uma exportação, um formato de modelo e um percurso consistente do treino à produção, onde quer que a inferência tenha de ocorrer.
Tens curiosidade sobre IA de visão? Descobre as nossas opções de licenciamento para levar a visão computacional aos teus projetos. Visita o nosso repositório no GitHub para explorar toda a gama de integrações de exportação da Ultralytics e consulta a Ultralytics Platform para começares a criar os teus próprios fluxos de trabalho de IA de visão completos, do início ao fim.






