Export Ultralytics YOLO trên LiteRT
Tìm hiểu cách tích hợp export LiteRT mới đưa inference Ultralytics YOLO đến các môi trường mobile, embedded, edge và trình duyệt trong một format thống nhất.

Tại Ultralytics, chúng tôi nhận thấy xu hướng ngày càng tăng là chạy model thị giác máy tính trực tiếp trên các thiết bị nơi chúng được sử dụng, thay vì phụ thuộc vào kết nối với cloud. Các ứng dụng di động, hệ thống nhúng, cảm biến IoT và công cụ chạy trên trình duyệt ngày càng cần thực hiện inference cục bộ, thường trên phần cứng có giới hạn nghiêm ngặt về năng lượng và năng lực tính toán. Đó là lý do chúng tôi vui mừng thông báo rằng các model Ultralytics YOLO hiện có thể được xuất trực tiếp sang LiteRT.
Đáp ứng nhu cầu này đòi hỏi một định dạng model có thể hoạt động trên tất cả các môi trường đó mà không buộc developer phải duy trì các pipeline export riêng cho từng môi trường.
Trước đây, khả năng này đã tồn tại thông qua một package bên thứ ba không chính thức, nhưng tích hợp mới này là kết quả của sự hợp tác chính thức với Google. Chúng tôi đã làm việc chặt chẽ với đội ngũ LiteRT để xây dựng pipeline end-to-end xuất các model Ultralytics YOLO sang TFLite thông qua LiteRT. Với tích hợp này, một model Ultralytics YOLO duy nhất sau khi export có thể được triển khai trên các môi trường di động, nhúng, edge và trình duyệt, hợp nhất những gì các định dạng export TFLite và TF.js trước đây xử lý riêng biệt thành một định dạng tinh gọn.
LiteRT là gì?#
LiteRT (viết tắt của Lite Runtime) là runtime hiệu năng cao của Google dành cho AI trên thiết bị. Đây là thế hệ tiếp theo và là tên gọi mới của TensorFlow Lite (TFLite), đồng thời chạy cùng định dạng model .tflite mà các developer đã quen thuộc.
LiteRT là một framework mã nguồn mở được thiết kế riêng cho inference trên thiết bị, còn được gọi là điện toán edge. Framework này cung cấp cho developer các công cụ để thực thi model đã train trên thiết bị di động, thiết bị nhúng và IoT, máy tính truyền thống, cũng như trực tiếp trên trình duyệt web và Node.js thông qua LiteRT.js. Định dạng export LiteRT tối ưu hóa model cho các tác vụ như phát hiện đối tượng, phân đoạn, ước tính tư thế và phân loại, giúp chúng chạy nhanh và offline trên nhiều loại thiết bị.
Tại sao nên export các model Ultralytics YOLO sang LiteRT?#
Một định dạng model hiện bao quát mọi target triển khai:
• Di động và nhúng. Android, iOS, Desktop, Linux nhúng và vi điều khiển (MCU).
• Bộ tăng tốc edge. Tương thích với Coral Edge TPU để tăng tốc hơn nữa.
• Trình duyệt và Node.js. LiteRT.js chạy cùng model .tflite trên web với khả năng tăng tốc WebGPU/WASM, loại bỏ nhu cầu export TensorFlow\.js riêng biệt.
• Desktop
Việc hợp nhất này rất quan trọng vì loại bỏ một nguồn gây trở ngại thực sự trong quá trình triển khai production. Thay vì duy trì một pipeline export cho thiết bị di động, một pipeline khác cho trình duyệt và pipeline thứ ba cho các bộ tăng tốc edge, các team giờ đây có thể export một lần và triển khai ở mọi nơi LiteRT hoạt động.
Các tính năng chính của model LiteRT#
• Tối ưu hóa trên thiết bị. Giảm latency bằng cách xử lý dữ liệu cục bộ, tăng cường quyền riêng tư bằng cách không truyền dữ liệu cá nhân và giảm kích thước model để tiết kiệm dung lượng.
• Hỗ trợ nhiều nền tảng. Chạy trên Android, iOS, Linux nhúng, vi điều khiển và các trình duyệt web hiện đại.
• Tăng tốc phần cứng. Tận dụng XNNPACK trên CPU và tăng tốc GPU thông qua OpenCL, Metal và WebGPU. Tăng tốc GPU mặc định chạy ở FP16 để đạt tốc độ cao hơn.
• Quantization. Hỗ trợ FP32, INT8 tĩnh, INT16-activation tĩnh và INT8 động để nén model và tăng tốc inference với mức suy giảm độ chính xác tối thiểu.
• Hỗ trợ đa dạng ngôn ngữ. Tương thích với Java/Kotlin, Swift, Objective-C, C++, Python và JavaScript.
Bắt đầu với việc export LiteRT#
Package Python của Ultralytics và Ultralytics Platform cung cấp một môi trường hoàn chỉnh, thống nhất để train, đánh giá và triển khai các model YOLO trên cả năm tác vụ thị giác máy tính. Định dạng export LiteRT hỗ trợ các mode Export, Predict và Validate, vì vậy model có thể được export rồi lập tức sử dụng cho inference hoặc validation độ chính xác cục bộ.
Export một model chỉ cần một command:
from ultralytics import YOLO
# Load a YOLO26 model
model = YOLO("yolo26n.pt")
# Export the model to LiteRT format
model.export(format="litert") # creates 'yolo26n.tflite'Đối với các team triển khai lên phần cứng hạn chế, LiteRT cũng hỗ trợ export đã quantize, cho phép nén model để inference nhanh hơn với mức suy giảm độ chính xác tối thiểu:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
# Dynamic INT8: int8 weights, FP32 activations - no calibration data needed
model.export(format="litert", quantize="w8a32")
# Static INT8: int8 weights + int8 activations - needs calibration data
model.export(format="litert", quantize=8, data="coco8.yaml")Sau khi export, model có thể được load và chạy inference trực tiếp:
from ultralytics import YOLO
# Load the exported LiteRT model
model = YOLO("yolo26n.tflite")
# Run inference
results = model("https://ultralytics.com/images/bus.jpg")Export LiteRT hiện được hỗ trợ trên Linux x86_64 và macOS. Bản thân model .tflite đã export có thể chạy trên mọi nền tảng được LiteRT hỗ trợ, bao gồm di động, nhúng, edge và trình duyệt.
Hình 1. So sánh hiệu năng giữa ONNX và LiteRT.
Hình ảnh trên đây so sánh thời gian inference trung bình cho tác vụ phát hiện, phân đoạn và ước tính tư thế trên YOLO26n, chạy trong trình duyệt thông qua @ultralytics/yolo, package npm của Ultralytics dành cho inference phía client trên WebGPU/WASM thông qua ONNX Runtime Web. Phép benchmark được thực hiện trên Apple MacBook Pro 2024 (Apple Silicon M4) trong môi trường trình duyệt được kiểm soát.
Đưa Ultralytics YOLO lên edge#
Với LiteRT, việc triển khai các model Ultralytics YOLO trên môi trường di động, nhúng, edge và trình duyệt không còn yêu cầu các pipeline export riêng cho từng target. Một lần export, một định dạng model và một quy trình nhất quán từ training đến production, bất kể inference cần diễn ra ở đâu.
Bạn tò mò về vision AI? Khám phá các tùy chọn cấp phép của chúng tôi để đưa thị giác máy tính vào các dự án của bạn. Truy cập repository GitHub của chúng tôi để khám phá đầy đủ các tích hợp export của Ultralytics và xem Ultralytics Platform để bắt đầu xây dựng các workflow vision AI end-to-end của riêng bạn.






