LiteRT에서 Ultralytics YOLO 내보내기
새로운 LiteRT 내보내기 통합을 통해 단일 통합 형식으로 모바일, 임베디드, 엣지 및 브라우저 환경에 Ultralytics YOLO 추론을 제공하는 방법을 알아보세요.

Ultralytics에서는 클라우드 연결에 의존하기보다 필요한 장치에서 직접 컴퓨터 비전 모델을 실행하는 방향으로 점점 더 크게 전환되고 있습니다. 모바일 앱, 임베디드 시스템, IoT 센서, 브라우저 기반 도구에서는 전력과 연산 리소스가 제한된 하드웨어에서 로컬로 inference를 실행해야 하는 경우가 점점 많아지고 있습니다. 따라서 Ultralytics YOLO 모델을 이제 LiteRT로 직접 내보낼 수 있게 되어 기쁘게 알려드립니다.
이러한 요구를 충족하려면 개발자가 각 환경에 대해 별도의 내보내기 파이프라인을 유지하지 않고도 모든 환경에서 사용할 수 있는 모델 형식이 필요합니다.
이 기능은 이전에도 비공식 서드파티 패키지를 통해 사용할 수 있었지만, 이번 새로운 통합은 Google과의 공식 협력으로 탄생했습니다. Ultralytics YOLO 모델을 LiteRT를 통해 TFLite로 내보내는 엔드투엔드 파이프라인을 구축하기 위해 LiteRT 팀과 긴밀히 협력했습니다. 이 통합을 사용하면 내보낸 하나의 Ultralytics YOLO 모델을 모바일, 임베디드, 엣지, 브라우저 환경 전반에 배포할 수 있으며, 이전에 TFLite 및 TF.js 내보내기 형식이 각각 처리하던 기능을 하나의 간소화된 형식으로 통합할 수 있습니다.
LiteRT란 무엇입니까?#
LiteRT(Lite Runtime의 약칭)는 온디바이스 AI를 위한 Google의 고성능 런타임입니다. 이는 TensorFlow Lite(TFLite)의 차세대 버전이자 새로운 이름이며, 개발자에게 익숙한 동일한 .tflite 모델 형식으로 실행됩니다.
LiteRT는 온디바이스 inference, 즉 엣지 컴퓨팅을 위해 특별히 설계된 오픈 소스 프레임워크입니다. 개발자는 이를 사용해 모바일, 임베디드, IoT 장치, 기존 컴퓨터에서 학습된 모델을 실행할 수 있으며, LiteRT.js를 통해 웹 브라우저와 Node.js에서도 직접 실행할 수 있습니다. LiteRT 내보내기 형식은 객체 감지, 세그멘테이션, 포즈 추정, 분류와 같은 작업에 맞게 모델을 최적화하므로, 다양한 장치에서 빠르고 오프라인으로 실행할 수 있습니다.
Ultralytics YOLO 모델을 LiteRT로 내보내는 이유는 무엇입니까?#
이제 하나의 모델 형식으로 모든 배포 대상을 지원합니다.
• 모바일 및 임베디드. Android, iOS, Desktop, 임베디드 Linux 및 마이크로컨트롤러(MCU).
• 엣지 가속기. 추가 가속을 위해 Coral Edge TPU와 호환됩니다.
• 브라우저 및 Node.js. LiteRT.js는 WebGPU/WASM 가속을 사용해 웹에서 동일한 .tflite 모델을 실행하므로 별도의 TensorFlow.js 내보내기가 필요하지 않습니다.
• Desktop
이러한 통합은 실제 운영 배포에서 발생하는 마찰의 주요 원인을 제거한다는 점에서 중요합니다. 이제 팀은 모바일용 내보내기 파이프라인, 브라우저용 파이프라인, 엣지 가속기용 세 번째 파이프라인을 각각 유지하는 대신 한 번만 내보내고 LiteRT가 실행되는 모든 환경에 배포할 수 있습니다.
LiteRT 모델의 주요 기능#
• 온디바이스 최적화. 데이터를 로컬에서 처리하여 지연 시간을 줄이고, 개인 데이터를 전송하지 않아 개인정보 보호를 강화하며, 모델 크기를 최소화해 저장 공간을 절약합니다.
• 다중 플랫폼 지원. Android, iOS, 임베디드 Linux, 마이크로컨트롤러 및 최신 웹 브라우저에서 실행됩니다.
• 하드웨어 가속. CPU에서는 XNNPACK을 활용하고, OpenCL, Metal 및 WebGPU를 통해 GPU 가속을 사용합니다. GPU 가속은 추가적인 속도 향상을 위해 기본적으로 FP16으로 실행됩니다.
• 양자화. FP32, 정적 INT8, 정적 INT16-activation 및 동적 INT8을 지원하여 모델을 압축하고 정확도 손실을 최소화하면서 inference 속도를 높입니다.
• 다양한 언어 지원. Java/Kotlin, Swift, Objective-C, C++, Python 및 JavaScript와 호환됩니다.
LiteRT 내보내기 시작하기#
Ultralytics Python 패키지와 Ultralytics Platform은 5가지 모든 컴퓨터 비전 작업에서 YOLO 모델을 학습, 평가 및 배포할 수 있는 완전하고 통합된 환경을 제공합니다. LiteRT 내보내기 형식은 내보내기, 예측 및 검증 모드를 지원하므로, 모델을 내보낸 후 즉시 로컬에서 inference 또는 정확도 검증에 사용할 수 있습니다.
모델 내보내기는 하나의 명령으로 수행됩니다.
from ultralytics import YOLO
# Load a YOLO26 model
model = YOLO("yolo26n.pt")
# Export the model to LiteRT format
model.export(format="litert") # creates 'yolo26n.tflite'제약이 있는 하드웨어에 배포하는 팀을 위해 LiteRT는 양자화된 내보내기도 지원하므로, 정확도 손실을 최소화하면서 더 빠른 inference를 위해 모델을 압축할 수 있습니다.
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
# Dynamic INT8: int8 weights, FP32 activations - no calibration data needed
model.export(format="litert", quantize="w8a32")
# Static INT8: int8 weights + int8 activations - needs calibration data
model.export(format="litert", quantize=8, data="coco8.yaml")내보낸 모델은 곧바로 로드하여 inference에 사용할 수 있습니다.
from ultralytics import YOLO
# Load the exported LiteRT model
model = YOLO("yolo26n.tflite")
# Run inference
results = model("https://ultralytics.com/images/bus.jpg")현재 LiteRT 내보내기는 Linux x86_64 및 macOS에서 지원됩니다. 내보낸 .tflite 모델 자체는 모바일, 임베디드, 엣지 및 브라우저를 포함하여 LiteRT가 지원하는 모든 플랫폼에서 실행됩니다.
그림 1. ONNX와 LiteRT의 성능 비교.
위 이미지는 [YOLO26n]에서 감지, 세그멘테이션 및 포즈 추정의 평균 inference 시간을 비교한 결과를 보여줍니다. 이 모델은 ONNX Runtime Web을 통해 WebGPU/WASM에서 클라이언트 측 inference를 수행하는 Ultralytics의 npm 패키지 @ultralytics/yolo를 사용하여 브라우저에서 실행되었습니다. 제어된 브라우저 환경에서 2024년 Apple MacBook Pro(Apple Silicon M4)를 사용해 벤치마크를 수행했습니다.
Ultralytics YOLO를 엣지로 확장하기#
LiteRT를 사용하면 모바일, 임베디드, 엣지 및 브라우저 환경 전반에 Ultralytics YOLO 모델을 배포할 때 대상별로 별도의 내보내기 파이프라인을 유지할 필요가 없습니다. 하나의 내보내기, 하나의 모델 형식으로 inference가 수행되는 위치와 관계없이 학습부터 프로덕션까지 일관된 경로를 제공합니다.
비전 AI에 관심이 있으십니까? 라이선스 옵션을 확인하고 컴퓨터 비전을 프로젝트에 도입해 보십시오. GitHub 리포지토리를 방문하여 Ultralytics 내보내기 통합의 전체 범위를 살펴보고, Ultralytics Platform에서 엔드투엔드 비전 AI 워크플로를 구축해 보십시오.






