OpenVINO™를 사용하여 Ultralytics YOLO11 원활하게 배포하기
Ultralytics YOLO11을 OpenVINO™ 형식으로 내보내 Intel® 하드웨어에서 초고속 추론을 구현하고, 속도, 확장성, 정확도를 향상하는 방법을 알아보세요.

AI 도입은 AI 솔루션의 접근성에 달려 있으며, 그중 상당 부분은 사람들이 이미 보유한 하드웨어에 쉽게 배포할 수 있도록 만드는 것입니다. GPU(그래픽 처리 장치)에서 AI 모델을 실행하는 것은 성능과 병렬 처리 능력 측면에서 훌륭한 선택입니다.
그러나 특히 엣지 환경이나 일반 노트북에서는 모든 사람이 고성능 GPU에 액세스할 수 있는 것은 아닙니다. 따라서 중앙 처리 장치(CPU), 통합 GPU, 신경망 처리 장치(NPU)처럼 더 널리 사용되는 하드웨어에서 모델을 효율적으로 실행하도록 최적화하는 것이 매우 중요합니다.
예를 들어 컴퓨터 비전은 머신이 이미지와 비디오 스트림을 실시간으로 분석하고 이해할 수 있도록 하는 AI의 한 분야입니다. Ultralytics YOLO11과 같은 비전 AI 모델은 객체 감지와 인스턴스 세그멘테이션 같은 핵심 작업을 지원하며, 소매 분석부터 의료 진단에 이르는 다양한 애플리케이션을 구현합니다.

그림 1. Ultralytics YOLO11을 사용하여 소매점에서 객체를 감지하고 세그멘테이션합니다.
컴퓨터 비전의 접근성을 더욱 확대하기 위해 Ultralytics는 OpenVINO 툴킷과의 통합을 업데이트하여 출시했습니다. OpenVINO는 CPU, GPU, NPU 전반에서 AI 추론을 최적화하고 실행하기 위한 오픈 소스 프로젝트입니다.
이 통합을 사용하면 YOLO11 모델을 더 쉽게 내보내고 배포할 수 있으며, CPU에서 최대 3배 빠른 추론과 Intel GPU 및 NPU에서 가속화된 성능을 얻을 수 있습니다. 이 글에서는 Ultralytics Python 패키지를 사용하여 YOLO11 모델을 OpenVINO 형식으로 내보내고 추론에 사용하는 방법을 단계별로 살펴봅니다. 시작해 보겠습니다!
Ultralytics YOLO11 개요#
Ultralytics가 지원하는 OpenVINO 통합의 세부 사항을 살펴보기 전에, YOLO11을 신뢰할 수 있고 영향력 있는 컴퓨터 비전 모델로 만드는 요소를 자세히 알아보겠습니다. YOLO11은 Ultralytics YOLO 시리즈의 최신 모델로, 속도와 정확도 모두에서 크게 향상되었습니다.
YOLO11의 주요 특징 중 하나는 효율성입니다. 예를 들어 Ultralytics YOLO11m은 Ultralytics YOLOv8m보다 파라미터 수가 22% 적지만, COCO 데이터셋에서 더 높은 평균 정밀도(mAP)를 달성합니다. 즉, 더 빠르게 실행되는 동시에 객체를 더 정확하게 감지하므로 성능과 응답성이 중요한 실시간 애플리케이션에 이상적입니다.

그림 2. Ultralytics YOLO11의 성능 벤치마크입니다.
객체 감지를 넘어 YOLO11은 인스턴스 세그멘테이션, 포즈 추정, 이미지 분류, 객체 추적, 방향성 바운딩 박스 감지와 같은 다양한 고급 컴퓨터 비전 작업을 지원합니다. 또한 Ultralytics Python 패키지는 모델의 학습, 평가 및 배포를 위한 간단하고 일관된 인터페이스를 제공하므로 YOLO11은 개발자 친화적입니다.
이와 더불어 Ultralytics Python 패키지는 다양한 통합과 OpenVINO, ONNX, TorchScript를 비롯한 여러 내보내기 형식을 지원하므로, 다양한 배포 파이프라인에 YOLO11을 쉽게 통합할 수 있습니다. 클라우드 인프라, 엣지 디바이스 또는 임베디드 시스템을 대상으로 하는 경우에도 내보내기 프로세스는 간단하며 하드웨어 요구 사항에 맞게 조정할 수 있습니다.
OpenVINO™란 무엇인가요?#
OpenVINO™(개방형 비전 추론 및 신경망 최적화)는 광범위한 하드웨어에서 AI 추론을 최적화하고 배포하기 위한 오픈 소스 툴킷입니다. 개발자는 이를 통해 CPU, 통합 및 독립 GPU, NPU, FPGA(필드 프로그래머블 게이트 어레이)를 포함한 다양한 Intel 플랫폼에서 고성능 추론 애플리케이션을 효율적으로 실행할 수 있습니다.
OpenVINO는 디바이스별 플러그인을 통해 하드웨어 차이를 추상화하는 통합 런타임 인터페이스를 제공합니다. 따라서 개발자는 코드를 한 번 작성하고 일관된 API를 사용하여 여러 Intel 하드웨어 대상에 배포할 수 있습니다.
OpenVINO를 배포에 적합한 선택으로 만드는 주요 기능은 다음과 같습니다.
- 모델 변환기: 이 도구는 PyTorch, ONNX, TensorFlow, PaddlePaddle 및 기타 주요 프레임워크의 모델을 변환하고 준비하여 Intel 하드웨어에서 효율적인 추론을 수행하도록 최적화할 수 있게 합니다.
- 이기종 실행: Intel 하드웨어별로 코드를 다시 작성할 필요가 없습니다. OpenVINO를 사용하면 CPU부터 GPU까지 지원되는 모든 하드웨어에서 동일한 모델을 쉽게 실행할 수 있습니다.
- 양자화 지원: 이 툴킷은 FP16(기본값) 및 INT8과 같은 저정밀도 형식을 지원합니다. 이를 통해 정확도에 큰 영향을 주지 않으면서 모델 크기를 줄이고 추론 속도를 높일 수 있습니다.

그림 3. OpenVINO는 다양한 배포 옵션을 지원합니다.
Ultralytics와 OpenVINO 통합 살펴보기#
이제 OpenVINO가 무엇이며 왜 중요한지 살펴보았으므로, Ultralytics YOLO11 모델을 OpenVINO 형식으로 내보내고 Intel 하드웨어에서 효율적인 추론을 실행하는 방법을 알아보겠습니다.
1단계: Ultralytics Python 패키지 설치#
모델을 OpenVINO 형식으로 내보내려면 먼저 Ultralytics Python 패키지를 설치해야 합니다. 이 패키지는 YOLO11을 포함한 YOLO 모델의 학습, 평가 및 내보내기에 필요한 모든 기능을 제공합니다.
터미널 또는 명령 프롬프트에서 "pip install ultralytics" 명령을 실행하여 설치할 수 있습니다. Jupyter Notebook이나 Google Colab과 같은 대화형 환경에서 작업하는 경우에는 명령 앞에 느낌표를 추가하면 됩니다.
또한 설치 중이나 내보내기 과정에서 문제가 발생하면 Ultralytics 문서와 문제 해결 가이드가 문제를 해결하고 작업을 재개하는 데 유용한 자료가 됩니다.
2단계: Ultralytics YOLO11 모델을 OpenVINO 형식으로 내보내기#
Ultralytics 패키지 설정이 완료되면 다음 단계는 YOLO11 모델을 로드하고 OpenVINO와 호환되는 형식으로 변환하는 것입니다.
아래 예제에서는 사전 학습된 YOLO11 모델(“yolo11n.pt”)을 사용합니다. 내보내기 기능을 사용하여 모델을 OpenVINO 형식으로 변환합니다. 이 코드를 실행하면 변환된 모델이 “yolo11n_openvino_model”이라는 새 디렉터리에 저장됩니다.
from ultralytics import YOLO
model = YOLO("yolo11n.pt")
model.export(format="openvino")3단계: 내보낸 모델로 추론 실행하기#
YOLO11 모델을 OpenVINO 형식으로 내보낸 후에는 두 가지 방법으로 추론을 실행할 수 있습니다. Ultralytics Python 패키지를 사용하거나 네이티브 OpenVINO Runtime을 사용하는 방법입니다.
Ultralytics Python 패키지 사용하기#
아래 코드 스니펫과 같이 내보낸 YOLO11 모델은 Ultralytics Python 패키지를 사용하여 쉽게 배포할 수 있습니다. 이 방법은 Intel 하드웨어에서 빠르게 실험하고 간소화된 배포를 수행하는 데 적합합니다.
시스템에서 사용 가능한 Intel 하드웨어에 따라 "intel:cpu", "intel:gpu" 또는 "intel:npu"와 같이 추론에 사용할 디바이스를 지정할 수도 있습니다.
ov_model = YOLO("yolo11n_openvino_model/")
results = ov_model("https://ultralytics.com/images/bus.jpg", device="intel:gpu")위 코드를 실행하면 출력 이미지가 "runs/detect/predict" 디렉터리에 저장됩니다.

그림 4. 내보낸 Ultralytics YOLO11 모델을 사용하여 이미지에서 객체를 감지합니다.
네이티브 OpenVINO Runtime 사용하기#
특히 프로덕션 환경에서 추론 실행 방식을 세부적으로 조정하려는 경우 OpenVINO Runtime을 사용하면 모델 실행 방식을 더 세밀하게 제어할 수 있습니다. 비동기 실행(여러 추론 요청을 병렬로 실행) 및 부하 분산(Intel 하드웨어 전반에 추론 워크로드를 효율적으로 분배)과 같은 고급 기능을 지원합니다.
네이티브 런타임을 사용하려면 내보낸 모델 파일인 .xml 파일(네트워크 아키텍처 정의)과 .bin 파일(모델의 학습된 가중치 저장)이 필요합니다. 애플리케이션에 따라 입력 차원이나 전처리 단계와 같은 추가 매개변수도 구성할 수 있습니다.
일반적인 배포 흐름에는 OpenVINO 코어 초기화, 대상 디바이스에 맞춘 모델 로드 및 컴파일, 입력 준비, 추론 실행이 포함됩니다. 자세한 예제와 단계별 안내는 공식 Ultralytics OpenVINO 문서를 참조하세요.
Ultralytics와 OpenVINO 통합을 선택해야 하는 이유#
Ultralytics 통합을 살펴보면 Ultralytics Python 패키지가 YOLO11 모델을 TorchScript, CoreML, TensorRT, ONNX 등 다양한 형식으로 내보내는 기능을 지원한다는 것을 알 수 있습니다. 그렇다면 OpenVINO 통합을 선택해야 하는 이유는 무엇일까요?
OpenVINO 내보내기 형식이 Intel 하드웨어에 모델을 배포하는 데 적합한 이유는 다음과 같습니다.
- 성능 향상: Intel CPU에서 최대 3배 빠른 추론을 경험할 수 있으며, 통합 GPU와 NPU에서는 추가적인 가속이 가능합니다.
- 재학습 불필요: 기존 Ultralytics YOLO11 모델을 수정하거나 재학습하지 않고 OpenVINO 형식으로 바로 내보낼 수 있습니다.
- 확장성을 고려한 설계: 동일하게 내보낸 모델을 저전력 엣지 디바이스부터 대규모 클라우드 인프라까지 배포할 수 있어 확장 가능한 AI 배포가 간소화됩니다.
OpenVINO™ Model Hub에서 다양한 Intel® 플랫폼에 걸친 Ultralytics YOLO11 모델의 성능 벤치마크를 평가할 수도 있습니다. OpenVINO Model Hub는 개발자가 Intel 하드웨어에서 AI 모델을 평가하고 Intel CPU, 내장 GPU, NPU 및 독립 그래픽 전반에서 OpenVINO의 성능 이점을 확인할 수 있는 리소스입니다.

그림 5. OpenVINO™ Model Hub: 다양한 Intel® 플랫폼에서의 Ultralytics YOLO11 모델 성능 벤치마크입니다.
Ultralytics YOLO11 및 OpenVINO 내보내기 형식의 활용 사례#
OpenVINO 통합을 활용하면 실제 환경에서 Intel 하드웨어 전반에 Ultralytics YOLO11 모델을 훨씬 간단하게 배포할 수 있습니다.
대표적인 예로 스마트 리테일을 들 수 있습니다. Ultralytics YOLO11을 사용하면 빈 선반을 실시간으로 감지하고, 재고가 부족해지는 제품을 추적하며, 고객이 매장을 이동하는 방식을 분석할 수 있습니다. 이를 통해 소매업체는 재고 관리를 개선하고 고객 참여도를 높이도록 매장 레이아웃을 최적화할 수 있습니다.
마찬가지로 스마트 시티에서는 YOLO11을 사용하여 차량 수를 세고, 보행자를 추적하며, 신호 위반을 실시간으로 감지하는 방식으로 교통을 모니터링할 수 있습니다. 이러한 인사이트는 교통 흐름 최적화와 도로 안전 개선을 지원하고 자동화된 단속 시스템을 보조할 수 있습니다.

그림 6. YOLO11을 사용하여 차량 수를 셉니다.
또 다른 흥미로운 활용 사례는 산업 검사입니다. Ultralytics YOLO11을 생산 라인에 배포하여 부품 누락, 정렬 불량, 표면 손상과 같은 시각적 결함을 자동으로 감지할 수 있습니다. 이를 통해 효율성을 높이고 비용을 절감하며 제품 품질을 향상할 수 있습니다.
OpenVINO 툴킷 사용 시 고려해야 할 주요 요소#
OpenVINO를 사용하여 Ultralytics YOLO11 모델을 배포할 때 최상의 결과를 얻으려면 다음과 같은 몇 가지 중요한 사항을 염두에 두어야 합니다.
- 하드웨어 호환성 확인: CPU, 통합 GPU, NPU 등 사용 중인 Intel 하드웨어가 OpenVINO에서 지원되는지 확인하여 모델이 효율적으로 실행되도록 하세요.
- 적절한 드라이버 설치: Intel GPU 또는 NPU를 사용하는 경우 필요한 모든 드라이버가 올바르게 설치되어 있고 최신 상태인지 다시 확인하세요.
- 정밀도 절충점 이해: OpenVINO는 FP32, FP16, INT8 모델 정밀도를 지원합니다. 각 옵션은 속도와 정확도 사이에 서로 다른 절충점을 가지므로 성능 목표와 사용 가능한 하드웨어에 따라 적절한 옵션을 선택하는 것이 중요합니다.
핵심 요점#
Ultralytics YOLO11을 OpenVINO 형식으로 내보내면 Intel 하드웨어에서 빠르고 효율적인 비전 AI 모델을 쉽게 실행할 수 있습니다. 재학습하거나 코드를 변경하지 않고 CPU, GPU, NPU 전반에 배포할 수 있습니다. 간단하고 확장 가능한 방식을 유지하면서 성능을 향상할 수 있는 훌륭한 방법입니다.
Ultralytics Python 패키지에 지원 기능이 내장되어 있어 OpenVINO를 사용한 내보내기와 추론 실행은 간단합니다. 몇 단계만 거치면 모델을 최적화하고 다양한 Intel 플랫폼에서 실행할 수 있습니다. 스마트 리테일, 교통 모니터링 또는 산업 검사 중 어떤 작업을 수행하든 이 워크플로를 통해 개발에서 배포까지 빠르고 안정적으로 진행할 수 있습니다.
YOLO 커뮤니티에 참여하고 Ultralytics에서 지원하는 유용한 통합에 대해 자세히 알아보려면 Ultralytics GitHub 저장소를 확인하세요. 또한 오늘 컴퓨터 비전을 시작하려면 Ultralytics 라이선스 옵션을 살펴보세요!
다가오는 웨비나에 등록하여 Ultralytics × OpenVINO 통합이 실제로 작동하는 모습을 확인하고, AI를 대규모로 최적화하고 배포하기 위한 도구를 살펴보려면 OpenVINO 웹사이트를 방문하세요.









