Spatial Intelligence
spatial intelligence가 AI로 하여금 3D 세계를 인식하고 탐색할 수 있도록 하는 방식을 살펴봅니다. Ultralytics YOLO26과 Ultralytics 플랫폼으로 공간 인식 시스템을 구축하는 방법을 알아봅니다.
공간 지능은 인공지능 시스템이 물리적 세계를 3차원으로 인식하고 이해하며 탐색하는 능력을 의미합니다. 정적인 스냅샷처럼 2D 이미지를 분석하는 경우가 많은 기존 컴퓨터 비전과 달리, 공간 지능은 동적 환경에서 깊이, 기하학, 움직임, 객체 간 관계를 추론하는 것을 포함합니다. 이를 통해 기계는 픽셀을 단순히 "보는" 데 그치지 않고 장면의 물리적 맥락을 이해하여 실제 세계와 더욱 효과적으로 상호작용할 수 있습니다. 이 능력은 디지털 시각 데이터와 물리적 행동을 연결하는 가교로서, 고급 AI 에이전트와 로봇 시스템의 핵심 기반이 됩니다.
공간 지능의 핵심 구성 요소#
인간과 유사한 공간 이해를 구현하기 위해 AI 시스템은 서로 연결된 여러 기술과 개념에 의존합니다.
- 깊이 인식 및 3D 재구성: 시스템은 카메라의 2D 입력을 3D 표현으로 변환해야 합니다. 단안 깊이 추정과 같은 기술을 사용하면 모델이 단일 이미지에서 거리를 예측할 수 있으며, 3D 객체 감지는 해당 공간에 있는 항목의 부피와 방향을 식별하는 데 도움이 됩니다.
- SLAM (동시적 위치 추정 및 지도 작성): 이를 통해 로봇이나 드론과 같은 장치가 자신의 위치를 추적하면서 알려지지 않은 환경의 지도를 작성할 수 있습니다. 최신 접근 방식에서는 변화하는 조명 조건에서 견고성을 향상하기 위해 비주얼 SLAM을 딥러닝과 통합하는 경우가 많습니다.
- 기하학적 추론: 시스템은 감지를 넘어 물리적 제약을 이해해야 합니다. 예를 들어 컵이 테이블 위에 놓여 있거나 통과하려면 문을 열어야 한다는 사실을 알아야 합니다. 여기에는 실시간으로 객체 또는 사람 관절의 방향을 추적하기 위한 포즈 추정이 사용되는 경우가 많습니다.
- Embodied AI: 이 개념은 인식을 행동과 연결합니다. Embodied 에이전트는 단순히 관찰하는 데 그치지 않고 공간 데이터를 사용하여 움직임을 계획하고, 장애물을 피하며, 객체를 조작합니다. 이는 제조 현장에서 로보틱스의 AI가 작동하는 방식과 유사합니다.
실제 적용 사례#
공간 지능은 기계가 복잡한 환경에서 자율적으로 작동할 수 있도록 하여 산업을 변화시키고 있습니다.
- 자율 로보틱스 및 물류: 창고에서 로봇은 공간 지능을 사용하여 혼잡한 통로를 탐색하고, 객체 감지를 통해 특정 패키지를 식별하며, 이를 컨베이어에 정확하게 배치합니다. 또한 물품을 부수지 않고 안전하게 잡을 수 있도록 그리퍼와 상자 사이의 공간적 관계를 계산해야 합니다.
- 증강 현실 (AR) 및 혼합 현실: 스마트 글래스와 같은 장치는 공간 컴퓨팅을 사용하여 디지털 콘텐츠를 물리적 세계에 고정합니다. 예를 들어 AR 유지보수 앱은 특정 엔진 부품 위에 수리 지침을 직접 표시할 수 있습니다. 이를 위해서는 사용자가 머리를 움직일 때도 그래픽이 정렬된 상태를 유지하도록 정밀한 객체 추적이 필요합니다.
공간 지능과 컴퓨터 비전 비교#
서로 밀접한 관련이 있지만 공간 지능과 컴퓨터 비전 비교를 통해 두 개념을 구분하는 것이 유용합니다. 컴퓨터 비전은 디지털 이미지, 동영상 및 기타 시각적 입력에서 의미 있는 정보를 도출하는 데 중점을 둔 더 넓은 분야입니다. 여기에는 분류나 기본적인 2D 감지와 같은 작업이 포함됩니다. 공간 지능은 컴퓨터 비전의 특화된 하위 분야 또는 발전 형태로, 공간과 물리학의 차원을 구체적으로 추가합니다. 즉, "이 객체는 무엇인가?"(비전)에서 "이 객체는 어디에 있고, 어떤 방향을 향하며, 어떻게 상호작용할 수 있는가?"(공간 지능)로 확장됩니다.
Ultralytics로 공간 인식 구현하기#
개발자는 Ultralytics Platform을 사용하여 공간 지능 시스템의 기반을 구축할 수 있습니다. Ultralytics YOLO26과 같은 모델을 방향성 바운딩 박스 (OBB) 감지 또는 포즈 추정과 같은 작업에 대해 학습시키면, 엔지니어는 후속 로보틱스 또는 AR 애플리케이션에 필요한 기하학적 데이터를 제공할 수 있습니다.
다음은 포즈 추정 모델을 사용하여 공간 키포인트를 추출하는 간단한 예제입니다. 이는 3D 공간에서 사람의 움직임을 이해하는 데 중요한 단계입니다:
from ultralytics import YOLO
# Load a pre-trained YOLO26 pose estimation model
model = YOLO("yolo26n-pose.pt")
# Run inference on an image to detect human keypoints
results = model("path/to/image.jpg")
# Access the keypoints (x, y coordinates and confidence)
for result in results:
# keypoints.xy returns a tensor of shape (N, 17, 2)
keypoints = result.keypoints.xy
print(f"Detected keypoints for {len(keypoints)} persons.")최근 비전 Transformer (ViT)와 파운데이션 모델의 발전은 이 분야를 더욱 빠르게 발전시키고 있으며, 시스템이 광범위한 재학습 없이도 다양한 환경에서 공간 이해를 일반화할 수 있도록 지원합니다. Stanford's HAI 및 Google DeepMind와 같은 그룹의 연구가 계속됨에 따라, 차세대 스마트 장치에서 공간 지능이 표준 기능이 될 것으로 예상됩니다.









