Grounding
AI에서 그라운딩의 기본 개념을 살펴봅니다. Ultralytics YOLO26 및 YOLO-World를 사용하여 자연어를 시각 데이터에 연결하고 오픈 보캐뷸러리 검출을 수행하는 방법을 알아봅니다.
그라운딩은 인공지능 시스템이 추상적인 개념(일반적으로 자연어에서 파생됨)을 시각 데이터나 감각 입력과 같은 물리적 세계의 구체적이고 실제적인 표현과 연결하는 능력을 의미합니다. 컴퓨터 비전의 맥락에서 이는 모델이 텍스트를 단순히 처리하는 데 그치지 않고, "개를 산책시키는 사람"과 같은 문구를 파싱하여 이미지나 비디오 피드 내에서 해당 개체의 위치를 정확하게 파악할 수 있음을 의미합니다. 이 프로세스는 기호적 추론과 픽셀 수준의 인식 사이의 격차를 해소하며, 인지 과학의 근본적인 기호 그라운딩 문제를 다룹니다. 언어 토큰을 시각적 특징과 연결함으로써 그라운딩은 현대 멀티모달 AI의 초석 역할을 하며, 기계가 변화하는 인간 환경과 더욱 직관적으로 상호작용할 수 있도록 합니다.
그라운딩의 작동 원리#
기술적인 관점에서 그라운딩은 서로 다른 모달리티의 데이터를 공유 고차원 벡터 공간에 정렬하는 작업을 포함합니다. Transformer 프레임워크를 기반으로 구축되는 경우가 많은 고급 아키텍처는 자연어 처리 (NLP)를 활용하여 텍스트 설명과 시각적 입력 모두에 대해 임베딩이라는 수치 표현을 생성합니다. 학습 과정에서 모델은 텍스트 프롬프트(예: "파란색 백팩")의 임베딩과 이에 해당하는 시각적 영역의 임베딩 사이의 거리를 최소화하는 방법을 학습합니다.
이러한 정렬을 통해 개방형 어휘 탐지가 가능해집니다. 모델이 고정된 범주의 집합으로 제한되는 기존의 지도 학습과 달리, 그라운딩은 제로샷 학습을 가능하게 합니다. 그라운딩된 모델은 학습 중 명시적으로 본 적이 없는 객체라도 해당 객체를 설명하는 언어를 이해할 수 있다면 식별할 수 있습니다. 이러한 유연성은 PyTorch와 같은 딥러닝 프레임워크를 통해 지원되며, 이러한 멀티모달 정렬에 필요한 복잡한 행렬 연산을 수행할 수 있도록 합니다.
실제 적용 사례#
그라운딩 기술은 시스템이 사용자의 의도를 해석하고 비정형 환경을 효과적으로 탐색할 수 있도록 하여 산업을 재편하고 있습니다.
- 로보틱스의 AI: 그라운딩은 음성 지시를 수행하는 자율 에이전트에 필수적입니다. 창고 로봇이 "맨 위 선반에 있는 패키지를 집어 들어"라는 지시를 받으면, 시야 내의 특정 3D 좌표에 "패키지"와 "맨 위 선반"이라는 개념을 그라운딩해야 합니다. 이 기능은 MIT CSAIL의 로보틱스 연구의 주요 초점이며, 로봇이 사람과 함께 안전하게 작동할 수 있도록 합니다.
- 시맨틱 검색 및 미디어 검색: 그라운딩은 키워드 매칭을 넘어서는 고급 검색 엔진을 구동합니다. 사용자는 "일몰에 왼쪽으로 방향을 트는 자전거 이용자"와 같은 복잡한 설명으로 비디오 아카이브를 검색할 수 있으며, 시스템은 그라운딩을 사용하여 특정 타임스탬프를 검색합니다. 이는 보안 및 미디어 관리 분야의 비디오 이해 기능을 크게 향상합니다.
- 보조 기술: 시각 장애가 있는 사용자의 경우, 그라운딩을 통해 애플리케이션이 주변 환경을 실시간으로 설명하거나 환경에 관한 질문에 답변할 수 있습니다. 이를 위해 음성 생성과 연결된 강력한 이미지 인식 기능을 활용합니다.
Ultralytics YOLO-World를 활용한 그라운딩#
Ultralytics 생태계는 YOLO-World와 같은 특수 아키텍처를 통해 그라운딩을 지원합니다. 표준 모델은 특정 데이터셋에 대한 학습이 필요하지만, YOLO-World를 사용하면 텍스트 프롬프트를 통해 사용자가 즉시 사용자 지정 탐지 클래스를 정의할 수 있습니다. 이를 통해 재학습 없이 자연어 입력을 이미지에 효과적으로 "그라운딩"할 수 있습니다.
다음 예제에서는 ultralytics 패키지를 사용하여 사용자 지정 텍스트 설명을 기반으로 객체를 탐지하는 방법을 보여줍니다.
from ultralytics import YOLO
# Load a pre-trained YOLO-World model for open-vocabulary detection
model = YOLO("yolov8s-world.pt")
# Define custom text prompts (classes) to ground in the image
# The model maps these descriptions to visual features
model.set_classes(["person wearing hat", "blue backpack"])
# Run prediction on an image source to localize the described objects
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Display the results
results[0].show()그라운딩과 관련 개념의 구분#
그라운딩의 유용성을 완전히 이해하려면 이 개념을 유사한 컴퓨터 비전 작업과 구분해 보는 것이 도움이 됩니다.
- 객체 탐지와의 비교: YOLO26과 같은 기존 탐지 모델은 사전에 정의된 폐쇄형 범주 집합(예: COCO의 80개 클래스)에서 객체를 식별합니다. 그라운딩은 개방형이며 자유 형식의 텍스트를 기반으로 객체를 식별합니다.
- 이미지 캡셔닝과의 비교: 캡셔닝은 전체 이미지에 대한 설명 문장을 생성합니다(이미지 $\to$ 텍스트). 그라운딩은 일반적으로 반대 방향 또는 양방향으로 작동하며, 텍스트 입력을 기반으로 특정 시각적 요소의 위치를 파악합니다(텍스트 $\to$ 이미지 영역).
- 시각적 질의응답 (VQA)과의 비교: VQA는 이미지에 관한 특정 질문(예: "자동차는 무슨 색인가요?")에 답변하는 작업입니다. 그라운딩은 언급된 객체 주위에 바운딩 박스를 그리는 위치 파악 단계에 특히 초점을 맞춥니다.
과제와 향후 전망#
발전에도 불구하고 그라운딩은 여전히 계산 집약적입니다. 대규모 언어 모델을 비전 인코더와 정렬하려면 상당한 GPU 리소스와 효율적인 메모리 관리가 필요하며, 이는 NVIDIA와 같은 하드웨어 혁신 기업이 자주 해결하는 과제입니다. 또한 모델은 언어적 모호성으로 인해 어려움을 겪을 수 있으므로, "bat"이라는 단어가 스포츠 도구를 의미하는지 동물을 의미하는지 판별하려면 대규모 컨텍스트 윈도우가 필요합니다.
향후 개발은 본질적으로 멀티모달인 통합 파운데이션 모델을 향해 나아가고 있습니다. Ultralytics Platform과 같은 도구는 이러한 작업에 필요한 복잡한 데이터셋을 개발자가 관리할 수 있도록 발전하고 있으며, 데이터 어노테이션과 모델 배포를 위한 간소화된 워크플로를 제공합니다. 이러한 기술이 성숙함에 따라 그라운딩이 엣지 디바이스에 원활하게 통합되어 더욱 스마트하고 반응성이 뛰어난 AI 애플리케이션을 구현할 수 있을 것으로 기대됩니다.









