World Models
세계 모델이 환경 역학을 사용하여 AI가 미래 상태를 예측할 수 있게 하는 방법을 탐색합니다. Ultralytics YOLO26이 예측 AI를 위한 인식을 어떻게 제공하는지 배웁니다.
"월드 모델(World Model)"은 환경이 작동하는 방식에 대한 AI 시스템의 내부 표현을 의미하며, 이를 통해 현재 관측값과 잠재적 행동을 기반으로 미래의 상태나 결과를 예측할 수 있습니다. 입력을 출력에 직접 매핑하는 전통적인 모델(이미지 분류 등)과 달리, 월드 모델은 시스템의 근본적인 동역학, 물리 법칙 및 인과 관계를 학습합니다. 이 개념은 기계에 "상식" 수준의 추론 능력을 부여하여 현실 세계에서 행동하기 전에 마음속으로 시나리오를 시뮬레이션할 수 있게 해주므로, 인공 일반 지능(AGI) 발전의 핵심입니다.
World Models의 원리#
핵심적으로 월드 모델은 인간의 직관과 유사하게 작동합니다. 공을 던질 때 풍속 방정식을 계산하지 않고, 뇌가 과거 경험을 바탕으로 궤적을 시뮬레이션하는 것과 같습니다. 마찬가지로 머신러닝(ML)에서 이러한 모델은 고차원 감각 데이터(비디오 프레임 등)를 컴팩트한 잠재 상태로 압축합니다. 이 압축된 상태를 통해 에이전트는 효율적으로 잠재적 미래를 "상상"하거나 환각할 수 있습니다.
Ha와 Schmidhuber의 순환 월드 모델(Recurrent World Models) 연구와 같은 선도적인 연구는 에이전트가 시뮬레이션된 드림 환경 안에서만 정책을 학습할 수 있음을 보여줍니다. 최근에는 OpenAI의 Sora와 같은 생성형 AI 발전이 월드 모델링의 시각적 형태를 보여주며, 시스템이 물리 법칙, 조명, 객체 영속성을 이해하여 일관된 비디오 연속성을 생성하도록 합니다.
로보틱스 및 시뮬레이션에서의 응용#
World models는 복잡한 의사결정이 필요한 분야에서 특히 혁신적입니다.
- 자율주행차: 자율주행차는 월드 모델을 사용하여 다른 운전자와 보행자의 행동을 예측합니다. 초당 수천 개의 잠재적 교통 시나리오를 시뮬레이션함으로써 차량은 가장 안전한 경로를 선택할 수 있습니다. 이는 정확한 인식이 예측의 기반이 되는 자동차 솔루션의 컴퓨터 비전과 밀접하게 연결됩니다.
- 로보틱스: 제조 로보틱스 분야에서 월드 모델로 학습된 로봇 팔은 재학습 없이도 새로운 객체나 예상치 못한 장애물에 적응할 수 있습니다. 로봇은 쥐기와 움직임의 물리 법칙을 이해하여 스마트 제조 솔루션을 향상시킵니다.
World Models vs. 표준 강화학습#
World models를 표준 접근 방식과 구분하는 것은 유용합니다.
- 월드 모델 대 강화학습(RL): 전통적인 강화학습은 종종 "모델 프리(model-free)"이며, 이는 에이전트가 환경 속에서 시행착오를 통해 순수하게 학습함을 의미합니다. 월드 모델 접근 방식은 "모델 기반(model-based)"으로, 에이전트가 학습할 시뮬레이터를 구축하여 필요한 현실 세계 상호작용의 양을 대폭 줄입니다.
- 월드 모델 대 대규모 언어 모델(LLM): LLM이 다음 텍스트 토큰을 예측하는 반면, 월드 모델은 주로 다음 시각적 프레임이나 상태를 예측합니다. 그러나 모델이 텍스트, 비전, 물리 법칙을 통합하는 멀티모달 학습의 부상과 함께 이러한 경계는 흐려지고 있습니다.
실용적인 구현 개념#
완전한 월드 모델을 구축하는 것은 복잡하지만, 그 기초 개념은 미래 상태 예측에 의존합니다. 컴퓨터 비전 작업의 경우, Ultralytics YOLO26과 같은 고속 감지 모델은 의사결정 로직에 관측값을 공급하는 감각적 "눈" 역할을 합니다.
다음 Python 스니펫은 world model의 예측 단계에 입력으로 사용될 현재 상태(객체 위치)를 추출하기 위해 YOLO 모델을 어떻게 사용할 수 있는지 보여줍니다.
from ultralytics import YOLO
# Load the Ultralytics YOLO26 model to act as the perception layer
model = YOLO("yolo26n.pt")
# Perform inference to get the current state of the environment
results = model("https://ultralytics.com/images/bus.jpg")
# Extract bounding boxes (xyxy) representing object states
for result in results:
boxes = result.boxes.xyxy.cpu().numpy()
print(f"Observed State (Object Positions): {boxes}")
# A World Model would take these 'boxes' to predict the NEXT frame's state예측 AI의 미래#
월드 모델의 진화는 디지털 지능이 물리 세계와 원활하게 상호작용하는 피지컬 AI를 향해 나아가고 있습니다. 얀 LeCun의 JEPA(합동 임베딩 예측 아키텍처)와 같은 혁신은 모든 픽셀을 예측하는 대신 추상적인 표현을 학습할 것을 제안하여 모델의 효율성을 크게 향상시킵니다.
이러한 아키텍처가 성숙해짐에 따라, 개발자가 객체를 감지할 뿐만 아니라 동적 환경 내에서의 궤적과 상호작용을 예측할 수 있도록 Ultralytics 플랫폼에 통합될 것으로 기대합니다. 정적 감지에서 동적 예측으로의 이러한 전환은 컴퓨터 비전(CV) 분야의 다음 위대한 도약을 나타냅니다.






