Diffusion Forcing
Diffusion Forcing은 자기회귀 예측과 시퀀스 디퓨전을 결합해 일관된 시간 데이터 생성을 수행하는 생성 모델링 패러다임입니다.
Diffusion Forcing은 2024년에 소개된 고급 생성 모델링 패러다임으로, 자기회귀 방식의 다음 토큰 예측과 전체 시퀀스 디퓨전의 강점을 결합합니다. 시퀀스 내 서로 다른 단계에 독립적이고 가변적인 노이즈 수준을 적용함으로써, 이 기법은 머신 러닝 모델이 시간적 일관성이 매우 높은 데이터를 생성할 수 있도록 합니다. 한 번에 하나씩 이산 토큰을 예측하거나 전체 시퀀스를 동시에 디노이징하는 기존 방식과 달리, Diffusion Forcing은 모델이 견고한 플래너이자 시퀀스 생성기로 작동하도록 학습하며, 복잡하고 장기적인 의존성이 있는 연속 상태를 처리합니다.
Diffusion Forcing의 작동 방식#
Diffusion Forcing의 핵심은 순환 신경망에서 사용하는 고전적인 teacher forcing에서 영감을 얻습니다. 그러나 다음 단계를 예측하기 위해 정답 이산 토큰을 입력하는 대신, 인과적 Transformer에 부분적으로 노이즈가 추가된 연속 이력을 입력합니다. 모델은 과거를 조건으로 현재 상태를 디노이징하는 방법을 학습합니다. 이를 통해 네트워크는 프레임별 노이즈 수준을 동적으로 조정할 수 있으며, 국소적인 정밀도와 광범위한 시간적 인식을 모두 요구하는 작업을 위한 유연한 프레임워크를 제공합니다.
이 접근 방식은 예측하기 어려운 환경에 대응하면서도 장기 계획을 준수해야 하는 지능형 AI 에이전트를 구축할 때 특히 유용하며, 표준 자기회귀 모델에서 흔히 발생하는 오류 누적 문제를 우회합니다.
실제 적용 사례#
Diffusion Forcing은 여러 복잡한 인공지능 분야에서 빠르게 주목받고 있습니다.
- 로보틱스 및 시각-운동 제어: 자율 로봇 팔과 자율 주행 시스템은 Diffusion Forcing을 사용하여 매끄럽고 연속적인 궤적 계획을 생성합니다. 연속적인 모터 명령 시퀀스를 예측함으로써 로봇은 안정적인 목표 경로를 유지하면서 동적인 장애물에 대응할 수 있습니다.
- 비디오 생성 및 예측: 고급 컴퓨터 비전 파이프라인에서 모델은 이 기법을 활용하여 시간적 일관성이 엄격하게 유지되는 미래 비디오 프레임을 예측하며, 초기 생성 방식에서 흔히 나타났던 깜박임 아티팩트를 방지합니다.
Diffusion Forcing와 표준 디퓨전 모델 비교#
기본적인 디노이징 메커니즘은 공유하지만 Diffusion Forcing은 표준 디퓨전 모델과 뚜렷하게 다릅니다. 텍스트-이미지 생성에 사용되는 모델과 같은 기존 디퓨전 모델은 일반적으로 하나의 정적인 출력에 포함된 모든 픽셀 또는 잠재 변수를 동시에 디노이징합니다. 반면 Diffusion Forcing은 시계열을 명시적으로 모델링하여 네트워크가 인과적 시퀀스 순서를 준수하도록 합니다. 따라서 궤적 예측 및 행동 인식과 같은 시간적 작업에 훨씬 더 적합합니다.
실제 환경에서 시퀀스 처리 통합하기#
Diffusion Forcing은 주로 생성 시퀀스 작업에 적용되지만, 시간적 시퀀스를 해석하는 것 역시 최신 비전 파이프라인에서 매우 중요합니다. 예를 들어, Ultralytics YOLO26을 사용하면 순차적인 비디오 프레임 전반에서 객체를 효율적으로 추적할 수 있으며, 객체 추적 중에 시간적 일관성을 기본적으로 처리합니다.
from ultralytics import YOLO
# Load the recommended Ultralytics YOLO26 model for high-speed inference
model = YOLO("yolo26n.pt")
# Process a temporal sequence (video) to maintain consistent object identities
results = model.track(source="path/to/video.mp4", stream=True)
# Iterate through the sequence of frames
for frame_result in results:
# Access temporal tracking IDs for objects in the current state
print(f"Tracked {len(frame_result.boxes)} objects in the current frame.")시퀀스 데이터 수집을 확장하고 고급 비전 모델을 학습하려는 팀을 위해 Ultralytics Platform은 복잡한 데이터셋을 관리하고, 실험을 추적하며, 모델을 엣지에 기본적으로 배포할 수 있는 강력한 클라우드 기반 도구를 제공합니다. PyTorch에서 최첨단 인과적 Transformer를 실험하든 실시간 추적 시스템을 배포하든, 공간 데이터와 시간 데이터의 교차점을 이해하는 것은 AI의 미래를 위해 필수적입니다.









