Deep Reinforcement Learning
Deep Reinforcement Learning (DRL)과 AI의 의사 결정 및 딥 러닝을 결합하는 방법을 살펴보세요. 지금 Ultralytics YOLO26을 인식 계층으로 사용하는 방법을 알아보세요.
심층 강화 학습(DRL)은 인공지능(AI)의 고급 하위 분야로, 강화 학습의 의사 결정 능력과 딥러닝(DL)의 지각 능력을 결합합니다. 기존 강화 학습은 상황을 행동에 매핑하기 위해 표 형식의 방법에 의존하지만, 환경이 복잡하거나 시각적인 경우 이러한 방법은 한계가 있습니다. DRL은 신경망을 사용하여 비디오 프레임이나 센서 판독값과 같은 고차원 입력 데이터를 해석함으로써 이 문제를 해결하며, 명시적인 사람의 지시 없이 원시 경험에서 직접 효과적인 전략을 학습할 수 있도록 합니다.
DRL의 핵심 메커니즘#
DRL 시스템에서 AI 에이전트는 이산적인 시간 단계에 따라 환경과 상호작용합니다. 각 단계에서 에이전트는 현재 "상태"를 관찰하고, 정책에 따라 행동을 선택하며, 해당 행동의 성공 또는 실패를 나타내는 보상 신호를 받습니다. 주요 목표는 시간에 따른 누적 보상을 최대화하는 것입니다.
"딥" 구성 요소는 정책(행동 전략) 또는 가치 함수(추정된 미래 보상)를 근사하기 위해 딥 신경망을 사용하는 것을 의미합니다. 이를 통해 에이전트는 비정형 데이터를 처리할 수 있으며, 컴퓨터 비전(CV)을 활용해 사람이 환경을 "보는" 것과 유사하게 환경을 인식합니다. 이러한 기능은 PyTorch나 TensorFlow와 같은 프레임워크를 통해 구현되며, 이러한 복잡한 네트워크의 학습을 지원합니다.
실제 적용 사례#
DRL은 이론적 연구를 넘어 다양한 산업 분야에서 실용적이고 영향력 높은 애플리케이션으로 발전했습니다.
- 고급 로보틱스: 로보틱스 분야의 AI에서 DRL은 하드코딩하기 어려운 복잡한 운동 기술을 기계가 습득할 수 있도록 합니다. 로봇은 NVIDIA Isaac Sim과 같은 물리 엔진 내에서 움직임을 개선하며 불규칙한 물체를 잡거나 고르지 않은 지형을 이동하는 방법을 학습할 수 있습니다. 이 과정에서는 정책을 실제 하드웨어에 배포하기 전에 합성 데이터를 사용해 학습하는 경우가 많습니다.
- 자율 주행: 자율주행 차량은 예측하기 어려운 교통 상황에서 실시간 의사 결정을 내리기 위해 DRL을 활용합니다. 객체 탐지 모델이 보행자와 표지판을 식별하면, DRL 알고리즘은 해당 정보를 사용하여 차선 합류, 교차로 통과, 속도 제어를 위한 안전한 주행 정책을 결정하고, 안전에 필요한 추론 지연 시간을 효과적으로 관리합니다.
상태 관찰자로서의 비전#
많은 DRL 애플리케이션에서 "상태"는 시각적입니다. 고속 모델은 에이전트의 눈 역할을 하여 원시 이미지를 정책 네트워크가 활용할 수 있는 구조화된 데이터로 변환합니다. 다음 예제에서는 YOLO26 모델이 에이전트의 인식 계층으로 작동하여 환경에서 관찰 정보(예: 장애물 수)를 추출하는 방식을 보여 줍니다.
from ultralytics import YOLO
# Load YOLO26n to serve as the perception layer for a DRL agent
model = YOLO("yolo26n.pt")
# Simulate an observation from the environment (e.g., a robot's camera feed)
observation_frame = "https://ultralytics.com/images/bus.jpg"
# Perform inference to extract the state (detected objects)
results = model(observation_frame)
# The detection count serves as a simplified state feature for the agent's policy
print(f"State Observation: {len(results[0].boxes)} objects detected.")관련 개념과 DRL 구분하기#
AI 분야에서 심층 강화 학습이 차지하는 고유한 위치를 이해하려면 유사한 용어와 구분하는 것이 도움이 됩니다.
- 강화 학습(RL): 표준 RL은 기본이 되는 개념이지만 일반적으로 조회 테이블(Q 테이블 등)에 의존하며, 이러한 테이블은 상태 공간이 큰 경우 실용성이 떨어집니다. DRL은 딥러닝을 사용해 함수를 근사함으로써 이 문제를 해결하고 이미지와 같은 복잡한 입력을 처리할 수 있도록 합니다.
- 인간 피드백을 통한 강화 학습(RLHF): DRL은 일반적으로 수학적으로 정의된 보상 함수(예: 게임의 점수)를 최적화하는 반면, RLHF는 주관적인 사람의 선호도를 사용하여 모델, 특히 대규모 언어 모델(LLMs)을 개선하고 AI의 동작을 인간의 가치에 맞춥니다. 이는 OpenAI와 같은 연구 그룹이 대중화한 기법입니다.
- 비지도 학습: 비지도 방법은 명시적인 피드백 없이 데이터에서 숨겨진 패턴을 찾습니다. 반면 DRL은 목표 지향적이며, 특정 목적을 향해 에이전트를 적극적으로 유도하는 보상 신호에 의해 구동됩니다. 이는 Sutton과 Barto의 기초 저서에서 논의된 내용입니다.
DRL 시스템의 인식 계층에 필요한 데이터셋을 관리하려는 개발자는 주석 처리와 클라우드 학습 워크플로를 간소화하는 Ultralytics Platform을 활용할 수 있습니다. 또한 연구자들은 DRL 알고리즘을 기존 베이스라인과 비교하여 벤치마크하기 위해 Gymnasium과 같은 표준화된 환경을 자주 사용합니다.









