YOLO Vision 2026:
Ultralytics 용어집으로 돌아가기

Deep Reinforcement Learning

심층 강화 학습(DRL)과 이것이 AI 의사결정과 딥러닝을 어떻게 결합하는지 탐구해 보십시오. 오늘날 Ultralytics YOLO26를 인식 계층으로 사용하는 방법을 배우십시오.

심층 강화학습(DRL)은 인공지능(AI)의 고급 하위 집합으로, 강화학습의 의사결정 능력과 심층 학습(DL)의 지각 능력을 결합한 것입니다. 전통적인 강화학습은 상황을 행동에 매핑하기 위해 표 형식의 방법에 의존하지만, 이러한 방법들은 환경이 복잡하거나 시각적일 때 어려움을 겪습니다. DRL은 비디오 프레임이나 센서 판독값과 같은 고차원 입력 데이터를 해석하기 위해 신경망을 사용하여 이를 극복하며, 기계가 명시적인 인간의 지시 없이도 원시 경험을 통해 직접 효과적인 전략을 학습할 수 있도록 합니다.

DRL의 핵심 메커니즘#

DRL 시스템에서 AI 에이전트는 이산적인 시간 단계에서 환경과 상호 작용합니다. 각 단계에서 에이전트는 현재 "상태"를 관찰하고, 정책을 기반으로 행동을 선택하며, 해당 행동의 성공 또는 실패를 나타내는 보상 신호를 받습니다. 주요 목표는 시간에 따른 누적 보상을 극대화하는 것입니다.

"심층" 구성 요소는 정책(행동 전략) 또는 가치 함수(추정된 미래 보상)를 근사화하기 위해 심층 신경망을 사용하는 것을 의미합니다. 이를 통해 에이전트는 비정조화된 데이터를 처리할 수 있으며, 컴퓨터 비전(CV)을 활용하여 인간과 마찬가지로 환경을 "볼" 수 있습니다. 이 기능은 PyTorchTensorFlow와 같은 프레임워크에 의해 구동되며, 이러한 복잡한 네트워크의 학습을 용이하게 합니다.

실제 애플리케이션 사례#

DRL은 이론적 연구를 넘어 다양한 산업 분야에서 실용적이고 영향력 있는 응용 사례로 발전했습니다:

  • 고급 로보틱스: 로보틱스 분야의 AI 분야에서 DRL은 기계가 하드코딩하기 어려운 복잡한 운동 기술을 마스터할 수 있도록 합니다. 로봇은 NVIDIA Isaac Sim과 같은 물리 엔진 내에서 움직임을 다듬어 불규칙한 물체를 잡거나 울퉁불퉁한 지형을 통과하는 법을 배울 수 있습니다. 이는 종종 물리적 하드웨어에 정책을 배포하기 전에 합성 데이터로 학습하는 과정을 포함합니다.
  • 자율 주행: 자율주행 차량은 예측할 수 없는 교통 시나리오에서 실시간 결정을 내리기 위해 DRL을 활용합니다. 객체 검출 모델이 보행자와 표지판을 식별하는 동안, DRL 알고리즘은 해당 정보를 사용하여 차선 합류, 교차로 주행, 속도 제어를 위한 안전한 운전 정책을 결정하며, 안전에 필요한 추론 지연 시간을 효과적으로 관리합니다.

상태 관찰자로서의 비전#

많은 DRL 애플리케이션에서 "상태"는 시각적인 것입니다. 고속 모델은 에이전트의 눈 역할을 하여 원시 이미지를 정책 네트워크가 처리할 수 있는 구조화된 데이터로 변환합니다. 다음 예시는 YOLO26 모델이 환경에서 관측값(예: 장애물 수)을 추출하여 에이전트의 지각 레이어 역할을 하는 방법을 보여줍니다.

from ultralytics import YOLO

# Load YOLO26n to serve as the perception layer for a DRL agent
model = YOLO("yolo26n.pt")

# Simulate an observation from the environment (e.g., a robot's camera feed)
observation_frame = "https://ultralytics.com/images/bus.jpg"

# Perform inference to extract the state (detected objects)
results = model(observation_frame)

# The detection count serves as a simplified state feature for the agent's policy
print(f"State Observation: {len(results[0].boxes)} objects detected.")

DRL과 관련 개념의 구별#

AI 환경 내에서 고유한 위치를 이해하기 위해 심층 강화 학습을 유사한 용어와 구별하는 것이 도움이 됩니다:

  • 강화학습(RL): 표준 RL은 기본 개념이지만 일반적으로 대규모 상태 공간에 대해 비실용적이 되는 조회 테이블(Q-테이블 등)에 의존합니다. DRL은 심층 학습을 사용하여 함수를 근사화함으로써 이를 해결하며, 이미지와 같은 복잡한 입력을 처리할 수 있게 합니다.
  • 인간 피드백 기반 강화학습(RLHF): DRL이 일반적으로 수학적으로 정의된 보상 함수(예: 게임 내 점수)를 최적화하는 반면, RLHF는 대규모 언어 모델(LLMs)을 주관적인 인간의 선호도를 사용하여 미세 조정함으로써 AI 행동을 인간의 가치에 맞추는 기법으로, OpenAI와 같은 연구 그룹에 의해 대중화되었습니다.
  • 비지도 학습: 비지도 방법은 명시적인 피드백 없이 데이터에서 숨겨진 패턴을 찾습니다. 이와 대조적으로 DRL은 Sutton과 Barto의 기초 문헌에서 논의된 바와 같이, 에이전트를 특정 목표로 적극적으로 안내하는 보상 신호에 의해 구동되는 목표 지향적 방식입니다.

DRL 시스템의 지각 레이어에 필요한 데이터셋을 관리하고자 하는 개발자는 Ultralytics Platform을 활용할 수 있으며, 이는 주석 및 클라우드 학습 워크플로우를 간소화합니다. 또한 연구자들은 Gymnasium과 같은 표준화된 환경을 사용하여 기존 기준선과 DRL 알고리즘을 벤치마킹하는 경우가 많습니다.

Explore solutions

Real-time AI that works with your team

로봇 공학에서의 AI

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 AI

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업에서의 AI

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 AI

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 AI

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 AI

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 AI

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기
Real-time AI that works with your team

로봇 공학에서의 AI

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 AI

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업에서의 AI

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 AI

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 AI

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 AI

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 AI

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기
Real-time AI that works with your team

로봇 공학에서의 AI

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 AI

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업에서의 AI

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 AI

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 AI

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 AI

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 AI

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기

미래의 AI를 함께 구축합시다!

머신 러닝의 미래와 함께 여정을 시작하십시오.