YOLO Vision 2026:
Ultralytics 용어집으로 돌아가기

Reinforcement Learning from Human Feedback (RLHF)

인간 피드백 기반 강화 학습(RLHF)이 어떻게 AI를 인간의 가치에 부합하게 만드는지 알아보십시오. 핵심 구성 요소와 Ultralytics YOLO26과의 통합을 확인해 보십시오.

인간 피드백 기반 강화학습(RLHF)은 학습 루프에 직접적인 인간의 입력을 통합하여 인공지능 모델을 개선하는 고급 머신러닝 기법입니다. 정적이고 레이블이 지정된 데이터셋에만 의존하는 표준 지도 학습(supervised learning)과 달리, RLHF는 인간 평가자가 모델의 출력을 순위 매기거나 평가하는 동적 피드백 메커니즘을 도입합니다. 이 프로세스를 통해 AI는 단순한 수학적 손실 함수로 정의하기 어려운 "도움성", "안전성" 또는 "창의성"과 같은 복잡하고 주관적이거나 미묘한 목표를 포착할 수 있습니다. RLHF는 현대 대규모 언어 모델(LLM) 및 생성형 AI 개발의 핵심 요소가 되어 강력한 파운데이션 모델이 인간의 가치 및 사용자 의도와 효과적으로 일치하도록 보장합니다.

RLHF의 핵심 구성 요소#

RLHF 프로세스는 일반적으로 원시적인 예측 능력과 인간의 행동 정렬 사이의 간극을 메우도록 설계된 3단계 파이프라인을 따릅니다.

  1. 지도 파인튜닝(SFT): 워크플로는 일반적으로 사전 학습된 파운데이션 모델(foundation model)로 시작됩니다. 개발자는 전문가가 작성한 질문-답변 쌍 등 더 작고 고품질인 시연 데이터셋을 사용하여 초기 파인튜닝(fine-tuning)을 수행합니다. 이 단계는 기본 정책을 수립하여 모델에 작업에 필요한 일반적인 형식과 어조를 가르칩니다.

  2. 보상 모델 학습: 이 단계는 RLHF의 차별화된 특징입니다. 인간 주석자가 동일한 입력에 대해 모델이 생성한 여러 출력을 검토하고 가장 좋은 것부터 가장 나쁜 것까지 순위를 매깁니다. 이러한 데이터 레이블링(data labeling) 작업은 선호도 데이터셋을 생성합니다. 보상 모델이라고 하는 별도의 신경망(neural network)이 이 비교 데이터를 기반으로 학습되어 인간의 판단을 반영하는 스칼라 점수를 예측합니다. Ultralytics Platform에서 제공하는 도구를 사용하면 이러한 주석 워크플로의 관리를 간소화할 수 있습니다.

  3. 강화학습 최적화: 마지막으로, 원래 모델은 강화학습 환경 내에서 AI 에이전트(AI agent) 역할을 합니다. 보상 모델을 가이드로 사용하여 근접 정책 최적화(PPO)와 같은 최적화 알고리즘이 모델의 파라미터를 조정하여 예상 보상을 극대화합니다. 이 단계는 모델의 정책을 학습된 인간의 선호도와 일치시켜, 유익하고 안전한 행동을 장려하는 동시에 독성이 있거나 터무니없는 출력을 억제합니다.

실제 애플리케이션 사례#

RLHF는 높은 안전 기준과 인간 상호작용에 대한 미묘한 이해가 필요한 AI 시스템을 배포하는 데 필수적인 것으로 입증되었습니다.

  • 대화형 AI 및 챗봇: RLHF의 가장 두드러진 응용 분야는 챗봇이 유익하고 무해하며 정직하도록 정렬하는 것입니다. 편향되거나 사실과 다르거나 위험한 출력에 페널티를 부과함으로써 RLHF는 LLM의 환각(hallucination in LLMs)을 완화하고 알고리즘 편향(algorithmic bias)의 위험을 줄이는 데 도움을 줍니다. 이를 통해 가상 비서는 합로운 질문에 유용하게 대응하면서도 유해한 지시를 거부할 수 있습니다.
  • 로보틱스 및 물리 제어: RLHF는 텍스트를 넘어 복잡한 물리적 작업에 대한 완벽한 보상 함수를 정의하기 어려운 로보틱스 분야의 AI(AI in robotics)로 확장됩니다. 예를 들어, 혼잡한 창류를 탐색하는 법을 배우는 로봇은 어떤 궤적이 안전했고 어떤 궤적이 문제를 일으켰는지에 대해 인간 감독자로부터 피드백을 받을 수 있습니다. 이 피드백은 순전히 목표 달성만을 기반으로 하는 단순한 심층 강화학습(deep reinforcement learning)보다 로봇의 제어 정책을 더 효과적으로 개선합니다.

RLHF와 표준 강화학습의 비교#

특정 효용을 이해하기 위해 RLHF를 전통적인 강화학습(RL)과 구분하는 것이 유용합니다.

  • 표준 RL: 전통적인 설정에서 보상 함수는 환경에 의해 하드코딩되는 경우가 많습니다. 예를 들어, 비디오 게임에서 환경은 명확한 신호(승리 시 +1, 패배 시 -1)를 제공합니다. 에이전트는 정의된 마르코프 결정 프로세스(MDP) 내에서 행동을 최적화합니다.
  • RLHF: 창의적인 이야기를 쓰거나 예의 바르게 운전하는 것과 같은 많은 실제 시나리오에서 '성공'은 주관적입니다. RLHF는 하드코딩된 보상을 인간의 선호도에서 파생된 학습된 보상 모델로 대체하여 이 문제를 해결합니다. 이를 통해 명시적으로 프로그래밍할 수 없는 '품질'이나 '적절성'과 같은 추상적 개념을 최적화할 수 있습니다.

피드백 루프와 인식 통합#

시각적 응용 프로그램에서 RLHF로 정렬된 에이전트는 행동하기 전에 환경의 상태를 인식하기 위해 종종 컴퓨터 비전(CV)에 의존합니다. YOLO26과 같은 강력한 디텍터가 인식 레이어 역할을 하여 정책 네트워크가 행동을 선택하는 데 사용하는 구조화된 관측값(예: "3미터 거리에 장애물 감지됨")을 제공합니다.

다음 Python 예제는 YOLO 모델이 환경 상태를 제공하는 간소화된 개념을 보여줍니다. 전체 RLHF 루프에서 '보상' 신호는 이 탐지 데이터를 기반으로 한 에이전트의 결정에 대한 인간 피드백을 학습한 모델에서 나옵니다.

from ultralytics import YOLO

# Load YOLO26n to act as the perception layer for an intelligent agent
model = YOLO("yolo26n.pt")

# The agent observes the environment (an image) to determine its state
results = model("https://ultralytics.com/images/bus.jpg")

# In an RL context, the 'state' is derived from detections
# A reward model (trained via RLHF) would evaluate the action taken based on this state
detected_objects = len(results[0].boxes)

print(f"Agent Observation: Detected {detected_objects} objects.")
# Example output: Agent Observation: Detected 4 objects.

강력한 인식 모델과 인간 피드백을 통해 개선된 정책을 결합함으로써, 개발자는 지능적일 뿐만 아니라 AI 안전성(AI safety) 원칙에 엄격하게 부합하는 시스템을 구축할 수 있습니다. 헌법적 AI(Constitutional AI)와 같은 확장 가능한 감독에 대한 지속적인 연구는 대규모 인간 주석의 병목 현상을 줄이고 높은 모델 성능을 유지하는 것을 목표로 이 분야를 계속 발전시키고 있습니다.

Explore solutions

Real-time AI that works with your team

로봇 공학에서의 AI

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 AI

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업에서의 AI

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 AI

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 AI

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 AI

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 AI

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기
Real-time AI that works with your team

로봇 공학에서의 AI

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 AI

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업에서의 AI

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 AI

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 AI

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 AI

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 AI

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기
Real-time AI that works with your team

로봇 공학에서의 AI

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 AI

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업에서의 AI

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 AI

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 AI

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 AI

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 AI

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기

미래의 AI를 함께 구축합시다!

머신 러닝의 미래와 함께 여정을 시작하십시오.