Ultralytics YOLO27:
Ultralytics 용어집으로 돌아가기

Reinforcement Learning from Human Feedback (RLHF)

Reinforcement Learning from Human Feedback(RLHF)이 AI를 인간의 가치에 맞추는 방법을 알아보세요. 핵심 구성 요소와 Ultralytics YOLO26과의 integration을 살펴보세요.

인간 피드백을 통한 강화 학습 (RLHF)은 직접적인 인간의 입력을 학습 루프에 통합하여 인공지능 모델을 개선하는 고급 머신러닝 기법입니다. 정적인 레이블 데이터셋에만 의존하는 일반적인 지도 학습과 달리, RLHF는 인간 평가자가 모델의 출력을 순위 지정하거나 평가하는 동적 피드백 메커니즘을 도입합니다. 이 프로세스를 통해 AI는 단순한 수학적 손실 함수로 정의하기 어려운 "유용성", "안전성" 또는 "창의성"과 같은 복잡하고 주관적이거나 미묘한 목표를 포착할 수 있습니다. RLHF는 최신 대규모 언어 모델 (LLMs)과 생성형 AI 개발의 핵심 요소가 되었으며, 강력한 파운데이션 모델이 인간의 가치와 사용자의 의도에 효과적으로 부합하도록 합니다.

RLHF의 핵심 구성 요소#

RLHF 프로세스는 일반적으로 원시 예측 능력과 인간의 의도에 부합하는 동작 간의 격차를 해소하도록 설계된 3단계 파이프라인을 따릅니다.

  1. 지도 미세 조정 (SFT): 일반적으로 워크플로는 사전 학습된 파운데이션 모델로 시작합니다. 개발자는 시연 데이터(예: 전문가가 작성한 질문-답변 쌍)로 구성된 더 작고 품질이 높은 데이터셋을 사용하여 초기 미세 조정을 수행합니다. 이 단계에서는 기준 정책을 수립하고, 모델이 해당 작업에 필요한 일반적인 형식과 어조를 학습하도록 합니다.

  2. 보상 모델 학습: 이 단계는 RLHF를 구별하는 핵심 특징입니다. 인간 어노테이터는 동일한 입력에 대해 모델이 생성한 여러 출력을 검토하고 가장 좋은 결과부터 가장 나쁜 결과까지 순위를 매깁니다. 이 데이터 레이블링 작업을 통해 선호도 데이터셋이 생성됩니다. 보상 모델이라고 하는 별도의 신경망을 이 비교 데이터로 학습하여 인간의 판단을 반영하는 스칼라 점수를 예측하도록 합니다. Ultralytics Platform에서 제공하는 도구를 사용하면 이러한 어노테이션 워크플로의 관리를 간소화할 수 있습니다.

  3. 강화 학습 최적화: 마지막으로 원래 모델은 강화 학습 환경 내에서 AI 에이전트로 작동합니다. 보상 모델을 지침으로 사용하여 근접 정책 최적화 (PPO)와 같은 최적화 알고리즘이 모델의 파라미터를 조정해 기대 보상을 최대화합니다. 이 단계에서는 모델의 정책을 학습된 인간의 선호도에 맞추고, 유용하고 안전한 동작을 장려하는 동시에 유해하거나 무의미한 출력을 억제합니다.

실제 적용 사례#

RLHF는 높은 안전 기준과 인간 상호작용에 대한 미묘한 이해가 필요한 AI 시스템을 배포하는 데 매우 중요한 기술임이 입증되었습니다.

  • 대화형 AI 및 챗봇: RLHF의 가장 대표적인 적용 분야는 챗봇을 유용하고 무해하며 정직하게 조정하는 것입니다. 편향되거나 사실과 다르거나 위험한 출력에 불이익을 줌으로써 RLHF는 LLMs의 환각을 완화하고 알고리즘 편향의 위험을 줄이는 데 도움을 줍니다. 이를 통해 가상 어시스턴트는 유해한 지시를 거부하면서도 정당한 질문에는 유용하게 답변할 수 있습니다.
  • 로보틱스 및 물리적 제어: RLHF는 텍스트를 넘어 로보틱스 분야의 AI로 확장되며, 복잡한 물리적 작업에 대한 완벽한 보상 함수를 정의하기 어려운 경우에 활용됩니다. 예를 들어 혼잡한 창고에서 이동하는 방법을 학습하는 로봇은 어떤 궤적이 안전했는지, 어떤 궤적이 작업을 방해했는지에 대해 인간 감독자로부터 피드백을 받을 수 있습니다. 이러한 피드백은 목표 달성만을 기준으로 하는 단순한 딥 강화 학습보다 로봇의 제어 정책을 효과적으로 개선합니다.

RLHF와 표준 강화 학습 비교#

RLHF의 구체적인 유용성을 이해하려면 RLHF와 기존의 강화 학습 (RL)을 구분하는 것이 도움이 됩니다.

  • 표준 RL: 기존 환경에서는 보상 함수가 환경에 의해 하드코딩되는 경우가 많습니다. 예를 들어 비디오 게임에서는 환경이 명확한 신호를 제공합니다(승리 시 +1, 패배 시 -1). 에이전트는 정의된 마르코프 의사결정 과정 (MDP) 내에서 행동을 최적화합니다.
  • RLHF: 창의적인 이야기를 쓰거나 예의 바르게 운전하는 것처럼 실제 세계의 많은 상황에서는 "성공"이 주관적입니다. RLHF는 하드코딩된 보상을 인간의 선호도에서 도출된 학습된 보상 모델로 대체하여 이 문제를 해결합니다. 이를 통해 명시적으로 프로그래밍할 수 없는 "품질"이나 "적절성"과 같은 추상적 개념을 최적화할 수 있습니다.

피드백 루프와 인식의 통합#

시각적 애플리케이션에서 RLHF에 맞게 조정된 에이전트는 행동하기 전에 환경의 상태를 인식하기 위해 컴퓨터 비전 (CV)에 의존하는 경우가 많습니다. YOLO26과 같은 강력한 디텍터는 인식 계층으로 작동하며, 정책 네트워크가 행동을 선택하는 데 사용하는 구조화된 관측값(예: "3미터 지점에서 장애물 감지")을 제공합니다.

다음 Python 예제는 YOLO 모델이 환경 상태를 제공하는 단순화된 개념을 보여줍니다. 전체 RLHF 루프에서는 이 감지 데이터를 기반으로 에이전트의 의사결정에 대한 인간 피드백을 사용해 학습된 모델에서 "보상" 신호가 제공됩니다.

from ultralytics import YOLO

# Load YOLO26n to act as the perception layer for an intelligent agent
model = YOLO("yolo26n.pt")

# The agent observes the environment (an image) to determine its state
results = model("https://ultralytics.com/images/bus.jpg")

# In an RL context, the 'state' is derived from detections
# A reward model (trained via RLHF) would evaluate the action taken based on this state
detected_objects = len(results[0].boxes)

print(f"Agent Observation: Detected {detected_objects} objects.")
# Example output: Agent Observation: Detected 4 objects.

강력한 인식 모델과 인간 피드백을 통해 개선된 정책을 결합하면 개발자는 지능적일 뿐만 아니라 AI 안전성 원칙에도 엄격하게 부합하는 시스템을 구축할 수 있습니다. 헌법적 AI와 같은 확장 가능한 감독에 대한 지속적인 연구는 높은 모델 성능을 유지하면서 대규모 인간 어노테이션의 병목 현상을 줄이는 것을 목표로 이 분야를 계속 발전시키고 있습니다.

Explore solutions

항공 이미지를 위한 컴퓨터 비전

항공 이미지를 위한 컴퓨터 비전

Ultralytics YOLO을 활용하여 드론 및 항공 이미지를 농업, 수산업, 환경 모니터링, 자연 보호, 지리 공간 분석을 위한 실시간 인사이트로 변환합니다.
자세히 알아보기
항공우주 분야의 컴퓨터 비전

항공우주 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 항공 모니터링에 비전 AI를 도입하세요. 컴퓨터 비전 솔루션으로 드론, 항공우주 워크플로, 환경 보전 및 지리 공간 산업을 지원합니다.
자세히 알아보기

Ultralytics YOLO 모델로 모든 사이트를 보호하세요. 비전 AI는 경계 모니터링, 위협 탐지, 번호판 인식 및 작업장 안전을 지원합니다.
자세히 알아보기
로보틱스 컴퓨터 비전

로보틱스 컴퓨터 비전

Ultralytics YOLO 모델로 더 스마트한 기계의 성능을 구현하세요. 로보틱스의 Vision AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 지원합니다.
자세히 알아보기
물류 컴퓨터 비전

물류 컴퓨터 비전

Ultralytics YOLO 모델로 물류를 효율화하세요. Vision AI는 패키지 검사, 분류, 차량 추적 및 창고의 실시간 안전 모니터링을 지원합니다.
자세히 알아보기
소매 컴퓨터 비전

소매 컴퓨터 비전

Ultralytics YOLO 모델로 소매업을 새롭게 혁신하세요. Vision AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
자세히 알아보기
헬스케어 분야의 컴퓨터 비전

헬스케어 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 헬스케어 솔루션을 구축하십시오. 헬스케어 분야의 Vision AI는 더 빠른 의료 영상 처리, 더욱 스마트한 진단, 환자 모니터링을 지원합니다.
자세히 알아보기
제조 분야의 컴퓨터 비전

제조 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 제조를 최적화하십시오. Vision AI는 품질 관리, 결함 탐지, PPE 준수, 조립 라인 자동화를 지원합니다.
자세히 알아보기
자동차 산업의 컴퓨터 비전

자동차 산업의 컴퓨터 비전

Ultralytics YOLO 모델을 활용해 자동차 산업에 컴퓨터 비전을 적용합니다. 비전 AI는 도로 안전, 운전자 보조, 차량 자동화를 향상해 더 스마트한 도로를 구현합니다.
자세히 알아보기
농업의 컴퓨터 비전

농업의 컴퓨터 비전

Ultralytics YOLO 모델로 스마트 농업에 비전 AI를 도입합니다. 작물 모니터링, 가축 추적, 정밀 농업을 강화해 더 높은 수확량을 스마트하게 실현합니다.
자세히 알아보기
항공 이미지를 위한 컴퓨터 비전

항공 이미지를 위한 컴퓨터 비전

Ultralytics YOLO을 활용하여 드론 및 항공 이미지를 농업, 수산업, 환경 모니터링, 자연 보호, 지리 공간 분석을 위한 실시간 인사이트로 변환합니다.
자세히 알아보기
항공우주 분야의 컴퓨터 비전

항공우주 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 항공 모니터링에 비전 AI를 도입하세요. 컴퓨터 비전 솔루션으로 드론, 항공우주 워크플로, 환경 보전 및 지리 공간 산업을 지원합니다.
자세히 알아보기

Ultralytics YOLO 모델로 모든 사이트를 보호하세요. 비전 AI는 경계 모니터링, 위협 탐지, 번호판 인식 및 작업장 안전을 지원합니다.
자세히 알아보기
로보틱스 컴퓨터 비전

로보틱스 컴퓨터 비전

Ultralytics YOLO 모델로 더 스마트한 기계의 성능을 구현하세요. 로보틱스의 Vision AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 지원합니다.
자세히 알아보기
물류 컴퓨터 비전

물류 컴퓨터 비전

Ultralytics YOLO 모델로 물류를 효율화하세요. Vision AI는 패키지 검사, 분류, 차량 추적 및 창고의 실시간 안전 모니터링을 지원합니다.
자세히 알아보기
소매 컴퓨터 비전

소매 컴퓨터 비전

Ultralytics YOLO 모델로 소매업을 새롭게 혁신하세요. Vision AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
자세히 알아보기
헬스케어 분야의 컴퓨터 비전

헬스케어 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 헬스케어 솔루션을 구축하십시오. 헬스케어 분야의 Vision AI는 더 빠른 의료 영상 처리, 더욱 스마트한 진단, 환자 모니터링을 지원합니다.
자세히 알아보기
제조 분야의 컴퓨터 비전

제조 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 제조를 최적화하십시오. Vision AI는 품질 관리, 결함 탐지, PPE 준수, 조립 라인 자동화를 지원합니다.
자세히 알아보기
자동차 산업의 컴퓨터 비전

자동차 산업의 컴퓨터 비전

Ultralytics YOLO 모델을 활용해 자동차 산업에 컴퓨터 비전을 적용합니다. 비전 AI는 도로 안전, 운전자 보조, 차량 자동화를 향상해 더 스마트한 도로를 구현합니다.
자세히 알아보기
농업의 컴퓨터 비전

농업의 컴퓨터 비전

Ultralytics YOLO 모델로 스마트 농업에 비전 AI를 도입합니다. 작물 모니터링, 가축 추적, 정밀 농업을 강화해 더 높은 수확량을 스마트하게 실현합니다.
자세히 알아보기
항공 이미지를 위한 컴퓨터 비전

항공 이미지를 위한 컴퓨터 비전

Ultralytics YOLO을 활용하여 드론 및 항공 이미지를 농업, 수산업, 환경 모니터링, 자연 보호, 지리 공간 분석을 위한 실시간 인사이트로 변환합니다.
자세히 알아보기
항공우주 분야의 컴퓨터 비전

항공우주 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 항공 모니터링에 비전 AI를 도입하세요. 컴퓨터 비전 솔루션으로 드론, 항공우주 워크플로, 환경 보전 및 지리 공간 산업을 지원합니다.
자세히 알아보기

Ultralytics YOLO 모델로 모든 사이트를 보호하세요. 비전 AI는 경계 모니터링, 위협 탐지, 번호판 인식 및 작업장 안전을 지원합니다.
자세히 알아보기
로보틱스 컴퓨터 비전

로보틱스 컴퓨터 비전

Ultralytics YOLO 모델로 더 스마트한 기계의 성능을 구현하세요. 로보틱스의 Vision AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 지원합니다.
자세히 알아보기
물류 컴퓨터 비전

물류 컴퓨터 비전

Ultralytics YOLO 모델로 물류를 효율화하세요. Vision AI는 패키지 검사, 분류, 차량 추적 및 창고의 실시간 안전 모니터링을 지원합니다.
자세히 알아보기
소매 컴퓨터 비전

소매 컴퓨터 비전

Ultralytics YOLO 모델로 소매업을 새롭게 혁신하세요. Vision AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
자세히 알아보기
헬스케어 분야의 컴퓨터 비전

헬스케어 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 헬스케어 솔루션을 구축하십시오. 헬스케어 분야의 Vision AI는 더 빠른 의료 영상 처리, 더욱 스마트한 진단, 환자 모니터링을 지원합니다.
자세히 알아보기
제조 분야의 컴퓨터 비전

제조 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 제조를 최적화하십시오. Vision AI는 품질 관리, 결함 탐지, PPE 준수, 조립 라인 자동화를 지원합니다.
자세히 알아보기
자동차 산업의 컴퓨터 비전

자동차 산업의 컴퓨터 비전

Ultralytics YOLO 모델을 활용해 자동차 산업에 컴퓨터 비전을 적용합니다. 비전 AI는 도로 안전, 운전자 보조, 차량 자동화를 향상해 더 스마트한 도로를 구현합니다.
자세히 알아보기
농업의 컴퓨터 비전

농업의 컴퓨터 비전

Ultralytics YOLO 모델로 스마트 농업에 비전 AI를 도입합니다. 작물 모니터링, 가축 추적, 정밀 농업을 강화해 더 높은 수확량을 스마트하게 실현합니다.
자세히 알아보기

AI의 미래를 함께 만들어가세요!

머신러닝의 미래와 함께 여정을 시작하세요