Reward Modeling
머신러닝의 보상 모델링을 살펴보십시오. 인간 피드백을 사용하여 AI 에이전트와 Ultralytics YOLO26 모델을 정렬하여 더 안전하고 정확한 성능을 이끌어내는 방법을 배우십시오.
리워드 모델링은 인간의 선호도를 바탕으로 인공지능 시스템이 자신의 행동을 평가하고 우선순위를 정하는 방법을 학습하도록 가르치는 데 사용되는 머신러닝 기법입니다. 전통적인 reinforcement learning 환경에서 AI agent는 비디오 게임의 점수처럼 미리 정의되고 수학적으로 엄격한 리워드 함수를 최대화하는 방식으로 학습합니다. 그러나 정중한 이메일 작성이나 교차로 안전 운행처럼 "좋은" 행동이 주관적이거나 미묘한 복잡한 실제 작업에서는 완벽한 리워드 함수를 수작업으로 작성하는 것이 거의 불가능합니다. 리워드 모델링은 인간의 판단을 대행할 보조 neural network(리워드 모델)를 학습시켜 이 문제를 해결합니다. 이 모델은 기본 AI의 출력을 평가하고 스칼라 점수를 부여하여, 주요 모델이 안전하고 유용하며 정확한 행동을 하도록 동적으로 유도합니다.
보상 모델링의 작동 방식#
보상 모델을 구축하기 위한 파이프라인은 고품질의 인간 피드백을 수집하는 데 크게 의존합니다.
- Data Labeling 및 선호도: 인간 주석자에게는 AI 모델이 생성한 여러 응답과 함께 프롬프트가 제공됩니다. 평가자는 유용성, 무해성, 정확성 등의 기준에 따라 이러한 응답을 가장 좋은 것부터 가장 나쁜 것까지 순위를 매깁니다. 이러한 대규모 주석 워크플로 관리는 Ultralytics Platform을 사용하여 원활하게 처리할 수 있습니다.
- 프록시 네트워크 학습: 이 인간 비교 데이터셋을 바탕으로 특화된 신경망이 학습됩니다. 최적화 과정을 통해 행동 또는 텍스트 응답의 embeddings을 단일 스칼라 리워드 값으로 매핑하여 인간이 선호할 출력을 예측하는 법을 학습합니다. 신경망 아키텍처 구축에 대한 자세한 내용은 PyTorch API documentation에서 확인할 수 있습니다.
- 정책 최적화: 기본 모델은 리워드 모델의 지속적인 피드백을 사용하여 행동을 개선하며, 주로 Proximal Policy Optimization (PPO)와 같은 알고리즘을 활용합니다. 이 단계는 모델의 정책을 학습된 인간의 의도와 반복적으로 일치시킵니다.
보상 모델링과 RLHF의 차이#
리워드 모델링을 Reinforcement Learning from Human Feedback (RLHF)와 구분하는 것은 중요합니다. 두 용어는 자주 함께 논의되지만 동의어는 아닙니다. RLHF는 모델을 정렬하는 데 사용되는 포괄적인 엔드투엔드 파이프라인으로, 지도 미세 조정, 데이터 수집, 정책 업데이트를 포함합니다. 리워드 모델링은 RLHF 파이프라인 내의 구체적이고 핵심적인 구성 요소입니다. 이는 이산적인 인간의 순위를 강화학습 알고리즘이 최적화할 수 있는 연속적인 수학적 신호로 변환하는 다리 역할을 합니다.
실제 애플리케이션 사례#
보상 모델링은 인간 및 물리적 세계와 직접 상호작용하는 현대적인 AI 시스템을 개발하는 데 필수적인 역할을 합니다.
- Large Language Models (LLMs): 대화형 AI 어시스턴트는 답변이 사실에 부합할 뿐만 아니라 정중하고 관련성이 있으며 유해한 언어가 없도록 보장하기 위해 리워드 모델에 의존합니다. AI safety를 탐구하는 조직은 helpful and harmless AI alignment을 반영하는 시스템을 구축하기 위해 리워드 모델링을 지속적으로 발전시키고 있습니다.
- Autonomous Vehicles 및 로보틱스: 물리적 자동화에서 리워드 모델은 로봇이 복잡한 운전 예절이나 물체 조작 전략을 이해하도록 돕습니다. Ultralytics YOLO26으로 구동되는 인지 시스템은 보행자와 교통표지판을 감지할 수 있으며, 리워드 모델은 차량의 계획된 궤적을 평가하여 AI가 순전한 공격적인 지점 간 내비게이션보다 승객의 편안함과 안전을 우선시하도록 보장합니다.
기본적인 보상 모델 개념 구현#
다음 Python 예제는 torch을 사용하여 리워드 모델의 기초 구조를 보여줍니다. 실제로 이 네트워크는 인간의 선호도와 일치하는 출력에 더 높은 스칼라 점수를 할당하는 법을 학습합니다.
import torch
import torch.nn as nn
# Define a simplified reward model architecture
class SimpleRewardModel(nn.Module):
def __init__(self):
super().__init__()
# Maps the AI's output embedding to a single reward score
self.fc = nn.Linear(768, 1)
def forward(self, embeddings):
return self.fc(embeddings)
# Initialize the model
reward_model = SimpleRewardModel()
# Simulated embeddings for a human-preferred action and a rejected action
chosen_action = torch.randn(1, 768)
rejected_action = torch.randn(1, 768)
# The model predicts scalar scores to guide the primary agent
print(f"Chosen Action Reward: {reward_model(chosen_action).item():.4f}")
print(f"Rejected Action Reward: {reward_model(rejected_action).item():.4f}")정렬(alignment)이 오픈소스 파운데이션 모델에 미치는 영향에 대해 더 깊이 탐구하려면, 언어 모델을 인간의 의도에 맞추는 것에 대한 기초 연구를 살펴보고 computer vision (CV) 시스템이 고급 피드백 루프를 활용하여 동적 환경과 안전하게 상호작용하는 방법을 알아보세요.






