YOLO Vision 2026:
Ultralytics 용어집으로 돌아가기

Process Reward Model (PRM)

프로세스 보상 모델(PRM)이 AI 추론을 어떻게 향상시키는지 탐구해 보십시오. RLHF의 단계별 피드백이 LLM과 Ultralytics YOLO26을 위해 어떻게 논리적이고 안전한 경로를 보장하는지 배우십시오.

복잡한 인공지능 모델을 평가하는 것은 단순히 최종 답변이 올바른지 확인하는 것 이상의 작업을 요구합니다. 고도로 특화된 강화학습 기법은 AI가 작업 수행 중에 거치는 각 중간 단계에 수학적 점수를 부여하여 조밀하고 단계별적인 피드백을 제공합니다. 이러한 세분화된 접근 방식은 모델이 올바른 목적지에 도달할 뿐만 아니라 그 과정에서 논리적이고 안전하며 검증 가능한 경로를 따르도록 보장합니다.

Process Reward Model 대 Outcome Reward Model#

보상 모델링의 더 넓은 맥락에서, 프로세스 기반 감독과 결과 기반 감독을 구분하는 것은 중요합니다. 전통적인 결과 보상 모델(ORM)은 생성 작업의 맨 마지막에 단일한 희소 보상을 제공합니다. ORM은 학습하기 더 쉽지만 복잡한 작업에서 큰 단점을 겪습니다. 즉, 결함이 있는 논리나 환각을 통해 정답에 도달한 모델에 의도치 않게 보상을 줄 수 있습니다.

프로세스 보상 모델(PRM)은 전체 추론 궤적을 평가함으로써 이 문제를 해결합니다. Let's Verify Step by Step과 같은 논문에서 기초적인 OpenAI 연구에 의해 대중화된 바와 같이, PRM은 각 생각이나 행동에 단계별 감독을 적용합니다. 이는 근접 정책 최적화(PPO)와 같은 알고리즘을 사용하여 정책 최적화를 적극적으로 유도하기 때문에 인간 피드백 기반 강화학습(RLHF) 파이프라인의 고급 구성 요소입니다.

실제 애플리케이션 사례#

대형 언어 모델(LLM)과 자율 시스템이 고위험 환경에서 작동하는 방식을 PRM이 변화시키고 있습니다:

  • 수학적 추론: 방정식을 줄 단위로 평가함으로써, PRM은 모델이 Best-of-N(BoN) 샘플링이나 몬테카를로 트리 탐색(MCTS)과 같은 알고리즘을 사용하여 여러 솔루션 경로를 탐색하고 가장 논리적으로 타당한 시퀀스를 선택할 수 있도록 합니다.
  • 코드 생성: 소프트웨어를 생성할 때, 단순히 최종 스크립트가 실행되는지 확인하는 것으로는 충분하지 않습니다. PRM은 프로세스 감독을 제공하여 개별 함수와 로직 블록에 점수를 매김으로써 코드가 효율적이고 안전하며 유지보수 가능하도록 보장합니다.
  • 운영 연구 및 시각적 에이전트: 2025년과 2026년의 최근 발전은 PRM을 텍스트 너머로 확장했습니다. 예를 들어, 운영 연구는 이제 복잡한 일정 관리 알고리즘을 검증하기 위해 PRM을 활용합니다. 마찬가지로, Ultralytics YOLO26과 같은 강력한 컴퓨터 비전 엔진을 갖춘 시각적 AI 에이전트는 목적지에 도달하는 단일 보상 대신 물리적 환경을 탐색하는 것에 대해 단계별 보상을 받습니다.

단계별 피드백 구현#

PRM을 학습하려면 각 하위 단계가 사람이나 더 강력한 AI 모델에 의해 평가되는 광범위한 데이터셋을 관리해야 합니다. 이러한 집약적인 데이터 주석 워크플로 관리는 프로젝트 조직과 배포를 간소화하는 Ultralytics Platform과 같은 클라우드 기반 도구를 통해 더 간단해집니다.

추론 또는 모델 최적화 과정에서 PRM은 단계 체인을 기반으로 누적 손실 또는 보상을 계산합니다. torch을 사용하는 다음 개념적 파이썬 스니펫은 시퀀스 스코어링을 위한 PyTorch 문서에서 흔히 볼 수 있는 접근 방식인, 중간 단계가 실패할 경우 단계별 보상이 어떻게 페널티를 받는지 보여줍니다:

import torch

# Simulate reward scores from a PRM for 3 consecutive reasoning steps
# Scores represent the probability of correctness for each step (0.0 to 1.0)
step_rewards = torch.tensor([0.95, 0.80, 0.15], requires_grad=True)

# The PRM aggregates the scores, heavily penalizing the poor 3rd step
# Negative log-likelihood is commonly used to optimize the trajectory
prm_loss = -torch.log(step_rewards).mean()

print(f"Calculated PRM Loss: {prm_loss.item():.4f}")
# During RLHF, this loss would guide hyperparameter tuning and model updates

모든 중간 단계가 예상되는 동작과 일치하도록 보장함으로써 개발자는 매우 신뢰할 수 있는 시스템을 배포할 수 있습니다. 프로세스 수준의 감독과 지속적인 하이퍼파라미터 튜닝을 결합하면 차세대 모델이 문제를 안전하고 효과적으로 진정으로 추론할 수 있습니다.

Explore solutions

Real-time AI that works with your team

로봇 공학의 컴퓨터 비전

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 컴퓨터 비전

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 컴퓨터 비전

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기
Real-time AI that works with your team

로봇 공학의 컴퓨터 비전

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 컴퓨터 비전

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 컴퓨터 비전

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기
Real-time AI that works with your team

로봇 공학의 컴퓨터 비전

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 컴퓨터 비전

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 컴퓨터 비전

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기

미래의 AI를 함께 구축합시다!

머신 러닝의 미래와 함께 여정을 시작하십시오.