YOLO Vision 2026:
Ultralytics 용어집으로 돌아가기

Group Relative Policy Optimization (GRPO)

그룹 상대 정책 최적화(GRPO)를 발견해 보십시오. 이 메모리 효율적이고 비평가 없는 RL 알고리즘이 어떻게 LLM 추론을 향상하고 학습 비용을 절감하는지 알아보십시오.

Group Relative Policy Optimization (GRPO)는 Large Language Models (LLMs) 및 광범위한 Artificial Intelligence (AI) 시스템의 추론 능력을 향상시키기 위해 개발된 메모리 효율적인 강화학습 알고리즘입니다. 2024년 DeepSeekMath 논문에서 처음 소개된 GRPO는 별도의 가치 네트워크(크리틱 모델)의 필요성을 제거하여 전통적인 최적화 방법을 개선합니다. 대신, 동일한 프롬프트에서 파생된 생성된 응답 그룹의 보상을 정규화합니다. 그룹 내 동료들과 비교하여 응답을 평가함으로써, GRPO는 현대 Deep Learning (DL) 아키텍처의 복잡한 추론 작업에서 성능을 높이는 동시에 연산 오버헤드를 극적으로 줄입니다.

GRPO와 PPO의 차이점#

GRPO는 인간 피드백 기반 강화학습(RLHF)에서 자주 사용되는 표준 최적화 알고리즘Proximal Policy Optimization (PPO)와 유사점을 공유하지만, 두 방식은 아키텍처에서 큰 차이가 있습니다. PPO는 주어진 상태의 가치를 추정하기 위해 메인 정책 네트워크와 병렬로 실행되는 보조 "크리틱" 모델을 요구합니다. 이는 학습 단계 동안 필요한 메모리를 거의 두 배로 늘립니다.

대조적으로, GRPO는 크리틱이 없는 알고리즘입니다. 단일 프롬프트에 대해 여러 출력을 샘플링하고 규칙 기반 보상 시스템 또는 검증기를 사용하여 점수를 매긴 후, GRPO는 해당 특정 그룹 내의 점수를 정규화하여 어드밴티지를 계산합니다. 이 상대적 비교는 베이스라인 역할을 하며, 가치 네트워크가 차지했을 막대한 양의 메모리를 절약하고 전반적인 모델 학습을 가속화합니다.

GRPO의 실제 활용 사례#

생성형 AI자연어 처리 분야에서 GRPO가 이끌어낸 몇 가지 최근의 획기적인 발전은 다음과 같습니다:

  1. 수학적 추론 모델: 널리 인용되는 DeepSeek-R1 릴리스 및 DeepSeekMath에서, GRPO는 모델이 긴 사고의 연쇄 추론 및 자체 검증을 개발하도록 장려하는 데 사용되었으며, OpenAI의 o1과 같은 독점 모델의 성능과 일치합니다. 올바른 최종 답변과 형식을 보상함으로써, 이 알고리즘은 인간이 주석을 단 데이터에 대한 광범위한 파인튜닝 없이도 모델이 고급 문제 해결 전략을 유기적으로 발견할 수 있게 했습니다.
  2. 코드 생성 및 에이전틱 로직: 코드를 작성하거나 자율적인 에이전틱 워크플로를 구동하는 모델의 경우, 절대적인 정확성을 평가하는 것은 어렵습니다. GRPO는 모델이 코드 변형을 실행하고 컴파일 성공 또는 통과된 테스트 케이스를 기반으로 상대적으로 점수를 매겨 학습할 수 있도록 하여, 매우 신뢰할 수 있는 AI 코딩 어시스턴트의 배포를 가속화합니다.

PyTorch에서 GRPO 개념 구현하기#

핵심적으로, GRPO는 보상을 정규화하여 응답의 상대적 어드밴티지를 계산합니다. 다음은 표준 텐서 연산을 사용하여 이 정규화를 시연하는 기본적인 PyTorch 구현입니다:



def compute_grpo_advantages(rewards):
    # 'rewards' is a tensor of shape (batch_size, group_size)
    group_mean = rewards.mean(dim=1, keepdim=True)
    group_std = rewards.std(dim=1, keepdim=True)

    # Normalize rewards within the group to calculate relative advantages
    advantages = (rewards - group_mean) / (group_std + 1e-8)
    return advantages

스마트 최적화를 통한 AI 발전#

GRPO가 텍스트 생성을 위한 효율성을 재정의하는 것처럼, 고급 Machine Learning (ML) 기법은 시각적 지각을 지속적으로 재형성합니다. 아키텍처와 손실 함수를 최적화하면 개발자는 모든 도메인에서 더 가볍고 빠른 모델을 구축할 수 있습니다.

최첨단 컴퓨터 비전 작업을 위해 엔드투엔드 최적화를 탐구하는 것 역시 매우 중요합니다. 예를 들어, Ultralytics YOLO26은 LLM 연구에서 영감을 받은 네이티브 NMS 프리 아키텍처와 하이브리드 옵티마이저를 도입하여 엣지 배포를 극적으로 개선합니다. 효율적인 컴퓨터 비전 워크플로를 활용하려는 개발자는 Ultralytics Platform을 사용하여 손쉽게 모델을 구축, 학습 및 배포할 수 있습니다. 이 클라우드 기반 도구는 강력하고 실시간인 비전 애플리케이션을 위해 복잡한 데이터셋 관리와 하이퍼파라미터 튜닝을 단순화합니다.

Explore solutions

Real-time AI that works with your team

로봇 공학의 컴퓨터 비전

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 컴퓨터 비전

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 컴퓨터 비전

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기
Real-time AI that works with your team

로봇 공학의 컴퓨터 비전

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 컴퓨터 비전

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 컴퓨터 비전

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기
Real-time AI that works with your team

로봇 공학의 컴퓨터 비전

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 컴퓨터 비전

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 컴퓨터 비전

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 컴퓨터 비전

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기

미래의 AI를 함께 구축합시다!

머신 러닝의 미래와 함께 여정을 시작하십시오.