Group Relative Policy Optimization (GRPO)
그룹 상대 정책 최적화(GRPO)는 각 답변을 그룹 내 답변과 비교해 점수를 매기는 비평자 없는 강화 학습(RL)으로, LLM의 추론 능력을 높입니다. PPO와 비교합니다.
그룹 상대 정책 최적화(GRPO)는 대규모 언어 모델(LLM)과 더 광범위한 인공지능(AI) 시스템의 추론 역량을 향상하기 위해 개발된 메모리 효율적인 강화 학습 알고리즘입니다. 2024년 DeepSeekMath 논문에서 처음 소개된 GRPO는 별도의 가치 네트워크(비평가 모델)가 필요하지 않다는 점에서 기존 최적화 방법보다 발전된 기법입니다. 대신 동일한 프롬프트에서 생성된 응답 그룹의 보상을 정규화합니다. 그룹 내 다른 응답과 비교해 응답을 평가함으로써 GRPO는 연산 오버헤드를 크게 줄이고 현대적인 딥러닝(DL) 아키텍처의 복잡한 추론 작업 성능을 높입니다.
GRPO와 PPO의 차이#
GRPO는 강화 학습의 인간 피드백(RLHF)에 자주 사용되는 표준 최적화 알고리즘인 근접 정책 최적화(PPO)와 유사한 점이 있지만, 아키텍처는 크게 다릅니다. PPO는 주 정책 네트워크와 병렬로 실행되는 보조 "비평가" 모델을 사용해 주어진 상태의 가치를 추정해야 합니다. 이 때문에 학습 단계에 필요한 메모리가 거의 두 배로 늘어납니다.
반면 GRPO는 크리틱이 필요 없는 알고리즘입니다. 하나의 프롬프트에 대해 여러 출력을 샘플링하고 규칙 기반 보상 시스템이나 검증기를 사용해 점수를 매긴 다음, GRPO는 해당 그룹 내에서 점수를 정규화해 어드밴티지를 계산합니다. 이러한 상대 비교가 기준선 역할을 하므로 값 네트워크에 필요했을 대량의 메모리를 절약하고 전반적인 모델 학습을 가속합니다. GRPO 업데이트는 다음 단계로 진행됩니다.
GRPO의 실제 적용 사례#
GRPO는 생성형 AI와 자연어 처리 분야의 최근 여러 기술 발전을 이끌었습니다. 주목할 만한 적용 사례 두 가지는 다음과 같습니다.
- 수학 추론 모델: 널리 인용되는 DeepSeek-R1 출시와 DeepSeekMath에서 GRPO는 모델이 긴 사고의 연쇄 추론과 자체 검증을 발전시키도록 유도하는 데 사용되었으며, OpenAI의 o1과 같은 독점 모델과 비슷한 성능을 보였습니다. 정답과 형식을 보상함으로써 이 알고리즘은 사람의 어노테이션 데이터로 광범위하게 파인튜닝하지 않고도 모델이 고급 문제 해결 전략을 스스로 발견하도록 했습니다.
- 코드 생성 및 에이전트 로직: 코드를 작성하거나 자율 에이전트 워크플로를 구동하는 모델에서는 절대적인 정확성을 평가하기 어렵습니다. GRPO를 사용하면 모델이 다양한 코드 변형을 실행하고 컴파일 성공 여부나 테스트 통과 여부에 따라 상대적인 점수를 매겨 학습할 수 있어, 신뢰성 높은 AI 코딩 어시스턴트의 배포를 앞당길 수 있습니다.
PyTorch에서 GRPO 개념 구현하기#
GRPO는 응답 보상을 정규화해 상대적 이점을 계산합니다. 다음은 표준 텐서 연산을 사용해 이러한 정규화를 보여 주는 기본적인 PyTorch 구현입니다.
def compute_grpo_advantages(rewards):
# 'rewards'는 (batch_size, group_size) 형태의 텐서입니다
group_mean = rewards.mean(dim=1, keepdim=True)
group_std = rewards.std(dim=1, keepdim=True)
# 그룹 내 보상을 정규화하여 상대적 이점을 계산합니다
advantages = (rewards - group_mean) / (group_std + 1e-8)
return advantages스마트 최적화로 AI를 발전시킵니다#
GRPO가 텍스트 생성의 효율성을 재정의하듯, 고급 머신러닝(ML) 기법은 시각 인식을 지속적으로 바꾸고 있습니다. 아키텍처와 손실 함수를 최적화하면 개발자는 모든 도메인에서 더 가볍고 빠른 모델을 구축할 수 있습니다.
최첨단 컴퓨터 비전 작업에서는 종단 간 최적화를 살펴보는 것도 중요합니다. 예를 들어 Ultralytics YOLO26은 일대일 헤드(nms=False)를 활용해 네이티브 종단 간 NMS 없는 추론을 지원하고, LLM 연구에서 영감을 받은 하이브리드 옵티마이저로 학습하여 엣지 배포를 간소화합니다. 효율적인 컴퓨터 비전 워크플로를 활용하려는 개발자는 Ultralytics Platform을 사용해 모델을 손쉽게 구축하고 학습하며 배포할 수 있습니다. 이 클라우드 기반 도구는 강력한 실시간 비전 애플리케이션을 위한 복잡한 데이터 세트 관리와 하이퍼파라미터 튜닝을 간소화합니다.










