Group Relative Policy Optimization (GRPO)
Descobre a Otimização de Política Relativa de Grupo (GRPO). Aprende como este algoritmo de RL eficiente em termos de memória e sem crítico melhora o raciocínio de LLM e reduz os custos de treino.
Group Relative Policy Optimization (GRPO) é um algoritmo de reinforcement learning eficiente em termos de memória, desenvolvido para aprimorar as capacidades de raciocínio de Large Language Models (LLMs) e de sistemas mais amplos de Artificial Intelligence (AI). Apresentado pela primeira vez no DeepSeekMath paper de 2024, o GRPO melhora os métodos de otimização tradicionais ao eliminar a necessidade de uma rede de valores separada (modelo crítico). Em vez disso, ele normaliza as recompensas de um grupo de respostas geradas a partir do mesmo prompt. Ao avaliar as respostas em relação aos seus pares dentro do grupo, o GRPO reduz drasticamente a sobrecarga computacional enquanto impulsiona o desempenho em tarefas complexas de raciocínio em arquiteturas modernas de Deep Learning (DL).
Como o GRPO difere do PPO#
Embora o GRPO compartilhe semelhanças com o Proximal Policy Optimization (PPO) — um optimization algorithm padrão frequentemente usado no aprendizado por reforço a partir de feedback humano (RLHF) —, os dois diferem significativamente em sua arquitetura. O PPO requer um modelo "crítico" secundário que roda em paralelo com a rede de política principal para estimar o valor de um determinado estado. Isso quase dobra a memória necessária durante a training phase.
Em contrapartida, o GRPO é um algoritmo sem crítico. Ao amostrar múltiplas saídas para um único prompt e pontuá-las usando um rule-based reward system ou verificador, o GRPO calcula a vantagem normalizando as pontuações dentro desse grupo específico. Essa comparação relativa atua como a linha de base, economizando a enorme quantidade de memória que seria ocupada por uma rede de valores e acelerando o model training geral.
Aplicações reais do GRPO#
O GRPO impulsionou vários avanços recentes em generative AI e natural language processing. Duas aplicações notáveis incluem:
- Modelos de Raciocínio Matemático: No amplamente citado DeepSeek-R1 release e no DeepSeekMath, o GRPO foi usado para incentivar os modelos a desenvolverem um longo raciocínio em chain-of-thought e autoverificação, igualando o desempenho de modelos proprietários como o OpenAI's o1. Ao recompensar respostas finais corretas e a formatação, o algoritmo permitiu que o modelo descobrisse organicamente estratégias avançadas de resolução de problemas sem fine-tuning extensivo em dados anotados por humanos.
- Geração de Código e Lógica de Agentes: Para modelos que escrevem código ou alimentam agentic workflows autônomos, avaliar a correção absoluta é desafiador. O GRPO permite que os modelos aprendam executando variações de código e pontuando-as de forma relativa com base no sucesso da compilação ou em casos de teste aprovados, acelerando a implantação de assistentes de codificação de IA altamente confiáveis.
Implementando conceitos de GRPO em PyTorch#
Em sua essência, o GRPO calcula a vantagem relativa das respostas normalizando suas recompensas. Aqui está uma implementação básica de PyTorch demonstrando essa normalização usando tensor operations padrão:
def compute_grpo_advantages(rewards):
# 'rewards' is a tensor of shape (batch_size, group_size)
group_mean = rewards.mean(dim=1, keepdim=True)
group_std = rewards.std(dim=1, keepdim=True)
# Normalize rewards within the group to calculate relative advantages
advantages = (rewards - group_mean) / (group_std + 1e-8)
return advantagesAvançando a IA com otimização inteligente#
Assim como o GRPO redefina a eficiência para a geração de texto, técnicas avançadas de Machine Learning (ML) remodelam continuamente a visual perception. Otimizar arquiteturas e loss functions permite que os desenvolvedores construam modelos mais leves e rápidos em todos os domínios.
Para computer vision tasks de ponta, explorar otimizações de ponta a ponta é igualmente crítico. Por exemplo, o Ultralytics YOLO26 introduz uma arquitetura nativamente livre de NMS e hybrid optimizers inspirados em pesquisas de LLMs, melhorando drasticamente a implantação na borda. Desenvolvedores que desejam aproveitar fluxos de trabalho eficientes de computer vision podem construir, treinar e implantar modelos sem esforço usando a Ultralytics Platform. Esta ferramenta baseada em nuvem simplifica o gerenciamento complexo de datasets e o hyperparameter tuning para aplicações de visão robustas e em tempo real.






