Group Relative Policy Optimization (GRPO)
A otimização de política relativa em grupo (GRPO) é um método de RL sem crítico que avalia cada resposta em relação ao grupo para aprimorar o raciocínio de LLMs. Compara-a ao PPO.
A otimização de política relativa em grupo (GRPO) é um algoritmo de aprendizado por reforço eficiente em termos de memória, desenvolvido para aprimorar as capacidades de raciocínio de grandes modelos de linguagem (LLMs) e de sistemas mais amplos de inteligência artificial (IA). Apresentado pela primeira vez no artigo DeepSeekMath de 2024, o GRPO aprimora os métodos de otimização tradicionais ao eliminar a necessidade de uma rede de valor separada (modelo crítico). Em vez disso, ele normaliza as recompensas de um grupo de respostas geradas a partir do mesmo prompt. Ao avaliar as respostas em relação às demais do grupo, o GRPO reduz drasticamente o custo computacional e melhora o desempenho em tarefas complexas de raciocínio nas arquiteturas modernas de deep learning (DL).
Como o GRPO difere do PPO#
Embora o GRPO tenha semelhanças com a otimização de política proximal (PPO) — um algoritmo de otimização padrão frequentemente usado no aprendizado por reforço com feedback humano (RLHF) —, os dois diferem significativamente em sua arquitetura. O PPO exige um modelo "crítico" secundário, que é executado em paralelo à rede de política principal para estimar o valor de um determinado estado. Isso quase dobra a memória necessária durante a fase de treinamento.
Em contrapartida, o GRPO é um algoritmo sem crítico. Ao amostrar várias saídas para um único prompt e classificá-las com um sistema de recompensas baseado em regras ou um verificador, o GRPO calcula a vantagem normalizando as pontuações dentro desse grupo específico. Esta comparação relativa serve de referência, poupando a enorme quantidade de memória que teria sido ocupada por uma rede de valor e acelerando o treino do modelo em geral. Uma atualização do GRPO segue estes passos:
Aplicações do GRPO no mundo real#
O GRPO impulsionou vários avanços recentes em IA generativa e processamento de linguagem natural. Duas aplicações notáveis incluem:
- Modelos de raciocínio matemático: No amplamente citado lançamento do DeepSeek-R1 e no DeepSeekMath, o GRPO foi usado para incentivar os modelos a desenvolver raciocínios longos em cadeia de pensamento e a autoverificação, alcançando um desempenho comparável ao de modelos proprietários como o o1 da OpenAI. Ao recompensar as respostas finais corretas e a formatação, o algoritmo permitiu ao modelo descobrir organicamente estratégias avançadas de resolução de problemas, sem um ajuste fino extensivo com dados anotados por humanos.
- Geração de código e lógica agêntica: Para modelos que escrevem código ou alimentam fluxos de trabalho agênticos autônomos, é difícil avaliar a correção absoluta. O GRPO permite que os modelos aprendam executando variações de código e pontuando-as relativamente com base no êxito da compilação ou nos casos de teste aprovados, acelerando a implantação de assistentes de programação de IA altamente confiáveis.
Implementando conceitos de GRPO em PyTorch#
Em essência, o GRPO calcula a vantagem relativa das respostas normalizando suas recompensas. Esta é uma implementação básica em PyTorch que demonstra essa normalização usando operações padrão com tensores:
def compute_grpo_advantages(rewards):
# 'rewards' é um tensor com formato (batch_size, group_size)
group_mean = rewards.mean(dim=1, keepdim=True)
group_std = rewards.std(dim=1, keepdim=True)
# Normalize as recompensas dentro do grupo para calcular vantagens relativas
advantages = (rewards - group_mean) / (group_std + 1e-8)
return advantagesImpulsionando a IA com otimização inteligente#
Tal como o GRPO redefine a eficiência da geração de texto, as técnicas avançadas de aprendizagem automática (ML) transformam continuamente a perceção visual. A otimização de arquiteturas e funções de perda permite aos programadores criar modelos mais leves e rápidos em todos os domínios.
Para tarefas de ponta de visão computacional, é igualmente essencial explorar otimizações de ponta a ponta. Por exemplo, o Ultralytics YOLO26 suporta inferência nativa de ponta a ponta, sem NMS, com a sua cabeça one-to-one (nms=False) e treina com otimizadores híbridos inspirados pela investigação em LLMs, simplificando a implementação em dispositivos de ponta. Os programadores que pretendam tirar partido de fluxos de trabalho eficientes de visão computacional podem criar, treinar e implementar modelos sem esforço através da Ultralytics Platform. Esta ferramenta baseada na nuvem simplifica a gestão complexa de conjuntos de dados e o ajuste de hiperparâmetros para aplicações de visão robustas e em tempo real.










