Group Relative Policy Optimization (GRPO)
Descubre la optimización de políticas relativas de grupo (GRPO). Aprende cómo este algoritmo de RL, eficiente en memoria y sin crítico, mejora el razonamiento de los LLM y reduce los costes de entrenamiento.
Group Relative Policy Optimization (GRPO) es un algoritmo de aprendizaje por refuerzo eficiente en memoria desarrollado para mejorar las capacidades de razonamiento de los Large Language Models (LLMs) y de los sistemas de Artificial Intelligence (AI) en general. Presentado por primera vez en el documento de DeepSeekMath de 2024, GRPO mejora los métodos de optimización tradicionales al eliminar la necesidad de una red de valores independiente (modelo crítico). En su lugar, normaliza las recompensas de un grupo de respuestas generadas a partir del mismo indicador (prompt). Al evaluar las respuestas en relación con sus pares dentro del grupo, GRPO reduce drásticamente la carga computacional a la vez que impulsa el rendimiento en tareas de razonamiento complejo en arquitecturas modernas de Deep Learning (DL).
Cómo se diferencia GRPO de PPO#
Aunque GRPO comparte similitudes con Proximal Policy Optimization (PPO) —un algoritmo de optimización estándar utilizado a menudo en el aprendizaje por refuerzo a partir de retroalimentación humana (RLHF)—, ambos difieren significativamente en su arquitectura. PPO requiere un modelo "crítico" secundario que se ejecuta en paralelo a la red de políticas principal para estimar el valor de un estado dado. Esto duplica casi la memoria requerida durante la fase de entrenamiento.
Por el contrario, GRPO es un algoritmo sin crítico. Al muestrear múltiples salidas para un solo indicador y puntuarlas mediante un sistema de recompensas basado en reglas o un verificador, GRPO calcula la ventaja normalizando las puntuaciones dentro de ese grupo específico. Esta comparación relativa actúa como la línea base, lo que ahorra las enormes cantidades de memoria que habría ocupado una red de valores y acelera el entrenamiento del modelo en general.
Aplicaciones reales de GRPO#
GRPO ha impulsado varios avances recientes en IA generativa y procesamiento del lenguaje natural. Dos aplicaciones destacadas incluyen:
- Modelos de razonamiento matemático: En el ampliamente citado lanzamiento de DeepSeek-R1 y DeepSeekMath, se utilizó GRPO para incentivar a los modelos a desarrollar un razonamiento de cadena de pensamiento largo y autoverificación, igualando el rendimiento de modelos propietarios como OpenAI's o1. Al premiar las respuestas finales correctas y el formato, el algoritmo permitió que el modelo descubriera de forma orgánica estrategias avanzadas de resolución de problemas sin un ajuste fino exhaustivo con datos anotados por humanos.
- Generación de código y lógica agéntica: Para los modelos que escriben código o impulsan flujos de trabajo agénticos autónomos, evaluar la corrección absoluta es un desafío. GRPO permite que los modelos aprendan ejecutando variaciones de código y puntuándolas de forma relativa según el éxito de compilación o los casos de prueba superados, lo que acelera el despliegue de asistentes de programación de IA altamente fiables.
Implementación de conceptos de GRPO en PyTorch#
En esencia, GRPO calcula la ventaja relativa de las respuestas normalizando sus recompensas. Aquí tienes una implementación básica en PyTorch que demuestra esta normalización utilizando operaciones tensoriales estándar:
def compute_grpo_advantages(rewards):
# 'rewards' is a tensor of shape (batch_size, group_size)
group_mean = rewards.mean(dim=1, keepdim=True)
group_std = rewards.std(dim=1, keepdim=True)
# Normalize rewards within the group to calculate relative advantages
advantages = (rewards - group_mean) / (group_std + 1e-8)
return advantagesAvanzando en la IA con optimización inteligente#
Del mismo modo que GRPO redefine la eficiencia para la generación de texto, las técnicas avanzadas de Machine Learning (ML) transforman continuamente la percepción visual. La optimización de arquitecturas y funciones de pérdida permite a los desarrolladores construir modelos más ligeros y rápidos en todos los dominios.
Para las tareas de visión artificial de vanguardia, explorar optimizaciones de extremo a extremo es igual de fundamental. Por ejemplo, Ultralytics YOLO26 introduce una arquitectura nativa sin NMS y optimizadores híbridos inspirados en la investigación de LLMs, lo que mejora drásticamente el despliegue en el borde. Los desarrolladores que deseen aprovechar flujos de trabajo de visión artificial eficientes pueden crear, entrenar y desplegar modelos sin esfuerzo utilizando la Ultralytics Platform. Esta herramienta basada en la nube simplifica la gestión compleja de conjuntos de datos y el ajuste de hiperparámetros para aplicaciones de visión robustas en tiempo real.






