Group Relative Policy Optimization (GRPO)
Khám phá Tối ưu hóa chính sách tương đối theo nhóm (GRPO). Tìm hiểu cách thuật toán RL không cần phê bình, tiết kiệm bộ nhớ này nâng cao khả năng suy luận của LLM và cắt giảm chi phí huấn luyện.
Group Relative Policy Optimization (GRPO) là một thuật toán reinforcement learning tiết kiệm bộ nhớ được phát triển nhằm nâng cao năng lực suy luận của các Large Language Models (LLMs) và các hệ thống Artificial Intelligence (AI) rộng lớn hơn. Được giới thiệu lần đầu tiên trong DeepSeekMath paper năm 2024, GRPO cải tiến các phương pháp tối ưu hóa truyền thống bằng cách loại bỏ nhu cầu sử dụng một mạng giá trị riêng biệt (critic model). Thay vào đó, thuật toán này chuẩn hóa phần thưởng của một nhóm các phản hồi được tạo ra bắt nguồn từ cùng một prompt. Bằng cách đánh giá các phản hồi tương đối so với các phản hồi cùng nhóm, GRPO giảm đáng kể chi phí tính toán đồng thời thúc đẩy hiệu suất trên các tác vụ suy luận phức tạp trong các kiến trúc Deep Learning (DL) hiện đại.
GRPO khác PPO như thế nào#
Mặc dù GRPO có những điểm tương đồng với Proximal Policy Optimization (PPO)—một optimization algorithm tiêu chuẩn thường được sử dụng trong học tăng cường từ phản hồi của con người (RLHF)—cả hai lại có sự khác biệt đáng kể về mặt kiến trúc. PPO yêu cầu một "critic" model thứ cấp chạy song song với mạng chính sách chính để ước tính giá trị của một trạng thái cho trước. Điều này làm tăng gần gấp đôi bộ nhớ cần thiết trong suốt training phase.
Ngược lại, GRPO là một thuật toán không dùng critic. Bằng cách lấy mẫu nhiều đầu ra cho một prompt đơn lẻ và chấm điểm chúng bằng rule-based reward system hoặc bộ kiểm chứng, GRPO tính toán lợi thế bằng cách chuẩn hóa điểm số trong nhóm cụ thể đó. Phép so sánh tương đối này đóng vai trò là đường cơ sở, tiết kiệm lượng lớn bộ nhớ vốn sẽ bị chiếm dụng bởi một mạng giá trị và đẩy nhanh quá trình model training tổng thể.
Các ứng dụng thực tế của GRPO#
GRPO đã thúc đẩy một số bước đột phá gần đây trong lĩnh vực generative AI và natural language processing. Hai ứng dụng đáng chú ý bao gồm:
- Mathematical Reasoning Models: Trong bản phát hành DeepSeek-R1 release và DeepSeekMath được trích dẫn rộng rãi, GRPO được sử dụng để khuyến khích các model phát triển khả năng suy luận chain-of-thought dài và tự kiểm chứng, mang lại hiệu suất tương đương với các model độc quyền như OpenAI's o1. Bằng cách thưởng cho các câu trả lời cuối cùng chính xác và cách định dạng, thuật toán này cho phép model tự khám phá các chiến lược giải quyết vấn đề nâng cao mà không cần fine-tuning rộng rãi trên dữ liệu được gán nhãn bởi con người.
- Code Generation and Agentic Logic: Đối với các model viết mã hoặc vận hành các agentic workflows tự động, việc đánh giá tính chính xác tuyệt đối là một thách thức. GRPO cho phép các model học hỏi bằng cách thực thi các biến thể mã và chấm điểm tương đối dựa trên thành công khi biên dịch hoặc các trường hợp kiểm thử đã vượt qua, đẩy nhanh quá trình triển khai các trợ lý lập trình AI có độ tin cậy cao.
Triển khai các khái niệm GRPO trong PyTorch#
Về cốt lõi, GRPO tính toán lợi thế tương đối của các phản hồi bằng cách chuẩn hóa phần thưởng của chúng. Dưới đây là một PyTorch implementation cơ bản minh họa quá trình chuẩn hóa này bằng cách sử dụng các tensor operations tiêu chuẩn:
def compute_grpo_advantages(rewards):
# 'rewards' is a tensor of shape (batch_size, group_size)
group_mean = rewards.mean(dim=1, keepdim=True)
group_std = rewards.std(dim=1, keepdim=True)
# Normalize rewards within the group to calculate relative advantages
advantages = (rewards - group_mean) / (group_std + 1e-8)
return advantagesThúc đẩy AI với tối ưu hóa thông minh#
Cũng giống như GRPO định nghĩa lại hiệu quả cho việc tạo văn bản, các kỹ thuật Machine Learning (ML) tiên tiến không ngừng định hình lại visual perception. Việc tối ưu hóa các kiến trúc và loss functions cho phép các nhà phát triển xây dựng các model nhẹ hơn, nhanh hơn trên mọi miền.
Đối với các computer vision tasks tiên tiến, việc khám phá các phương pháp tối ưu hóa đầu cuối cũng mang tầm quan trọng không kém. Ví dụ: Ultralytics YOLO26 giới thiệu một kiến trúc hoàn toàn không cần NMS và các hybrid optimizers lấy cảm hứng từ nghiên cứu LLM, cải thiện đáng kể quá trình triển khai ở biên. Các nhà phát triển muốn tận dụng các computer vision workflows hiệu quả có thể xây dựng, huấn luyện và triển khai các model một cách dễ dàng bằng cách sử dụng Ultralytics Platform. Công cụ dựa trên đám mây này đơn giản hóa việc quản lý tập dữ liệu phức tạp và hyperparameter tuning cho các ứng dụng thị giác thời gian thực, mạnh mẽ.






