Group Relative Policy Optimization (GRPO)
Tối ưu hóa chính sách tương đối theo nhóm (GRPO) là phương pháp RL không cần critic, chấm điểm từng câu trả lời dựa trên nhóm của câu trả lời đó để cải thiện khả năng suy luận của LLM. Bài viết so sánh phương pháp này với PPO.
Group Relative Policy Optimization (GRPO) là thuật toán học tăng cường tiết kiệm bộ nhớ, được phát triển để nâng cao năng lực suy luận của các mô hình ngôn ngữ lớn (LLMs) và các hệ thống trí tuệ nhân tạo (AI) rộng hơn. Được giới thiệu lần đầu trong bài báo DeepSeekMath năm 2024, GRPO cải tiến các phương pháp tối ưu hóa truyền thống bằng cách loại bỏ nhu cầu sử dụng một mạng giá trị riêng biệt (model critic). Thay vào đó, thuật toán chuẩn hóa phần thưởng của một nhóm phản hồi được tạo từ cùng một prompt. Bằng cách đánh giá các phản hồi tương quan với những phản hồi khác trong nhóm, GRPO giảm đáng kể chi phí tính toán đồng thời cải thiện hiệu năng trên các tác vụ suy luận phức tạp trong kiến trúc deep learning (DL) hiện đại.
GRPO khác PPO như thế nào#
Dù GRPO có điểm tương đồng với Proximal Policy Optimization (PPO)—một thuật toán tối ưu hóa tiêu chuẩn thường được dùng trong học tăng cường từ phản hồi của con người (RLHF)—hai thuật toán khác biệt đáng kể về kiến trúc. PPO cần một model "critic" thứ hai chạy song song với mạng policy chính để ước tính giá trị của một trạng thái nhất định. Điều này gần như làm tăng gấp đôi bộ nhớ cần thiết trong giai đoạn huấn luyện.
Ngược lại, GRPO là thuật toán không cần critic. Bằng cách lấy mẫu nhiều đầu ra cho một prompt rồi chấm điểm chúng bằng hệ thống phần thưởng dựa trên luật hoặc bộ xác minh, GRPO tính lợi thế bằng cách chuẩn hóa điểm số trong nhóm cụ thể đó. So sánh tương đối này đóng vai trò đường cơ sở, tiết kiệm lượng bộ nhớ lớn vốn dành cho mạng giá trị và đẩy nhanh quá trình huấn luyện model tổng thể. Một lần cập nhật GRPO gồm các bước sau:
Các ứng dụng thực tế của GRPO#
GRPO đã thúc đẩy một số đột phá gần đây trong AI tạo sinh và xử lý ngôn ngữ tự nhiên. Hai ứng dụng đáng chú ý gồm:
- Mô hình suy luận toán học: Trong bản phát hành DeepSeek-R1 được trích dẫn rộng rãi và DeepSeekMath, GRPO được dùng để khuyến khích model phát triển khả năng suy luận chuỗi suy nghĩ dài và tự xác minh, đạt hiệu năng tương đương các model độc quyền như o1 của OpenAI. Bằng cách thưởng cho câu trả lời cuối cùng chính xác và định dạng đúng, thuật toán giúp model tự khám phá các chiến lược giải quyết vấn đề nâng cao mà không cần fine-tuning sâu trên dữ liệu do con người gán nhãn.
- Tạo mã và logic agent: Với các model viết mã hoặc vận hành workflow theo hướng agent tự động, việc đánh giá tính chính xác tuyệt đối là một thách thức. GRPO cho phép model học bằng cách thực thi các biến thể mã và chấm điểm tương đối dựa trên việc biên dịch thành công hoặc vượt qua các test case, qua đó đẩy nhanh việc triển khai trợ lý lập trình AI có độ tin cậy cao.
Triển khai các khái niệm GRPO trong PyTorch#
Về cốt lõi, GRPO tính lợi thế tương đối của các phản hồi bằng cách chuẩn hóa phần thưởng. Dưới đây là cách triển khai PyTorch cơ bản minh họa phép chuẩn hóa này bằng các phép toán tensor tiêu chuẩn:
def compute_grpo_advantages(rewards):
# 'rewards' là tensor có shape (batch_size, group_size)
group_mean = rewards.mean(dim=1, keepdim=True)
group_std = rewards.std(dim=1, keepdim=True)
# Chuẩn hóa phần thưởng trong nhóm để tính lợi thế tương đối
advantages = (rewards - group_mean) / (group_std + 1e-8)
return advantagesThúc đẩy AI bằng tối ưu hóa thông minh#
Cũng như GRPO định nghĩa lại hiệu quả cho tạo sinh văn bản, các kỹ thuật Machine Learning (ML) tiên tiến liên tục định hình lại nhận thức thị giác. Tối ưu kiến trúc và hàm mất mát giúp nhà phát triển xây dựng model nhẹ hơn, nhanh hơn trong mọi lĩnh vực.
Đối với các tác vụ thị giác máy tính tiên tiến, việc tìm hiểu các tối ưu hóa end-to-end cũng quan trọng không kém. Ví dụ, Ultralytics YOLO26 hỗ trợ suy luận end-to-end gốc, không cần NMS nhờ head one-to-one (nms=False), đồng thời huấn luyện bằng bộ tối ưu hóa lai lấy cảm hứng từ nghiên cứu LLM, giúp đơn giản hóa triển khai biên. Nhà phát triển muốn tận dụng workflow thị giác máy tính hiệu quả có thể dễ dàng xây dựng, huấn luyện và triển khai model bằng Ultralytics Platform. Công cụ đám mây này đơn giản hóa việc quản lý tập dữ liệu phức tạp và điều chỉnh siêu tham số cho các ứng dụng thị giác thời gian thực vững chắc.










