YOLO Vision 2026:
Quay lại Bảng thuật ngữ Ultralytics

Group Relative Policy Optimization (GRPO)

Khám phá Tối ưu hóa chính sách tương đối theo nhóm (GRPO). Tìm hiểu cách thuật toán RL không cần phê bình, tiết kiệm bộ nhớ này nâng cao khả năng suy luận của LLM và cắt giảm chi phí huấn luyện.

Group Relative Policy Optimization (GRPO) là một thuật toán reinforcement learning tiết kiệm bộ nhớ được phát triển nhằm nâng cao năng lực suy luận của các Large Language Models (LLMs) và các hệ thống Artificial Intelligence (AI) rộng lớn hơn. Được giới thiệu lần đầu tiên trong DeepSeekMath paper năm 2024, GRPO cải tiến các phương pháp tối ưu hóa truyền thống bằng cách loại bỏ nhu cầu sử dụng một mạng giá trị riêng biệt (critic model). Thay vào đó, thuật toán này chuẩn hóa phần thưởng của một nhóm các phản hồi được tạo ra bắt nguồn từ cùng một prompt. Bằng cách đánh giá các phản hồi tương đối so với các phản hồi cùng nhóm, GRPO giảm đáng kể chi phí tính toán đồng thời thúc đẩy hiệu suất trên các tác vụ suy luận phức tạp trong các kiến trúc Deep Learning (DL) hiện đại.

GRPO khác PPO như thế nào#

Mặc dù GRPO có những điểm tương đồng với Proximal Policy Optimization (PPO)—một optimization algorithm tiêu chuẩn thường được sử dụng trong học tăng cường từ phản hồi của con người (RLHF)—cả hai lại có sự khác biệt đáng kể về mặt kiến trúc. PPO yêu cầu một "critic" model thứ cấp chạy song song với mạng chính sách chính để ước tính giá trị của một trạng thái cho trước. Điều này làm tăng gần gấp đôi bộ nhớ cần thiết trong suốt training phase.

Ngược lại, GRPO là một thuật toán không dùng critic. Bằng cách lấy mẫu nhiều đầu ra cho một prompt đơn lẻ và chấm điểm chúng bằng rule-based reward system hoặc bộ kiểm chứng, GRPO tính toán lợi thế bằng cách chuẩn hóa điểm số trong nhóm cụ thể đó. Phép so sánh tương đối này đóng vai trò là đường cơ sở, tiết kiệm lượng lớn bộ nhớ vốn sẽ bị chiếm dụng bởi một mạng giá trị và đẩy nhanh quá trình model training tổng thể.

Các ứng dụng thực tế của GRPO#

GRPO đã thúc đẩy một số bước đột phá gần đây trong lĩnh vực generative AInatural language processing. Hai ứng dụng đáng chú ý bao gồm:

  1. Mathematical Reasoning Models: Trong bản phát hành DeepSeek-R1 release và DeepSeekMath được trích dẫn rộng rãi, GRPO được sử dụng để khuyến khích các model phát triển khả năng suy luận chain-of-thought dài và tự kiểm chứng, mang lại hiệu suất tương đương với các model độc quyền như OpenAI's o1. Bằng cách thưởng cho các câu trả lời cuối cùng chính xác và cách định dạng, thuật toán này cho phép model tự khám phá các chiến lược giải quyết vấn đề nâng cao mà không cần fine-tuning rộng rãi trên dữ liệu được gán nhãn bởi con người.
  2. Code Generation and Agentic Logic: Đối với các model viết mã hoặc vận hành các agentic workflows tự động, việc đánh giá tính chính xác tuyệt đối là một thách thức. GRPO cho phép các model học hỏi bằng cách thực thi các biến thể mã và chấm điểm tương đối dựa trên thành công khi biên dịch hoặc các trường hợp kiểm thử đã vượt qua, đẩy nhanh quá trình triển khai các trợ lý lập trình AI có độ tin cậy cao.

Triển khai các khái niệm GRPO trong PyTorch#

Về cốt lõi, GRPO tính toán lợi thế tương đối của các phản hồi bằng cách chuẩn hóa phần thưởng của chúng. Dưới đây là một PyTorch implementation cơ bản minh họa quá trình chuẩn hóa này bằng cách sử dụng các tensor operations tiêu chuẩn:



def compute_grpo_advantages(rewards):
    # 'rewards' is a tensor of shape (batch_size, group_size)
    group_mean = rewards.mean(dim=1, keepdim=True)
    group_std = rewards.std(dim=1, keepdim=True)

    # Normalize rewards within the group to calculate relative advantages
    advantages = (rewards - group_mean) / (group_std + 1e-8)
    return advantages

Thúc đẩy AI với tối ưu hóa thông minh#

Cũng giống như GRPO định nghĩa lại hiệu quả cho việc tạo văn bản, các kỹ thuật Machine Learning (ML) tiên tiến không ngừng định hình lại visual perception. Việc tối ưu hóa các kiến trúc và loss functions cho phép các nhà phát triển xây dựng các model nhẹ hơn, nhanh hơn trên mọi miền.

Đối với các computer vision tasks tiên tiến, việc khám phá các phương pháp tối ưu hóa đầu cuối cũng mang tầm quan trọng không kém. Ví dụ: Ultralytics YOLO26 giới thiệu một kiến trúc hoàn toàn không cần NMS và các hybrid optimizers lấy cảm hứng từ nghiên cứu LLM, cải thiện đáng kể quá trình triển khai ở biên. Các nhà phát triển muốn tận dụng các computer vision workflows hiệu quả có thể xây dựng, huấn luyện và triển khai các model một cách dễ dàng bằng cách sử dụng Ultralytics Platform. Công cụ dựa trên đám mây này đơn giản hóa việc quản lý tập dữ liệu phức tạp và hyperparameter tuning cho các ứng dụng thị giác thời gian thực, mạnh mẽ.

Explore solutions

Real-time AI that works with your team

Thị giác máy tính trong lĩnh vực robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

Thị giác máy tính trong y tế

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

Thị giác máy tính trong ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

Thị giác máy tính trong nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

Thị giác máy tính trong lĩnh vực robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

Thị giác máy tính trong y tế

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

Thị giác máy tính trong ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

Thị giác máy tính trong nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

Thị giác máy tính trong lĩnh vực robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

Thị giác máy tính trong y tế

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

Thị giác máy tính trong ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

Thị giác máy tính trong nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm

Hãy cùng nhau xây dựng tương lai của AI!

Bắt đầu hành trình của bạn với tương lai của machine learning