Reinforcement Learning with Verifiable Rewards (RLVR)
Khám phá Học tăng cường với phần thưởng có thể xác minh (RLVR). Tìm hiểu cách huấn luyện AI tiên tiến bằng phản hồi xác định và Ultralytics YOLO26.
Học tăng cường với phần thưởng có thể kiểm chứng (RLVR) là một mô hình huấn luyện nâng cao được dùng để cải thiện năng lực suy luận và giải quyết vấn đề của các model trí tuệ nhân tạo (AI). Khác với các phương pháp huấn luyện truyền thống dựa vào dữ liệu sở thích do con người gán nhãn, RLVR sử dụng hệ thống dựa trên luật mang tính xác định để đánh giá đầu ra của model. Bằng cách cung cấp phần thưởng nhị phân khách quan—chẳng hạn như mã được tạo có biên dịch thành công hay phương trình toán học được giải đúng—RLVR cho phép model học thông qua quá trình khám phá không bị hạn chế. Vòng phản hồi khách quan này là động lực chính đằng sau những đột phá gần đây trong các model suy luận có năng lực cao, giúp chúng tìm ra những lộ trình logic phức tạp tối ưu mà không cần sự can thiệp liên tục của con người.
Các nguyên lý cốt lõi của RLVR#
Trong môi trường machine learning (ML) tiêu chuẩn, một AI agent học bằng cách tối đa hóa tín hiệu phần thưởng. Trong RLVR, tín hiệu phần thưởng này được tạo bởi một hệ thống lập trình cứng nhắc thay vì đánh giá chủ quan của con người. Quá trình học dựa trên một số bước cơ bản:
- Chiến lược khám phá: Model tạo ra nhiều giải pháp hoặc lộ trình suy luận tiềm năng cho một prompt nhất định, thường sử dụng phương pháp gợi ý chuỗi suy nghĩ để phân rã các tác vụ phức tạp.
- Xác minh xác định: Một công cụ bên ngoài—chẳng hạn như trình biên dịch Python, máy tính hoặc hệ thống nhận thức thị giác máy tính (CV)—kiểm tra đầu ra cuối cùng dựa trên các tiêu chí thành công khách quan.
- Tối ưu hóa policy: Nếu đầu ra được xác minh là chính xác, model sẽ nhận phần thưởng dương. Sau đó, policy của model được cập nhật bằng các thuật toán tối ưu hóa như Tối ưu hóa Policy Tương đối theo Nhóm (GRPO) hoặc Tối ưu hóa Policy Cận kề (PPO) để ưu tiên các lộ trình suy luận thành công.
Phương pháp này cải thiện đáng kể hiệu quả độ trễ suy luận của model trong quá trình huấn luyện và khuyến khích hình thành các năng lực suy luận mới nổi; đây là kỹ thuật gần đây được dùng để huấn luyện những model có năng lực cao như DeepSeek-R1.
RLVR so với RLHF và PRM#
Điều quan trọng là cần phân biệt RLVR với các mô hình căn chỉnh và huấn luyện khác trong hệ sinh thái AI:
- So với Học tăng cường từ phản hồi của con người (RLHF): RLHF dựa vào một hệ thống mô hình hóa phần thưởng được học từ các lựa chọn chủ quan của con người. RLVR loại bỏ nút thắt con người trong vòng lặp bằng cách chỉ dựa vào các sự thật khách quan được xác định bằng chương trình, nhờ đó có khả năng mở rộng cao cho các tác vụ có đáp án đúng hoặc sai rõ ràng.
- So với Mô hình Phần thưởng theo Quy trình (PRM): Trong khi PRM cung cấp phản hồi chi tiết theo từng bước xuyên suốt lộ trình suy luận của model, RLVR thường tập trung vào kết quả có thể kiểm chứng ở cuối quy trình. Tuy nhiên, nghiên cứu gần đây năm 2025 cho thấy việc tối ưu hóa phần thưởng cuối cùng có thể kiểm chứng trong RLVR cũng ngầm khuyến khích các bước suy luận trung gian chính xác.
Ứng dụng thực tế#
RLVR đang thay đổi cách huấn luyện các hệ thống AI phức tạp trên nhiều lĩnh vực có tính xác định:
- Suy luận toán học: Các model suy luận lớn như dòng OpenAI o-series tận dụng RLVR để giải các định lý toán học phức tạp. Bộ xác minh đóng vai trò như một engine chứng minh dứt khoát liệu đáp án model suy ra có chính xác hay không, qua đó cải thiện đáng kể hiệu suất trên dataset benchmark.
- Kỹ thuật phần mềm và tạo mã: Các trợ lý lập trình AI sử dụng RLVR để viết, gỡ lỗi và tối ưu hóa mã. Phần thưởng có thể kiểm chứng được trao khi mã được tạo biên dịch thành công và vượt qua một bộ kiểm thử unit tự động.
- Vision agent tự hành: Trong môi trường vật lý, các agent tự hành nhận phần thưởng có thể kiểm chứng khi đến được đích hoặc thao tác thành công với một đối tượng. Các model thị giác đóng vai trò bộ kiểm tra điều kiện có thể xác minh trong những môi trường này.
Triển khai phần thưởng có thể kiểm chứng trong AI thị giác#
Trong môi trường vật lý và thị giác, các model nhận thức như Ultralytics YOLO26 có thể đóng vai trò bộ xác minh bằng chương trình trong vòng lặp RLVR. Ví dụ, nếu mục tiêu của một AI agent là di chuyển một đối tượng vào một vùng cụ thể, model YOLO có thể xác minh thành công bằng cách phát hiện sự hiện diện của đối tượng trong vùng đó.
Đoạn mã Python sau minh họa một bộ xác minh bằng chương trình ở mức khái niệm, sử dụng package ultralytics.
from ultralytics import YOLO
# Load a YOLO26 model to act as the programmatic verifier
verifier_model = YOLO("yolo26n.pt")
def get_verifiable_reward(image_path: str, target_class: int) -> float:
"""Returns a verifiable reward of 1.0 if the target object is detected."""
results = verifier_model(image_path)
# Check if the desired class (e.g., 0 for 'person') exists in the detections
detected_classes = results[0].boxes.cls.tolist()
if target_class in detected_classes:
return 1.0 # Verifiable success
return 0.0 # Verifiable failure
# Simulate an agent's environment state check
reward = get_verifiable_reward("https://ultralytics.com/images/bus.jpg", target_class=0)
print(f"RLVR Reward Signal: {reward}")Bằng cách tận dụng các nền tảng cloud như Ultralytics Platform để triển khai các bộ xác minh nhận thức này, nhà phát triển có thể xây dựng pipeline RLVR mạnh mẽ, có khả năng mở rộng để huấn luyện thế hệ agent tự hành và suy luận tiếp theo.









