YOLO Vision 2026:
Quay lại Bảng thuật ngữ Ultralytics

Reinforcement Learning with Verifiable Rewards (RLVR)

Khám phá Reinforcement Learning with Verifiable Rewards (RLVR). Tìm hiểu cách huấn luyện AI tiên tiến sử dụng phản hồi tất định và Ultralytics YOLO26.

Reinforcement Learning with Verifiable Rewards (RLVR) là một mô hình huấn luyện tiên tiến được sử dụng để nâng cao năng lực suy luận và giải quyết vấn đề của các mô hình artificial intelligence (AI). Khác với các phương pháp huấn luyện truyền thống vốn dựa vào dữ liệu ưu tiên do con người chú thích, RLVR sử dụng các rule-based systems tất định để đánh giá đầu ra của mô hình. Bằng cách cung cấp một phần thưởng khách quan, binary reward — chẳng hạn như việc một đoạn mã được tạo ra có biên dịch được hay một phương trình toán học có được giải đúng hay không — RLVR cho phép các mô hình học tập thông qua quá trình khám phá không bị giới hạn. Vòng lặp phản hồi khách quan này là động lực chính đằng sau những đột phá gần đây trong các mô hình suy luận có năng lực cao, giúp chúng khám phá ra các đường dẫn logic tối ưu và phức tạp mà không cần sự can thiệp liên tục của con người.

Các nguyên tắc cốt lõi của RLVR#

Trong các môi trường machine learning (ML) tiêu chuẩn, một AI agent học tập bằng cách tối đa hóa tín hiệu phần thưởng. Trong RLVR, tín hiệu phần thưởng này được tạo ra bởi một hệ thống lập trình cứng nhắc thay vì phán đoán chủ quan của con người. Quá trình học tập dựa trên một số bước cơ bản:

  • Exploration Strategy: Mô hình tạo ra nhiều giải pháp tiềm năng hoặc đường dẫn suy luận cho một câu lệnh đầu vào nhất định, thường tận dụng kỹ thuật nhắc nhở chuỗi suy nghĩ để chia nhỏ các tác vụ phức tạp.
  • Deterministic Verification: Một công cụ bên ngoài — chẳng hạn như trình biên dịch Python, máy tính, hoặc hệ thống nhận diện computer vision (CV) — sẽ kiểm tra đầu ra cuối cùng dựa trên các tiêu chí thành công khách quan.
  • Policy Optimization: Nếu đầu ra được xác minh là chính xác, mô hình sẽ nhận được phần thưởng tích cực. Chính sách của mô hình sau đó được cập nhật bằng cách sử dụng các thuật toán tối ưu hóa như Group Relative Policy Optimization (GRPO) hoặc Proximal Policy Optimization (PPO) để ưu tiên các đường dẫn suy luận thành công.

Phương pháp này cải thiện đáng kể hiệu quả inference latency của mô hình tại thời điểm huấn luyện và khuyến khích các năng lực suy luận mới nổi, một kỹ thuật gần đây được sử dụng để huấn luyện các mô hình có năng lực cao như DeepSeek-R1.

RLVR so với RLHF và PRMs#

Việc phân biệt RLVR với các mô hình căn chỉnh và đào tạo khác trong hệ sinh thái AI là rất quan trọng:

  • vs. Reinforcement Learning from Human Feedback (RLHF): RLHF dựa vào hệ thống reward modeling đã học được huấn luyện trên các sở thích chủ quan của con người. RLVR loại bỏ nút thắt cổ chai có con người tham gia trong quy trình bằng cách dựa hoàn toàn vào các chân lý lập trình khách quan, giúp nó có khả năng mở rộng cao cho các tác vụ có câu trả lời đúng hoặc sai xác định.
  • vs. Process Reward Model (PRM): Mặc dù các PRM cung cấp phản hồi chi tiết theo từng bước trong suốt quỹ đạo suy luận của mô hình, RLVR thường tập trung vào kết quả có thể xác minh ở cuối quy trình. Tuy nhiên, nghiên cứu gần đây vào năm 2025 chỉ ra rằng việc tối ưu hóa cho một phần thưởng có thể xác minh cuối cùng trong RLVR cũng ngầm khuyến khích các bước suy luận trung gian chính xác.

Các ứng dụng trong thực tế#

RLVR đang thay đổi cách các hệ thống AI phức tạp được đào tạo trên nhiều lĩnh vực có tính xác định khác nhau:

  • Mathematical Reasoning: Các mô hình suy luận lớn như dòng OpenAI o tận dụng RLVR để giải quyết các định lý toán học phức tạp. Trình xác minh đóng vai trò là một công cụ chứng minh dứt khoát xem câu trả lời do mô hình suy ra có chính xác hay không, qua đó thúc đẩy đáng kể hiệu suất của benchmark dataset.
  • Software Engineering and Code Generation: Các trợ lý lập trình AI sử dụng RLVR để viết, gỡ lỗi và tối ưu hóa mã. Phần thưởng có thể xác minh đạt được khi mã được tạo ra biên dịch thành công và vượt qua một bộ các bài kiểm tra đơn vị tự động.
  • Autonomous Vision Agents: Trong các môi trường vật lý, các tác nhân tự động nhận được phần thưởng có thể xác minh khi đến được một đích đến mục tiêu hoặc thao tác thành công một đối tượng. Các mô hình thị giác đóng vai trò là bộ kiểm tra điều kiện có thể xác minh trong các không gian này.

Triển khai phần thưởng có thể kiểm chứng trong AI thị giác#

Trong các môi trường vật lý và trực quan, các mô hình nhận diện như Ultralytics YOLO26 có thể đóng vai trò là bộ xác minh lập trình trong một vòng lặp RLVR. Ví dụ, nếu mục tiêu của một AI agent là di chuyển một đối tượng vào một khu vực cụ thể, mô hình YOLO có thể xác minh thành công bằng cách phát hiện sự hiện diện của đối tượng trong khu vực đó.

Đoạn mã Python sau đây minh họa một bộ xác minh lập trình theo khái niệm bằng cách sử dụng gói ultralytics.

from ultralytics import YOLO

# Load a YOLO26 model to act as the programmatic verifier
verifier_model = YOLO("yolo26n.pt")


def get_verifiable_reward(image_path: str, target_class: int) -> float:
    """Returns a verifiable reward of 1.0 if the target object is detected."""
    results = verifier_model(image_path)

    # Check if the desired class (e.g., 0 for 'person') exists in the detections
    detected_classes = results[0].boxes.cls.tolist()
    if target_class in detected_classes:
        return 1.0  # Verifiable success
    return 0.0  # Verifiable failure


# Simulate an agent's environment state check
reward = get_verifiable_reward("https://ultralytics.com/images/bus.jpg", target_class=0)
print(f"RLVR Reward Signal: {reward}")

Bằng cách tận dụng các nền tảng đám mây như Ultralytics Platform để triển khai các bộ xác minh nhận diện này, các nhà phát triển có thể xây dựng các đường ống RLVR mạnh mẽ, có khả năng mở rộng nhằm huấn luyện thế hệ tiếp theo của các tác nhân tự động và suy luận.

Explore solutions

Real-time AI that works with your team

AI trong ngành Robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong Logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong chăm sóc sức khỏe

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

AI trong Ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

AI trong Nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong Logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong chăm sóc sức khỏe

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

AI trong Ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

AI trong Nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong Logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong chăm sóc sức khỏe

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

AI trong Ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

AI trong Nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm

Hãy cùng nhau xây dựng tương lai của AI!

Bắt đầu hành trình của bạn với tương lai của machine learning