YOLO Vision 2026:
Quay lại Bảng thuật ngữ Ultralytics

Reward Modeling

Khám phá mô hình hóa phần thưởng (reward modeling) trong học máy. Tìm hiểu cách nó sử dụng phản hồi của con người để căn chỉnh các tác nhân AI và các mô hình Ultralytics YOLO26 để có hiệu suất an toàn và chính xác hơn.

Reward modeling là một kỹ thuật machine learning được sử dụng để dạy cho hệ thống trí tuệ nhân tạo cách đánh giá và ưu tiên các hành vi của chính nó dựa trên sở thích của con người. Trong môi trường reinforcement learning truyền thống, một AI agent học hỏi bằng cách tối đa hóa một hàm phần thưởng (reward function) được định nghĩa sẵn và có tính toán cứng nhắc, chẳng hạn như điểm số trong một trò chơi điện tử. Tuy nhiên, đối với các tác vụ phức tạp trong thế giới thực nơi hành vi "tốt" mang tính chủ quan hoặc vi tế—chẳng hạn như viết một email lịch sự hoặc điều hướng qua một giao lộ một cách an toàn—việc viết thủ công một hàm phần thưởng hoàn hảo là gần như bất khả thi. Reward modeling giải quyết vấn đề này bằng cách huấn luyện một neural network thứ cấp (reward model) đóng vai trò là đại diện cho phán đoán của con người. Mô hình này đánh giá các đầu ra của AI chính và gán các điểm số dạng vô hướng (scalar), dẫn dắt một cách động mô hình chính hướng tới các hành vi an toàn, hữu ích và chính xác.

Cách thức hoạt động của Reward Modeling#

Quy trình xây dựng reward model phụ thuộc rất lớn vào việc thu thập phản hồi chất lượng cao từ con người.

  • Data Labeling và Sở thích: Những người gán nhãn con người nhận được các câu lệnh (prompt) kèm theo nhiều phản hồi do mô hình AI tạo ra. Các nhà đánh giá xếp hạng các phản hồi này từ tốt nhất đến tệ nhất dựa trên các tiêu chí như tính hữu ích, tính vô hại và độ chính xác. Việc quản lý các quy trình gán nhãn quy mô lớn này có thể được xử lý mượt mà bằng cách sử dụng Ultralytics Platform.
  • Huấn luyện Mạng Đại diện: Một neural network chuyên biệt được huấn luyện trên tập dữ liệu so sánh của con người này. Thông qua quy trình tối ưu hóa, nó học cách dự đoán đầu ra nào mà con người sẽ thích hơn, ánh xạ các embeddings của một hành động hoặc phản hồi văn bản thành một giá trị phần thưởng vô hướng duy nhất. Bạn có thể đọc thêm về cách xây dựng kiến trúc neural network trong PyTorch API documentation.
  • Tối ưu hóa Chính sách (Policy Optimization): Mô hình chính sử dụng phản hồi liên tục từ reward model để tinh chỉnh các hành động của nó, thường tận dụng các thuật toán như Proximal Policy Optimization (PPO). Bước này liên tục điều chỉnh chính sách của mô hình theo ý intent đã học được của con người.

Reward Modeling so với RLHF#

Điều quan trọng là phải phân biệt reward modeling với Reinforcement Learning from Human Feedback (RLHF). Mặc dù hai thuật ngữ này thường được thảo luận cùng nhau, nhưng chúng không đồng nghĩa với nhau. RLHF là quy trình toàn diện từ đầu đến cuối được sử dụng để căn chỉnh các mô hình, bao gồm quá trình tinh chỉnh có giám sát, thu thập dữ liệu và cập nhật chính sách. Reward modeling là một thành phần cụ thể và quan trọng trong quy trình RLHF. Nó đóng vai trò là cầu nối chuyển đổi các xếp hạng rời rạc của con người thành tín hiệu toán học liên tục mà thuật toán reinforcement learning có thể tối ưu hóa.

Các ứng dụng trong thực tế#

Reward modeling đóng vai trò quan trọng trong việc phát triển các hệ thống AI hiện đại tương tác trực tiếp với con người và thế giới vật lý.

  • Large Language Models (LLMs): Các trợ lý AI trò chuyện dựa vào các reward model để đảm bảo câu trả lời của họ không chỉ chính xác về mặt sự thật mà còn lịch sự, phù hợp và không chứa ngôn từ độc hại. Các tổ chức đang khám phá AI safety không ngừng thúc đẩy reward modeling để xây dựng các hệ thống phản ánh helpful and harmless AI alignment.
  • Autonomous Vehicles và Robotics: Trong tự động hóa vật lý, reward model giúp robot hiểu được phép xã giao phức tạp khi lái xe hoặc các chiến lược thao tác đối tượng. Hệ thống nhận diện được hỗ trợ bởi Ultralytics YOLO26 có thể phát hiện người đi bộ và biển báo giao thông, trong khi reward model đánh giá quỹ đạo dự kiến của phương tiện, đảm bảo AI ưu tiên sự thoải mái và an toàn cho hành khách hơn là việc điều hướng điểm tới điểm hoàn toàn hung hăng.

Triển khai khái niệm Reward Model cơ bản#

Ví dụ Python sau đây sử dụng torch để minh họa cấu trúc nền tảng của một reward model. Trong thực tế, mạng này học cách gán điểm vô hướng cao hơn cho một đầu ra phù hợp với sở thích của con người.

import torch
import torch.nn as nn


# Define a simplified reward model architecture
class SimpleRewardModel(nn.Module):
    def __init__(self):
        super().__init__()
        # Maps the AI's output embedding to a single reward score
        self.fc = nn.Linear(768, 1)

    def forward(self, embeddings):
        return self.fc(embeddings)


# Initialize the model
reward_model = SimpleRewardModel()

# Simulated embeddings for a human-preferred action and a rejected action
chosen_action = torch.randn(1, 768)
rejected_action = torch.randn(1, 768)

# The model predicts scalar scores to guide the primary agent
print(f"Chosen Action Reward: {reward_model(chosen_action).item():.4f}")
print(f"Rejected Action Reward: {reward_model(rejected_action).item():.4f}")

Để tìm hiểu sâu hơn về cách sự căn chỉnh tác động đến các mô hình nền tảng mã nguồn mở, hãy khám phá nghiên cứu nền tảng về việc căn chỉnh các ngôn ngữ mô hình với ý định của con người và tìm hiểu cách các hệ thống computer vision (CV) tận dụng các vòng phản hồi nâng cao để tương tác an toàn với các môi trường động.

Explore solutions

Real-time AI that works with your team

Thị giác máy tính trong lĩnh vực robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

Thị giác máy tính trong y tế

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

Thị giác máy tính trong ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

Thị giác máy tính trong nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

Thị giác máy tính trong lĩnh vực robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

Thị giác máy tính trong y tế

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

Thị giác máy tính trong ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

Thị giác máy tính trong nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

Thị giác máy tính trong lĩnh vực robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

Thị giác máy tính trong y tế

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

Thị giác máy tính trong ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

Thị giác máy tính trong nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm

Hãy cùng nhau xây dựng tương lai của AI!

Bắt đầu hành trình của bạn với tương lai của machine learning