Reward Modeling
Khám phá mô hình hóa phần thưởng (reward modeling) trong học máy. Tìm hiểu cách nó sử dụng phản hồi của con người để căn chỉnh các tác nhân AI và các mô hình Ultralytics YOLO26 để có hiệu suất an toàn và chính xác hơn.
Reward modeling là một kỹ thuật machine learning được sử dụng để dạy cho hệ thống trí tuệ nhân tạo cách đánh giá và ưu tiên các hành vi của chính nó dựa trên sở thích của con người. Trong môi trường reinforcement learning truyền thống, một AI agent học hỏi bằng cách tối đa hóa một hàm phần thưởng (reward function) được định nghĩa sẵn và có tính toán cứng nhắc, chẳng hạn như điểm số trong một trò chơi điện tử. Tuy nhiên, đối với các tác vụ phức tạp trong thế giới thực nơi hành vi "tốt" mang tính chủ quan hoặc vi tế—chẳng hạn như viết một email lịch sự hoặc điều hướng qua một giao lộ một cách an toàn—việc viết thủ công một hàm phần thưởng hoàn hảo là gần như bất khả thi. Reward modeling giải quyết vấn đề này bằng cách huấn luyện một neural network thứ cấp (reward model) đóng vai trò là đại diện cho phán đoán của con người. Mô hình này đánh giá các đầu ra của AI chính và gán các điểm số dạng vô hướng (scalar), dẫn dắt một cách động mô hình chính hướng tới các hành vi an toàn, hữu ích và chính xác.
Cách thức hoạt động của Reward Modeling#
Quy trình xây dựng reward model phụ thuộc rất lớn vào việc thu thập phản hồi chất lượng cao từ con người.
- Data Labeling và Sở thích: Những người gán nhãn con người nhận được các câu lệnh (prompt) kèm theo nhiều phản hồi do mô hình AI tạo ra. Các nhà đánh giá xếp hạng các phản hồi này từ tốt nhất đến tệ nhất dựa trên các tiêu chí như tính hữu ích, tính vô hại và độ chính xác. Việc quản lý các quy trình gán nhãn quy mô lớn này có thể được xử lý mượt mà bằng cách sử dụng Ultralytics Platform.
- Huấn luyện Mạng Đại diện: Một neural network chuyên biệt được huấn luyện trên tập dữ liệu so sánh của con người này. Thông qua quy trình tối ưu hóa, nó học cách dự đoán đầu ra nào mà con người sẽ thích hơn, ánh xạ các embeddings của một hành động hoặc phản hồi văn bản thành một giá trị phần thưởng vô hướng duy nhất. Bạn có thể đọc thêm về cách xây dựng kiến trúc neural network trong PyTorch API documentation.
- Tối ưu hóa Chính sách (Policy Optimization): Mô hình chính sử dụng phản hồi liên tục từ reward model để tinh chỉnh các hành động của nó, thường tận dụng các thuật toán như Proximal Policy Optimization (PPO). Bước này liên tục điều chỉnh chính sách của mô hình theo ý intent đã học được của con người.
Reward Modeling so với RLHF#
Điều quan trọng là phải phân biệt reward modeling với Reinforcement Learning from Human Feedback (RLHF). Mặc dù hai thuật ngữ này thường được thảo luận cùng nhau, nhưng chúng không đồng nghĩa với nhau. RLHF là quy trình toàn diện từ đầu đến cuối được sử dụng để căn chỉnh các mô hình, bao gồm quá trình tinh chỉnh có giám sát, thu thập dữ liệu và cập nhật chính sách. Reward modeling là một thành phần cụ thể và quan trọng trong quy trình RLHF. Nó đóng vai trò là cầu nối chuyển đổi các xếp hạng rời rạc của con người thành tín hiệu toán học liên tục mà thuật toán reinforcement learning có thể tối ưu hóa.
Các ứng dụng trong thực tế#
Reward modeling đóng vai trò quan trọng trong việc phát triển các hệ thống AI hiện đại tương tác trực tiếp với con người và thế giới vật lý.
- Large Language Models (LLMs): Các trợ lý AI trò chuyện dựa vào các reward model để đảm bảo câu trả lời của họ không chỉ chính xác về mặt sự thật mà còn lịch sự, phù hợp và không chứa ngôn từ độc hại. Các tổ chức đang khám phá AI safety không ngừng thúc đẩy reward modeling để xây dựng các hệ thống phản ánh helpful and harmless AI alignment.
- Autonomous Vehicles và Robotics: Trong tự động hóa vật lý, reward model giúp robot hiểu được phép xã giao phức tạp khi lái xe hoặc các chiến lược thao tác đối tượng. Hệ thống nhận diện được hỗ trợ bởi Ultralytics YOLO26 có thể phát hiện người đi bộ và biển báo giao thông, trong khi reward model đánh giá quỹ đạo dự kiến của phương tiện, đảm bảo AI ưu tiên sự thoải mái và an toàn cho hành khách hơn là việc điều hướng điểm tới điểm hoàn toàn hung hăng.
Triển khai khái niệm Reward Model cơ bản#
Ví dụ Python sau đây sử dụng torch để minh họa cấu trúc nền tảng của một reward model. Trong thực tế, mạng này học cách gán điểm vô hướng cao hơn cho một đầu ra phù hợp với sở thích của con người.
import torch
import torch.nn as nn
# Define a simplified reward model architecture
class SimpleRewardModel(nn.Module):
def __init__(self):
super().__init__()
# Maps the AI's output embedding to a single reward score
self.fc = nn.Linear(768, 1)
def forward(self, embeddings):
return self.fc(embeddings)
# Initialize the model
reward_model = SimpleRewardModel()
# Simulated embeddings for a human-preferred action and a rejected action
chosen_action = torch.randn(1, 768)
rejected_action = torch.randn(1, 768)
# The model predicts scalar scores to guide the primary agent
print(f"Chosen Action Reward: {reward_model(chosen_action).item():.4f}")
print(f"Rejected Action Reward: {reward_model(rejected_action).item():.4f}")Để tìm hiểu sâu hơn về cách sự căn chỉnh tác động đến các mô hình nền tảng mã nguồn mở, hãy khám phá nghiên cứu nền tảng về việc căn chỉnh các ngôn ngữ mô hình với ý định của con người và tìm hiểu cách các hệ thống computer vision (CV) tận dụng các vòng phản hồi nâng cao để tương tác an toàn với các môi trường động.






