YOLO Vision 2026:
Quay lại Bảng thuật ngữ Ultralytics

Reinforcement Learning from Human Feedback (RLHF)

Tìm hiểu cách Học tăng cường từ phản hồi của con người (RLHF) căn chỉnh AI với các giá trị con người. Khám phá các thành phần cốt lõi và sự tích hợp với Ultralytics YOLO26.

Reinforcement Learning from Human Feedback (RLHF) là một kỹ thuật machine learning nâng cao giúp tối ưu hóa các model trí tuệ nhân tạo bằng cách tích hợp trực tiếp dữ liệu đầu vào từ con người vào vòng lặp huấn luyện. Khác với supervised learning tiêu chuẩn vốn chỉ dựa vào các tập dữ liệu gán nhãn tĩnh, RLHF giới thiệu một cơ chế phản hồi động nơi các chuyên gia đánh giá xếp hạng hoặc chấm điểm kết quả của model. Quá trình này cho phép AI nắm bắt các mục tiêu phức tạp, chủ quan hoặc tinh tế—chẳng hạn như "tính hữu ích", "an toàn" hoặc "tính sáng tạo"—những yếu tố rất khó định nghĩa bằng một hàm mất mát toán học đơn giản. RLHF đã trở thành nền tảng trong việc phát triển các large language models (LLMs) hiện đại và AI tạo sinh, đảm bảo rằng các foundation model mạnh mẽ đồng bộ hiệu quả với các giá trị của con người và ý định của người dùng.

Các thành phần cốt lõi của RLHF#

Quy trình RLHF thường tuân theo một pipeline gồm ba bước được thiết kế để thu hẹp khoảng cách giữa các khả năng dự đoán thô và hành vi căn chỉnh với con người.

  1. Supervised Fine-Tuning (SFT): Quy trình thường bắt đầu với một foundation model đã được huấn luyện trước. Các lập trình viên thực hiện fine-tuning ban đầu bằng cách sử dụng một tập dữ liệu mẫu nhỏ hơn, chất lượng cao (ví dụ: các cặp câu hỏi-câu trả lời do chuyên gia viết). Bước này thiết lập một chính sách cơ sở, dạy cho model định dạng chung và giọng điệu mong đợi cho tác vụ.

  2. Reward Model Training: Giai đoạn này là tính năng đặc trưng của RLHF. Các chuyên gia gán nhãn đánh giá nhiều kết quả đầu do model tạo ra cho cùng một đầu vào và xếp hạng chúng từ tốt nhất đến tệ nhất. Nỗ lực data labeling này tạo ra một tập dữ liệu sở thích. Một neural network riêng biệt, được gọi là reward model, được huấn luyện trên dữ liệu so sánh này để dự đoán một điểm số vô hướng phản ánh đánh giá của con người. Các công cụ có sẵn trên Ultralytics Platform có thể hợp lý hóa việc quản lý các quy trình gán nhãn như vậy.

  3. Reinforcement Learning Optimization: Cuối cùng, model ban đầu đóng vai trò là một AI agent trong một môi trường reinforcement learning. Sử dụng reward model làm hướng dẫn, các thuật toán tối ưu hóa như Proximal Policy Optimization (PPO) điều chỉnh các tham số của model để tối đa hóa phần thưởng kỳ vọng. Bước này căn chỉnh chính sách của model với các sở thích của con người đã học được, khuyến khích các hành vi hữu ích và an toàn đồng thời ngăn chặn các kết quả độc hại hoặc vô nghĩa.

Các ứng dụng trong thực tế#

RLHF đã chứng minh được tầm quan trọng trong việc triển khai các hệ thống AI đòi hỏi tiêu chuẩn an toàn cao và sự hiểu biết tinh tế về tương tác của con người.

  • Conversational AI and Chatbots: Ứng dụng nổi bật nhất của RLHF là trong việc căn chỉnh các chatbot để trở nên hữu ích, vô hại và trung thực. Bằng cách phạt các kết quả có thành kiến, sai lệch về mặt thực tế hoặc nguy hiểm, RLHF giúp giảm thiểu hallucination in LLMs và giảm rủi ro về algorithmic bias. Điều này đảm bảo các trợ lý ảo có thể từ chối các hướng dẫn độc hại trong khi vẫn hữu ích cho các truy vấn hợp pháp.
  • Robotics and Physical Control: RLHF mở rộng ra ngoài văn bản sang AI in robotics, nơi việc xác định một hàm phần thưởng hoàn hảo cho các tác vụ vật lý phức tạp là một thử thách. Ví dụ, một robot học cách điều hướng trong một kho hàng đông đúc có thể nhận được phản hồi từ người giám sát con người về những quỹ đạo nào an toàn so với những quỹ đạo gây ra sự gián đoạn. Phản hồi này tinh chỉnh chính sách điều khiển của robot hiệu quả hơn so với deep reinforcement learning đơn thuần dựa vào việc hoàn thành mục tiêu.

RLHF so với học tăng cường tiêu chuẩn#

Việc phân biệt RLHF với reinforcement learning (RL) truyền thống rất hữu ích để hiểu được công dụng cụ thể của nó.

  • Standard RL: Trong các cài đặt truyền thống, hàm phần thưởng thường được mã hóa cứng bởi môi trường. Ví dụ, trong một trò chơi điện tử, môi trường cung cấp một tín hiệu rõ ràng (+1 cho một trận thắng, -1 cho một trận thua). Agent tối ưu hóa các hành động của nó trong Markov Decision Process (MDP) đã được định nghĩa này.
  • RLHF: Trong nhiều kịch bản thực tế, chẳng hạn như viết một câu chuyện sáng tạo hoặc lái xe lịch sự, "sự thành công" mang tính chủ quan. RLHF giải quyết vấn đề này bằng cách thay thế phần thưởng được mã hóa cứng bằng một reward model đã học được, bắt nguồn từ các tùy chọn ưu tiên của con người. Điều này cho phép tối ưu hóa các khái niệm trừu tượng như "chất lượng" hoặc "sự phù hợp" vốn không thể lập trình một cách rõ ràng.

Tích hợp nhận thức với các vòng lặp phản hồi#

Trong các ứng dụng thị giác, các agent được căn chỉnh bằng RLHF thường dựa vào computer vision (CV) để nhận thức trạng thái của môi trường trước khi hành động. Một detector mạnh mẽ, chẳng hạn như YOLO26, đóng vai trò là tầng nhận thức, cung cấp các quan sát có cấu trúc (ví dụ: "phát hiện chướng ngại vật ở khoảng cách 3 mét") mà mạng chính sách sử dụng để chọn một hành động.

Ví dụ Python sau đây minh họa một khái niệm đơn giản hóa nơi một model YOLO cung cấp trạng thái môi trường. Trong một vòng lặp RLHF đầy đủ, tín hiệu "phần thưởng" sẽ đến từ một model được huấn luyện trên phản hồi của con người liên quan đến các quyết định của tác nhân dựa trên dữ liệu phát hiện này.

from ultralytics import YOLO

# Load YOLO26n to act as the perception layer for an intelligent agent
model = YOLO("yolo26n.pt")

# The agent observes the environment (an image) to determine its state
results = model("https://ultralytics.com/images/bus.jpg")

# In an RL context, the 'state' is derived from detections
# A reward model (trained via RLHF) would evaluate the action taken based on this state
detected_objects = len(results[0].boxes)

print(f"Agent Observation: Detected {detected_objects} objects.")
# Example output: Agent Observation: Detected 4 objects.

Bằng cách kết hợp các perception model mạnh mẽ với các chính sách được tinh chỉnh thông qua phản hồi từ con người, các lập trình viên có thể xây dựng các hệ thống không chỉ thông minh mà còn tuân thủ nghiêm ngặt các nguyên tắc AI safety. Nghiên cứu đang diễn ra về việc giám sát có khả năng mở rộng, chẳng hạn như Constitutional AI, tiếp tục phát triển lĩnh vực này, nhằm giảm bớt nút cổ chai của việc gán nhãn quy mô lớn từ con người trong khi vẫn duy trì hiệu suất cao của model.

Explore solutions

Real-time AI that works with your team

AI trong ngành Robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong Logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong chăm sóc sức khỏe

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

AI trong Ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

AI trong Nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong Logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong chăm sóc sức khỏe

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

AI trong Ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

AI trong Nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong Logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong chăm sóc sức khỏe

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

AI trong Ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

AI trong Nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm

Hãy cùng nhau xây dựng tương lai của AI!

Bắt đầu hành trình của bạn với tương lai của machine learning