Ultralytics YOLO27:
Quay lại bảng thuật ngữ Ultralytics

Reinforcement Learning from Human Feedback (RLHF)

Tìm hiểu cách Reinforcement Learning from Human Feedback (RLHF) điều chỉnh AI theo các giá trị của con người. Khám phá các thành phần cốt lõi và việc tích hợp với Ultralytics YOLO26.

Học tăng cường từ phản hồi của con người (RLHF) là một kỹ thuật học máy tiên tiến, giúp tinh chỉnh các model trí tuệ nhân tạo bằng cách đưa phản hồi trực tiếp từ con người vào vòng lặp huấn luyện. Không giống học có giám sát tiêu chuẩn, vốn chỉ dựa vào các tập dữ liệu tĩnh đã gán nhãn, RLHF đưa vào một cơ chế phản hồi động, trong đó các đánh giá viên là con người xếp hạng hoặc chấm điểm đầu ra của model. Quy trình này cho phép AI nắm bắt các mục tiêu phức tạp, mang tính chủ quan hoặc tinh tế—chẳng hạn như "tính hữu ích", "tính an toàn" hoặc "tính sáng tạo"—những mục tiêu khó định nghĩa bằng một hàm mất mát toán học đơn giản. RLHF đã trở thành nền tảng quan trọng trong quá trình phát triển các mô hình ngôn ngữ lớn (LLMs) hiện đại và AI tạo sinh, bảo đảm các model nền tảng mạnh mẽ có thể liên kết hiệu quả với các giá trị của con người và ý định của người dùng.

Các thành phần cốt lõi của RLHF#

Quy trình RLHF thường tuân theo một pipeline gồm ba bước, được thiết kế để thu hẹp khoảng cách giữa năng lực dự đoán thô và hành vi phù hợp với con người.

  1. Tinh chỉnh có giám sát (SFT): Quy trình thường bắt đầu với một model nền tảng đã được huấn luyện trước. Các developer thực hiện tinh chỉnh ban đầu bằng một tập dữ liệu nhỏ hơn nhưng chất lượng cao, gồm các bản minh họa (ví dụ: các cặp câu hỏi–trả lời do chuyên gia viết). Bước này thiết lập một policy cơ sở, hướng dẫn model về định dạng và giọng điệu tổng quát được kỳ vọng cho tác vụ.

  2. Huấn luyện model phần thưởng: Giai đoạn này là đặc điểm phân biệt của RLHF. Các annotator là con người xem xét nhiều đầu ra do model tạo ra cho cùng một đầu vào và xếp hạng chúng từ tốt nhất đến kém nhất. Nỗ lực gán nhãn dữ liệu này tạo ra một tập dữ liệu về mức độ ưu thích. Một mạng neural riêng biệt, được gọi là model phần thưởng, được huấn luyện trên dữ liệu so sánh này để dự đoán một điểm số vô hướng phản ánh đánh giá của con người. Các công cụ có trên Ultralytics Platform có thể đơn giản hóa việc quản lý các workflow gán nhãn như vậy.

  3. Tối ưu hóa bằng học tăng cường: Cuối cùng, model ban đầu hoạt động như một AI agent trong một môi trường học tăng cường. Sử dụng model phần thưởng làm hướng dẫn, các thuật toán tối ưu hóa như Tối ưu hóa chính sách gần (PPO) điều chỉnh các tham số của model để tối đa hóa phần thưởng kỳ vọng. Bước này điều chỉnh policy của model theo các mức ưu thích đã học từ con người, khuyến khích những hành vi hữu ích và an toàn, đồng thời ngăn cản các đầu ra độc hại hoặc vô nghĩa.

Các ứng dụng trong thực tế#

RLHF đã chứng minh vai trò then chốt trong việc triển khai các hệ thống AI đòi hỏi tiêu chuẩn an toàn cao và khả năng hiểu tinh tế về tương tác giữa con người.

  • AI hội thoại và chatbot: Ứng dụng nổi bật nhất của RLHF là điều chỉnh chatbot để trở nên hữu ích, vô hại và trung thực. Bằng cách phạt các đầu ra thiên lệch, sai lệch về факt hoặc nguy hiểm, RLHF giúp giảm thiểu ảo giác trong LLM và giảm nguy cơ thiên kiến thuật toán. Điều này bảo đảm các trợ lý ảo có thể từ chối những hướng dẫn gây hại mà vẫn hữu ích đối với các truy vấn hợp lệ.
  • Robotics và điều khiển vật lý: RLHF không chỉ giới hạn ở văn bản mà còn mở rộng sang AI trong robotics, nơi việc xác định một hàm phần thưởng hoàn hảo cho các tác vụ vật lý phức tạp là rất khó. Chẳng hạn, một robot học cách di chuyển trong một nhà kho đông đúc có thể nhận phản hồi từ các giám sát viên là con người về việc quỹ đạo nào an toàn và quỹ đạo nào gây gián đoạn. Phản hồi này tinh chỉnh policy điều khiển của robot hiệu quả hơn so với học tăng cường sâu đơn giản chỉ dựa trên việc hoàn thành mục tiêu.

RLHF so với học tăng cường tiêu chuẩn#

Việc phân biệt RLHF với học tăng cường (RL) truyền thống sẽ giúp làm rõ tính hữu ích riêng của phương pháp này.

  • RL tiêu chuẩn: Trong các thiết lập truyền thống, hàm phần thưởng thường được hard-code bởi môi trường. Ví dụ, trong một trò chơi điện tử, môi trường cung cấp một tín hiệu rõ ràng (+1 khi thắng, -1 khi thua). Agent tối ưu hóa các hành động của mình trong Quy trình quyết định Markov (MDP) đã được định nghĩa này.
  • RLHF: Trong nhiều tình huống thực tế, chẳng hạn như viết một câu chuyện sáng tạo hoặc lái xe lịch sự, "thành công" mang tính chủ quan. RLHF giải quyết vấn đề này bằng cách thay thế phần thưởng được hard-code bằng một model phần thưởng được học từ các mức ưu thích của con người. Điều này cho phép tối ưu hóa các khái niệm trừu tượng như "chất lượng" hoặc "mức độ phù hợp", những khái niệm không thể lập trình một cách tường minh.

Tích hợp khả năng nhận biết với các vòng lặp phản hồi#

Trong các ứng dụng thị giác, các agent được điều chỉnh bằng RLHF thường dựa vào thị giác máy tính (CV) để nhận biết trạng thái của môi trường trước khi hành động. Một detector mạnh như YOLO26 hoạt động như lớp nhận biết, cung cấp các quan sát có cấu trúc (ví dụ: "phát hiện chướng ngại vật ở khoảng cách 3 mét") để mạng policy sử dụng khi lựa chọn hành động.

Ví dụ Python sau đây minh họa một khái niệm đơn giản hóa, trong đó một model YOLO cung cấp trạng thái môi trường. Trong một vòng lặp RLHF hoàn chỉnh, tín hiệu "phần thưởng" sẽ đến từ một model được huấn luyện trên phản hồi của con người về các quyết định của agent dựa trên dữ liệu phát hiện này.

from ultralytics import YOLO

# Load YOLO26n to act as the perception layer for an intelligent agent
model = YOLO("yolo26n.pt")

# The agent observes the environment (an image) to determine its state
results = model("https://ultralytics.com/images/bus.jpg")

# In an RL context, the 'state' is derived from detections
# A reward model (trained via RLHF) would evaluate the action taken based on this state
detected_objects = len(results[0].boxes)

print(f"Agent Observation: Detected {detected_objects} objects.")
# Example output: Agent Observation: Detected 4 objects.

Bằng cách kết hợp các model nhận biết mạnh mẽ với các policy được tinh chỉnh thông qua phản hồi của con người, developer có thể xây dựng những hệ thống không chỉ thông minh mà còn được điều chỉnh nghiêm ngặt theo các nguyên tắc an toàn AI. Nghiên cứu đang diễn ra về hoạt động giám sát có khả năng mở rộng, chẳng hạn như AI theo hiến pháp, tiếp tục thúc đẩy lĩnh vực này, hướng đến việc giảm nút thắt do hoạt động gán nhãn quy mô lớn của con người trong khi vẫn duy trì hiệu năng model cao.

Explore solutions

Thị giác máy tính cho hình ảnh trên không

Thị giác máy tính cho hình ảnh trên không

Biến đổi hình ảnh từ máyδ bay không người lái và ảnh chụp trên không thành thông tin chi tiết thời gian thực cho nông nghiệp, nuôi trồng thủy sản, giám sát môi trường, bảo tồn và phân tích không gian địa lý với Ultralytics YOLO.
Tìm hiểu thêm
Thị giác máy tính trong hàng không vũ trụ

Thị giác máy tính trong hàng không vũ trụ

Mang thị giác AI đến với hoạt động giám sát trên không bằng các model Ultralytics YOLO. Cung cấp sức mạnh cho máy bay không người lái, quy trình hàng không vũ trụ, bảo tồn môi trường & ngành công nghiệp địa không gian với các giải pháp thị giác máy tính.
Tìm hiểu thêm

Bảo vệ mọi địa điểm bằng các model Ultralytics YOLO. Thị giác AI cung cấp sức mạnh cho việc giám sát chu vi, phát hiện mối đe dọa, nhận diện biển số xe và an toàn nơi làm việc.
Tìm hiểu thêm
Thị giác máy tính trong robotics

Thị giác máy tính trong robotics

Nâng cao năng lực cho máy móc thông minh hơn với các model Ultralytics YOLO. Vision AI trong robotics hỗ trợ điều hướng tự động, nhận thức, theo dõi đối tượng và điều khiển theo thời gian thực.
Tìm hiểu thêm
Thị giác máy tính trong logistics

Thị giác máy tính trong logistics

Tinh gọn logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra kiện hàng, phân loại, theo dõi phương tiện và giám sát an toàn kho theo thời gian thực.
Tìm hiểu thêm
Thị giác máy tính trong bán lẻ

Thị giác máy tính trong bán lẻ

Định hình lại ngành bán lẻ với các model Ultralytics YOLO. Vision AI hỗ trợ tracking hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và cung cấp insight khách hàng thông minh hơn.
Tìm hiểu thêm
Computer vision trong healthcare

Computer vision trong healthcare

Xây dựng các giải pháp healthcare với các model Ultralytics YOLO. Vision AI trong healthcare thúc đẩy chẩn đoán hình ảnh nhanh hơn, chẩn đoán thông minh hơn và giám sát bệnh nhân.
Tìm hiểu thêm
Computer vision trong sản xuất

Computer vision trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Computer vision trong ngành ô tô

Computer vision trong ngành ô tô

Ứng dụng computer vision trong ngành ô tô với các model Ultralytics YOLO. Vision AI nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện để tạo nên những tuyến đường thông minh hơn.
Tìm hiểu thêm
Computer vision trong nông nghiệp

Computer vision trong nông nghiệp

Đưa vision AI vào nông nghiệp thông minh với các model Ultralytics YOLO. Thúc đẩy giám sát cây trồng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Thị giác máy tính cho hình ảnh trên không

Thị giác máy tính cho hình ảnh trên không

Biến đổi hình ảnh từ máyδ bay không người lái và ảnh chụp trên không thành thông tin chi tiết thời gian thực cho nông nghiệp, nuôi trồng thủy sản, giám sát môi trường, bảo tồn và phân tích không gian địa lý với Ultralytics YOLO.
Tìm hiểu thêm
Thị giác máy tính trong hàng không vũ trụ

Thị giác máy tính trong hàng không vũ trụ

Mang thị giác AI đến với hoạt động giám sát trên không bằng các model Ultralytics YOLO. Cung cấp sức mạnh cho máy bay không người lái, quy trình hàng không vũ trụ, bảo tồn môi trường & ngành công nghiệp địa không gian với các giải pháp thị giác máy tính.
Tìm hiểu thêm

Bảo vệ mọi địa điểm bằng các model Ultralytics YOLO. Thị giác AI cung cấp sức mạnh cho việc giám sát chu vi, phát hiện mối đe dọa, nhận diện biển số xe và an toàn nơi làm việc.
Tìm hiểu thêm
Thị giác máy tính trong robotics

Thị giác máy tính trong robotics

Nâng cao năng lực cho máy móc thông minh hơn với các model Ultralytics YOLO. Vision AI trong robotics hỗ trợ điều hướng tự động, nhận thức, theo dõi đối tượng và điều khiển theo thời gian thực.
Tìm hiểu thêm
Thị giác máy tính trong logistics

Thị giác máy tính trong logistics

Tinh gọn logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra kiện hàng, phân loại, theo dõi phương tiện và giám sát an toàn kho theo thời gian thực.
Tìm hiểu thêm
Thị giác máy tính trong bán lẻ

Thị giác máy tính trong bán lẻ

Định hình lại ngành bán lẻ với các model Ultralytics YOLO. Vision AI hỗ trợ tracking hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và cung cấp insight khách hàng thông minh hơn.
Tìm hiểu thêm
Computer vision trong healthcare

Computer vision trong healthcare

Xây dựng các giải pháp healthcare với các model Ultralytics YOLO. Vision AI trong healthcare thúc đẩy chẩn đoán hình ảnh nhanh hơn, chẩn đoán thông minh hơn và giám sát bệnh nhân.
Tìm hiểu thêm
Computer vision trong sản xuất

Computer vision trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Computer vision trong ngành ô tô

Computer vision trong ngành ô tô

Ứng dụng computer vision trong ngành ô tô với các model Ultralytics YOLO. Vision AI nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện để tạo nên những tuyến đường thông minh hơn.
Tìm hiểu thêm
Computer vision trong nông nghiệp

Computer vision trong nông nghiệp

Đưa vision AI vào nông nghiệp thông minh với các model Ultralytics YOLO. Thúc đẩy giám sát cây trồng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Thị giác máy tính cho hình ảnh trên không

Thị giác máy tính cho hình ảnh trên không

Biến đổi hình ảnh từ máyδ bay không người lái và ảnh chụp trên không thành thông tin chi tiết thời gian thực cho nông nghiệp, nuôi trồng thủy sản, giám sát môi trường, bảo tồn và phân tích không gian địa lý với Ultralytics YOLO.
Tìm hiểu thêm
Thị giác máy tính trong hàng không vũ trụ

Thị giác máy tính trong hàng không vũ trụ

Mang thị giác AI đến với hoạt động giám sát trên không bằng các model Ultralytics YOLO. Cung cấp sức mạnh cho máy bay không người lái, quy trình hàng không vũ trụ, bảo tồn môi trường & ngành công nghiệp địa không gian với các giải pháp thị giác máy tính.
Tìm hiểu thêm

Bảo vệ mọi địa điểm bằng các model Ultralytics YOLO. Thị giác AI cung cấp sức mạnh cho việc giám sát chu vi, phát hiện mối đe dọa, nhận diện biển số xe và an toàn nơi làm việc.
Tìm hiểu thêm
Thị giác máy tính trong robotics

Thị giác máy tính trong robotics

Nâng cao năng lực cho máy móc thông minh hơn với các model Ultralytics YOLO. Vision AI trong robotics hỗ trợ điều hướng tự động, nhận thức, theo dõi đối tượng và điều khiển theo thời gian thực.
Tìm hiểu thêm
Thị giác máy tính trong logistics

Thị giác máy tính trong logistics

Tinh gọn logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra kiện hàng, phân loại, theo dõi phương tiện và giám sát an toàn kho theo thời gian thực.
Tìm hiểu thêm
Thị giác máy tính trong bán lẻ

Thị giác máy tính trong bán lẻ

Định hình lại ngành bán lẻ với các model Ultralytics YOLO. Vision AI hỗ trợ tracking hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và cung cấp insight khách hàng thông minh hơn.
Tìm hiểu thêm
Computer vision trong healthcare

Computer vision trong healthcare

Xây dựng các giải pháp healthcare với các model Ultralytics YOLO. Vision AI trong healthcare thúc đẩy chẩn đoán hình ảnh nhanh hơn, chẩn đoán thông minh hơn và giám sát bệnh nhân.
Tìm hiểu thêm
Computer vision trong sản xuất

Computer vision trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Computer vision trong ngành ô tô

Computer vision trong ngành ô tô

Ứng dụng computer vision trong ngành ô tô với các model Ultralytics YOLO. Vision AI nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện để tạo nên những tuyến đường thông minh hơn.
Tìm hiểu thêm
Computer vision trong nông nghiệp

Computer vision trong nông nghiệp

Đưa vision AI vào nông nghiệp thông minh với các model Ultralytics YOLO. Thúc đẩy giám sát cây trồng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm

Hãy cùng xây dựng tương lai của AI!

Bắt đầu hành trình của bạn với tương lai của machine learning