YOLO Vision 2026:
Quay lại bảng thuật ngữ Ultralytics

Reinforcement Learning

Khám phá các khái niệm cốt lõi của Reinforcement Learning (RL). Tìm hiểu cách agent sử dụng feedback để làm chủ các tác vụ và cách Ultralytics YOLO26 hỗ trợ hệ thống vision dùng RL.

Học tăng cường (RL) là một phân nhánh định hướng mục tiêu của học máy (ML), trong đó một hệ thống tự động, được gọi là agent, học cách đưa ra quyết định bằng cách thực hiện hành động và nhận phản hồi từ môi trường. Không giống học có giám sát, vốn dựa trên các tập dữ liệu tĩnh được gắn nhãn với đáp án chính xác, các thuật toán RL học thông qua một quy trình thử và sai động. Agent tương tác với một mô phỏng hoặc thế giới thực, quan sát hệ quả của các hành động để xác định chiến lược nào mang lại phần thưởng dài hạn cao nhất. Phương pháp này mô phỏng khá sát khái niệm tâm lý về điều kiện hóa thao tác, trong đó hành vi được định hình theo thời gian bằng củng cố tích cực (phần thưởng) và củng cố tiêu cực (hình phạt).

Các khái niệm cốt lõi trong vòng lặp RL#

Để hiểu cách RL hoạt động, việc hình dung nó như một chu kỳ tương tác liên tục sẽ rất hữu ích. Framework này thường được hình thức hóa về mặt toán học dưới dạng Quá trình quyết định Markov (MDP), dùng để cấu trúc việc ra quyết định trong những tình huống mà kết quả vừa mang tính ngẫu nhiên một phần, vừa do người ra quyết định kiểm soát một phần.

Các thành phần chính của vòng lặp học này bao gồm:

  • Agent AI: Thực thể chịu trách nhiệm học và đưa ra quyết định. Agent nhận thức môi trường và thực hiện các hành động để tối đa hóa thành công tích lũy.
  • Môi trường: Thế giới bên ngoài nơi agent hoạt động. Đây có thể là một trò chơi điện tử phức tạp, một mô phỏng thị trường tài chính hoặc một nhà kho vật lý trong AI trong logistics.
  • Trạng thái: Ảnh chụp nhanh hoặc biểu diễn của tình huống hiện tại. Trong các ứng dụng thị giác, điều này thường bao gồm việc xử lý luồng hình ảnh từ camera bằng thị giác máy tính (CV) để phát hiện đối tượng và chướng ngại vật.
  • Hành động: Động thái hoặc lựa chọn cụ thể mà agent thực hiện. Tập hợp đầy đủ của mọi động thái có thể xảy ra được gọi là không gian hành động.
  • Phần thưởng: Tín hiệu số được gửi từ môi trường đến agent sau một hành động. Một hàm phần thưởng được thiết kế tốt sẽ gán các giá trị dương cho những hành động có lợi và áp dụng mức phạt cho những hành động gây bất lợi.
  • Policy: Chiến lược hoặc tập quy tắc mà agent sử dụng để xác định hành động tiếp theo dựa trên trạng thái hiện tại. Các thuật toán như Q-learning xác định cách policy này được cập nhật và tối ưu hóa.

Các ứng dụng trong thực tế#

Học tăng cường đã vượt ra ngoài phạm vi nghiên cứu lý thuyết để được triển khai thực tế với tác động lớn trong nhiều ngành khác nhau.

  • Robot nâng cao: Trong lĩnh vực AI trong robot, RL cho phép máy móc thành thạo các kỹ năng vận động phức tạp vốn khó mã hóa cứng. Robot có thể học cách nắm các vật thể có hình dạng bất thường hoặc di chuyển trên địa hình không bằng phẳng bằng cách huấn luyện trong các physics engine như NVIDIA Isaac Sim trước khi triển khai vào thế giới thực.
  • Hệ thống tự động: Xe tự hành sử dụng RL để đưa ra quyết định theo thời gian thực trong các tình huống giao thông khó dự đoán. Trong khi các model phát hiện đối tượng xác định người đi bộ và biển báo, các thuật toán RL giúp xác định policy lái xe an toàn cho việc nhập làn và di chuyển qua giao lộ.
  • Tối ưu hóa chiến lược: RL thu hút sự chú ý trên toàn cầu khi các hệ thống như AlphaGo của Google DeepMind đánh bại các nhà vô địch thế giới trong những trò chơi bàn cờ phức tạp. Ngoài lĩnh vực trò chơi, các agent này còn tối ưu hóa logistics công nghiệp, chẳng hạn như điều khiển hệ thống làm mát trong các trung tâm dữ liệu để giảm mức tiêu thụ năng lượng.

Tích hợp thị giác với RL#

Trong nhiều ứng dụng hiện đại, "trạng thái" mà agent quan sát được mang tính trực quan. Các model hiệu năng cao như YOLO26 đóng vai trò là lớp nhận thức cho các agent RL, chuyển đổi hình ảnh thô thành dữ liệu có cấu trúc. Thông tin đã được xử lý này—chẳng hạn như vị trí và lớp của các đối tượng—trở thành trạng thái mà policy RL sử dụng để chọn một hành động.

Ví dụ sau đây minh họa cách sử dụng package ultralytics để xử lý một frame của môi trường, tạo ra biểu diễn trạng thái (ví dụ: số lượng đối tượng) cho một vòng lặp RL mang tính lý thuyết.

from ultralytics import YOLO

# Load the YOLO26 model to serve as the agent's vision system
model = YOLO("yolo26n.pt")

# Simulate the agent observing the environment (an image frame)
observation_frame = "https://ultralytics.com/images/bus.jpg"

# Process the frame to extract the current 'state'
results = model(observation_frame)

# The agent uses detection data to inform its next action
# For example, an autonomous delivery robot might stop if it sees people
num_objects = len(results[0].boxes)
print(f"Agent Observation: {num_objects} objects detected. Calculating next move...")

Phân biệt các thuật ngữ liên quan#

Điều quan trọng là phải phân biệt Học tăng cường với các paradigm học máy khác:

  • so với Học có giám sát: Học có giám sát yêu cầu một người giám sát bên ngoài có kiến thức cung cấp dữ liệu huấn luyện được gắn nhãn (ví dụ: "hình ảnh này có một con mèo"). Ngược lại, RL học từ hệ quả của chính các hành động mà nó thực hiện mà không cần nhãn rõ ràng, khám phá các lộ trình tối ưu thông qua quá trình thăm dò.
  • so với Học không giám sát: Học không giám sát tập trung vào việc tìm kiếm các cấu trúc hoặc pattern ẩn trong dữ liệu chưa gắn nhãn (chẳng hạn như phân cụm khách hàng). RL khác biệt vì được định hướng mục tiêu một cách rõ ràng, tập trung vào tối đa hóa tín hiệu phần thưởng thay vì chỉ mô tả cấu trúc dữ liệu.

Khi năng lực tính toán tăng lên, các kỹ thuật như Học tăng cường từ phản hồi của con người (RLHF) tiếp tục tinh chỉnh cách agent học, giúp các mục tiêu của chúng phù hợp hơn với những giá trị phức tạp của con người và các tiêu chuẩn an toàn. Các nhà nghiên cứu thường sử dụng những môi trường được chuẩn hóa như Gymnasium để benchmark và cải thiện các thuật toán này. Đối với các team cần quản lý những tập dữ liệu phục vụ các lớp nhận thức của các agent này, Ultralytics Platform cung cấp các công cụ toàn diện cho việc annotation và quản lý model.

Explore solutions

Real-time AI that works with your team

Thị giác máy tính trong robotics

Nâng cao năng lực cho máy móc thông minh hơn với các model Ultralytics YOLO. Vision AI trong robotics hỗ trợ điều hướng tự động, nhận thức, theo dõi đối tượng và điều khiển theo thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

Thị giác máy tính trong logistics

Tinh gọn logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra kiện hàng, phân loại, theo dõi phương tiện và giám sát an toàn kho theo thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

Thị giác máy tính trong bán lẻ

Định hình lại ngành bán lẻ với các model Ultralytics YOLO. Vision AI hỗ trợ tracking hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và cung cấp insight khách hàng thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong healthcare

Xây dựng các giải pháp healthcare với các model Ultralytics YOLO. Vision AI trong healthcare thúc đẩy chẩn đoán hình ảnh nhanh hơn, chẩn đoán thông minh hơn và giám sát bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

Computer vision trong ngành ô tô

Ứng dụng computer vision trong ngành ô tô với các model Ultralytics YOLO. Vision AI nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện để tạo nên những tuyến đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

Computer vision trong nông nghiệp

Đưa vision AI vào nông nghiệp thông minh với các model Ultralytics YOLO. Thúc đẩy giám sát cây trồng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

Thị giác máy tính trong robotics

Nâng cao năng lực cho máy móc thông minh hơn với các model Ultralytics YOLO. Vision AI trong robotics hỗ trợ điều hướng tự động, nhận thức, theo dõi đối tượng và điều khiển theo thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

Thị giác máy tính trong logistics

Tinh gọn logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra kiện hàng, phân loại, theo dõi phương tiện và giám sát an toàn kho theo thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

Thị giác máy tính trong bán lẻ

Định hình lại ngành bán lẻ với các model Ultralytics YOLO. Vision AI hỗ trợ tracking hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và cung cấp insight khách hàng thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong healthcare

Xây dựng các giải pháp healthcare với các model Ultralytics YOLO. Vision AI trong healthcare thúc đẩy chẩn đoán hình ảnh nhanh hơn, chẩn đoán thông minh hơn và giám sát bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

Computer vision trong ngành ô tô

Ứng dụng computer vision trong ngành ô tô với các model Ultralytics YOLO. Vision AI nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện để tạo nên những tuyến đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

Computer vision trong nông nghiệp

Đưa vision AI vào nông nghiệp thông minh với các model Ultralytics YOLO. Thúc đẩy giám sát cây trồng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

Thị giác máy tính trong robotics

Nâng cao năng lực cho máy móc thông minh hơn với các model Ultralytics YOLO. Vision AI trong robotics hỗ trợ điều hướng tự động, nhận thức, theo dõi đối tượng và điều khiển theo thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

Thị giác máy tính trong logistics

Tinh gọn logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra kiện hàng, phân loại, theo dõi phương tiện và giám sát an toàn kho theo thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

Thị giác máy tính trong bán lẻ

Định hình lại ngành bán lẻ với các model Ultralytics YOLO. Vision AI hỗ trợ tracking hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và cung cấp insight khách hàng thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong healthcare

Xây dựng các giải pháp healthcare với các model Ultralytics YOLO. Vision AI trong healthcare thúc đẩy chẩn đoán hình ảnh nhanh hơn, chẩn đoán thông minh hơn và giám sát bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

Computer vision trong ngành ô tô

Ứng dụng computer vision trong ngành ô tô với các model Ultralytics YOLO. Vision AI nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện để tạo nên những tuyến đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

Computer vision trong nông nghiệp

Đưa vision AI vào nông nghiệp thông minh với các model Ultralytics YOLO. Thúc đẩy giám sát cây trồng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm

Hãy cùng xây dựng tương lai của AI!

Bắt đầu hành trình của bạn với tương lai của machine learning