Deep Reinforcement Learning
Khám phá Deep Reinforcement Learning (DRL) và cách phương pháp này kết hợp khả năng ra quyết định của AI với deep learning. Tìm hiểu cách sử dụng Ultralytics YOLO26 làm perception layer ngay hôm nay.
Học tăng cường sâu (DRL) là một nhánh nâng cao của trí tuệ nhân tạo (AI), kết hợp khả năng ra quyết định của học tăng cường với năng lực nhận thức của học sâu (DL). Trong khi học tăng cường truyền thống dựa vào các phương pháp dạng bảng để ánh xạ tình huống với hành động, những phương pháp này gặp khó khăn khi môi trường phức tạp hoặc mang tính trực quan. DRL khắc phục vấn đề này bằng cách sử dụng mạng neural để diễn giải dữ liệu đầu vào nhiều chiều, chẳng hạn như các khung hình video hoặc giá trị đọc từ cảm biến, cho phép máy móc trực tiếp học các chiến lược hiệu quả từ trải nghiệm thô mà không cần hướng dẫn cụ thể từ con người.
Cơ chế cốt lõi của DRL#
Trong một hệ thống DRL, một AI agent tương tác với môi trường theo các bước thời gian rời rạc. Ở mỗi bước, agent quan sát "trạng thái" hiện tại, chọn một hành động dựa trên policy và nhận tín hiệu phần thưởng cho biết hành động đó thành công hay thất bại. Mục tiêu chính là tối đa hóa phần thưởng tích lũy theo thời gian.
Thành phần "sâu" đề cập đến việc sử dụng các mạng neural sâu để xấp xỉ policy (chiến lược hành động) hoặc hàm giá trị (phần thưởng tương lai ước tính). Điều này cho phép agent xử lý dữ liệu không có cấu trúc, sử dụng thị giác máy tính (CV) để "nhìn" môi trường tương tự như con người. Khả năng này được hỗ trợ bởi các framework như PyTorch hoặc TensorFlow, giúp quá trình huấn luyện các mạng phức tạp này trở nên thuận tiện hơn.
Các ứng dụng trong thực tế#
DRL đã vượt ra ngoài phạm vi nghiên cứu lý thuyết để đi vào các ứng dụng thực tiễn có tác động lớn trong nhiều ngành:
- Robot nâng cao: Trong lĩnh vực AI trong robot, DRL cho phép máy móc thành thạo các kỹ năng vận động phức tạp khó mã hóa thủ công. Robot có thể học cách gắp các vật thể có hình dạng bất quy tắc hoặc di chuyển trên địa hình không bằng phẳng bằng cách tinh chỉnh chuyển động trong các bộ mô phỏng vật lý như NVIDIA Isaac Sim. Quá trình này thường bao gồm huấn luyện trên dữ liệu tổng hợp trước khi triển khai policy lên phần cứng vật lý.
- Lái xe tự hành: Xe tự hành tận dụng DRL để đưa ra quyết định theo thời gian thực trong các tình huống giao thông khó dự đoán. Trong khi các model phát hiện đối tượng xác định người đi bộ và biển báo, các thuật toán DRL sử dụng thông tin đó để xác định policy lái xe an toàn cho việc nhập làn, di chuyển qua giao lộ và kiểm soát tốc độ, đồng thời quản lý hiệu quả độ trễ suy luận cần thiết cho sự an toàn.
Thị giác với vai trò bộ quan sát trạng thái#
Trong nhiều ứng dụng DRL, "trạng thái" mang tính trực quan. Các model tốc độ cao đóng vai trò như đôi mắt của agent, chuyển đổi hình ảnh thô thành dữ liệu có cấu trúc để mạng policy có thể sử dụng. Ví dụ sau minh họa cách model YOLO26 đóng vai trò lớp nhận thức cho một agent, trích xuất các quan sát (ví dụ: số lượng chướng ngại vật) từ môi trường.
from ultralytics import YOLO
# Load YOLO26n to serve as the perception layer for a DRL agent
model = YOLO("yolo26n.pt")
# Simulate an observation from the environment (e.g., a robot's camera feed)
observation_frame = "https://ultralytics.com/images/bus.jpg"
# Perform inference to extract the state (detected objects)
results = model(observation_frame)
# The detection count serves as a simplified state feature for the agent's policy
print(f"State Observation: {len(results[0].boxes)} objects detected.")Phân biệt DRL với các khái niệm liên quan#
Để hiểu vị trí độc đáo của Học tăng cường sâu trong bối cảnh AI, việc phân biệt khái niệm này với các thuật ngữ tương tự là rất hữu ích:
- Học tăng cường (RL): RL tiêu chuẩn là khái niệm nền tảng, nhưng thường dựa vào các bảng tra cứu (chẳng hạn như bảng Q), vốn trở nên không thực tế khi không gian trạng thái lớn. DRL giải quyết vấn đề này bằng cách sử dụng học sâu để xấp xỉ các hàm, nhờ đó có thể xử lý những đầu vào phức tạp như hình ảnh.
- Học tăng cường từ phản hồi của con người (RLHF): Trong khi DRL thường tối ưu một hàm phần thưởng được xác định về mặt toán học (ví dụ: điểm số trong một trò chơi), RLHF tinh chỉnh các model—cụ thể là mô hình ngôn ngữ lớn (LLMs)—bằng các sở thích chủ quan của con người để điều chỉnh hành vi AI phù hợp với các giá trị của con người, một kỹ thuật được phổ biến bởi các nhóm nghiên cứu như OpenAI.
- Học không giám sát: Các phương pháp không giám sát tìm kiếm những mẫu ẩn trong dữ liệu mà không có phản hồi cụ thể. Ngược lại, DRL hướng đến mục tiêu, được thúc đẩy bởi tín hiệu phần thưởng chủ động dẫn dắt agent đến một mục tiêu cụ thể, như được thảo luận trong các tài liệu nền tảng của Sutton và Barto.
Các developer muốn quản lý những dataset cần thiết cho các lớp nhận thức của hệ thống DRL có thể sử dụng Ultralytics Platform, nền tảng giúp đơn giản hóa quy trình gán nhãn và huấn luyện trên cloud. Ngoài ra, các nhà nghiên cứu thường sử dụng những môi trường tiêu chuẩn hóa như Gymnasium để benchmark các thuật toán DRL của họ với những baseline đã được thiết lập.






