YOLO Vision 2026:
Quay lại Bảng thuật ngữ Ultralytics

Deep Reinforcement Learning

Khám phá Deep Reinforcement Learning (DRL) và cách nó kết hợp việc ra quyết định của AI với học sâu. Tìm hiểu cách sử dụng Ultralytics YOLO26 làm lớp nhận thức ngay hôm nay.

Deep Reinforcement Learning (DRL) là một tập hợp con nâng cao của trí tuệ nhân tạo (AI) kết hợp khả năng ra quyết định của reinforcement learning với sức mạnh nhận thức của deep learning (DL). Mặc dù reinforcement learning truyền thống dựa vào các phương pháp dạng bảng để ánh xạ tình huống thành hành động, các phương pháp này gặp khó khăn khi môi trường phức tạp hoặc mang tính trực quan. DRL khắc phục điều này bằng cách sử dụng neural networks để diễn giải dữ liệu đầu vào có số chiều cao, chẳng hạn như khung hình video hoặc kết quả đọc từ cảm biến, cho phép máy móc học các chiến lược hiệu quả trực tiếp từ trải nghiệm thô mà không cần hướng dẫn rõ ràng từ con người.

Cơ chế cốt lõi của DRL#

Trong một hệ thống DRL, một AI agent tương tác với môi trường theo các bước thời gian rời rạc. Tại mỗi bước, agent quan sát "trạng thái" hiện tại, chọn một hành động dựa trên một policy, và nhận một tín hiệu phần thưởng cho biết sự thành công hoặc thất bại của hành động đó. Mục tiêu chính là tối đa hóa phần thưởng tích lũy theo thời gian.

Thành phần "deep" đề cập đến việc sử dụng deep neural networks để xấp xỉ policy (chiến lược hành động) hoặc giá trị hàm (phần thưởng ước tính trong tương lai). Điều này cho phép agent xử lý dữ liệu phi cấu trúc, tận dụng computer vision (CV) để "nhìn" môi trường giống như con người. Khả năng này được cung cấp bởi các framework như PyTorch hoặc TensorFlow, giúp hỗ trợ quá trình huấn luyện các mạng phức tạp này.

Các ứng dụng trong thực tế#

DRL đã vượt ra khỏi phạm vi nghiên cứu lý thuyết để tiến tới các ứng dụng thực tế, có tác động cao trong nhiều ngành công nghiệp:

  • Advanced Robotics: Trong lĩnh vực AI trong robotics, DRL cho phép máy móc làm chủ các kỹ năng vận động phức tạp vốn khó viết mã thủ công. Robot có thể học cách nắm bắt các vật thể bất thường hoặc di chuyển trên địa hình gồ ghề bằng cách cải thiện các chuyển động của chúng trong các công cụ vật lý như NVIDIA Isaac Sim. Điều này thường bao gồm việc huấn luyện trên synthetic data trước khi triển khai policy lên phần cứng vật lý.
  • Autonomous Driving: Autonomous vehicles tận dụng DRL để đưa ra quyết định thời gian thực trong các kịch bản giao thông khó đoán. Trong khi các mô hình object detection xác định người đi bộ và biển báo, các thuật toán DRL sử dụng thông tin đó để xác định các policy lái xe an toàn cho việc nhập làn, điều hướng ngã tư và kiểm soát tốc độ, quản lý hiệu quả inference latency cần thiết cho sự an toàn.

Thị giác như một bộ quan sát trạng thái#

Đối với nhiều ứng dụng DRL, "trạng thái" mang tính trực quan. Các mô hình tốc độ cao đóng vai trò là đôi mắt của agent, chuyển đổi hình ảnh thô thành dữ liệu có cấu trúc mà mạng policy có thể xử lý. Ví dụ sau minh họa cách mô hình YOLO26 đóng vai trò là lớp nhận thức cho một agent, trích xuất các quan sát (ví dụ: số lượng vật cản) từ môi trường.

from ultralytics import YOLO

# Load YOLO26n to serve as the perception layer for a DRL agent
model = YOLO("yolo26n.pt")

# Simulate an observation from the environment (e.g., a robot's camera feed)
observation_frame = "https://ultralytics.com/images/bus.jpg"

# Perform inference to extract the state (detected objects)
results = model(observation_frame)

# The detection count serves as a simplified state feature for the agent's policy
print(f"State Observation: {len(results[0].boxes)} objects detected.")

Phân biệt DRL với các khái niệm liên quan#

Việc phân biệt Học tăng cường sâu với các thuật ngữ tương tự rất hữu ích để hiểu vị thế độc đáo của nó trong hệ sinh thái AI:

  • Reinforcement Learning (RL): Standard RL là khái niệm nền tảng nhưng thường dựa vào bảng tra cứu (như Q-tables) vốn trở nên thiếu thực tế đối với các không gian trạng thái lớn. DRL giải quyết vấn đề này bằng cách sử dụng deep learning để xấp xỉ các hàm, cho phép nó xử lý các đầu vào phức tạp như hình ảnh.
  • Reinforcement Learning from Human Feedback (RLHF): Mặc dù DRL thường tối ưu hóa cho một hàm phần thưởng được xác định bằng toán học (ví dụ: điểm số trong trò chơi), RLHF tinh chỉnh các mô hình—cụ thể là Large Language Models (LLMs)—bằng cách sử dụng sở thích chủ quan của con người để căn chỉnh hành vi AI với các giá trị của con người, một kỹ thuật được phổ biến bởi các nhóm nghiên cứu như OpenAI.
  • Unsupervised Learning: Các phương pháp unsupervised tìm kiếm các mẫu ẩn trong dữ liệu mà không cần phản hồi rõ ràng. Ngược lại, DRL mang tính định hướng mục tiêu, được thúc đẩy bởi tín hiệu phần thưởng hướng dẫn tích cực agent hướng tới một mục tiêu cụ thể, như đã thảo luận trong các tài liệu nền tảng bởi Sutton and Barto.

Các nhà phát triển muốn quản lý các tập dữ liệu cần thiết cho các lớp nhận thức của hệ thống DRL có thể tận dụng Ultralytics Platform, giúp đơn giản hóa quy trình chú thích và huấn luyện trên đám mây. Ngoài ra, các nhà nghiên cứu thường sử dụng các môi trường tiêu chuẩn hóa như Gymnasium để đánh giá các thuật toán DRL của họ dựa trên các cơ sở chuẩn đã thiết lập.

Explore solutions

Real-time AI that works with your team

AI trong ngành Robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong Logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong chăm sóc sức khỏe

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

AI trong Ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

AI trong Nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong Logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong chăm sóc sức khỏe

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

AI trong Ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

AI trong Nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong Logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong chăm sóc sức khỏe

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

AI trong Ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

AI trong Nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm

Hãy cùng nhau xây dựng tương lai của AI!

Bắt đầu hành trình của bạn với tương lai của machine learning