YOLO Vision 2026:
Hướng dẫn

Tận dụng học tăng cường trong các dự án thị giác máy tính

Khám phá cách học tăng cường (reinforcement learning) trong các ứng dụng thị giác máy tính đang giúp các hệ thống nhìn, đưa ra quyết định và cải thiện trong các ứng dụng thực tế trên nhiều ngành công nghiệp.

ABAbirami Vina5 min read
Học tăng cường áp dụng cho các dự án thị giác máy tính

Một cách đơn giản để giải thích về trí tuệ nhân tạo (AI) là coi đây là lĩnh vực tập trung vào việc mô phỏng cách con người suy nghĩ và học tập. Đây chính là nguồn gốc của các kỹ thuật học trong AI, bao gồm các phương pháp cho phép máy móc cải thiện hiệu suất theo thời gian, tương tự như con người.

Trước đây, chúng tôi đã khám phá các kỹ thuật học AI chính, bao gồm học có giám sát, học không giám sát, học tăng cường và học chuyển giao, cũng như cách mỗi kỹ thuật đóng vai trò quan trọng trong việc giúp các model AI xử lý thông tin và đưa ra quyết định.

Hôm nay, chúng ta sẽ tìm hiểu kỹ hơn về học tăng cường, một kỹ thuật dạy hệ thống AI học hỏi thông qua trải nghiệm bằng cách tương tác với môi trường và cải thiện dựa trên phản hồi. Cụ thể, chúng tôi sẽ khám phá cách áp dụng học tăng cường vào các ứng dụng computer vision - những hệ thống cho phép máy móc diễn giải và hiểu thông tin thị giác từ thế giới.

Việc kết hợp các khái niệm như học tăng cường và thị giác máy tính đang mở ra những khả năng mới đầy thú vị và là một lĩnh vực nghiên cứu tích cực. Nó cho phép các hệ thống AI nhận diện những gì chúng nhìn thấy và đưa ra quyết định sáng suốt dựa trên thông tin hình ảnh đó.

Học tăng cường là gì?#

Học tăng cường là một nhánh của machine learning, trong đó một AI agent học hỏi bằng cách thực hiện các hành động và nhận phản hồi dưới dạng phần thưởng hoặc hình phạt. Mục tiêu là tìm ra hành động nào mang lại kết quả tốt nhất theo thời gian.

Bạn có thể coi học tăng cường giống như việc huấn luyện một chú chó. Khi chó ngồi theo lệnh, bạn thưởng cho nó một miếng bánh. Sau một thời gian, chú chó học được rằng việc ngồi sẽ mang lại phần thưởng. Trong học tăng cường, tác nhân hoặc mô hình AI đóng vai trò như chú chó; môi trường là thế giới xung quanh nó, và phần thưởng giúp nó hiểu liệu mình đã thực hiện đúng hành động hay chưa.

Điều này khác với học có giám sát, nơi mô hình AI được cung cấp nhiều ví dụ về câu trả lời đúng. Ví dụ, mô hình có thể được xem một bức ảnh con chó và được bảo rằng, "Đây là một con chó."

Mặt khác, học tăng cường không dựa vào dữ liệu có nhãn. Thay vào đó, nó bao gồm việc học thông qua thử nghiệm các hành động khác nhau và rút kinh nghiệm từ kết quả, giống như chơi một trò chơi và tìm ra những nước đi nào giúp bạn chiến thắng.

Reinforcement learning vs. supervised learning

Hình 1. So sánh học tăng cường và học có giám sát.

Học tăng cường đóng vai trò quan trọng đối với các tác vụ mà quyết định được đưa ra từng bước, và mỗi lựa chọn sẽ thay đổi những gì xảy ra tiếp theo. Loại hình học tập này được sử dụng trong các video game chiến thuật để làm cho lối chơi trở nên thử thách và hấp dẫn hơn đối với người chơi.

Học tăng cường hoạt động như thế nào trong các giải pháp AI#

Hãy xem xét cách bạn học đi xe đạp. Lúc đầu, bạn có thể bị ngã. Nhưng với việc luyện tập, bạn bắt đầu tìm ra cách giữ thăng bằng. Bạn càng đi nhiều, bạn càng trở nên giỏi hơn. Bạn học bằng cách thực hiện, chứ không chỉ bằng cách được bảo phải làm gì.

Học tăng cường hoạt động theo cách tương tự đối với AI. Nó học thông qua trải nghiệm - bằng cách thử các hành động khác nhau, quan sát những gì xảy ra và dần dần cải thiện khả năng đưa ra lựa chọn đúng đắn theo thời gian.

Understanding how reinforcement learning works

Hình 2. Hiểu về cách thức hoạt động của học tăng cường.

Dưới đây là một số thành phần chính của học tăng cường:

  • Tác nhân (Agent): Tác nhân là người học hoặc người ra quyết định. Nó tương tác với môi trường bằng cách thực hiện các hành động và hướng tới việc đạt được một mục tiêu cụ thể.
  • Môi trường (Environment): Môi trường bao gồm tất cả những gì tác nhân tương tác. Nó thay đổi để phản hồi lại các hành động của tác nhân và cung cấp phản hồi dựa trên kết quả đạt được.
  • Trạng thái (State): Trạng thái đại diện cho một ảnh chụp nhanh về tình hình hiện tại trong môi trường. Tác nhân quan sát trạng thái để hiểu môi trường xung quanh và xác định hành động tiếp theo cần thực hiện.
  • Hành động (Action): Hành động là một động thái hoặc quyết định do tác nhân thực hiện, có tác động đến môi trường. Mỗi hành động dẫn đến một trạng thái mới và có thể ảnh hưởng đến các phần thưởng trong tương lai.
  • Phần thưởng (Reward): Phần thưởng đơn giản là phản hồi từ môi trường cho biết tác nhân liệu hành động đó có mang lại lợi ích hay không. Phần thưởng tích cực khuyến khích tác nhân lặp lại các hành động tốt, trong khi phần thưởng tiêu cực ngăn cản các hành động không hiệu quả.
  • Chính sách (Policy): Chính sách là chiến lược của tác nhân để chọn hành động dựa trên trạng thái hiện tại. Theo thời gian, tác nhân tinh chỉnh chính sách của mình để tối đa hóa tổng số phần thưởng có thể nhận được.

Bằng cách sử dụng các thành phần này cùng nhau, học tăng cường giúp hệ thống AI có thể học hỏi các hành vi hiệu quả thông qua quá trình thử và sai liên tục. Qua mỗi lần thử, agent trở nên giỏi hơn trong việc lựa chọn các hành động dẫn đến phần thưởng cao hơn và kết quả tốt hơn.

Học tăng cường trong các đổi mới thị giác máy tính#

Computer vision được sử dụng cho các tác vụ như phát hiện đối tượng trong hình ảnh, phân loại nội dung trong ảnh và phân đoạn hình ảnh thành các phần khác nhau. Các model computer vision như Ultralytics YOLO11 hỗ trợ các tác vụ này và có thể được sử dụng để xây dựng các ứng dụng có tác động lớn nhằm thu thập thông tin chi tiết về thị giác.

Tuy nhiên, khi các tác vụ Vision AI này kết hợp với học tăng cường, kết quả là một giải pháp AI không chỉ nhìn thấy mà còn học cách hành động dựa trên các thông tin thị giác và trở nên tốt hơn theo thời gian.

Một ví dụ thú vị về học tăng cường trong các ứng dụng computer vision là việc sử dụng robot trong các kho hàng. Robot được trang bị camera và hệ thống computer vision có thể phân tích môi trường xung quanh, phát hiện vị trí của từng mặt hàng, nhận dạng hình dạng và kích thước của mặt hàng đó, cũng như hiểu cách nó được đặt trên kệ.

Mỗi lần robot cố gắng lấy một mặt hàng, nó sẽ nhận được phản hồi - thành công nếu mặt hàng được lấy chính xác hoặc thất bại nếu nó bị rơi. Theo thời gian, robot học được hành động nào hiệu quả nhất cho từng loại mặt hàng. Thay vì tuân theo một tập hợp hướng dẫn cố định, nó liên tục cải thiện thông qua trải nghiệm.

A robotic arm using vision AI and reinforcement learning to pick up objects

Hình 3. Cánh tay robot sử dụng Vision AI và học tăng cường để gắp các đối tượng.

Các ứng dụng của học tăng cường trong thị giác máy tính#

Bây giờ chúng ta đã hiểu rõ hơn về học tăng cường là gì và vai trò của nó trong thị giác máy tính, hãy cùng xem xét kỹ hơn một số ví dụ về nơi học tăng cường và thị giác máy tính được sử dụng kết hợp với nhau.

Tích hợp Vision AI và học tăng cường cho các phương tiện thông minh hơn#

Xe tự hành có thể dựa vào cả Vision AI để hiểu môi trường xung quanh và học tăng cường để đưa ra quyết định dựa trên những gì chúng nhìn thấy. Một ví dụ điển hình cho điều này trong thực tế là AWS DeepRacer.

AWS DeepRacer là một chiếc xe đua tỷ lệ 1/18 hoàn toàn tự động, học cách lái bằng cách sử dụng camera và học tăng cường. Thay vì được hướng dẫn phải làm gì, nó tự mình tìm ra mọi thứ bằng cách thử nghiệm, mắc lỗi và rút kinh nghiệm từ đó.

Camera của chiếc xe nhỏ bé này hoạt động như một cặp mắt, ghi lại đường đua phía trước. Dựa trên những gì nhìn thấy, chiếc xe học cách lái và tốc độ cần đi. Sau mỗi vòng đua, nó lại giỏi hơn. Ví dụ, nó có thể học cách cua rộng hơn hoặc giảm tốc độ trước những khúc cua gấp bằng cách học từ những lần thử trước đó.

Quá trình đào tạo cho DeepRacer bắt đầu trong một môi trường ảo, nơi mô hình thực hành và tinh chỉnh các kỹ năng lái xe của mình. Khi đạt đến một mức hiệu suất nhất định, các kỹ năng đó sẽ được chuyển sang các đường đua thực tế với những chiếc xe vật lý.

The AWS DeepRacer using vision and reinforcement learning to drive autonomously

Hình 4. AWS DeepRacer sử dụng thị giác và học tăng cường để lái xe tự động. Nguồn hình ảnh: Amazon.

Hướng tới các robot phẫu thuật tự hành#

Một lĩnh vực nghiên cứu thú vị đang thu hút sự chú ý là việc tích hợp Vision AI và học tăng cường trong phẫu thuật bằng robot. Hiện tại, ứng dụng này phần lớn vẫn mang tính lý thuyết. Các nhà nghiên cứu đang chạy mô phỏng trong môi trường ảo.

Tuy nhiên, các thí nghiệm ban đầu đang cho thấy kết quả đầy hứa hẹn, gợi ý rằng các robot phẫu thuật cuối cùng có thể thực hiện các quy trình phức tạp, tinh vi với độ chính xác cao hơn, khả năng thích ứng linh hoạt và ít cần sự can thiệp của con người hơn.

Surgical robots becoming more and more advanced

Hình 5. Robot phẫu thuật ngày càng trở nên tiên tiến hơn.

Ví dụ, hãy tưởng tượng tình huống cần cẩn thận nhấc một miếng gạc ra khỏi vị trí phẫu thuật. Một robot được trang bị Vision AI sẽ phân tích cảnh trước, sử dụng phân đoạn để xác định miếng gạc và các mô xung quanh.

Học tăng cường sau đó sẽ giúp robot phẫu thuật quyết định cách tiếp cận tác vụ, xác định góc tốt nhất để cầm miếng gạc, lực ép bao nhiêu là phù hợp, và cách nhấc nó lên mà không làm ảnh hưởng đến các khu vực nhạy cảm lân cận. Theo thời gian và qua quá trình luyện tập lặp đi lặp lại trong môi trường mô phỏng, robot có thể học cách thực hiện các chuyển động tinh tế, quan trọng này với kỹ năng và độ tin cậy ngày càng cao.

Ưu điểm và nhược điểm của học tăng cường trong Vision AI#

Học tăng cường cho phép các hệ thống Vision AI vượt ra ngoài việc nhận diện đơn giản và bắt đầu đưa ra quyết định dựa trên những gì chúng thấy. Điều này mở ra những khả năng mới trong các lĩnh vực như robot, tự động hóa và tương tác thời gian thực.

Dưới đây là một số ưu điểm chính của việc tích hợp học tăng cường vào quy trình làm việc của Vision AI:

  • Ít phụ thuộc hơn vào dữ liệu gán nhãn: Các hệ thống này có thể học hỏi từ sự tương tác, vì vậy chúng không cần các dataset gán nhãn khổng lồ để bắt đầu.
  • Xử lý sự không chắc chắn tốt hơn: Học tăng cường có thể xử lý thông tin thị giác không đầy đủ hoặc bị nhiễu bằng cách điều chỉnh hành động dựa trên phản hồi thay vì chỉ dựa vào dữ liệu hoàn hảo.
  • Hỗ trợ học tập dài hạn: Nó giúp các mô hình cải thiện theo thời gian bằng cách học từ các chuỗi hành động, thay vì chỉ dựa vào các quyết định đơn lẻ.

Mặt khác, dưới đây là một số hạn chế của học tăng cường cần xem xét:

  • Vấn đề phân bổ tín dụng: Tác nhân có thể khó xác định hành động cụ thể nào đóng góp vào kết quả cuối cùng, đặc biệt là trong các chuỗi quyết định dài.
  • Rủi ro khám phá không an toàn: Trong quá trình đào tạo, tác nhân có thể thử các hành động không an toàn hoặc không mong muốn, điều này không thể chấp nhận được trong các ứng dụng thực tế như chăm sóc sức khỏe hoặc lái xe tự hành.
  • Hội tụ chậm: Model có thể mất nhiều thời gian để thực sự đạt được hiệu suất tốt, đặc biệt đối với các tác vụ phức tạp.

Các điểm chính cần lưu ý#

Học tăng cường trong các dự án thị giác máy tính cho phép các hệ thống AI hiểu môi trường xung quanh và học cách hành động thông qua trải nghiệm. Với các mô hình như Ultralytics YOLO11 cung cấp khả năng phát hiện đối tượng thời gian thực, hệ thống có thể đưa ra các quyết định sáng suốt dựa trên những gì nó thấy.

Phương pháp này vượt xa các cách tiếp cận truyền thống bằng cách cho phép AI cải thiện thông qua thử nghiệm và phản hồi thay vì chỉ dựa vào dữ liệu có nhãn. Nó hỗ trợ học tập liên tục và giúp xây dựng các hệ thống Vision AI linh hoạt, thích ứng và thông minh hơn, ngày càng trở nên tốt hơn theo thời gian.

Tham gia cộng đồng đang phát triển của chúng tôi. Truy cập kho lưu trữ GitHub của chúng tôi để tìm hiểu sâu hơn về AI. Bạn muốn bắt đầu các dự án computer vision của riêng mình? Khám phá các tùy chọn cấp phép của chúng tôi. Tìm hiểu thêm về AI trong sản xuấtVision AI trong ngành công nghiệp ô tô trên các trang giải pháp của chúng tôi.

Explore solutions

Real-time AI that works with your team

AI trong ngành Robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong Logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong chăm sóc sức khỏe

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

AI trong Ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

AI trong Nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong Logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong chăm sóc sức khỏe

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

AI trong Ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

AI trong Nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong Logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong chăm sóc sức khỏe

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

AI trong Ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

AI trong Nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm

Hãy cùng nhau xây dựng tương lai của AI!

Bắt đầu hành trình của bạn với tương lai của machine learning