Giải thích về YOLO12: Các ứng dụng và trường hợp sử dụng trong thực tế
Khám phá YOLO12, model thị giác máy tính mới nhất! Tìm hiểu cách kiến trúc tập trung vào attention và công nghệ FlashAttention nâng cao các tác vụ phát hiện đối tượng trong nhiều ngành.

Thị giác máy tính là một nhánh của trí tuệ nhân tạo (AI), giúp máy móc hiểu hình ảnh và video. Đây là một lĩnh vực đang phát triển với tốc độ đáng kinh ngạc vì các nhà nghiên cứu và nhà phát triển AI không ngừng vượt qua các giới hạn. Cộng đồng AI luôn hướng tới việc làm cho các model nhanh hơn, thông minh hơn và hiệu quả hơn. Một trong những đột phá mới nhất là YOLO12, thành viên mới nhất của dòng model YOLO (You Only Look Once), được phát hành vào ngày 18 tháng 2 năm 2025.
YOLO12 được phát triển bởi các nhà nghiên cứu từ University at Buffalo, SUNY (Đại học Bang New York) và University of Chinese Academy of Sciences. Theo một phương pháp tiếp cận mới độc đáo, YOLO12 giới thiệu các cơ chế attention, cho phép model tập trung vào những phần thiết yếu nhất của hình ảnh thay vì xử lý mọi phần như nhau.
Model này cũng tích hợp FlashAttention, một kỹ thuật tăng tốc độ xử lý trong khi sử dụng ít bộ nhớ hơn, cùng cơ chế attention theo vùng được thiết kế để mô phỏng cách con người tự nhiên tập trung vào các đối tượng ở trung tâm.
Những cải tiến này giúp YOLO12n chính xác hơn 2,1% so với YOLOv10n và YOLO12m chính xác hơn 1,0% so với YOLO11m. Tuy nhiên, điều này đi kèm với sự đánh đổi - YOLO12n chậm hơn 9% so với YOLOv10n và YOLO12m chậm hơn 3% so với YOLO11m.

Hình 1. Ví dụ về việc YOLO12 được sử dụng để phát hiện đối tượng.
Trong bài viết này, chúng ta sẽ tìm hiểu điều gì khiến YOLO12 khác biệt, model này so sánh như thế nào với các phiên bản trước và có thể được áp dụng ở đâu.
Hành trình dẫn đến việc phát hành YOLO12#
Dòng model YOLO là tập hợp các model thị giác máy tính được thiết kế để phát hiện đối tượng theo thời gian thực, nghĩa là chúng có thể nhanh chóng xác định và định vị các đối tượng trong hình ảnh và video. Theo thời gian, mỗi phiên bản đều được cải thiện về tốc độ, độ chính xác và hiệu quả.
Chẳng hạn, Ultralytics YOLOv5, được phát hành vào năm 2020, trở nên phổ biến nhờ tốc độ nhanh và khả năng custom-train, triển khai dễ dàng. Sau đó, Ultralytics YOLOv8 tiếp tục cải thiện bằng cách hỗ trợ thêm các tác vụ thị giác máy tính như phân đoạn instance và theo dõi đối tượng.
Gần đây hơn, Ultralytics YOLO11 tập trung cải thiện khả năng xử lý theo thời gian thực trong khi duy trì sự cân bằng giữa tốc độ và độ chính xác. Ví dụ, YOLO11m có ít hơn 22% tham số so với YOLOv8m nhưng vẫn đạt hiệu suất phát hiện tốt hơn trên dataset COCO, một benchmark được sử dụng rộng rãi để đánh giá các model phát hiện đối tượng.
Dựa trên những tiến bộ này, YOLO12 tạo ra sự thay đổi trong cách xử lý thông tin hình ảnh. Thay vì xem mọi phần của hình ảnh như nhau, model ưu tiên những khu vực phù hợp nhất, qua đó cải thiện độ chính xác phát hiện. Nói một cách đơn giản, YOLO12 kế thừa các cải tiến trước đây đồng thời hướng tới độ chính xác cao hơn.
Các tính năng chính của YOLO12#
YOLO12 giới thiệu một số cải tiến giúp nâng cao các tác vụ thị giác máy tính trong khi vẫn duy trì tốc độ xử lý theo thời gian thực. Dưới đây là tổng quan về các tính năng chính của YOLO12:
- Kiến trúc tập trung vào attention: Thay vì xem mọi phần của hình ảnh như nhau, YOLO12 tập trung vào những khu vực quan trọng nhất. Điều này cải thiện độ chính xác và giảm việc xử lý không cần thiết, giúp hoạt động phát hiện sắc bén và hiệu quả hơn, ngay cả trong những hình ảnh có nhiều chi tiết lộn xộn.
- FlashAttention: YOLO12 tăng tốc phân tích hình ảnh trong khi sử dụng ít bộ nhớ hơn. Với FlashAttention (một thuật toán tiết kiệm bộ nhớ), model tối ưu việc xử lý dữ liệu, giảm tải cho phần cứng và giúp các tác vụ thời gian thực mượt mà, đáng tin cậy hơn.
- Mạng tổng hợp lớp hiệu quả dư (R-ELAN): YOLO12 tổ chức các lớp hiệu quả hơn bằng R-ELAN, giúp cải thiện cách model xử lý và học từ dữ liệu. Nhờ đó, quá trình training ổn định hơn, khả năng nhận dạng đối tượng sắc bén hơn và yêu cầu tính toán thấp hơn, cho phép model chạy hiệu quả trong nhiều môi trường khác nhau.
Để hiểu cách các tính năng này hoạt động trong thực tế, hãy hình dung một trung tâm mua sắm. YOLO12 có thể giúp theo dõi người mua sắm, nhận diện các vật trang trí trong cửa hàng như cây trồng trong chậu hoặc biển quảng cáo, đồng thời phát hiện những đồ vật bị đặt sai chỗ hoặc bị bỏ lại.
Kiến trúc tập trung vào attention giúp model chú ý đến những chi tiết quan trọng nhất, trong khi FlashAttention bảo đảm model xử lý mọi thứ nhanh chóng mà không làm hệ thống quá tải. Điều này giúp các đơn vị vận hành trung tâm mua sắm dễ dàng cải thiện an ninh, sắp xếp bố cục cửa hàng và nâng cao trải nghiệm mua sắm tổng thể.

Hình 2. Phát hiện đối tượng trong trung tâm mua sắm bằng YOLO12.
Tuy nhiên, YOLO12 cũng có một số hạn chế cần cân nhắc:
- Thời gian training lâu hơn: Do kiến trúc của mình, YOLO12 cần nhiều thời gian training hơn so với Ultralytics YOLO11.
- Thách thức khi export: Một số người dùng có thể gặp khó khăn khi export các model YOLO12, đặc biệt là khi tích hợp chúng vào những môi trường triển khai cụ thể.
Tìm hiểu benchmark hiệu suất của YOLO12#
YOLO12 có nhiều biến thể, mỗi biến thể được tối ưu cho các nhu cầu khác nhau. Các phiên bản nhỏ hơn (nano và small) ưu tiên tốc độ và hiệu quả, rất phù hợp với thiết bị di động và điện toán biên. Các phiên bản medium và large tạo sự cân bằng giữa tốc độ và độ chính xác, trong khi YOLO12x (extra large) được thiết kế cho các ứng dụng đòi hỏi độ chính xác cao, chẳng hạn như tự động hóa công nghiệp, chẩn đoán hình ảnh y khoa và các hệ thống giám sát tiên tiến.
Nhờ những biến thể này, YOLO12 mang lại các mức hiệu suất khác nhau tùy thuộc vào kích thước model. Các bài kiểm tra benchmark cho thấy một số biến thể YOLO12 vượt trội hơn YOLOv10 và Ultralytics YOLO11 về độ chính xác, đạt mean average precision (mAP) cao hơn.
Tuy nhiên, một số model như YOLO12m, YOLO12l và YOLO12x xử lý hình ảnh chậm hơn YOLO11, cho thấy sự đánh đổi giữa độ chính xác phát hiện và tốc độ. Mặc dù vậy, YOLO12 vẫn hiệu quả, cần ít tham số hơn nhiều model khác, dù vẫn sử dụng nhiều tham số hơn YOLO11. Điều này khiến YOLO12 trở thành lựa chọn phù hợp cho các ứng dụng coi trọng độ chính xác hơn tốc độ thuần túy.

Hình 3. So sánh Ultralytics YOLO11 và YOLO12.
Sử dụng YOLO12 thông qua package Python của Ultralytics#
YOLO12 được package Python của Ultralytics hỗ trợ và dễ sử dụng, phù hợp với cả người mới bắt đầu lẫn chuyên gia. Chỉ với vài dòng code, người dùng có thể tải các model đã pre-trained, chạy nhiều tác vụ thị giác máy tính trên hình ảnh và video, đồng thời training YOLO12 trên các dataset tùy chỉnh. Package Python của Ultralytics đơn giản hóa quy trình, loại bỏ nhu cầu thực hiện các bước thiết lập phức tạp.
Ví dụ, dưới đây là các bước bạn sẽ thực hiện để sử dụng YOLO12 cho việc phát hiện đối tượng:
- Cài đặt package Ultralytics: Trước tiên, hãy cài đặt package Python của Ultralytics, package này cung cấp các công cụ cần thiết để chạy YOLO12 hiệu quả. Điều này bảo đảm tất cả dependency được thiết lập chính xác.
- Tải model YOLO12 đã pre-trained: Chọn biến thể YOLO12 phù hợp (nano, small, medium, large hoặc extra large) dựa trên mức độ chính xác và tốc độ cần thiết cho tác vụ của bạn.
- Cung cấp hình ảnh hoặc video: Nhập file hình ảnh hoặc video mà bạn muốn phân tích. YOLO12 cũng có thể xử lý các luồng video trực tiếp để phát hiện theo thời gian thực.
- Chạy quy trình phát hiện: Model quét dữ liệu hình ảnh, xác định các đối tượng và đặt các bounding box xung quanh chúng. Model gắn nhãn cho từng đối tượng được phát hiện bằng class dự đoán và confidence score tương ứng.
- Điều chỉnh cài đặt phát hiện: Bạn cũng có thể thay đổi các tham số như ngưỡng confidence để tinh chỉnh độ chính xác và hiệu suất phát hiện.
- Lưu hoặc sử dụng output: Hình ảnh hoặc video đã xử lý, giờ đây chứa các đối tượng được phát hiện, có thể được lưu hoặc tích hợp vào một ứng dụng để tiếp tục phân tích, tự động hóa hoặc ra quyết định.
Những bước này giúp YOLO12 dễ sử dụng cho nhiều ứng dụng, từ giám sát và theo dõi bán lẻ đến chẩn đoán hình ảnh y khoa và phương tiện tự hành.
Các ứng dụng YOLO12 trong thực tế#
YOLO12 có thể được sử dụng trong nhiều ứng dụng thực tế nhờ hỗ trợ phát hiện đối tượng, phân đoạn instance, phân loại hình ảnh, ước tính pose và phát hiện đối tượng định hướng (OBB).

Hình 4. YOLO12 hỗ trợ các tác vụ như phát hiện đối tượng và phân đoạn instance.
Tuy nhiên, như đã thảo luận trước đó, các model YOLO12 ưu tiên độ chính xác hơn tốc độ, nghĩa là chúng mất nhiều thời gian hơn một chút để xử lý hình ảnh so với các phiên bản trước. Sự đánh đổi này khiến YOLO12 phù hợp với các ứng dụng mà độ chính xác quan trọng hơn tốc độ thời gian thực, chẳng hạn như:
- Chẩn đoán hình ảnh y khoa: YOLO12 có thể được custom-train để phát hiện khối u hoặc các bất thường trong ảnh X-quang và MRI với độ chính xác cao, trở thành một công cụ hữu ích cho bác sĩ và chuyên gia chẩn đoán hình ảnh cần phân tích hình ảnh chính xác để chẩn đoán.
- Kiểm soát chất lượng trong sản xuất: Model có thể giúp xác định các lỗi sản phẩm trong quá trình sản xuất, bảo đảm chỉ những sản phẩm chất lượng cao được đưa ra thị trường, đồng thời giảm lãng phí và nâng cao hiệu quả.
- Phân tích pháp y: Các cơ quan thực thi pháp luật có thể fine-tune YOLO12 để phân tích video giám sát và thu thập bằng chứng. Trong các cuộc điều tra hình sự, độ chính xác đóng vai trò thiết yếu để xác định những chi tiết quan trọng.
- Nông nghiệp chính xác: Nông dân có thể sử dụng YOLO12 để phân tích tình trạng cây trồng, phát hiện bệnh hoặc sự xâm nhiễm của sâu bệnh và theo dõi điều kiện đất. Các đánh giá chính xác giúp tối ưu hóa chiến lược canh tác, từ đó nâng cao năng suất và quản lý tài nguyên tốt hơn.
Bắt đầu với YOLO12#
Trước khi chạy YOLO12, điều quan trọng là bảo đảm hệ thống của bạn đáp ứng các yêu cầu cần thiết.
Về mặt kỹ thuật, YOLO12 có thể chạy trên bất kỳ GPU (bộ xử lý đồ họa) chuyên dụng nào. Theo mặc định, model không yêu cầu FlashAttention, vì vậy có thể hoạt động trên hầu hết các hệ thống GPU mà không cần đến tính năng này. Tuy nhiên, việc bật FlashAttention có thể đặc biệt hữu ích khi làm việc với các dataset lớn hoặc hình ảnh độ phân giải cao, vì tính năng này giúp ngăn chặn tình trạng chậm, giảm mức sử dụng bộ nhớ và cải thiện hiệu quả xử lý.
Để sử dụng FlashAttention, bạn sẽ cần GPU NVIDIA thuộc một trong các dòng sau: Turing (T4, Quadro RTX), Ampere (dòng RTX 30, A30, A40, A100), Ada Lovelace (dòng RTX 40) hoặc Hopper (H100, H200).
Với mục tiêu bảo đảm tính dễ sử dụng và khả năng tiếp cận, package Python của Ultralytics hiện chưa hỗ trợ inference bằng FlashAttention, vì quá trình cài đặt tính năng này khá phức tạp về mặt kỹ thuật. Để tìm hiểu thêm về cách bắt đầu với YOLO12 và tối ưu hiệu suất, hãy xem tài liệu Ultralytics chính thức.
Những điểm chính#
Khi thị giác máy tính phát triển, các model ngày càng chính xác và hiệu quả hơn. YOLO12 cải thiện các tác vụ thị giác máy tính như phát hiện đối tượng, phân đoạn instance và phân loại hình ảnh bằng cơ chế xử lý tập trung vào attention cùng FlashAttention, nâng cao độ chính xác trong khi tối ưu việc sử dụng bộ nhớ.
Đồng thời, thị giác máy tính cũng dễ tiếp cận hơn bao giờ hết. YOLO12 dễ sử dụng thông qua package Python của Ultralytics và, với trọng tâm là độ chính xác thay vì tốc độ, đặc biệt phù hợp với chẩn đoán hình ảnh y khoa, kiểm tra công nghiệp và robotics - những ứng dụng mà độ chính xác đóng vai trò then chốt.
Bạn tò mò về AI? Hãy truy cập repository GitHub của chúng tôi và tham gia cùng cộng đồng của chúng tôi. Khám phá các đổi mới trong những lĩnh vực như AI trong xe tự lái và thị giác máy tính trong nông nghiệp trên các trang giải pháp của chúng tôi. Xem các tùy chọn cấp phép của chúng tôi và biến các dự án vision AI của bạn thành hiện thực. 🚀









