Receiver Operating Characteristic (ROC) Curve
Tìm hiểu cách sử dụng đường cong Receiver Operating Characteristic (ROC) để đánh giá binary classifier. Khám phá sự đánh đổi giữa TPR và FPR với Ultralytics YOLO26.
Đường cong đặc tính hoạt động của bộ thu (ROC) là một công cụ đồ họa nền tảng được sử dụng để đánh giá hiệu suất của các model phân loại nhị phân. Trong lĩnh vực học máy (ML), đường cong này trực quan hóa sự đánh đổi giữa độ nhạy và độ đặc hiệu của một model trên tất cả các ngưỡng quyết định có thể. Không giống các metric đơn giá trị như độ chính xác, vốn có thể gây hiểu lầm nếu dataset bị mất cân bằng, đường cong ROC cung cấp cái nhìn toàn diện về cách một bộ phân loại hoạt động khi tiêu chí xác định các mẫu dương tính trở nên nghiêm ngặt hơn hoặc ít nghiêm ngặt hơn. Hình trực quan hóa này rất cần thiết cho các kỹ sư sử dụng các kỹ thuật học có giám sát để xác định điểm vận hành tối ưu cho trường hợp sử dụng cụ thể của họ.
Diễn giải các trục và sự đánh đổi#
Để hiểu đường cong ROC, cần xem xét hai tham số được biểu diễn đối chiếu với nhau: Tỷ lệ dương tính thật (TPR) và Tỷ lệ dương tính giả (FPR).
- Tỷ lệ dương tính thật (TPR): Thường được gọi là Độ thu hồi hoặc độ nhạy, metric này trên trục y đo tỷ lệ các quan sát dương tính thực tế được model xác định chính xác. TPR cao nghĩa là hệ thống hiếm khi bỏ sót mục tiêu.
- Tỷ lệ dương tính giả (FPR): Được biểu diễn trên trục x, đại lượng này thể hiện tỷ lệ các mẫu âm tính bị phân loại sai thành dương tính, còn được gọi là "báo động giả."
Đường cong thể hiện một mối quan hệ động: khi bạn hạ ngưỡng độ tin cậy để thu được nhiều trường hợp dương tính hơn (tăng TPR), bạn tất yếu làm tăng rủi ro đánh dấu sai các trường hợp âm tính (tăng FPR). Một bộ phân loại hoàn hảo sẽ đạt đến góc trên bên trái của biểu đồ, cho thấy độ nhạy 100% và 0% báo động giả. Một model đưa ra dự đoán ngẫu nhiên sẽ xuất hiện dưới dạng đường chéo từ góc dưới bên trái đến góc trên bên phải. Hiệu suất tổng thể thường được tóm tắt bằng Diện tích dưới đường cong (AUC), trong đó giá trị 1.0 biểu thị sự hoàn hảo.
Các ứng dụng trong thực tế#
Quyết định đặt ngưỡng ở đâu trên đường cong ROC hoàn toàn phụ thuộc vào chi phí của các lỗi trong một ứng dụng thuộc ngành cụ thể.
-
Chẩn đoán y khoa: Trong AI trong chăm sóc sức khỏe, cụ thể là các tác vụ như phát hiện khối u trong phân tích hình ảnh y khoa, chi phí bỏ sót một ca dương tính (âm tính giả) có khả năng đe dọa tính mạng. Do đó, các chuyên gia thường chọn một ngưỡng tối đa hóa TPR, ngay cả khi điều này dẫn đến FPR cao hơn, nghĩa là ban đầu có thể có nhiều bệnh nhân khỏe mạnh hơn bị đánh dấu để xét nghiệm thêm.
-
Phát hiện gian lận tài chính: Khi AI trong tài chính được sử dụng để giám sát các giao dịch thẻ tín dụng, ngân hàng phải cân bằng giữa bảo mật và trải nghiệm khách hàng. Nếu hệ thống quá nhạy (TPR cao), hệ thống có thể chặn các thẻ hợp lệ (FPR cao), gây khó chịu cho người dùng. Các nhà phân tích sử dụng đường cong ROC để tìm một ngưỡng cân bằng, giúp phát hiện phần lớn gian lận trong khi giữ các trường hợp dương tính giả ở mức tối thiểu chấp nhận được.
Tạo xác suất cho phân tích ROC#
Để vẽ đường cong ROC, bạn cần các xác suất dự đoán thô thay vì chỉ các nhãn lớp cuối cùng. Ví dụ sau sử dụng model YOLO26 hiện đại nhất để tạo các điểm số phân loại.
from ultralytics import YOLO
# Load a pretrained YOLO26 classification model
model = YOLO("yolo26n-cls.pt")
# Run inference to get probability distribution
results = model("bus.jpg")
# Access the probability score for the predicted class
# These continuous scores are required to calculate TPR/FPR at different thresholds
print(f"Top Class Index: {results[0].probs.top1}")
print(f"Confidence Score: {results[0].probs.top1conf:.4f}")Sau khi thu thập các xác suất này cho một tập validation, developer có thể sử dụng các thư viện như Scikit-learn để tính toán các điểm trên đường cong. Để quản lý dataset và theo dõi các metric này theo thời gian, Ultralytics Platform cung cấp các công cụ tích hợp để đánh giá và triển khai model.
ROC so với các khái niệm liên quan#
Điều quan trọng là phân biệt đường cong ROC với các công cụ đánh giá khác:
- So với đường cong Precision-Recall (PR): Trong khi ROC biểu diễn TPR đối chiếu với FPR, đường cong Precision-Recall biểu diễn Precision đối chiếu với Recall. Đường cong PR thường được ưu tiên khi dataset bị mất cân bằng nghiêm trọng (ví dụ: phát hiện các bất thường hiếm gặp), vì đường cong ROC đôi khi có thể đưa ra góc nhìn quá lạc quan trong những trường hợp như vậy.
- So với ma trận nhầm lẫn: Ma trận nhầm lẫn cung cấp ảnh chụp nhanh về hiệu suất tại một ngưỡng cụ thể duy nhất. Ngược lại, đường cong ROC trực quan hóa hiệu suất trên tất cả các ngưỡng có thể, khiến nó trở thành một công cụ tổng quát hơn để phân tích mô hình hóa dự đoán trước khi thiết lập quy tắc quyết định cuối cùng.









