Dataset Bias
Khám phá nguyên nhân gây ra dataset bias trong AI và tìm hiểu cách giảm thiểu sự thiên lệch. Tìm hiểu cách sử dụng Ultralytics Platform và Ultralytics YOLO26 để cải thiện tính công bằng.
Độ thiên lệch của tập dữ liệu xảy ra khi thông tin được sử dụng để đào tạo các model học máy (ML) chứa lỗi có tính hệ thống hoặc các phân phối lệch, khiến hệ thống AI tạo ra có xu hướng ưu tiên một số kết quả nhất định hơn các kết quả khác. Vì các model hoạt động như những engine nhận dạng mẫu, chúng hoàn toàn phụ thuộc vào đầu vào; nếu dữ liệu huấn luyện không phản ánh chính xác sự đa dạng của môi trường thực tế, model sẽ kế thừa những điểm mù này. Hiện tượng này thường dẫn đến khả năng khái quát hóa kém, trong đó AI có thể đạt điểm số cao khi kiểm thử nhưng lại thất bại nghiêm trọng khi được triển khai để suy luận theo thời gian thực trong các tình huống đa dạng hoặc bất ngờ.
Các nguồn phổ biến gây lệch dữ liệu#
Độ thiên lệch có thể xâm nhập vào tập dữ liệu ở nhiều giai đoạn trong vòng đời phát triển, thường bắt nguồn từ các quyết định của con người trong quá trình thu thập hoặc gán nhãn.
- Độ thiên lệch do lựa chọn: Điều này xảy ra khi dữ liệu được thu thập không đại diện ngẫu nhiên cho quần thể mục tiêu. Ví dụ, việc tạo một tập dữ liệu nhận dạng khuôn mặt chủ yếu sử dụng hình ảnh người nổi tiếng có thể khiến model thiên lệch về lớp trang điểm đậm và ánh sáng chuyên nghiệp, làm model thất bại trên các hình ảnh từ webcam thông thường.
- Lỗi gán nhãn: Tính chủ quan trong quá trình gán nhãn dữ liệu có thể đưa định kiến của con người vào dữ liệu. Nếu các annotator liên tục phân loại sai những đối tượng mơ hồ do thiếu hướng dẫn rõ ràng, model sẽ coi những lỗi này là ground truth.
- Độ thiên lệch về tính đại diện: Ngay cả khi được lựa chọn ngẫu nhiên, các nhóm thiểu số vẫn có thể bị nhóm đa số lấn át về mặt thống kê. Trong phát hiện đối tượng, một tập dữ liệu có 10.000 hình ảnh ô tô nhưng chỉ 100 hình ảnh xe đạp sẽ tạo ra một model thiên lệch về việc phát hiện ô tô.
Ứng dụng và hệ quả trong thực tế#
Tác động của độ thiên lệch trong tập dữ liệu rất đáng kể ở nhiều ngành khác nhau, đặc biệt là những lĩnh vực mà các hệ thống tự động đưa ra quyết định có rủi ro cao hoặc tương tác với thế giới vật lý.
Trong ngành ô tô, AI trong ngành ô tô dựa vào camera để nhận diện người đi bộ và chướng ngại vật. Nếu một ô tô tự lái được đào tạo chủ yếu trên dữ liệu thu thập ở những vùng có khí hậu nắng và khô, hiệu năng của nó có thể suy giảm khi vận hành trong tuyết hoặc mưa lớn. Đây là ví dụ điển hình về việc phân phối huấn luyện không khớp với phân phối vận hành, dẫn đến các rủi ro về an toàn.
Tương tự, trong phân tích hình ảnh y tế, các model chẩn đoán thường được đào tạo trên dữ liệu bệnh nhân trong quá khứ. Nếu một model được thiết kế để phát hiện các bệnh lý về da được đào tạo trên một tập dữ liệu chủ yếu gồm các tông màu da sáng, model có thể thể hiện độ chính xác thấp hơn đáng kể khi chẩn đoán bệnh nhân có làn da sẫm màu. Để giải quyết vấn đề này, cần có nỗ lực phối hợp nhằm tuyển chọn các tập dữ liệu đa dạng, bảo đảm tính công bằng trong AI giữa tất cả các nhóm nhân khẩu học.
Các chiến lược giảm thiểu#
Các nhà phát triển có thể giảm độ thiên lệch trong tập dữ liệu bằng cách áp dụng quy trình kiểm toán nghiêm ngặt và các chiến lược huấn luyện nâng cao. Các kỹ thuật như tăng cường dữ liệu giúp cân bằng tập dữ liệu bằng cách nhân tạo tạo ra các biến thể của những mẫu ít được đại diện (ví dụ: lật, xoay hoặc điều chỉnh độ sáng). Ngoài ra, việc tạo dữ liệu tổng hợp có thể lấp đầy những khoảng trống tại các nơi dữ liệu thực tế khan hiếm hoặc khó thu thập.
Quản lý hiệu quả các tập dữ liệu này là yếu tố then chốt. Nền tảng Ultralytics cho phép các nhóm trực quan hóa phân phối lớp và xác định sự mất cân bằng trước khi bắt đầu huấn luyện. Ngoài ra, việc tuân thủ các hướng dẫn như Khung quản lý rủi ro AI của NIST giúp các tổ chức xây dựng phương pháp tiếp cận có hệ thống để xác định và giảm thiểu những rủi ro này.
Độ thiên lệch của tập dữ liệu so với các khái niệm liên quan#
Việc phân biệt độ thiên lệch của tập dữ liệu với các thuật ngữ tương tự sẽ giúp xác định nguồn gốc của lỗi:
- so với Độ thiên lệch thuật toán: Độ thiên lệch của tập dữ liệu lấy dữ liệu làm trung tâm; điều này hàm ý rằng các "thành phần" có vấn đề. Độ thiên lệch thuật toán lấy model làm trung tâm; nó phát sinh từ thiết kế của chính thuật toán hoặc thuật toán tối ưu hóa, vốn có thể ưu tiên các lớp đa số để tối đa hóa các chỉ số tổng thể, gây bất lợi cho các nhóm thiểu số.
- so với Hiện tượng trôi dạt của model: Độ thiên lệch của tập dữ liệu là một vấn đề tĩnh, hiện diện tại thời điểm huấn luyện. Hiện tượng trôi dạt của model (hoặc trôi dạt dữ liệu) xảy ra khi dữ liệu thực tế thay đổi theo thời gian sau khi model được triển khai, đòi hỏi phải giám sát model liên tục.
Ví dụ mã: Tăng cường để giảm độ thiên lệch#
Ví dụ sau đây minh họa cách áp dụng tăng cường dữ liệu trong quá trình huấn luyện với YOLO26. Bằng cách tăng cường các phép biến đổi hình học, model học cách khái quát hóa tốt hơn, qua đó có thể giảm độ thiên lệch đối với các hướng hoặc vị trí cụ thể của đối tượng xuất hiện trong tập huấn luyện.
from ultralytics import YOLO
# Load YOLO26n, a high-efficiency model ideal for edge deployment
model = YOLO("yolo26n.pt")
# Train with increased augmentation to improve generalization
# 'fliplr' (flip left-right) and 'scale' help the model see diverse variations
results = model.train(
data="coco8.yaml",
epochs=50,
fliplr=0.5, # 50% probability of horizontal flip
scale=0.5, # +/- 50% image scaling
)








