Tìm hiểu về bias AI và bias dataset trong các hệ thống AI thị giác
Tìm hiểu cách bias của dataset ảnh hưởng đến các model thị giác máy tính và cách Ultralytics YOLO11 giúp giảm bias bằng augmentation thông minh và các công cụ train linh hoạt.

Các model trí tuệ nhân tạo (AI) đang thay đổi cách chúng ta giải quyết vấn đề, nhưng chúng không hoàn hảo. Từ xe tự lái đến các công cụ chẩn đoán trong lĩnh vực chăm sóc sức khỏe, chúng ta dựa vào AI để diễn giải dữ liệu và đưa ra quyết định. Điều gì xảy ra khi bản thân dữ liệu có sai sót?
Thiên kiến trong AI đề cập đến các kiểu thiếu nhất quán hình thành trong model, thường mà không ai nhận ra. Những thiên kiến này có thể khiến model đưa ra các dự đoán không chính xác, thiếu nhất quán hoặc thậm chí gây hại. Trong computer vision, thiên kiến thường bắt nguồn từ một nguồn chính: tập dữ liệu. Nếu dữ liệu dùng để huấn luyện model không cân bằng hoặc không mang tính đại diện, model sẽ phản ánh những khoảng trống đó.
Hãy cùng xem xét kỹ hơn cách thiên kiến tập dữ liệu hình thành, cách nó tác động đến các model computer vision và những bước developer có thể thực hiện để phát hiện, ngăn chặn thiên kiến. Chúng tôi cũng sẽ trình bày cách các model như Ultralytics YOLO11 có thể hỗ trợ xây dựng các hệ thống AI công bằng hơn và tổng quát tốt hơn, nghĩa là hoạt động hiệu quả trên dữ liệu mới, chưa từng thấy và phục vụ mọi người bình đẳng hơn.
Thiên kiến AI là gì và tại sao nó quan trọng?#
Thiên kiến AI là các lỗi có tính nhất quán trong một hệ thống AI, dẫn đến kết quả sai lệch hoặc không chính xác. Nói đơn giản hơn, model bắt đầu ưu tiên một loại đầu vào hình ảnh hơn các loại khác, ảnh hưởng đến tính công bằng của model, không phải vì model hoạt động tốt hơn mà do cách nó được huấn luyện.
Điều này đặc biệt phổ biến trong computer vision, nơi các model học từ dữ liệu hình ảnh. Nếu một tập dữ liệu chủ yếu bao gồm một loại đối tượng, cảnh hoặc người, model sẽ học các pattern chỉ hoạt động tốt trong những trường hợp đó.
Hãy hình dung một model chủ yếu được huấn luyện trên hình ảnh giao thông từ các thành phố lớn. Nếu được triển khai ở khu vực nông thôn, model có thể phân loại sai các bố cục đường bất thường hoặc không phát hiện được các loại phương tiện mà nó chưa từng thấy. Đó chính là thiên kiến AI trong thực tế. Nó dẫn đến độ chính xác thấp hơn và khả năng tổng quát hóa hạn chế, tức khả năng hoạt động tốt trên các đầu vào mới hoặc đa dạng của model.
Trong các ứng dụng đòi hỏi độ chính xác cao như chăm sóc sức khỏe hoặc bảo mật, những sai sót này không chỉ gây khó chịu mà còn có thể nguy hiểm. Giải quyết thiên kiến liên quan đến hiệu năng, độ tin cậy và an toàn.
Thiên kiến tập dữ liệu ảnh hưởng đến hành vi của model như thế nào#
Khi nói về thiên kiến tập dữ liệu, chúng ta đề cập đến sự mất cân bằng hoặc hạn chế trong dữ liệu dùng để huấn luyện model. Thiên kiến tập dữ liệu xảy ra khi dữ liệu huấn luyện không phản ánh đầy đủ sự đa dạng của thế giới thực mà model được xây dựng để mô hình hóa.
Các model computer vision không hiểu thế giới. Chúng hiểu các pattern. Nếu những hình ảnh duy nhất về chó mà chúng thấy là chó golden retriever trong sân sau, chúng có thể không nhận ra một chú husky trên đường mòn phủ tuyết.

Hình 1. Tái trọng số dữ liệu nguồn giúp đạt độ chính xác model tốt hơn.
Điều này cho thấy một trong những thách thức chính do thiên kiến tập dữ liệu gây ra. Model xây dựng sự hiểu biết dựa trên những gì nó được cung cấp. Nếu dữ liệu huấn luyện không phản ánh sự đa dạng của thế giới thực, hành vi của model sẽ trở nên hạn hẹp và kém hiệu quả hơn trong các điều kiện không quen thuộc.
Các image classifier thường hoạt động kém hơn đáng kể khi được kiểm thử trên một tập dữ liệu khác với tập dữ liệu dùng để huấn luyện, ngay cả khi cả hai tập dữ liệu được xây dựng cho cùng một tác vụ. Những thay đổi nhỏ về ánh sáng, background hoặc góc camera có thể dẫn đến mức giảm độ chính xác rõ rệt. Điều này cho thấy thiên kiến tập dữ liệu có thể dễ dàng ảnh hưởng đến khả năng tổng quát hóa của model.
Đây không phải là những trường hợp hiếm gặp. Chúng là tín hiệu cho thấy data pipeline của bạn cũng quan trọng không kém kiến trúc model.
Các loại thiên kiến trong dữ liệu huấn luyện AI#
Thiên kiến có thể xuất hiện một cách tinh vi trong quy trình phát triển, thường ở giai đoạn thu thập, gán nhãn hoặc tuyển chọn dữ liệu. Dưới đây là ba loại thiên kiến chính có thể ảnh hưởng đến dữ liệu huấn luyện của bạn:
Thiên kiến lựa chọn#
Thiên kiến lựa chọn có thể xảy ra khi tập dữ liệu không đại diện cho sự đa dạng trong quá trình sử dụng thực tế. Nếu một model phát hiện người đi bộ chỉ được huấn luyện trên hình ảnh rõ nét vào ban ngày, model sẽ không hoạt động tốt vào ban đêm hoặc trong sương mù. Do đó, quy trình lựa chọn đã bỏ sót các trường hợp quan trọng.

Hình 2. Biểu diễn trực quan về thiên kiến lựa chọn khi chỉ một tập con thiếu đa dạng được chọn.
Thiên kiến này xảy ra khi tập dữ liệu không bao quát đầy đủ các kịch bản trong thế giới thực do cách dữ liệu được thu thập. Ví dụ, một model phát hiện người đi bộ chỉ được huấn luyện trên hình ảnh rõ nét vào ban ngày có thể không hoạt động trong sương mù, tuyết hoặc điều kiện ánh sáng yếu. Điều này thường xảy ra khi dữ liệu được thu thập trong các điều kiện lý tưởng hoặc thuận tiện, làm hạn chế khả năng hoạt động của model trong những môi trường đa dạng. Mở rộng hoạt động thu thập để bao gồm nhiều bối cảnh đa dạng hơn giúp giảm loại thiên kiến này.
Thiên kiến này cũng có thể phát sinh trong các tập dữ liệu được xây dựng từ nguồn trực tuyến, nơi nội dung có thể bị lệch mạnh về một số địa điểm, ngôn ngữ hoặc bối cảnh kinh tế xã hội nhất định. Nếu không chủ động đa dạng hóa tập dữ liệu, model sẽ kế thừa những hạn chế này.
Thiên kiến gán nhãn#
Thiên kiến gán nhãn xảy ra khi người gán nhãn áp dụng nhãn không chính xác hoặc thiếu nhất quán. Một nhãn sai có vẻ vô hại, nhưng nếu xảy ra thường xuyên, model sẽ bắt đầu học các mối liên hệ sai.
Việc gán nhãn thiếu nhất quán có thể khiến model nhầm lẫn trong quá trình huấn luyện, đặc biệt ở các tác vụ phức tạp như object detection. Ví dụ, một người gán nhãn có thể gắn nhãn một phương tiện là "car", trong khi người khác gắn nhãn một phương tiện tương tự là "truck". Những điểm không nhất quán này ảnh hưởng đến khả năng học các pattern đáng tin cậy của model, dẫn đến độ chính xác thấp hơn trong quá trình inference.

Hình 3. Thiên kiến trong data pipeline bắt nguồn từ sự mất cân bằng trong thế giới thực.
Thiên kiến gán nhãn cũng có thể xuất hiện do hướng dẫn annotation không rõ ràng hoặc cách diễn giải khác nhau đối với cùng một dữ liệu. Thiết lập các tiêu chuẩn gán nhãn được tài liệu hóa đầy đủ và thực hiện kiểm tra chất lượng có thể giảm đáng kể những thách thức này.
Đào tạo liên tục cho người gán nhãn và sử dụng phương pháp gán nhãn đồng thuận, trong đó nhiều người gán nhãn cùng xem xét từng mẫu, là hai chiến lược hiệu quả để giảm thiểu thiên kiến gán nhãn và cải thiện chất lượng tập dữ liệu.
Thiên kiến đại diện#
Thiên kiến đại diện thường phản ánh những bất bình đẳng rộng hơn trong xã hội. Dữ liệu được thu thập tại các khu vực giàu có hoặc có mức độ kết nối cao hơn có thể không phản ánh sự đa dạng của các nhóm dân cư hoặc môi trường ít được đại diện. Giải quyết thiên kiến này đòi hỏi chủ động đưa vào các nhóm và bối cảnh bị bỏ sót.
Thiên kiến đại diện xảy ra khi một số nhóm hoặc class được đại diện không đầy đủ trong tập dữ liệu. Các nhóm này có thể là nhóm nhân khẩu học, category đối tượng hoặc điều kiện môi trường. Nếu model chỉ nhìn thấy một tông màu da, một loại đối tượng hoặc một kiểu background, các dự đoán của model sẽ phản ánh sự mất cân bằng đó.
Chúng ta có thể nhận thấy loại thiên kiến này khi một số nhóm hoặc category xuất hiện với số lượng nhỏ hơn nhiều so với các nhóm khác. Điều này có thể làm sai lệch dự đoán của model theo các mẫu chiếm ưu thế trong tập dữ liệu. Chẳng hạn, một model nhận diện khuôn mặt được huấn luyện chủ yếu trên một nhóm nhân khẩu học có thể gặp khó khăn khi hoạt động chính xác với mọi người dùng. Khác với thiên kiến lựa chọn, vốn gắn với sự đa dạng của dữ liệu, thiên kiến đại diện liên quan đến sự cân bằng giữa các nhóm.
Các hoạt động audit tính đa dạng và chiến lược mở rộng dữ liệu có mục tiêu có thể giúp đảm bảo mọi nhóm nhân khẩu học và category liên quan đều được đại diện đầy đủ trong toàn bộ tập dữ liệu huấn luyện.
Cách phát hiện và giảm thiểu thiên kiến tập dữ liệu#
Trong các triển khai thực tế, thiên kiến AI không chỉ có nghĩa là một vài dự đoán sai. Nó có thể tạo ra các hệ thống hoạt động tốt với một số người nhưng không tốt với tất cả mọi người.
Trong AI cho lĩnh vực ô tô, các model phát hiện có thể hoạt động thiếu nhất quán giữa các nhóm người đi bộ, dẫn đến mức độ an toàn thấp hơn đối với những người ít được đại diện. Vấn đề không nằm ở mục đích của model mà ở các đầu vào hình ảnh dùng để huấn luyện model. Ngay cả trong nông nghiệp, thiên kiến trong object detection có thể dẫn đến việc nhận diện cây trồng kém trong các điều kiện ánh sáng hoặc thời tiết khác nhau. Đây là những hậu quả phổ biến khi huấn luyện model trên các tập dữ liệu hạn chế hoặc mất cân bằng.
Khắc phục thiên kiến AI bắt đầu từ việc biết cần tìm ở đâu. Nếu tập huấn luyện của bạn thiếu các mẫu quan trọng hoặc đại diện quá nhiều cho một phạm vi hạn hẹp, model sẽ phản ánh những khoảng trống đó. Vì vậy, phát hiện thiên kiến trong AI là một bước quan trọng trong mọi development pipeline.

Hình 4. Các bước chính để giảm thiên kiến AI và cải thiện tính công bằng.
Hãy bắt đầu bằng việc phân tích tập dữ liệu. Xem xét phân phối giữa các class, môi trường, điều kiện ánh sáng, kích thước đối tượng và nhóm nhân khẩu học. Nếu một category chiếm ưu thế, model của bạn có khả năng hoạt động kém hơn trên các category còn lại.
Tiếp theo, hãy xem xét hiệu năng. Model có hoạt động kém hơn trong một số bối cảnh hoặc với các loại đối tượng cụ thể không? Nếu có, đó là dấu hiệu của thiên kiến đã học và thường bắt nguồn từ dữ liệu.
Đánh giá ở cấp độ slice là yếu tố then chốt. Một model có thể báo cáo độ chính xác trung bình 90% nhưng chỉ đạt 60% trên một nhóm hoặc điều kiện cụ thể. Nếu không kiểm tra các slice đó, bạn sẽ không bao giờ biết.
Sử dụng các metric về tính công bằng trong quá trình huấn luyện và đánh giá là một công cụ hữu hiệu khác. Các metric này vượt ra ngoài điểm độ chính xác tiêu chuẩn và đánh giá cách model hoạt động trên các subset dữ liệu khác nhau. Chúng giúp làm lộ ra những điểm mù mà nếu không sẽ dễ bị bỏ qua.
Tính minh bạch trong thành phần tập dữ liệu và kiểm thử model dẫn đến các model tốt hơn.
Cải thiện tính công bằng thông qua đa dạng dữ liệu và augmentation#
Sau khi xác định được thiên kiến, bước tiếp theo là thu hẹp khoảng cách. Một trong những cách hiệu quả nhất là tăng độ đa dạng dữ liệu trong các model AI. Điều đó có nghĩa là thu thập thêm mẫu từ những kịch bản ít được đại diện, chẳng hạn hình ảnh y tế từ các nhóm dân cư khác nhau hoặc các điều kiện môi trường bất thường.
Bổ sung thêm dữ liệu có thể mang lại giá trị, đặc biệt khi làm tăng tính đa dạng. Tuy nhiên, cải thiện tính công bằng cũng phụ thuộc vào việc thu thập đúng loại mẫu. Các mẫu này nên phản ánh những biến thiên trong thế giới thực mà model của bạn có khả năng gặp phải.
Data augmentation là một chiến lược hữu ích khác. Lật, xoay, điều chỉnh ánh sáng và thay đổi tỷ lệ đối tượng có thể giúp mô phỏng các điều kiện khác nhau trong thế giới thực. Augmentation không chỉ tăng tính đa dạng của tập dữ liệu mà còn giúp model mạnh mẽ hơn trước những thay đổi về diện mạo, ánh sáng và bối cảnh.
Hầu hết training pipeline hiện đại đều mặc định bao gồm augmentation, nhưng cách sử dụng có chiến lược, chẳng hạn tập trung điều chỉnh dựa trên nhu cầu cụ thể của tác vụ, mới khiến augmentation hiệu quả đối với tính công bằng.
Sử dụng dữ liệu tổng hợp để lấp đầy khoảng trống#
Dữ liệu tổng hợp là dữ liệu được tạo nhân tạo nhằm mô phỏng các mẫu trong thế giới thực. Đây có thể là công cụ hữu ích khi một số kịch bản quá hiếm hoặc quá nhạy cảm để thu thập trong thực tế.
Ví dụ, nếu bạn đang xây dựng một model để phát hiện các lỗi hiếm gặp trong máy móc hoặc các vi phạm giao thông thuộc trường hợp biên, bạn có thể mô phỏng những trường hợp đó bằng dữ liệu tổng hợp. Điều này tạo cơ hội để model học từ các sự kiện mà model có thể không thường xuyên gặp trong tập huấn luyện.
Các nghiên cứu phát hiện rằng việc đưa dữ liệu tổng hợp có chủ đích vào quá trình huấn luyện có thể giảm thiên kiến tập dữ liệu và cải thiện hiệu năng trên các nhóm nhân khẩu học và môi trường khác nhau.
Dữ liệu tổng hợp đạt hiệu quả tốt nhất khi được kết hợp với các mẫu trong thế giới thực. Nó bổ trợ cho tập dữ liệu của bạn chứ không thay thế tập dữ liệu đó.
Ultralytics YOLO11 hỗ trợ AI có đạo đức như thế nào#
Việc xây dựng các model AI không thiên kiến cũng phụ thuộc vào những công cụ bạn sử dụng. Ultralytics YOLO11 được thiết kế linh hoạt, dễ fine-tune và có khả năng thích ứng cao, nên rất phù hợp để giảm thiên kiến tập dữ liệu.
Ultralytics YOLO11 hỗ trợ các kỹ thuật data augmentation nâng cao trong khi huấn luyện model, qua đó đưa vào các bối cảnh hình ảnh đa dạng và các mẫu được pha trộn để cải thiện khả năng tổng quát hóa của model và giảm overfitting.
Ultralytics YOLO11 cũng có kiến trúc backbone và neck được cải tiến để trích xuất feature hiệu quả hơn. Nâng cấp này tăng cường khả năng phát hiện các chi tiết tinh vi của model, yếu tố quan trọng trong những kịch bản ít được đại diện hoặc thuộc trường hợp biên, nơi các model tiêu chuẩn có thể gặp khó khăn.
Vì Ultralytics YOLO11 dễ retrain và triển khai trên các môi trường edge và cloud, các team có thể xác định khoảng cách hiệu năng và nhanh chóng cập nhật model khi phát hiện thiên kiến trong thực tế.
AI công bằng không phải là mục tiêu chỉ cần đạt một lần. Đó là một chu trình đánh giá, học hỏi và điều chỉnh. Các công cụ như Ultralytics YOLO11 giúp chu trình này diễn ra nhanh hơn và hiệu quả hơn.
Những điểm chính#
Thiên kiến AI ảnh hưởng đến mọi khía cạnh, từ tính công bằng đến hiệu năng. Thiên kiến trong computer vision thường bắt nguồn từ cách tập dữ liệu được thu thập, gán nhãn và cân bằng. May mắn là có những cách đã được chứng minh để phát hiện và giảm thiểu thiên kiến.
Hãy bắt đầu bằng việc audit dữ liệu và kiểm thử hiệu năng model trên nhiều kịch bản khác nhau. Sử dụng thu thập dữ liệu có mục tiêu, augmentation và dữ liệu tổng hợp để tạo độ bao phủ huấn luyện tốt hơn.
Ultralytics YOLO11 hỗ trợ workflow này bằng cách giúp dễ dàng hơn trong việc huấn luyện model tùy chỉnh, áp dụng các kỹ thuật augmentation mạnh và phản ứng nhanh khi phát hiện thiên kiến.
Xây dựng AI công bằng không chỉ là điều đúng đắn cần làm. Đó cũng là cách bạn xây dựng các hệ thống thông minh hơn và đáng tin cậy hơn.
Hãy tham gia cộng đồng đang không ngừng phát triển của chúng tôi! Khám phá repository GitHub để tìm hiểu thêm về AI. Sẵn sàng bắt đầu các dự án computer vision của riêng bạn? Hãy xem các tùy chọn cấp phép của chúng tôi. Khám phá AI trong sản xuất và AI thị giác trong nông nghiệp bằng cách truy cập các trang giải pháp của chúng tôi!








