Tìm hiểu về thiên kiến AI và thiên kiến tập dữ liệu trong các hệ thống Vision AI
Tìm hiểu cách thiên kiến trong tập dữ liệu (dataset bias) ảnh hưởng đến các model computer vision và cách Ultralytics YOLO11 giúp giảm thiểu thiên kiến bằng các công cụ tăng cường dữ liệu thông minh và huấn luyện linh hoạt.

Các mô hình trí tuệ nhân tạo (AI) đang thay đổi cách chúng ta giải quyết vấn đề, nhưng chúng không phải lúc nào cũng hoàn hảo. Từ xe tự hành cho đến các công cụ chẩn đoán trong healthcare, chúng ta phụ thuộc vào AI để diễn giải dữ liệu và đưa ra quyết định. Chuyện gì xảy ra khi bản thân dữ liệu đó có khuyết điểm?
Bias in AI đề cập đến các mẫu hình không nhất quán phát sinh trong các mô hình, thường là mà không ai nhận ra. Những độ lệch này có thể khiến mô hình đưa ra các dự đoán không chính xác, thiếu nhất quán hoặc thậm chí gây hại. Trong thị giác máy tính, độ lệch thường bắt nguồn từ một nguồn chính: dataset. Nếu dữ liệu dùng để huấn luyện mô hình không cân bằng hoặc thiếu tính đại diện, mô hình sẽ phản ánh những khoảng trống đó.
Hãy cùng xem xét kỹ hơn cách dataset bias hình thành, cách nó tác động đến các mô hình computer vision, và các bước nhà phát triển có thể thực hiện để phát hiện và ngăn chặn nó. Chúng tôi cũng sẽ chỉ ra cách các mô hình như Ultralytics YOLO11 có thể hỗ trợ nỗ lực xây dựng các hệ thống AI công bằng hơn với khả năng tổng quát hóa tốt hơn, nghĩa là chúng hoạt động hiệu quả trên dữ liệu mới, chưa từng thấy trước đây và phục vụ mọi người một cách bình đẳng hơn.
Thiên kiến AI là gì và tại sao nó lại quan trọng?#
Độ lệch AI đề cập đến các lỗi nhất quán trong hệ thống AI dẫn đến các kết quả bị lệch hoặc không chính xác. Nói một cách đơn giản hơn, mô hình bắt đầu ưu tiên một loại đầu vào hình ảnh này hơn các loại khác, điều này ảnh hưởng đến tính fairness của mô hình, không phải vì nó hoạt động tốt hơn mà là do cách nó được huấn luyện.
Điều này đặc biệt phổ biến trong thị giác máy tính, nơi các model học từ dữ liệu hình ảnh. Nếu một tập dữ liệu chủ yếu bao gồm một loại vật thể, cảnh quan hoặc con người, model sẽ học các mô hình chỉ hoạt động tốt cho những trường hợp đó.
Hãy tưởng tượng một mô hình được huấn luyện chủ yếu trên hình ảnh giao thông từ các thành phố lớn. Nếu được triển khai ở một vùng nông thôn, nó có thể phân loại sai các bố cục đường bất thường hoặc fail to detect types of vehicles mà nó chưa từng thấy trước đây. Đó chính là độ lệch AI trong thực tế. Nó dẫn đến độ chính xác thấp hơn và khả năng tổng quát hóa bị hạn chế, đề cập đến khả năng hoạt động tốt của mô hình trên các đầu vào mới hoặc đa dạng.
Trong các ứng dụng mà độ chính xác là yếu tố thiết yếu, như chăm sóc sức khỏe hoặc an ninh, những sai sót này không chỉ gây thất vọng mà còn có thể nguy hiểm. Việc giải quyết thiên kiến liên quan đến hiệu suất, độ tin cậy và an toàn.
Cách thiên kiến tập dữ liệu ảnh hưởng đến hành vi của model#
Khi nói đến thiên kiến tập dữ liệu, chúng tôi đề cập đến sự mất cân bằng hoặc hạn chế trong dữ liệu được sử dụng để huấn luyện model. Thiên kiến tập dữ liệu xảy ra khi dữ liệu huấn luyện không phản ánh đầy đủ sự đa dạng trong thế giới thực mà nó được thiết kế để mô hình hóa.
Các model thị giác máy tính không hiểu thế giới. Chúng hiểu các mô hình. Nếu những hình ảnh duy nhất về chó mà chúng thấy là Golden Retriever ở sân sau, chúng có thể không nhận ra một chú Husky trên đường mòn đầy tuyết.

Fig 1. Việc gán trọng số lại cho dữ liệu nguồn giúp đạt được độ chính xác mô hình tốt hơn.
Điều này làm nổi bật một trong những thách thức chính do độ lệch tập dữ liệu gây ra. Mô hình xây dựng sự hiểu biết dựa trên những gì nó được hiển thị. Nếu dữ liệu huấn luyện đó không phản ánh sự đa dạng của thế giới thực, hành vi của mô hình sẽ trở nên hạn hẹp và kém hiệu quả trong unfamiliar conditions.
Các trình phân loại hình ảnh thường hoạt động kém hơn đáng kể khi được kiểm tra trên một tập dữ liệu khác với tập dữ liệu mà chúng được huấn luyện, ngay cả khi cả hai tập dữ liệu đều được xây dựng cho cùng một tác vụ. Những thay đổi nhỏ về ánh sáng, nền hoặc góc máy ảnh có thể dẫn đến sự sụt giảm đáng chú ý về độ chính xác. Điều này cho thấy thiên kiến tập dữ liệu ảnh hưởng dễ dàng như thế nào đến khả năng khái quát hóa của một model.
Đây không phải là những trường hợp ngoại lệ. Đây là những tín hiệu cho thấy pipeline dữ liệu của bạn quan trọng không kém gì kiến trúc model.
Các loại thiên kiến trong dữ liệu huấn luyện AI#
Thiên kiến có thể được nhìn thấy trong quá trình phát triển theo những cách tinh vi, thường là trong quá trình thu thập, gán nhãn hoặc tuyển chọn dữ liệu. Dưới đây là ba loại thiên kiến chính có thể ảnh hưởng đến dữ liệu huấn luyện của bạn:
Thiên kiến lựa chọn (Selection bias)#
Thiên kiến lựa chọn có thể xảy ra khi tập dữ liệu không đại diện cho sự đa dạng được thấy trong thực tế. Nếu một model phát hiện người đi bộ chỉ được huấn luyện trên hình ảnh ban ngày, rõ ràng, nó sẽ không hoạt động tốt vào ban đêm hoặc trong sương mù. Do đó, quá trình lựa chọn đã bỏ lỡ các trường hợp quan trọng.

Fig 2. Biểu diễn trực quan về độ lệch lựa chọn, trong đó chỉ có một tập con không đa dạng được chọn.
Loại thiên kiến này xảy ra khi tập dữ liệu không nắm bắt được toàn bộ các kịch bản trong thế giới thực do cách dữ liệu được thu thập. Ví dụ, một model phát hiện người đi bộ chỉ được huấn luyện trên hình ảnh ban ngày, rõ ràng, có thể thất bại trong sương mù, tuyết hoặc ánh sáng yếu. Điều này thường xảy ra khi dữ liệu được thu thập trong các điều kiện lý tưởng hoặc thuận tiện, hạn chế khả năng hoạt động của model trong các môi trường đa dạng. Việc mở rộng nỗ lực thu thập để bao gồm nhiều bối cảnh đa dạng hơn sẽ giúp giảm bớt loại thiên kiến này.
Nó cũng có thể nảy sinh trong các tập dữ liệu được xây dựng từ các nguồn trực tuyến, nơi nội dung có thể bị lệch đáng kể về phía các địa điểm, ngôn ngữ hoặc bối cảnh kinh tế xã hội nhất định. Nếu không có nỗ lực có chủ ý để đa dạng hóa tập dữ liệu, model sẽ kế thừa những hạn chế này.
Thiên kiến gán nhãn (Label bias)#
Label bias xảy ra khi những người gán nhãn áp dụng các nhãn không chính xác hoặc không nhất quán. Một nhãn sai có thể có vẻ vô hại, nhưng nếu điều đó xảy ra thường xuyên, mô hình bắt đầu học các mối liên kết sai.
Việc gán nhãn thiếu nhất quán có thể làm nhầm lẫn model trong quá trình huấn luyện, đặc biệt là trong các tác vụ phức tạp như phát hiện vật thể. Ví dụ, một người chú thích có thể gán nhãn một phương tiện là "ô tô" trong khi người khác gán nhãn một phương tiện tương tự là "xe tải". Những sự thiếu nhất quán này ảnh hưởng đến khả năng học các mô hình đáng tin cậy của model, dẫn đến giảm độ chính xác trong quá trình suy luận.

Fig 3. Độ lệch trong các pipeline dữ liệu bắt nguồn từ sự mất cân bằng trong thế giới thực.
Thiên kiến gán nhãn cũng có thể phát sinh từ các hướng dẫn chú thích không rõ ràng hoặc cách diễn giải khác nhau về cùng một dữ liệu. Việc thiết lập các tiêu chuẩn gán nhãn được ghi chép rõ ràng và thực hiện các bước kiểm tra chất lượng có thể giảm đáng kể những thách thức này.
Việc đào tạo liên tục cho người chú thích và sử dụng gán nhãn đồng thuận, nơi nhiều người chú thích xem xét từng mẫu, là hai chiến lược hiệu quả để giảm thiểu thiên kiến gán nhãn và cải thiện chất lượng tập dữ liệu.
Thiên kiến đại diện (Representation bias)#
Representation bias thường phản ánh sự bất bình đẳng xã hội rộng lớn hơn. Dữ liệu được thu thập ở các khu vực giàu có hoặc có kết nối tốt hơn có thể không ghi lại được sự đa dạng của các nhóm dân cư hoặc môi trường ít được đại diện hơn. Khắc phục độ lệch này đòi hỏi phải có ý thức đưa vào các nhóm và ngữ cảnh bị bỏ qua.
Thiên kiến đại diện xảy ra khi một số nhóm hoặc lớp nhất định bị thiếu đại diện trong tập dữ liệu. Chúng có thể bao gồm các nhóm nhân khẩu học, loại vật thể hoặc điều kiện môi trường. Nếu một model chỉ thấy một tông màu da, một loại vật thể hoặc một kiểu nền, các dự đoán của nó sẽ phản ánh sự mất cân bằng đó.
Chúng ta có thể quan sát loại thiên kiến này khi một số nhóm hoặc danh mục nhất định được đưa vào với số lượng ít hơn nhiều so với những nhóm khác. Điều này có thể làm lệch dự đoán của model về phía các ví dụ thống trị trong tập dữ liệu. Ví dụ, một model nhận diện khuôn mặt được huấn luyện chủ yếu trên một nhóm nhân khẩu học có thể gặp khó khăn khi hoạt động chính xác trên tất cả người dùng. Không giống như thiên kiến lựa chọn, vốn gắn liền với sự đa dạng của dữ liệu, thiên kiến đại diện liên quan đến sự cân bằng giữa các nhóm.
Kiểm toán sự đa dạng và các chiến lược mở rộng dữ liệu mục tiêu có thể giúp đảm bảo rằng tất cả các nhóm nhân khẩu học và danh mục liên quan được đại diện đúng cách trong suốt tập dữ liệu huấn luyện.
Cách phát hiện và giảm thiểu thiên kiến tập dữ liệu#
Trong các triển khai thực tế, thiên kiến AI không chỉ có nghĩa là một vài dự đoán không chính xác. Nó có thể dẫn đến các hệ thống hoạt động tốt cho một số người nhưng không dành cho tất cả mọi người.
Trong AI ngành ô tô, các mô hình phát hiện có thể hoạt động không nhất quán ở các nhóm người đi bộ, dẫn đến kết quả an toàn thấp hơn cho các cá nhân ít được đại diện. Vấn đề không nằm ở dụng ý của mô hình. Mà là ở các đầu vào hình ảnh mà nó được huấn luyện. Ngay cả trong nông nghiệp, độ lệch trong object detection có thể có nghĩa là khả năng nhận diện cây trồng kém dưới các điều kiện ánh sáng hoặc thời tiết khác nhau. Đây là những hậu quả phổ biến của việc huấn luyện mô hình trên các tập dữ liệu hạn chế hoặc mất cân bằng.
Fixing AI bias bắt đầu bằng việc biết cần phải tìm kiếm ở đâu. Nếu tập huấn luyện của bạn thiếu các ví dụ quan trọng hoặc đại diện quá mức cho một phạm vi hẹp, mô hình của bạn sẽ phản ánh những khoảng trống đó. Đó là lý do tại sao việc phát hiện độ lệch trong AI là một bước quan trọng trong mọi pipeline phát triển.

Fig 4. Các bước chính để giảm độ lệch AI và cải thiện tính công bằng.
Bắt đầu bằng cách phân tích tập dữ liệu của bạn. Xem xét sự phân bổ giữa các lớp, môi trường, ánh sáng, quy mô vật thể và nhân khẩu học. Nếu một danh mục thống trị, model của bạn có khả năng sẽ hoạt động kém hơn trên các danh mục khác.
Tiếp theo, hãy xem xét hiệu suất. Model có hoạt động kém hơn trong các cài đặt nhất định hoặc đối với các loại vật thể cụ thể không? Nếu có, đó là dấu hiệu của thiên kiến đã học, và nó thường chỉ ngược lại dữ liệu.
Đánh giá cấp độ cắt (Slice-level) là chìa khóa. Một model có thể báo cáo độ chính xác trung bình 90% nhưng chỉ 60% trên một nhóm hoặc điều kiện cụ thể. Nếu không kiểm tra những phần cắt đó, bạn sẽ không bao giờ biết được.
Sử dụng các số liệu công bằng trong quá trình huấn luyện và đánh giá là một công cụ mạnh mẽ khác. Các số liệu này vượt xa các điểm số độ chính xác tiêu chuẩn và đánh giá cách model hoạt động trên các tập con dữ liệu khác nhau. Chúng giúp làm nổi bật các điểm mù mà nếu không sẽ không bị chú ý.
Sự minh bạch trong thành phần tập dữ liệu và kiểm tra model dẫn đến các model tốt hơn.
Cải thiện tính công bằng thông qua sự đa dạng dữ liệu và tăng cường dữ liệu#
Khi bạn đã xác định được độ lệch, bước tiếp theo là thu hẹp khoảng cách đó. Một trong những cách hiệu quả nhất để làm điều này là tăng data diversity trong các mô hình AI. Điều đó có nghĩa là thu thập nhiều mẫu hơn từ các kịch bản ít được đại diện, cho dù đó là hình ảnh y tế từ các quần thể dân cư khác nhau hay các điều kiện môi trường bất thường.
Việc thêm dữ liệu có thể có giá trị, đặc biệt là khi nó làm tăng sự đa dạng. Tuy nhiên, việc cải thiện tính công bằng cũng phụ thuộc vào việc thu thập đúng loại ví dụ. Những ví dụ này nên phản ánh sự biến đổi trong thế giới thực mà model của bạn có khả năng gặp phải.
Tăng cường dữ liệu (Data augmentation) là một chiến lược có giá trị khác. Lật, xoay, điều chỉnh ánh sáng và thay đổi tỷ lệ vật thể có thể giúp mô phỏng các điều kiện thực tế khác nhau. Tăng cường không chỉ làm tăng sự đa dạng của tập dữ liệu mà còn giúp model trở nên mạnh mẽ hơn trước những thay đổi về ngoại hình, ánh sáng và bối cảnh.
Hầu hết các pipeline huấn luyện hiện đại đều bao gồm tính năng augmentation theo mặc định, nhưng việc sử dụng chiến lược, chẳng hạn như tập trung điều chỉnh dựa trên các nhu cầu cụ thể của tác vụ, mới là yếu tố giúp tính năng này đạt hiệu quả về mặt công bằng.
Sử dụng dữ liệu tổng hợp để lấp đầy các khoảng trống#
Dữ liệu tổng hợp đề cập đến dữ liệu được tạo ra nhân tạo bắt chước các ví dụ trong thế giới thực. Nó có thể là một công cụ hữu ích khi một số kịch bản quá hiếm hoặc quá nhạy cảm để ghi lại trong tự nhiên.
Ví dụ, nếu bạn đang xây dựng một model để phát hiện các lỗi hiếm gặp trong máy móc hoặc các vi phạm giao thông trường hợp biên, bạn có thể mô phỏng các trường hợp đó bằng dữ liệu tổng hợp. Điều này mang lại cho model của bạn cơ hội học hỏi từ các sự kiện mà nó có thể không gặp thường xuyên trong tập huấn luyện của bạn.
Studies đã phát hiện ra rằng việc đưa dữ liệu tổng hợp targeted vào quá trình huấn luyện có thể làm giảm độ lệch tập dữ liệu và cải thiện hiệu suất trên các nhóm nhân khẩu học và môi trường.
Dữ liệu tổng hợp hoạt động tốt nhất khi được kết hợp với các mẫu thực tế. Nó bổ sung cho tập dữ liệu của bạn; nó không thay thế nó.
Ultralytics YOLO11 hỗ trợ AI đạo đức như thế nào#
Việc xây dựng các mô hình AI không thiên vị cũng phụ thuộc vào các công cụ bạn sử dụng. Ultralytics YOLO11 được thiết kế linh hoạt, dễ dàng fine-tune và có khả năng thích ứng cao, giúp nó trở thành một lựa chọn phù hợp để giảm thiểu độ lệch tập dữ liệu.
Ultralytics YOLO11 hỗ trợ các kỹ thuật tăng cường dữ liệu nâng cao trong quá trình training mô hình, giới thiệu các bối cảnh hình ảnh đa dạng và các ví dụ được pha trộn để cải thiện khả năng khái quát hóa của mô hình và giảm hiện tượng overfitting.
Ultralytics YOLO11 cũng sở hữu kiến trúc backbone và neck được cải tiến giúp trích xuất tính năng hiệu quả hơn. Nâng cấp này cải thiện khả năng phát hiện các chi tiết tinh tế của mô hình, điều tối quan trọng trong các kịch bản có ít đại diện hoặc các trường hợp biên nơi các mô hình chuẩn có thể gặp khó khăn.
Vì Ultralytics YOLO11 dễ dàng retrain và triển khai trên các môi trường edge và cloud, các nhóm có thể xác định các khoảng trống hiệu suất và nhanh chóng cập nhật mô hình khi phát hiện độ lệch trong thực tế.
AI công bằng không phải là mục tiêu một lần. Đó là một chu trình đánh giá, học tập và điều chỉnh. Các công cụ như Ultralytics YOLO11 giúp chu trình đó diễn ra nhanh hơn và hiệu quả hơn.
Các điểm chính cần lưu ý#
Thiên kiến AI ảnh hưởng đến mọi thứ từ tính công bằng đến hiệu suất. Thiên kiến thị giác máy tính thường bắt nguồn từ cách các tập dữ liệu được thu thập, gán nhãn và cân bằng. May mắn thay, có những cách đã được kiểm chứng để phát hiện và giảm thiểu nó.
Bắt đầu bằng việc kiểm toán dữ liệu của bạn và kiểm tra hiệu suất của model trên các kịch bản khác nhau. Sử dụng thu thập dữ liệu có mục tiêu, tăng cường dữ liệu và dữ liệu tổng hợp để tạo ra độ phủ huấn luyện tốt hơn.
Ultralytics YOLO11 hỗ trợ quy trình này bằng cách giúp việc huấn luyện các model tùy chỉnh trở nên dễ dàng hơn, áp dụng các kỹ thuật tăng cường dữ liệu mạnh mẽ và phản hồi nhanh chóng khi phát hiện độ lệch.
Xây dựng AI công bằng không chỉ là điều đúng đắn cần làm. Đó cũng là cách bạn xây dựng các hệ thống thông minh hơn, đáng tin cậy hơn.
Hãy tham gia community đang phát triển của chúng tôi! Khám phá GitHub repository của chúng tôi để tìm hiểu thêm về AI. Sẵn sàng bắt đầu các dự án thị giác máy tính của riêng bạn chưa? Hãy xem các licensing options của chúng tôi. Khám phá AI in manufacturing và vision AI in agriculture bằng cách truy cập các trang giải pháp của chúng tôi!






