Độ tin cậy giữa các đánh giá viên: Định nghĩa, ví dụ và cách tính
Tìm hiểu về độ tin cậy giữa các đánh giá viên, Cohen's Kappa, ICC, đào tạo đánh giá viên và tỷ lệ đồng thuận. Tìm hiểu cách các thước đo thống kê này bảo đảm tính nhất quán và sự đồng thuận giữa các quan sát viên trong nghiên cứu và phân tích dữ liệu.

Khi xây dựng một model AI, chất lượng dữ liệu cũng quan trọng không kém các thuật toán đứng sau model đó. Bất cứ khi nào nhiều người cùng gán nhãn hoặc đánh giá một dữ liệu, bất đồng là điều khó tránh khỏi. Điều này đúng trong nhiều lĩnh vực, bao gồm nghiên cứu, chăm sóc sức khỏe và giáo dục.
Đặc biệt, trong thị giác máy tính, một nhánh của AI liên quan đến việc huấn luyện các model như Ultralytics YOLO11 để diễn giải dữ liệu trực quan như hình ảnh hoặc video, các mẫu đã gán nhãn đóng vai trò then chốt. Nếu các nhãn không nhất quán, các model thị giác máy tính có thể gặp khó khăn trong việc học đúng các mẫu.
Độ tin cậy giữa các đánh giá viên (IRR) đo lường mức độ nhất quán trong sự đồng thuận của những cá nhân khác nhau, hay còn gọi là người gán nhãn, đối với một tác vụ. Chỉ số này giúp theo dõi tính nhất quán và xác định các khoảng trống trong đào tạo, hướng dẫn hoặc diễn giải. Điều này đặc biệt quan trọng trong việc huấn luyện model tùy chỉnh, khi các model AI được xây dựng bằng dữ liệu cụ thể cho một mục đích nhất định.
Trong bài viết này, chúng ta sẽ tìm hiểu độ tin cậy giữa các đánh giá viên là gì, cách đo lường và cách cải thiện chỉ số này trong các dự án thực tế. Hãy bắt đầu!
Độ tin cậy giữa các đánh giá viên là gì?#
Độ tin cậy giữa các đánh giá viên đo lường tần suất hai hoặc nhiều người (còn gọi là các đánh giá viên) đồng thuận khi gán nhãn, chấm điểm hoặc đánh giá cùng một nội dung. Chỉ số này được dùng để kiểm tra mức độ nhất quán trong việc các đánh giá viên khác nhau áp dụng những tiêu chí nhất định. Mức độ đồng thuận cao giữa các đánh giá viên cho thấy tác vụ được định nghĩa rõ ràng và dễ hiểu.
Khái niệm này được sử dụng trong nhiều lĩnh vực khác nhau. Tùy theo lĩnh vực, nó có thể được gọi bằng các tên khác nhau, chẳng hạn như độ đồng thuận giữa các đánh giá viên, độ tin cậy giữa các quan sát viên hoặc độ tin cậy giữa các bộ mã hóa. Tuy nhiên, nguyên tắc nền tảng vẫn không thay đổi.
Trong AI thị giác, độ tin cậy giữa các đánh giá viên là một phần quan trọng của quy trình gán nhãn dữ liệu. Việc huấn luyện các model thị giác máy tính thường yêu cầu gán nhãn các dataset hình ảnh hoặc khung hình video khổng lồ, vì vậy nhiều nhà phát triển AI cùng làm việc trên một dữ liệu.
Để có được kết quả chính xác, họ phải tuân thủ cùng một bộ hướng dẫn gán nhãn. Ví dụ, khi gán nhãn động vật, mọi người cần thống nhất rõ ràng thế nào được tính là chó, cách vẽ bounding box xung quanh nó và có nên gán nhãn hay bỏ qua các đối tượng bị mờ hay không.

Hình 1. Tìm hiểu về độ tin cậy giữa các đánh giá viên (Hình ảnh của tác giả)
Độ tin cậy giữa các đánh giá viên, trong cùng một đánh giá viên và độ tin cậy kiểm tra–kiểm tra lại#
Khi con người tham gia gán nhãn hoặc chấm điểm dữ liệu, có ba loại độ tin cậy chính cần xem xét. Mỗi loại phục vụ một mục đích khác nhau trong việc đo lường mức độ nhất quán của kết quả. Dưới đây là phần tìm hiểu kỹ hơn về từng loại:
-
Độ tin cậy giữa các đánh giá viên: Độ tin cậy giữa các đánh giá viên xem xét mức độ đồng thuận giữa những người khác nhau cùng thực hiện một tác vụ. Chỉ số này đặc biệt hữu ích khi có nhiều người gán nhãn tham gia vào các dự án như gán nhãn hình ảnh, phân tích cảm xúc hoặc đánh giá y tế.
-
Độ tin cậy trong cùng một đánh giá viên: Chỉ số này chuyển trọng tâm sang một cá nhân duy nhất. Độ tin cậy trong cùng một đánh giá viên kiểm tra xem người đánh giá có duy trì tính nhất quán khi lặp lại cùng một tác vụ ở các thời điểm khác nhau hay không. Nếu các nhãn thay đổi quá nhiều, nguyên nhân có thể là hướng dẫn chưa rõ ràng hoặc tác vụ chưa được làm rõ.
-
Độ tin cậy kiểm tra–kiểm tra lại: Độ tin cậy kiểm tra–kiểm tra lại không tập trung vào người gán nhãn mà tập trung vào công cụ hoặc phương pháp được sử dụng. Chỉ số này đo lường xem cùng một kết quả có xuất hiện khi lặp lại bài kiểm tra trong các điều kiện tương tự hay không. Nếu đầu ra vẫn nhất quán, phương pháp đó được xem là đáng tin cậy.
Kết hợp lại, các phép đo này giúp xác nhận rằng cả con người và quy trình đều tạo ra kết quả ổn định, đáng tin cậy.

Hình 2. Tổng quan về độ tin cậy giữa các đánh giá viên, trong cùng một đánh giá viên và kiểm tra–kiểm tra lại (Hình ảnh của tác giả)
Tại sao độ tin cậy giữa các đánh giá viên lại quan trọng?#
Trong các dự án AI thị giác quy mô lớn, chất lượng dữ liệu đã gán nhãn ảnh hưởng trực tiếp đến hiệu suất của model. Ngay cả những khác biệt nhỏ trong cách người gán nhãn áp dụng hướng dẫn cũng có thể tạo ra sự không nhất quán, khiến model bị nhiễu trong quá trình huấn luyện. Theo thời gian, điều này có thể dẫn đến dự đoán không chính xác, lãng phí tài nguyên và phải gán nhãn lại với chi phí cao.
Đo lường độ tin cậy giữa các đánh giá viên giúp phát hiện sớm những vấn đề này. Mức độ đồng thuận cao cho thấy các annotator có cùng cách hiểu, tạo ra dataset sạch hơn và đáng tin cậy hơn. Mức độ đồng thuận thấp báo hiệu rằng hướng dẫn, ví dụ hoặc hoạt động đào tạo có thể cần được tinh chỉnh trước khi dự án tiếp tục. Bằng cách đảm bảo những người gán nhãn làm việc đồng bộ, các nhóm có thể xây dựng những model AI học hiệu quả hơn và mang lại kết quả tốt hơn trong các ứng dụng thực tế.
Các yếu tố thực tiễn cần cân nhắc về độ tin cậy giữa các đánh giá viên#
Dưới đây là một số yếu tố thực tiễn quan trọng cần ghi nhớ khi làm việc với nhiều đánh giá viên và hướng đến việc duy trì độ tin cậy giữa các đánh giá viên ở mức cao:
- Tác vụ mơ hồ hoặc chủ quan: Khi việc gán nhãn đòi hỏi diễn giải, chẳng hạn như quyết định một đối tượng bị mờ là người đi bộ hay đánh giá chất lượng hình ảnh, việc có nhiều đánh giá viên giúp đảm bảo các quyết định nhất quán và không bị ảnh hưởng quá mức bởi thiên kiến cá nhân.
- Tác vụ đơn giản, khách quan: Những tác vụ trực tiếp như đếm số ô tô trong một hình ảnh hoặc xác nhận một đối tượng có tồn tại thường chỉ cần một đánh giá viên được đào tạo tốt, vì mức độ đồng thuận thường cao khi quy trình đã được định nghĩa rõ ràng.
- Hướng dẫn gán nhãn rõ ràng: Các hướng dẫn chi tiết, dễ làm theo giúp giảm sự không chắc chắn trong cách áp dụng nhãn, từ đó cải thiện mức độ đồng thuận giữa các đánh giá viên. Hướng dẫn nên nêu rõ các trường hợp ngoại lệ để tránh những cách diễn giải không nhất quán.
- Đào tạo và hiệu chuẩn định kỳ: Ngay cả những đánh giá viên giàu kinh nghiệm cũng có thể dần thay đổi phán đoán theo thời gian. Các buổi đào tạo thường xuyên và hoạt động kiểm tra hiệu chuẩn giúp duy trì tính nhất quán và giảm thiểu thiên kiến của người thực hiện thí nghiệm.
Các phép đo độ tin cậy giữa các đánh giá viên#
Có nhiều cách để đo lường độ tin cậy giữa các đánh giá viên, và lựa chọn tốt nhất phụ thuộc vào loại dữ liệu cũng như tác vụ. Một số phương pháp phù hợp với một đánh giá viên xử lý các câu hỏi đơn giản có hoặc không, trong khi những phương pháp khác được thiết kế cho các tình huống có nhiều đánh giá viên.
Các phương pháp phổ biến bao gồm tỷ lệ đồng thuận, Cohen’s Kappa, Fleiss’ Kappa và hệ số tương quan nội lớp. Mỗi phương pháp đo lường mức độ đồng thuận giữa các đánh giá viên và tính đến khả năng một phần sự đồng thuận có thể xảy ra do ngẫu nhiên.
Cohen’s Kappa và Fleiss’ Kappa#
Cohen’s Kappa là một phương pháp được sử dụng rộng rãi để đo lường độ tin cậy giữa hai đánh giá viên. Phương pháp này tính toán tần suất họ đồng thuận trong một tác vụ, đồng thời hiệu chỉnh khả năng một phần sự đồng thuận có thể xảy ra do ngẫu nhiên. Điểm số nằm trong khoảng từ -1 đến 1, trong đó 1 thể hiện sự đồng thuận hoàn hảo và 0 có nghĩa là mức đồng thuận không tốt hơn việc đoán ngẫu nhiên.
Tương tự, Fleiss’ Kappa được sử dụng khi có hơn hai đánh giá viên tham gia. Phương pháp này cung cấp một điểm số tổng thể thể hiện mức độ nhất quán của cả nhóm. Cả hai phương pháp đều được dùng cho các tác vụ có những danh mục xác định, chẳng hạn như gán nhãn hình ảnh hoặc gắn thẻ cảm xúc. Chúng dễ tính toán và được hầu hết các công cụ annotation hỗ trợ.
Tỷ lệ đồng thuận và hệ số tương quan nội lớp (ICC)#
Một cách khác để đo lường độ tin cậy giữa các đánh giá viên là tỷ lệ đồng thuận, tính phần trăm số lần các đánh giá viên đưa ra cùng một quyết định. Tuy đơn giản khi sử dụng, phương pháp này không tính đến sự đồng thuận có thể xảy ra do ngẫu nhiên.
Trong khi đó, hệ số tương quan nội lớp là một phương pháp nâng cao được sử dụng cho dữ liệu liên tục hoặc dữ liệu dựa trên thang đo. Phương pháp này đo lường mức độ nhất quán của các đánh giá giữa nhiều đánh giá viên và thường được áp dụng trong nghiên cứu liên quan đến điểm số, phép đo hoặc các loại dữ liệu khác ngoài những danh mục cố định.
Ví dụ và ứng dụng của độ tin cậy giữa các đánh giá viên#
Giờ đây, khi đã hiểu rõ hơn về cách đo lường độ tin cậy giữa các đánh giá viên, hãy cùng tìm hiểu cách sử dụng các phương pháp này trong những ứng dụng thực tế.
Độ tin cậy giữa các đánh giá viên trong annotation ảnh y tế#
Đối với ảnh y tế, ngay cả những khác biệt nhỏ trong cách diễn giải cũng có thể dẫn đến thay đổi đáng kể trong kết quả. Ví dụ, các bác sĩ X-quang thường được yêu cầu xác định những mẫu hình tinh vi, mơ hồ hoặc khó định nghĩa. Khi các mẫu hình đó trở thành dữ liệu huấn luyện cho hệ thống AI, mức độ rủi ro sẽ cao hơn. Nếu các chuyên gia gán nhãn khác nhau cho cùng một bản quét, model có thể học sai mẫu hình hoặc hoàn toàn không học được.
Độ tin cậy giữa các đánh giá viên giúp các nhóm xử lý loại dữ liệu này đánh giá mức độ nhất quán thực sự trong phán đoán của chuyên gia. Ví dụ, trong một nghiên cứu gần đây tập trung vào ảnh chụp OCT võng mạc, hai đánh giá viên đã gán nhãn 500 hình ảnh.
Mức độ đồng thuận cao đối với các đặc điểm rõ ràng như drusen (các lắng đọng màu vàng bên dưới võng mạc), với điểm kappa là 0,87. Tuy nhiên, đối với các yếu tố khó định nghĩa hơn như ổ tăng phản xạ (các đốm nhỏ, sáng quan sát được trong ảnh chụp võng mạc), điểm số giảm xuống còn 0,33. Điều này cho thấy các đặc điểm rõ ràng và được định nghĩa tốt hơn thường tạo ra phán đoán nhất quán hơn giữa các chuyên gia, trong khi những đặc điểm mơ hồ tạo ra nhiều dư địa hơn cho việc diễn giải.

Hình 3. Ví dụ về nhãn cho các đặc điểm khác nhau liên quan đến bệnh võng mạc (Nguồn)
Dataset xe tự hành và độ tin cậy giữa các đánh giá viên#
Việc huấn luyện các model AI cho hệ thống lái xe tự hành phụ thuộc vào các nhãn chính xác và nhất quán trong nhiều điều kiện đường sá. Những người gán nhãn làm việc trong các dự án như vậy thường được yêu cầu xác định người đi bộ, phương tiện, biển báo giao thông và vạch làn đường, thường trong điều kiện thiếu sáng hoặc cảnh đông đúc.
Những quyết định này định hình cách model học cách phản ứng trong các môi trường thực tế khắc nghiệt. Độ tin cậy giữa các đánh giá viên giúp các nhóm kiểm tra xem những nhãn đó có được áp dụng theo cùng một cách giữa các annotator hay không.

Hình 4. Quan sát những bất đồng trong annotation (Nguồn)
Vượt ra ngoài độ tin cậy giữa các đánh giá viên: Các biện pháp đảm bảo chất lượng khác#
Mặc dù đo lường độ tin cậy giữa các đánh giá viên là một bước quan trọng trong việc xây dựng một giải pháp AI, đây chỉ là một phần của quy trình đảm bảo chất lượng rộng hơn. Dưới đây là một số biện pháp khác có thể giúp cải thiện chất lượng dữ liệu trong các nhóm và dự án:
- Hướng dẫn annotation rõ ràng: Hướng dẫn nên giải thích chính xác cách áp dụng nhãn để mọi người cùng làm việc theo một tiêu chuẩn.
- Đào tạo và hiệu chuẩn: Các buổi đào tạo thường xuyên giúp annotator duy trì sự thống nhất, đồng thời tạo cơ hội để họ đặt câu hỏi và điều chỉnh cách xử lý các trường hợp ngoại lệ.
- Kiểm tra chất lượng liên tục: Việc kiểm tra ngẫu nhiên và các ví dụ chuẩn vàng có thể phát hiện sớm lỗi và duy trì chất lượng cao khi dự án mở rộng.
- Giải quyết bất đồng: Khi các annotator không đồng thuận, cần có một quy trình rõ ràng để xem xét những trường hợp đó và đưa ra quyết định cuối cùng.
- Đội ngũ annotator đa dạng: Việc có sự tham gia của những người đến từ các nền tảng khác nhau có thể giảm thiên kiến và cải thiện mức độ dataset phản ánh sự đa dạng trong thế giới thực.
Những điểm chính#
Độ tin cậy giữa các đánh giá viên đo lường mức độ nhất quán trong cách mọi người áp dụng nhãn hoặc đưa ra quyết định. Các phương pháp như Cohen’s Kappa, Fleiss’ Kappa và ICC giúp định lượng mức độ đồng thuận đó. Với hướng dẫn rõ ràng, hoạt động đào tạo và kiểm soát thiên kiến, annotation đáng tin cậy sẽ dẫn đến dữ liệu tốt hơn và kết quả model tốt hơn.
Tham gia cộng đồng của chúng tôi và khám phá repository GitHub của chúng tôi để tìm hiểu thêm về AI. Nếu bạn muốn bắt đầu dự án AI thị giác của riêng mình, hãy xem các tùy chọn cấp phép của chúng tôi. Bạn cũng có thể tìm hiểu cách AI trong chăm sóc sức khỏe và AI thị giác trong bán lẻ đang tạo ra tác động bằng cách truy cập các trang giải pháp của chúng tôi.









