YOLO Vision 2026:
指南

评估者间信度:定义、示例和计算

了解评估者间信度、Cohen's Kappa、ICC、评估者培训和一致百分比。了解这些统计量如何确保研究和数据分析中观察者之间的一致性和认同度。

ABAbirami Vina5 min read
理解数据标注中的评估者间信度

构建 AI 模型时,数据质量与其背后的算法同样重要。每当多人对同一数据进行标注或审核时,分歧几乎不可避免。这一点适用于许多领域,包括研究、医疗保健和教育。

尤其是在计算机视觉领域——这是一个涉及训练 Ultralytics YOLO11 等模型来解读图像或视频等视觉数据的 AI 分支——带标注的示例发挥着关键作用。如果这些标注不一致,计算机视觉模型可能难以学习正确的模式。

评定者间信度(IRR)衡量不同个体或标注者在一项任务上的一致程度。它有助于监控一致性,并发现培训、指南或解读方面的不足。这对于自定义模型训练尤其重要,因为 AI 模型是使用特定数据、针对特定目的构建的。

本文将介绍评定者间信度的含义、测量方法,以及如何在实际项目中加以改进。现在开始吧!

什么是评定者间信度?#

评定者间信度衡量两名或更多人员(也称为评定者)在标注、评分或审核相同内容时达成一致的频率。它用于检查不同评定者使用给定标准时的一致程度。评定者之间的高度一致性意味着任务定义明确且易于理解。

这一概念广泛应用于不同领域。根据所在领域的不同,它也有不同的名称,例如评定者间一致性、观察者间信度或编码员间信度。不过,其基本原则保持不变。

在视觉 AI 中,评定者间信度是数据标注流程的重要组成部分。训练计算机视觉模型通常需要标注包含大量图像或视频帧的数据集,因此多名 AI 开发者会共同处理同一份数据。

为了获得准确结果,他们必须遵循相同的标注指南。例如,在标注动物时,所有人都需要明确什么算作狗、如何在狗的周围绘制边界框,以及对于模糊对象应该标注还是忽略。

了解评定者间信度

图 1. 了解评定者间信度(图片由作者提供)

评定者间信度、评定者内信度与重测信度#

当人员参与数据标注或评分时,需要考虑三种主要的信度类型。每种类型都有不同的用途,用于衡量结果的一致程度。下面分别进行介绍:

  • **评定者间信度:**评定者间信度关注执行同一任务的不同人员之间的一致程度。当项目涉及多名标注者时,例如图像标注、情感分析或医疗审核,这一指标尤其有用。

  • **评定者内信度:**它将重点转向单个人。评定者内信度检查评定者在不同时间重复执行同一任务时是否保持一致。如果标注变化过大,可能是指南不明确或任务缺乏清晰度所致。

  • **重测信度:**重测信度关注的不是标注者,而是所使用的工具或方法。它衡量在相似条件下重复测试时是否会得到相同结果。如果输出保持一致,则认为该方法具有可靠性。

综合来看,这些指标有助于确认人员和流程都能产生稳定、可信的结果。

评定者间信度、评定者内信度和重测信度概览

图 2. 评定者间信度、评定者内信度和重测信度概览(图片由作者提供)

为什么评定者间信度很重要?#

在大规模视觉 AI 项目中,标注数据的质量会直接影响模型的表现。即使标注者应用指南时存在细微差异,也可能引入不一致性,使模型在训练过程中产生混淆。随着时间推移,这可能导致预测不准确、资源浪费,以及需要耗费高昂成本重新标注。

测量评定者间信度有助于及早发现这些问题。高度一致性意味着标注者达成了统一,从而生成更干净、更可靠的数据集。一致性较低则表明,在项目继续推进前,可能需要改进说明、示例或培训。通过确保标注者协同工作,团队可以构建学习效率更高、在实际应用中表现更好的 AI 模型。

评定者间信度的实践注意事项#

在与多名评定者合作并努力保持较高评定者间信度时,以下是一些需要注意的关键实践事项:

  • **含糊或主观的任务:**当标注涉及解读时,例如判断模糊对象是否为行人,或评估图像质量,让多名评定者参与有助于确保决策一致,并避免受到个人偏见的过度影响。
  • **简单、客观的任务:**像统计图像中的汽车数量,或确认某个对象是否存在这样的直接任务,通常只需要一名训练有素的评定者,因为一旦流程定义清晰,一致性通常就很高。
  • **清晰的标注指南:**详细且易于遵循的说明可以减少标签应用方式上的不确定性,从而提高评定者之间的一致性。指南应明确涵盖边界情况,以避免产生不一致的解读。
  • **定期培训与校准:**即使是经验丰富的评定者,随着时间推移也可能逐渐改变判断标准。定期培训和校准检查有助于保持一致性,并最大限度地减少实验者偏差。

评定者间信度的测量方法#

评定者间信度有多种测量方法,最佳选择取决于数据和任务的类型。有些方法适用于由单名评定者处理简单的是非题,另一些方法则针对涉及多名评定者的情况。

常见方法包括一致率、Cohen’s Kappa、Fleiss’ Kappa 和组内相关系数。每种方法都会测量评定者之间的一致程度,并考虑部分一致性可能由偶然因素造成的情况。

Cohen’s Kappa 与 Fleiss’ Kappa#

Cohen’s Kappa 是一种广泛使用的、用于测量两名评定者之间评定者间信度的方法。它会计算两人在任务上的一致频率,同时校正部分一致性可能由偶然因素造成的情况。分数范围为 -1 到 1,其中 1 表示完全一致,0 表示一致程度不高于随机猜测。

同样,Fleiss’ Kappa 用于涉及两名以上评定者的情况。它会提供一个总体分数,反映整个群体的一致程度。这两种方法都适用于具有固定类别的任务,例如标注图像或标记情绪。它们易于计算,并且大多数标注工具都支持。

一致率与组内相关系数(ICC)#

测量评定者间信度的另一种方法是一致率,即计算评定者做出相同决定的百分比。虽然这种方法简单易用,但它不会考虑可能由偶然因素造成的一致性。

与此同时,组内相关系数是一种更高级的方法,用于连续数据或基于量表的数据。它衡量多名评定者的评分一致程度,常用于涉及分数、测量值或其他超出固定类别的数据类型的研究。

评定者间信度的示例与应用#

现在我们已经更好地了解了如何测量评定者间信度,下面来看看这些方法如何应用于实际场景。

医学影像标注中的评定者间信度#

医学影像领域,即使解读上的细微差异也可能导致结果发生重大变化。例如,放射科医生经常需要识别细微、含糊或难以定义的模式。当这些模式成为 AI 系统的训练数据时,影响会更加重大。如果专家对同一份扫描结果给出不同标注,模型可能会学习错误的模式,甚至完全无法学习。

评定者间信度有助于处理此类数据的团队评估专家判断的实际一致程度。例如,在最近一项专注于视网膜 OCT 扫描的研究中,两名评定者对 500 张图像进行了标注。

对于玻璃膜疣(视网膜下方的黄色沉积物)等清晰特征,一致性较高,kappa 分数为 0.87。但对于高反射灶(视网膜扫描中可见的小而明亮的斑点)等较难定义的元素,分数降至 0.33。这表明,越清晰、定义越明确的特征,越容易产生一致的专家判断,而含糊的特征则会留下更多解读空间。

与视网膜疾病相关的不同特征的标注示例

图 3. 与视网膜疾病相关的不同特征的标注示例(来源

自动驾驶数据集与评定者间信度#

自动驾驶系统训练 AI 模型,取决于在各种道路条件下获得准确且一致的标注。处理此类项目的标注者通常需要识别行人、车辆、交通标志和车道线,而且场景往往光线较差或十分拥挤。

这些决策会影响模型学习如何应对严苛的现实环境。评定者间信度使团队能够检查不同标注者是否以相同方式应用这些标签。

查看标注分歧

图 4. 查看标注分歧(来源

超越评定者间信度:其他质量保证措施#

虽然测量评定者间信度是构建AI 解决方案的重要步骤,但它只是更广泛质量保证流程的一部分。以下是一些有助于在团队和项目中提升数据质量的其他实践:

  • **清晰的标注指南:**说明应准确解释如何应用标签,确保所有人都遵循相同的标准。
  • **培训与校准:**定期培训有助于标注者保持一致,也为他们提供提问和适应边界情况的机会。
  • **持续质量检查:**抽查和黄金标准示例可以及早发现错误,并在项目扩展过程中保持高质量。
  • **分歧解决:**当标注者意见不一致时,应有明确的流程来审核这些情况并做出最终决定。
  • **多元化的标注者群体:**让具有不同背景的人员参与可以减少偏差,并提高数据集对现实世界差异的代表性。

要点总结#

评定者间信度衡量人员应用标签或做出决策时的一致程度。Cohen’s Kappa、Fleiss’ Kappa 和 ICC 等方法有助于量化这种一致性。通过清晰的指南、培训和偏差控制,可靠的标注能够带来更高质量的数据和更好的模型结果。

加入我们的社区,并探索我们的 GitHub 代码仓库,了解更多 AI 相关内容。如果你想启动自己的视觉 AI 项目,可以查看我们的许可选项。你还可以访问我们的解决方案页面,了解 AI 在医疗保健领域的应用零售领域的视觉 AI如何产生影响。

Explore solutions

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅