机器学习中的准确率与精确率及召回率对比
了解机器学习中的准确率、精确率和召回率。探索混淆矩阵、F1 分数,以及如何使用这些重要的评估指标。

机器学习(ML)是人工智能(AI)的一个分支,专注于创建能够从数据中学习的系统。它在许多其他 AI 领域中发挥着核心作用,包括计算机视觉,机器可以在其中解读图像;以及自然语言处理,机器可以在其中理解并生成自然语言。
通常,这类 AI 模型会使用深度学习技术根据数据进行预测。虽然这类系统可能非常有效,但它们并不总能生成正确的预测。有些输出可能是准确的,而另一些则会偏离目标。
了解这些错误是如何产生的,是评估模型表现的重要组成部分。为了衡量性能,我们可以使用模型评估指标。
常见的评估指标包括准确率(整体正确性)、精确率(正类预测的可靠性)和召回率(模型识别实际正类的能力)。它们乍看之下可能很相似,但每个指标关注模型行为的不同方面。
在本文中,我们将深入了解这些 AI 模型性能指标。我们还将探讨它们之间的关系,以及如何根据你的用例选择合适的指标。让我们开始吧!
模型评估指标在机器学习中的重要性#
机器学习模型起初可能看起来运行良好。但如果没有合适的评估指标,就很难了解其结果的准确程度。这些指标为模型评估提供了结构,并帮助回答一个关键问题:对于给定任务,模型的预测是否有用且可靠?
准确率、精确率和召回率等指标为 AI 开发者提供了清晰的方法,用于衡量模型的运行效果。例如,在比较不同模型时,这些指标可以帮助你判断哪个模型在特定任务上的表现最佳。它们有助于评估性能,并指导你选择最符合 AI 项目目标的模型。

图 1。模型训练与评估工作流(来源)
这些指标还使性能比较更加客观。它们不依赖猜测或不完整的观察,而是提供可衡量的洞察,帮助你了解模型在不同情况下的行为。这样一来,它们可以突出在每种场景中最重要的性能方面。
例如,指标的选择通常取决于应用场景。在AI 医疗应用中,召回率很重要,因为目标是尽可能识别更多正类病例,即使有些负类病例被误报也在所难免。相比之下,电子邮件垃圾邮件过滤器可能会优先考虑精确率,以避免将正常邮件错误标记为垃圾邮件。
混淆矩阵:分类指标的基础#
混淆矩阵是一个二乘二表格,是评估 AI 模型的基础。它通过比较实际结果与预测结果(模型给出的答案),将预测组织为四个类别。
这种比较可以详细展示模型的性能。它构成了精确率和召回率等关键评估指标的基础,这些指标直接根据矩阵中的值计算得出。
表格的行表示实际类别,列表示预测类别。每个单元格显示该类别中的结果数量。简单来说,它展示了有多少预测是正确的,以及模型犯了哪些类型的错误。
当数据不平衡时,混淆矩阵尤其有用,也就是说,某些类别的样本数量远多于其他类别。当不同类型的错误带来的代价不同时,它同样很有帮助。
例如,在欺诈检测中,识别欺诈活动至关重要,但错误标记真实交易也可能带来问题。矩阵可以清楚地显示每种错误发生的频率。
混淆矩阵的组成元素#
下面概述混淆矩阵中的不同元素:
- 真正例(TP): 当模型正确预测出一个正类实例时,该实例会被记录为真正例。例如,计算机视觉模型正确地将图像中的车辆分类出来。
- 真负例(TN): 当模型正确识别出一个负类实例时,就会产生真负例。例如,电子邮件分类器将一封普通邮件标记为非垃圾邮件。
- 假正例(FP): 当一个实例实际为负类,而模型错误地将其预测为正类时,就会产生假正例。这也称为 I 类错误,例如欺诈检测系统将一笔有效交易标记为欺诈交易。
- 假负例(FN): 当模型未能检测到正类病例,并错误地将其预测为负类时,就会记录为假负例。这也称为 II 类错误,例如诊断工具未能发现实际患病患者的疾病。

图 2。混淆矩阵的组成元素(来源)
混淆矩阵的可视化表示与解读#
混淆矩阵以网格形式显示。纵轴表示实际类别,横轴表示预测类别。正确预测出现在对角线上,代表真正例和真负例。
错误位于对角线之外,包括假正例和假负例。这种结构便于发现模型的优势与不足。
什么是机器学习中的准确率?#
准确率是最常用的指标之一,用于评估机器学习模型的表现。它衡量模型在所有类别中预测正确的频率。换句话说,它回答了一个简单的问题:在 AI 模型做出的所有预测中,有多少是正确的?
准确率的计算公式是:正确预测的数量(包括真正例和真负例)除以预测总数。准确率计算简单、易于理解,因此常被作为模型评估的起点。
通常,在处理平衡数据集时,准确率是可靠的。然而,在某个类别占据主导地位的不平衡数据集中,准确率往往会产生误导。始终预测多数类的模型可能仍能获得较高的准确率分数,却无法检测出其他少数类。
例如,在一个只有少量图像包含行人的图像数据集中,如果模型对每张图像都预测“没有行人”,它可能仍能获得较高的准确率,但会完全无法检测出实际存在的行人。
这是因为仅凭准确率无法显示模型犯了哪些类型的错误,也无法显示这些错误发生的频率。因此,还需要查看精确率和召回率等指标,才能全面了解 AI 模型的运行效果。
深入理解精确率:减少误报#
精确率是一个关键评估指标,用于衡量模型正类预测的准确性。它回答了这样一个问题:在所有被预测为正类的实例中,有多少是正确的?
精确率的计算公式是:真正例数量除以真正例与假正例之和。当正类预测一旦出错就会带来较高代价时,精确率尤其重要。

图 3。准确率与精确率对比。(来源)
例如,在欺诈检测中,精确率较低的模型可能会将许多有效交易标记为欺诈,从而给用户和支持团队带来不必要的问题。精确率较高的模型可以降低这种风险,因为它能确保被标记的交易更有可能确实是欺诈交易。
高精确率固然很好,但过度关注精确率的模型可能会变得过于挑剔,从而漏掉实际的正类病例。因此,人们通常会同时检查精确率和召回率,以保持性能平衡。
什么是召回率?#
召回率用于衡量模型识别实际正类病例的能力。它也称为敏感度或真正例率,并回答这样一个问题:在所有实际的正类实例中,模型正确检测出了多少?
召回率的计算公式是:真正例数量除以真正例与假负例之和。较高的召回率分数表明,模型捕获了数据中的大多数真实正类病例。
召回率在医疗保健等行业中至关重要,因为未能检测出某种疾病可能会延误治疗,使患者面临风险。即使有些负类病例被错误标记,识别出所有真实病例仍然是首要任务。
然而,只关注召回率的模型可能会产生过多假正例,从而降低精确率并损害模型的整体效率。平衡召回率和精确率对于可靠的 AI 模型性能至关重要。
平衡之道:精确率与召回率的权衡#
精确率和召回率通常朝相反方向变化。一个指标提高时,另一个可能下降。这种权衡是机器学习任务中的常见挑战。
高精确率模型只有在确信某个实例为正类时才会进行正类预测。这会减少误报,但也可能漏掉真实正类,从而降低召回率。试图捕获所有正类的模型会提高召回率,但也会面临更多误报的风险,导致精确率下降。
当你调整模型的决策阈值时,这种权衡会更加明显。阈值是系统将分数或概率转换为操作或标签时所使用的界限。降低阈值会使系统更频繁地采取正向操作,这可能提高召回率,但也可能降低精确率。提高阈值则会产生相反的效果:模型预测的正类更少,精确率提高,但召回率通常会下降。
假设你正在进行垃圾邮件检测。模型必须在允许垃圾邮件进入收件箱的风险与拦截正常邮件的风险之间取得平衡。严格的过滤器可能仍会漏掉一些垃圾邮件,而更宽松的过滤器则可能误拦截正常邮件。正确的平衡取决于用例以及每种错误所带来的代价。
精确率–召回率曲线的重要性#
精确率-召回率曲线或 PR 曲线展示了模型决策阈值变化时精确率和召回率的变化情况。每个点代表二者之间不同的权衡。PR 曲线对于不平衡数据集尤其有用,因为其中一个类别的出现频率要低得多。
与受试者工作特征(ROC)曲线相比,它还能提供更有意义的洞察;ROC 曲线同样展示模型在不同决策阈值下区分正类和负类的能力。精确率和召回率都很高的模型,其精确率–召回率曲线会保持在右上角附近,这通常是理想状态。
F1-score 简介:用于实现平衡的综合指标#
F1-score提供了一个单一数值,用于体现精确率和召回率之间的平衡。F1-score 的计算方式是:精确率与召回率乘积的两倍除以精确率与召回率之和。当假正例和假负例都很重要时,或者使用不平衡数据集、需要平衡视角来评估模型性能时,F1-score 都非常有用。

图 4。使用精确率和召回率计算 F1-score(来源)
超越准确率、精确率和召回率#
准确率、精确率和召回率虽然至关重要,但根据模型类型和数据集特征,其他指标也能提供额外洞察。
下面是一些常用指标,可以帮助评估性能的不同方面:
- 特异度: 衡量模型识别实际负类的能力。当避免假正例很重要时,特异度非常有用。
- AUC: AUC,即曲线下面积,可以用一个分数反映模型区分类别的能力。
- 对数损失: 对数损失用于衡量模型进行预测时的置信程度,并会对高置信度下做出的错误预测施加更大惩罚。这里的置信度是指模型对其预测结果的确定程度。
- 多标签评估: 在多标签任务中,指标会在各个标签之间取平均,以反映模型的整体性能。
在计算机视觉中应用准确率、精确率和召回率#
现在我们已经更清楚地理解了准确率、精确率和召回率,下面来看看如何在计算机视觉中应用这些指标。
Ultralytics YOLO11等计算机视觉模型支持目标检测等任务。在目标检测中,模型会识别图像中有哪些物体,并使用边界框定位它们。每个预测结果都包含物体标签及其位置,因此评估过程比简单检查标签是否正确更加复杂。

图 5。使用 Ultralytics YOLO11 进行目标检测的示例。(来源)
考虑一个零售应用:通过摄像头自动跟踪货架上的商品。目标检测模型可能会识别麦片盒、汽水罐或水瓶等商品,并标记它们的位置。
在这种情况下,精确率告诉我们检测出的商品中有多少是正确的。高精确率意味着系统可以避免产生假正例,例如将阴影或背景物体标记为商品。召回率则显示模型成功检测出货架上多少真实商品。高召回率意味着漏检的商品更少,这对于准确的库存统计至关重要。
准确率仍然可以提供整体正确性的衡量方式,但在这种场景中,即使漏掉少量商品或检测出不存在的商品,也可能对库存管理产生重大影响。因此,开发者会同时查看精确率、召回率和准确率,以确保系统在实际应用中既可靠又实用。
准确率、精确率和召回率:关键要点#
准确率、精确率和召回率分别展现了机器学习模型性能的不同方面。只依赖单一指标可能会产生误导。
混淆矩阵、精确率–召回率曲线和 F1-score 等工具与指标有助于揭示各种权衡,并指导如何改进 ML 模型。通过为特定 AI 解决方案选择合适的指标组合,你可以确保模型在实际应用中准确、可靠且有效。
探索我们不断壮大的社区!访问我们的 GitHub 代码仓库,进一步了解 AI。准备开始你的计算机视觉项目了吗?看看我们的许可选项。访问我们的解决方案页面,了解农业中的 AI和机器人领域的视觉 AI!









