探索集成学习及其在 AI 和 ML 中的作用
了解集成学习如何通过装袋、提升和堆叠等技术提升 AI 模型性能,从而提供更准确、更稳定的预测。

如需直观了解本文涵盖的概念,请观看下方视频。
推荐引擎和欺诈检测系统等 AI 创新依赖机器学习算法和模型,根据数据进行预测和决策。这些模型可以识别模式、预测趋势,并帮助自动化复杂任务。
然而,单个模型可能难以捕捉现实世界数据中的所有细节。它可能在某些情况下表现良好,但在其他情况下表现不佳,例如欺诈检测模型漏检新型交易。
在构建和部署机器学习模型时,AI 工程师经常会遇到这一局限。一些模型会因过度贴合训练数据而过拟合,而另一些模型则会因遗漏重要模式而欠拟合。集成学习是一种AI 技术,通过将多个模型(称为基学习器)组合成一个更强大的系统来应对这些挑战。
你可以把它想象成一组专家协作解决问题。在本文中,我们将探讨什么是集成学习、它如何工作,以及它可以应用于哪些领域。让我们开始吧!
什么是集成学习?#
集成学习是指一组将多个模型组合起来解决同一问题并生成单一改进结果的技术。它既可以应用于监督学习(模型从带标签的数据中学习),也可以应用于无监督学习(模型从无标签的数据中发现模式)。
集成方法不依赖单个模型进行预测,而是使用多个模型,让每个模型以自己的方式分析数据。将它们的输出组合后,结果通常比任何单个模型独立实现的结果更加准确、稳定且具有更好的泛化能力。
你可以将其与一组分析师共同解决同一个问题进行比较。每位分析师或每个模型对数据的解读方式都不同。
其中一个可能关注模式,另一个关注异常,还有一个关注上下文。将这些视角汇集起来后,这个团队做出的决策会比任何个人判断更加均衡可靠。
这种方法还有助于解决机器学习中最大的两个挑战:偏差和方差。高偏差模型过于简单,会忽略重要模式;高方差模型则过于敏感,会过度拟合训练数据。通过组合多个模型,集成学习在两者之间取得平衡,从而提升系统在新数据和未见数据上的表现。
了解集成学习的工作原理#
集成中的每个模型都称为基学习器或基模型。根据所使用的集成技术,这些模型可以采用相同类型的算法,也可以混合使用不同算法。
以下是集成学习中使用的不同模型的一些常见示例:
- 决策树:这些模型根据特征值将数据划分为不同分支,从而做出决策。例如,在预测客户是否会购买产品等分类问题中,它们会考虑年龄、收入和浏览历史等因素。
- 神经网络:其设计灵感来自人脑处理信息的方式,是大多数现代 AI 和机器学习模型背后的基础架构。
- 支持向量机 (SVMs):这些算法通过寻找一个称为超平面的最优决策边界来对数据进行分类,使不同类别之间的间隔最大化。换句话说,SVM 会绘制一条尽可能好的线,在分隔不同组别的同时,为它们留出最大的间距。例如,它可以根据词频和结构等模式判断一封电子邮件是否为垃圾邮件。
- 逻辑回归模型:这些模型用于估计概率,通常用于二分类任务。一个典型示例是预测一笔交易属于欺诈交易还是合法交易。
组合后的模型集成通常称为强学习器,因为它整合了基学习器(也称为弱模型)的优势,同时最大限度地减少其弱点。它通过结构化地组合每个模型的预测来实现这一点:在分类任务中使用多数投票,在回归任务中使用加权平均,从而生成更准确的最终结果。

图 1. 集成学习示例(来源)
何时使用集成学习#
在深入了解各种集成学习技术之前,我们先退一步,了解在机器学习或 AI 项目中何时应采用这种方法。
当单个模型难以做出准确或一致的预测时,集成学习最能发挥作用。在数据复杂、嘈杂或不可预测的情况下,也可以使用集成学习。
以下是集成方法特别有效的一些常见情况:
- 模型准确率低:当单个模型的预测不够可靠时,组合多个模型可以显著提高准确率和性能。例如,在信用评分或医学诊断中,即使预测准确率只有小幅提升,也可能带来很大差异。
- 数据嘈杂或不一致:如果数据集包含离群值、错误或随机波动,集成学习可以通过对多个模型进行平均或投票来平滑这些不规则性。
- 需要鲁棒性:集成模型对数据的小幅变化不那么敏感,因此在现实世界输入可能发生变化的生产环境中更加稳定可靠。
- 复杂的预测任务:在图像识别、欺诈检测或时间序列预测等任务中,集成模型能够捕捉比单个模型更多的模式和关系。
它也更容易训练、更易于解释,并且维护速度更快。在使用集成模型之前,务必权衡更高准确率带来的收益,以及它所需的额外时间、计算能力和复杂性。
集成学习技术概览#
接下来,我们来看看集成学习在机器学习项目中的主要应用方式。组合模型有几种核心技术,每种技术都以自己的方式提升性能。最常见的集成方法包括装袋、提升、堆叠和混合。
装袋#
装袋是 bootstrap aggregating 的简称,是一种集成学习方法,通过在数据的不同部分上训练同一模型的多个版本来提高模型的稳定性和准确率。
每个子集都通过一种称为自助采样的过程创建,即随机有放回地选择数据点。这意味着一个数据点被选中后,会在选择下一个数据点之前放回样本池,因此同一个数据点可能出现多次,而其他数据点可能被遗漏。这种随机性确保每个模型都在数据集的略有不同的版本上进行训练。
在推理期间,所有训练好的模型并行运行,对新数据和未见数据进行预测。每个模型根据所学内容生成自己的输出,然后将这些单独的预测组合起来形成最终结果。
对于预测房价或销售额等回归任务,这通常意味着对所有模型的输出取平均值,以获得更平滑的估计。对于判断一笔交易是否为欺诈交易等分类任务,集成方法通常通过多数投票来确定最终类别。
装袋实践:随机森林算法#
决策树是装袋效果良好的一个示例,因为决策树在单个数据集上训练时很容易过拟合。通过在略有不同的样本上训练许多棵树并组合它们的结果,装袋可以减少过拟合并提高可靠性。
考虑一下随机森林算法。它是一个由决策树组成的集成模型,其中每棵树都在训练数据集的随机子集以及特征的随机子集上进行训练。
这种特征随机性有助于确保各棵树之间的相关性较低,并使整体模型更加稳定和准确。随机森林算法可用于图像分类、欺诈检测、客户流失预测、销售预测或房产价格估算。

图 2. 随机森林算法概览(来源)
提升#
提升是另一种集成学习技术,专注于通过依次训练弱学习器(模型)来改进它们,而不是并行训练。提升的核心概念是,每个新模型都从前面模型的错误中学习,逐步改善整体模型性能。
装袋通过对独立模型取平均来降低方差,而提升则通过让每个新模型更加关注早期模型难以处理的困难样本来降低偏差。
由于提升模型是按顺序训练的,因此最终组合其预测的方式与其他集成方法略有不同。每个模型对最终预测的贡献与其在训练期间的性能成正比,准确率更高的模型会获得更大的权重。
对于回归任务,最终结果通常是所有模型预测值的加权和。对于分类任务,算法会组合各模型的加权投票来确定最终类别。这种方法会为更准确的模型赋予更大权重,同时继续从其他模型中学习,从而帮助提升方法构建出强大的整体模型。
以下是一些常见的提升算法类型:
- AdaBoost(自适应提升):这种方法首先训练一个简单模型,例如一棵小型决策树,然后提高被错误分类的数据点的权重。这些权重会让下一个模型更加关注困难样本。经过多次迭代后,各模型相互建立在彼此基础上,其组合预测会形成更强、更准确的结果。例如,AdaBoost 可以提高垃圾邮件检测或人脸识别的准确率。
- 梯度提升:梯度提升不重新调整样本权重,而是训练每个新模型来纠正前面模型产生的残差误差,即实际值与预测值之间的差异。这种迭代方法对销售预测和信用评分等回归及分类任务都很有效。
- XGBoost(极限梯度提升):这一高级版本的梯度提升同时提高了速度和准确率。它使用正则化,在训练期间对过于复杂的模型施加轻微惩罚,使模型专注于有意义的模式,而不是记忆数据。虽然模型仍然按顺序训练,但 XGBoost 在构建树的过程中使用并行化来加快处理速度。它可以在不同 CPU 核心上同时评估许多可能的分割点。这会使训练速度大幅提升,尤其是在处理大型数据集时,同时保持较高的预测性能。

图 3. 使用提升方法训练的基于决策树 (DTB) 分类器进行糖尿病风险预测示例。(来源)
堆叠#
堆叠也称为堆叠泛化,它更进一步,将多个模型的预测结果作为最终模型(称为元学习器)的输入。你可以把它想象成一群专家各自分享意见,然后由最终决策者学习如何权衡这些意见,从而做出尽可能好的判断。
例如,一个模型可能非常擅长发现欺诈,而另一个模型更擅长预测客户流失。元学习器会研究每个模型的表现,并结合它们的优势,做出更准确的最终预测。
混合#
混合与堆叠的工作方式类似,因为它也会组合多个模型的预测来做出最终决策,但采用了更简单、更快速的方法。堆叠会使用交叉验证(将数据划分为多个部分,并在训练和测试之间轮换这些部分,以提高模型可靠性),而混合则会留出一小部分数据,称为留出集。
基模型在剩余数据上进行训练,然后在此前未见过的留出集上进行预测。这会产生两项关键信息:实际答案或真实标签,以及每个基模型做出的预测。
然后,这些预测会传递给另一个模型,称为混合模型或元模型。这个最终模型会研究每个基模型预测的准确程度,并学习以尽可能好的方式将它们组合起来。
由于混合只依赖一次训练集与测试集的划分,而不是多次重复这一过程,因此运行速度更快,也更容易设置。其代价是可供学习的信息略少,因此精确度可能稍低。
评估集成算法#
集成学习的一个重要环节是评估模型在此前未见过的数据上的表现。无论技术多么先进,都必须进行测试,以确保模型具备泛化能力,也就是说,它应当能够在新的现实世界示例上做出准确预测,而不是只记住训练数据。
以下是用于评估 AI 模型的一些常见性能指标:
- 准确率:该指标衡量模型做出的所有预测中,正确预测所占的比例。它可以快速概览整体性能。
- 精确率:它表示被预测为正类的样本中实际为正类的数量。精确率高意味着模型产生的假阳性错误较少。
- 召回率:该指标关注所有实际为正类的案例中,有多少被模型正确识别。它在医疗保健等领域尤其重要,因为漏掉一个正类案例(例如疾病诊断)可能会造成严重后果。
集成学习的现实应用#
到目前为止,我们已经了解了集成学习的工作原理及其背后的技术。现在,让我们看看这种方法正在产生影响的领域。
以下是集成学习常见的一些关键应用领域:
- 数据分析和预测:在商业和分析领域,集成模型通过组合多个模型的洞察,帮助组织做出更好的预测。这会带来更准确的销售预测、更智能的需求规划,以及对客户行为更清晰的理解。
- 二分类:垃圾邮件检测、欺诈防范和医学诊断等任务通常需要在两种可能结果之间进行区分。集成模型有助于减少假阳性和假阴性,这在网络安全和医疗保健等领域尤其关键。
- 回归问题:在预测房价、销售收入或信用风险等连续值时,集成方法能够捕捉数据中的复杂关系。这会带来更精准的预测,从而支持更好的财务和运营决策。
利用集成学习处理超越结构化数据的任务#
虽然集成学习最常用于结构化数据或表格数据(例如包含数值或类别信息的电子表格),但它也可以应用于文本、图像、音频和视频等非结构化数据。
这些数据类型更加复杂,也更难让模型解释,但集成方法有助于提高准确率和可靠性。例如,在计算机视觉中,集成方法可以增强图像分类和目标检测等任务。
通过组合多个视觉模型(例如卷积神经网络 (CNNs))的预测,系统可以更准确地识别对象,并处理光照、角度或背景变化,而这些变化可能会使单个模型产生混淆。
了解 Ultralytics YOLOv5 模型集成#
在计算机视觉中使用集成学习的一个有趣示例,是工程师组合多个目标检测模型来提高准确率。设想一位工程师正在为建筑工地开发安全监控系统,其中光照、角度和物体大小不断变化。
单个模型可能会漏检阴影中的工人,或将运动中的机械设备识别错误。通过使用多个各具优势的模型组成的集成系统,系统会更加可靠,也不容易出现这些错误。
具体来说,Ultralytics YOLOv5等模型与模型集成相得益彰。工程师可以组合不同的 YOLOv5 变体(例如 YOLOv5x 和 YOLOv5l6)来共同进行预测。每个模型都会分析同一图像并生成自己的检测结果,然后对这些结果取平均值,以生成更强大、更准确的最终结果。

图 4. 使用 YOLOv5 检测图像中的对象。(来源)
集成学习的优缺点#
以下是使用集成学习的一些主要优势:
- 对噪声数据的韧性:由于依赖多个模型,集成模型受数据集中的离群值或随机噪声影响较小。
- 更好的泛化能力:集成模型可以减少过拟合,帮助模型在未见数据上表现良好,而不是只记住训练示例。
- 跨算法的灵活性:你可以组合不同类型的模型,例如决策树、神经网络和线性模型,从而利用它们各自的独特优势。
虽然集成学习带来了诸多优势,但也有一些需要考虑的挑战。以下是需要注意的几个因素:
- 更高的计算成本:训练和维护多个模型比单个模型需要更多内存、处理能力和时间。
- 可解释性降低:由于最终输出来自多个模型的组合,因此可能很难理解某个决策为何产生。不过,这取决于所使用的模型,因为使用决策树或支持向量机等具有可解释性的模型时,通常更容易理解结果。
- 集成设计注意事项:构建集成模型需要选择合适的模型组合,并确保它们能够良好协作。不过,在某些情况下,这也可能更简单,因为你不需要分别调整每个模型的超参数。
要点总结#
集成学习展示了组合多个模型如何让 AI 系统更加准确可靠。它有助于减少错误,并提升系统在不同类型任务中的性能。随着机器学习和 AI 不断发展,此类技术正推动 AI 解决方案得到更广泛的应用,并变得更加实用且高性能。
加入不断壮大的社区和GitHub 代码库,进一步了解视觉 AI。探索我们的解决方案页面,了解计算机视觉在农业中的应用和AI 在物流中的应用。查看我们的许可选项,立即开始构建你自己的计算机视觉模型!









