Ultralytics YOLO27:
指南

神经符号 AI 新兴领域简介

探索神经符号 AI 如何结合学习与逻辑,构建能够理解上下文并提供更透明、可解释决策的系统。

ABAbirami Vina9 min read
神经符号 AI 将神经网络与推理相结合

如今,得益于人工智能(AI)的快速发展以及计算能力日益普及,先进 AI 模型的发布速度比以往任何时候都快。事实上,AI 正在推动众多行业实现有意义的创新。

例如,在医疗领域,AI 系统正被用于辅助执行医疗影像分析等任务,以实现早期诊断。然而,与任何技术一样,AI 也存在局限性。

其中一个主要问题是透明度。例如,一个目标检测模型可能会准确定位 MRI 脑部扫描中的肿瘤,但人们很难理解模型是如何得出这一结论的。这种缺乏可解释性的情况使医生和研究人员更难完全信任或验证 AI 的结果。

这正是新兴的神经符号 AI 领域受到越来越多关注的原因。神经符号 AI 将深度学习的模式识别优势与符号 AI中结构化、基于规则的推理结合起来。其目标是创建能够做出准确预测,同时也能以人类可以理解的方式解释其推理过程的系统。

本文将探讨神经符号人工智能的工作原理,以及它如何将学习与推理结合起来,构建更加透明、能够理解上下文的系统。让我们开始吧!

神经符号 AI 的两面:学习与推理#

在深入了解神经符号 AI 之前,我们先仔细看看它所结合的两个子领域:深度学习和符号 AI。

深度学习专注于识别数据中的模式,而符号 AI 则利用规则、逻辑或常识来推理和解决问题。两者各有优势,但也存在局限。通过将它们结合起来,神经符号 AI 可以创建既能从数据中学习,又能更清晰地解释决策的系统。

深度学习概览#

深度学习是机器学习的一个分支,它使用人工神经网络,这些网络的设计灵感在一定程度上来源于大脑处理信息的方式。这些网络通过分析大量数据并调整内部连接来提升性能,从而实现学习。

这使它们无需为每种情况手工编写规则,就能识别图像、声音和文本中的模式。因此,深度学习非常适合图像识别、语音处理和语言翻译等以感知为重点的任务。

一个很好的例子是经过训练、能够分割图像中对象的计算机视觉模型。只要有足够多的标注示例,它就能学会在实时交通画面中区分道路、车辆和行人。

然而,尽管深度学习模型具有很高的准确率,却往往难以清晰解释自己是如何得出特定结果的。这一挑战通常被称为黑盒问题,使用户更难理解或验证模型的决策,尤其是在医疗或金融等敏感领域。它之所以重要,是因为负责任的 AI 需要透明度、信任,以及理解模型为何做出某项预测的能力。

探索符号 AI#

符号 AI 采用更加结构化的智能与决策方法。它使用符号表示知识,并应用逻辑规则处理这些知识,这类似于我们利用推理和语言解决问题的方式。推理过程中的每一步都经过定义,因此符号 AI 的决策具有透明性,也更易于解释。

符号知识尤其适用于遵循清晰且定义明确规则的任务,例如规划、调度或管理结构化知识。然而,面对非结构化数据或无法整齐归入预定义类别的情况时,符号 AI 往往表现不佳。

符号方法的一个常见应用例子是早期的国际象棋程序。它们遵循手工编写的规则和固定策略,而不是从过去的棋局中学习或适应不同的对手。因此,它们的棋局表现往往僵化且容易预测。

AI 的结构及其子领域概览

图 1:AI 的结构及其子领域概览。(图片由作者提供)

什么是神经符号 AI?#

在 2010 年代,随着深度学习得到更广泛的应用,研究人员开始寻找超越简单模式识别、转而理解关系和上下文的方法。这一转变使 AI 模型不仅能够检测场景中的对象(例如猫和垫子),还能够理解这些对象之间的关系,例如识别出猫正坐在垫子上。

然而,这一进展也凸显了一个核心局限。深度学习模型能够非常出色地识别模式,但往往难以解释其推理过程或处理陌生情况。对推理能力的重新关注,使研究人员重新回到了一个自 20 世纪 80 年代以来就已存在的领域:神经符号 AI。

神经符号 AI 将深度学习与符号 AI 结合起来。它使模型能够像深度学习一样从示例中学习,同时也能像符号 AI 一样应用逻辑和推理。

简单来说,神经符号 AI 能够识别信息、理解上下文,并更清晰地解释其决策。这种方法让我们更接近构建行为更加可靠、更像人类的 AI 系统。

理解神经符号 AI

图 2:理解神经符号 AI(图片由作者提供)

神经符号 AI 的基本工作原理#

神经符号架构在单一框架内将学习与推理结合起来。它通常包含三个主要部分:用于解释原始数据的神经感知层、用于应用逻辑的符号推理层,以及用于连接两者的集成层。接下来,我们将仔细了解每一层。

神经感知层#

神经感知组件处理图像、视频、文本或音频等非结构化数据,并将其转换为系统可以处理的内部表示。它通常使用深度学习模型检测输入中的模式并识别对象或特征。在这一阶段,系统能够识别数据中存在的内容,但还不能对其含义、关系或上下文进行推理。

以下是该层使用的一些常见深度学习模型类型:

  • 卷积神经网络 (CNNs):这是一类用于处理图像等网格状数据的神经网络。CNNs 使用卷积滤波器扫描图像,检测边缘、纹理和形状等模式。通过堆叠这些模式,它们能够学会识别汽车、水果和人等对象。
  • Transformer:Transformer 是用于理解输入不同部分之间关系的模型。它们不必严格按照顺序读取信息,而是可以同时查看数据的多个部分,并判断哪些部分最重要。这有助于它们理解文本、图像或两者中的上下文。得益于这种灵活性,Transformer 是大多数现代语言模型和许多视觉语言系统背后的核心架构。
  • 循环神经网络 (RNNs):这类模型用于分析语音或时间序列信号等序列数据。它会保留先前输入的记忆,因此其预测可以考虑随时间变化的上下文。

最终,这些神经模型会从原始数据中提取并表示有意义的特征。随后,这些输出将成为符号推理层的输入,由该层解释系统检测到的内容并进行推理。

符号推理层#

符号推理层接收神经感知层产生的信息,并使用逻辑理解这些信息。它不只是处理模式,还依赖规则、知识图谱、知识库和本体等内容(本体是对概念及其相互关系的结构化描述)。这些内容帮助系统理解不同元素如何组合,以及在特定情况下哪些操作是合理的。

例如,在自动驾驶汽车中,神经感知层可能会从摄像头画面中识别出红色交通信号灯。随后,符号推理层可以应用如下规则:“如果信号灯为红色,车辆必须停车。”由于推理基于清晰的规则,系统的决策更易于解释和验证,这一点在安全与问责十分重要的场景中尤为关键。

集成层#

集成层连接神经感知层和符号推理层,确保学习与推理协同运行。在一个方向上,它会将神经模型的输出(例如检测到行人)转换为描述对象及其属性的符号表示。

在另一个方向上,它会获取符号规则(例如“如果人行横道上有行人,车辆必须停车”),并将其转换为引导神经模型的信号。这可能包括突出显示图像中的相关区域、影响注意力,或塑造模型的决策路径。

这种双向交换形成了反馈回路。神经侧从符号规则中获得结构和可解释性,而符号侧则可以根据现实世界数据更有效地适应。逻辑神经网络 (LNNs) 等技术通过将逻辑约束直接嵌入神经架构,帮助实现这种交互。

通过以这种方式连接感知与推理,神经符号 AI 能够做出既准确又更易于理解的决策。许多研究人员认为,这种方法是迈向更可靠、更符合人类价值观的 AI 的有希望的一步,也可能为未来朝着通用人工智能 (AGI)发展奠定基础。

神经符号 AI 的应用#

现在我们已经更好地了解了神经符号 AI 是什么以及它如何工作,接下来看看它在现实世界中的一些应用场景。

让驾驶更安全:从看见行人到理解行人#

自动驾驶汽车需要理解周围环境才能安全运行。它们使用计算机视觉等技术来检测行人、车辆、车道线和交通标志。

虽然深度学习模型可以准确识别这些对象,但它们并不总能理解这些对象在上下文中的含义,或它们在现实场景中彼此之间的关系。例如,神经模型可能识别出人行横道上的行人,却无法判断对方是准备过马路,还是只是站在那里等待。

神经符号 AI 试图通过让自动驾驶车辆结合视觉识别与逻辑推理来弥合这一差距,使车辆能够解释场景,而不只是识别对象。近期 AI 研究表明,将神经感知与符号规则结合起来的系统可以改善行人行为预测

在这些系统中,神经组件会分析行人的姿势、运动和位置等视觉线索。随后,符号组件应用逻辑规则,考虑行人是否靠近人行横道、当前交通信号表示什么等因素。

通过结合这两种视角,神经符号系统能够完成的不只是检测行人。它可以合理预测行人是否可能过马路,并解释自己为何做出这一决策。这将使自动驾驶车辆的行为更加安全、透明。

利用神经符号 AI 基于观察到的行人行为进行预测

图 3:利用神经符号 AI 基于观察到的行人行为进行预测。(来源

视觉问答中的逻辑解释#

神经符号 AI 的另一个重要应用是视觉问答 (VQA)。VQA 系统旨在回答有关图像的问题。

它将大型语言模型 (LLMs) 与视觉模型结合起来执行多模态推理,将系统看到的内容与理解的内容结合起来。例如,如果向 VQA 系统展示一张图像并询问“杯子在桌子上吗?”,它不仅要识别对象,还要理解对象之间的关系。它需要判断场景中的杯子是否确实位于桌面上。

近期一项研究展示了神经符号 AI 如何通过将神经感知与符号推理相结合来增强 VQA。在提出的系统中,神经网络首先分析图像,识别对象及其属性,例如颜色、形状或大小。

随后,符号推理组件应用逻辑规则来解释这些对象之间的关系并回答问题。如果问题是“场景中有多少个灰色圆柱体?”,神经部分会识别所有圆柱体及其颜色,符号部分则根据条件筛选并统计符合要求的对象。

需要抽象知识和逻辑的 VQA 场景示例

图 4:需要抽象知识和逻辑的 VQA 场景示例。(来源

这类研究展示了神经符号 VQA 如何超越简单地提供答案。由于模型可以展示得出结论所经历的步骤,它支持可解释 AI,让系统能够以人们可以理解的方式做出预测并解释其推理过程。

神经符号 AI 的优缺点#

以下是使用神经符号 AI 的一些主要优势:

  • **更强的推理能力:**与纯深度学习模型不同,神经符号 AI 可以执行需要多步推理、规划、遵循规则以及处理结构化知识领域的任务,而这些正是符号 AI 的传统优势。
  • **适应性:**由于能够在训练内容之外进行逻辑推理,这些系统在处理新的或未见过的任务时表现良好。它们不只是记忆数据,还能理解关系和模式。
  • **对噪声和歧义的鲁棒性:**当数据存在噪声、不完整或含义不明确时,逻辑约束有助于防止错误。推理层可以强制执行规则,从而引导或纠正神经预测。

尽管神经符号 AI 具有潜力,但它仍在不断发展,也面临一些实际挑战。以下是它的一些主要局限:

  • **集成复杂性:**虽然这种混合框架具有很强的可解释性,但设计能够融合感知与推理的算法仍然充满挑战。
  • **可扩展性:**处理大型知识图谱或复杂规则集时,符号推理可能变得缓慢或计算成本高昂。这会使自动驾驶、视频处理或大规模知识推理等实时应用更难高效部署。
  • **推理鲁棒性:**如果符号规则过于僵化,系统可能难以应对含糊不清或不可预测的现实场景。在灵活学习与可靠推理之间取得平衡仍是一项持续的挑战。

要点总结#

神经符号 AI 是构建新型 AI 系统的重要一步,这些系统不仅能够感知世界,还能对世界进行推理并解释自己的决策。传统深度学习系统主要依赖从数据中学习的模式,而神经符号 AI 则将统计学习与结构化逻辑和知识结合起来。它并不是要取代深度学习,而是在其基础上进一步发展,让我们距离构建能够以更像人类的方式理解和推理的 AI 又近了一步。

加入我们的社区,探索我们的 GitHub 代码仓库。查看我们的解决方案页面,了解AI 在农业中的应用以及计算机视觉在医疗领域的应用。了解我们的许可选项,开始构建你的视觉 AI 项目!

Explore solutions

用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅