Ultralytics YOLO27:
活动

生成式 AI 正在改变计算机视觉的未来发展方向

了解 YOLO Vision 2024 小组讨论中的精彩见解,探索生成式 AI 如何塑造实时 Vision AI 模型的未来发展方向。

ABAbirami Vina6 min read
YOLO Vision 2024 关于生成式 AI 和 Vision AI 的小组讨论

生成式 AI 是人工智能(AI)的一个分支,它通过从现有数据中学习模式来创建图像、文本或音频等新内容。得益于近期的技术进步,生成式 AI 现在能够生成高度逼真的内容,而且通常可以模拟人类的创造力。

然而,生成式 AI 的影响远不止内容创建。随着 Ultralytics YOLO models 等实时计算机视觉模型不断发展,生成式 AI 也在重新定义视觉数据的处理和增强方式,为现实场景中的创新应用铺平道路。

这项新的技术变革成为 YOLO Vision 2024 (YV24) 讨论中的一个有趣话题。YV24 是由 Ultralytics 主办的年度混合活动,来自 AI 领域的爱好者和行业领袖齐聚一堂,探讨 computer vision 领域的最新突破。本次活动聚焦于创新、效率以及实时 AI 解决方案的未来。

活动的一大亮点是关于 YOLO in the Age of Generative AI 的小组讨论。参与嘉宾包括 Ultralytics 创始人兼 CEO Glenn Jocher、Ultralytics 高级机器学习工程师 Jing Qiu,以及来自清华大学的 Ao Wang。他们探讨了生成式 AI 如何影响计算机视觉,以及构建实用 AI 模型所面临的挑战。

本文将回顾他们讨论中的关键观点,并进一步了解生成式 AI 如何改变 Vision AI。

开发 Ultralytics YOLO 模型#

除了 Glenn Jocher 之外,许多技术精湛的工程师也在开发 Ultralytics YOLO 模型的过程中发挥了重要作用。其中一位是 Jing Qiu,他讲述了自己与 YOLO 意外结缘的经历。他解释说,自己在大学期间开始对 AI 产生兴趣,并投入大量时间探索和学习这一领域。Jing Qiu 回忆道,他通过 GitHub 与 Glenn Jocher 建立联系,并参与了多个 AI 项目。

接着 Jing Qiu 的话题,Glenn Jocher 将 GitHub 形容为“一种不可思议的分享方式——素未谋面的人聚在一起互相帮助,为彼此的工作贡献力量。这是一个很棒的社区,也是开启 AI 之旅的绝佳方式。”

Glenn Jocher 和 Jing Qiu 在 YV24 舞台上发言

图 1. Glenn Jocher 和 Jing Qiu 在 YV24 舞台上发言。

Jing Qiu 对 AI 的兴趣以及他在 Ultralytics YOLOv5 上的工作帮助完善了该模型。随后,他在开发 Ultralytics YOLOv8 的过程中发挥了关键作用,该模型带来了进一步改进。他将这段经历称为一场不可思议的旅程。如今,Jing Qiu 仍在持续改进和开发 Ultralytics YOLO11 等模型。

YOLOv10:针对真实世界性能进行优化#

Ao Wang 从中国远程参加了小组讨论,并介绍自己是一名博士生。起初,他学习的是软件工程,但对 AI 的热情促使他转向计算机视觉和深度学习领域。

他第一次接触著名的 YOLO 模型,是在尝试各种 AI 技术和模型时。YOLO 的速度和准确性给他留下了深刻印象,也促使他深入研究目标检测等 computer vision tasks。最近,Ao Wang 参与了 YOLOv10 的开发,这是 YOLO 模型的一个较新版本。他的研究重点是优化模型,使其速度更快、准确性更高。

生成式 AI 与 Vision AI 的关键区别#

随后,小组开始讨论生成式 AI,Jing Qiu 指出,生成式 AI 和 Vision AI 的用途截然不同。生成式 AI 会创建或生成文本、图像和视频等内容,而 Vision AI 则会分析已经存在的内容,主要是图像。

Glenn Jocher 还强调,规模也是一个显著差异。生成式 AI 模型规模庞大,通常包含数十亿个参数——这些内部设置帮助模型从数据中学习。计算机视觉模型则小得多。他说:“我们拥有的最小 YOLO 模型,大约只有最小 LLM [Large Language Model] 的千分之一大小。所以,是 300 万个参数对比 30 亿个参数。”

YV24 上关于生成式 AI 和 Vision AI 的小组讨论

图 2. YV24 上关于生成式 AI 和 Vision AI 的小组讨论。

Jing Qiu 补充说,生成式 AI 与计算机视觉的训练和部署流程也大不相同。生成式 AI 需要运行在规模庞大、性能强劲的服务器上。另一方面,YOLO 等模型以高效为设计目标,可以在标准硬件上进行训练和部署。这使得 Ultralytics YOLO 模型更加适合现实世界中的应用。

尽管两者有所不同,但这两个领域正开始相互交织。Glenn Jocher 进一步解释说,生成式 AI 正在为 Vision AI 带来新的进步,使模型变得更加智能、高效。

生成式 AI 对计算机视觉的影响#

生成式 AI 发展迅速,这些突破正在影响人工智能的许多其他领域,包括计算机视觉。接下来,让我们一起了解小组讨论中关于这一主题的一些精彩观点。

硬件进步正在推动 AI 创新#

在小组讨论开始不久,Glenn Jocher 解释说,机器学习的理念存在已久,但当时的计算机性能还不足以将其付诸实践。AI 的构想需要更强大的硬件才能成为现实。

过去 20 年中,GPU(GPU)凭借并行处理能力崛起,改变了一切。GPU 让 AI 模型的训练速度更快、效率更高,从而推动深度学习迅速发展。

如今,TPUs (Tensor Processing Units) 等 AI 芯片和经过优化的 GPU 在处理更大、更复杂的模型时,能耗更低。这使 AI 在现实应用中更易于使用,也更具实用价值。

随着每一次新的硬件改进,生成式 AI 和计算机视觉应用都变得更加强大。这些进步让实时 AI 速度更快、效率更高,并为更多行业的应用做好了准备。

生成式 AI 如何塑造目标检测模型#

当被问及生成式 AI 如何影响计算机视觉时,Jing Qiu 表示,transformers——帮助 AI 聚焦于图像中最重要部分的模型——改变了 AI 理解和处理图像的方式。第一个重大进展是 DETR(检测 Transformer),它将这种新方法用于目标检测。DETR 提高了准确性,但也存在性能问题,在某些情况下速度较慢。

为了解决这一问题,研究人员创建了 RT-DETR 等混合模型。这些模型结合了卷积神经网络(CNNs,即能够自动学习并提取图像特征的深度学习模型)和 Transformer,在速度与准确性之间取得平衡。这种方法利用了 Transformer 的优势,同时让目标检测速度更快。

有趣的是,YOLOv10 使用了基于 Transformer 的注意力层(模型中类似聚光灯的部分,用于突出图像中最重要的区域,同时忽略相关性较低的细节),从而提升性能。

Ao Wang 还提到,生成式 AI 正在改变模型的训练方式。掩码图像建模等技术可以帮助 AI 更高效地从图像中学习,减少对大规模人工标注数据集的需求。这使计算机视觉训练速度更快,所需资源更少。

生成式 AI 与 Vision AI 的未来#

小组讨论的另一个关键观点是,生成式 AI 和 Vision AI 可能会结合起来,构建能力更强的模型。Glenn Jocher 解释说,虽然这两种方法各有所长,但将它们结合起来可能会带来新的可能性。

例如,YOLO 等 Vision AI 模型通常会将图像划分为网格,以识别其中的对象。这种基于网格的方法可以帮助语言模型提升同时定位细节和描述细节的能力——这是如今许多语言模型面临的挑战。从本质上说,融合这些技术可能会产生能够准确检测所见内容并清晰解释这些内容的系统。

生成式 AI 和 Vision AI 的未来

图 3. 生成式 AI 和 Vision AI 的未来。图片由作者提供。

要点总结#

生成式 AI 和计算机视觉正在共同发展。生成式 AI 不仅能够创建图像和视频,还能通过带来新的创新理念来改善图像和视频分析,从而使 Vision AI 模型更加准确、高效。

在这场富有洞察力的 YV24 小组讨论中,Glenn Jocher、Jing Qiu 和 Ao Wang 分享了他们对这些技术如何塑造未来的看法。随着 AI 硬件不断改进,生成式 AI 和 Vision AI 将持续发展,并带来更大的创新。这两个领域正携手合作,为日常生活创造更智能、更快速、更实用的 AI。

加入我们的社区,并探索我们的 GitHub 代码库,进一步了解 Vision AI。查看我们的许可选项,开启你的计算机视觉项目。对制造业中的 AI自动驾驶中的计算机视觉等创新感兴趣?访问我们的解决方案页面,了解更多信息。

Explore solutions

用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅