使用 Hugging Face 的开源工具为 CV 项目提供动力
加入我们,一起回顾 YOLO Vision 2024 的主题演讲,了解 Hugging Face 的开源工具如何推动 AI 开发发展。

选择合适的算法只是构建有影响力的计算机视觉解决方案的一部分。AI 工程师通常需要处理大型数据集、针对特定任务微调模型,并优化 AI 系统以实现真实环境中的性能。随着 AI 应用得到更快速的采用,对简化这些流程的工具的需求也在不断增长。
在由 Ultralytics 主办的年度混合活动 YOLO Vision 2024 (YV24) 上,AI 专家和技术爱好者齐聚一堂,探索计算机视觉领域的最新创新。活动引发了围绕多个主题的讨论,例如如何加快 AI 应用开发速度。
活动的一大亮点是关于 Hugging Face 的主题演讲。Hugging Face 是一个开源 AI 平台,可简化模型训练、优化和部署流程。Hugging Face 的机器学习工程师 Pavel Iakubovskii 分享了其工具如何改进计算机视觉任务的工作流程,例如检测图像中的对象、将图像分类到不同组别中,以及无需针对特定示例进行先前训练即可进行预测(零样本学习)。
Hugging Face Hub 托管并提供各种 AI 和计算机视觉模型的访问权限,例如 Ultralytics YOLO11。本文将回顾 Pavel 的演讲要点,并了解开发者如何使用 Hugging Face 的开源工具快速构建和部署 AI 模型。

图 1。Pavel 在 YV24 舞台上。
Hugging Face Hub 支持更快的 AI 开发#
Pavel 在演讲开始时介绍了 Hugging Face,这是一个开源 AI 平台,提供适用于各种应用的预训练模型。这些模型面向 AI 的不同分支,包括自然语言处理(NLP)、计算机视觉和多模态 AI,使系统能够处理文本、图像和音频等不同类型的数据。
Pavel 提到,Hugging Face Hub 目前已托管超过 100 万个模型,开发者可以轻松找到适合自己项目的模型。Hugging Face 旨在通过提供模型训练、微调和部署工具来简化 AI 开发。当开发者能够试验不同模型时,将 AI 集成到实际应用中的流程也会更加简单。
Hugging Face 最初以 NLP 闻名,但后来已扩展到计算机视觉和多模态 AI 领域,使开发者能够应对更广泛的 AI 任务。它还拥有一个活跃的社区,开发者可以在其中协作、分享见解,并通过论坛、Discord 和 GitHub 获取支持。
探索 Hugging Face 的计算机视觉应用模型#
Pavel 进一步详细介绍了 Hugging Face 的工具如何简化计算机视觉应用的构建。开发者可以使用这些工具完成图像分类、对象检测和视觉语言应用等任务。
他还指出,许多计算机视觉任务都可以使用 Hugging Face Hub 上提供的预训练模型来完成,从而减少从头训练的需要并节省时间。事实上,Hugging Face 为图像分类任务提供了超过 13,000 个预训练模型,其中包括用于食物分类、宠物分类和情绪检测的模型。
为了强调这些模型的易用性,他说:“你可能甚至不需要为项目训练模型——你或许能在 Hub 上找到一个社区成员已经训练好的模型。”
用于对象检测的 Hugging Face 模型#
Pavel 又以对象检测为例,详细说明了 Hugging Face 如何提供帮助。对象检测是计算机视觉中的一项关键功能,用于识别和定位图像中的对象。即使标注数据有限,Hugging Face Hub 上提供的预训练模型也能让对象检测更加高效。
他还快速介绍了 Hugging Face 上可以找到的几种用于此任务的模型:
- 实时对象检测模型:对于速度至关重要的动态环境,Detection Transformer (DETR) 等模型能够实现实时对象检测。DETR 在 COCO 数据集上训练,旨在高效处理多尺度特征,因此适合对时效性要求较高的应用。
- 视觉语言模型:这些模型结合图像和文本处理,使 AI 系统能够将图像与描述进行匹配,或识别超出其训练数据范围的对象。示例包括 **CLIP 和 SigLIP,**它们通过将文本与视觉内容关联起来改进图像搜索,并使 AI 解决方案能够通过理解上下文来识别新对象。
- **零样本对象检测模型:**这些模型通过理解图像与文本之间的关系来识别以前未见过的对象。示例包括 OwlVit、GroundingDINO 和 OmDet,它们利用零样本学习来检测新对象,而无需标注训练数据。
如何使用 Hugging Face 模型#
随后,Pavel 将重点转向实际使用 Hugging Face 模型,并介绍了开发者可以利用这些模型的三种方式:探索模型、快速测试模型,以及进一步定制模型。
他演示了开发者如何无需编写任何代码,直接在 Hugging Face Hub 上浏览模型,从而通过交互式界面即时测试模型。Pavel 补充道:“你甚至不用在电脑上写一行代码或下载模型,就可以试用它。”由于某些模型体积较大,在 Hub 上运行这些模型有助于避免存储和处理能力方面的限制。

图 2。如何使用 Hugging Face 模型。
此外,Hugging Face Inference API 让开发者能够通过简单的 API 调用运行 AI 模型。它非常适合快速测试、概念验证项目和快速原型开发,无需进行复杂的设置。
对于更高级的使用场景,开发者可以使用 Hugging Face Transformers 框架。这是一款开源工具,提供用于文本、视觉和音频任务的预训练模型,同时支持 PyTorch 和 TensorFlow。Pavel 解释说,开发者只需两行代码,就能从 Hugging Face Hub 获取模型,并将其连接到图像处理器等预处理工具,以分析用于 Vision AI 应用的图像数据。
使用 Hugging Face 优化 AI 工作流程#
接下来,Pavel 介绍了 Hugging Face 如何简化 AI 工作流程。他重点讲解了 Transformers 中注意力机制的优化。注意力机制是深度学习模型的核心功能之一,能够帮助模型关注输入数据中最相关的部分,从而提升语言处理和计算机视觉任务的准确性。不过,这一机制可能会消耗大量资源。
优化注意力机制可以在提升速度的同时显著降低内存使用量。Pavel 指出:“例如,切换到更高效的注意力实现后,性能最高可以提升 1.8 倍。”
Hugging Face 在 Transformers 框架中内置了对更高效注意力实现的支持。开发者只需在加载模型时指定其他注意力实现,即可启用这些优化。
Optimum 和 Torch Compile#
他还谈到了量化技术。这种技术通过降低模型所使用数值的精度来缩小 AI 模型,同时不会对性能造成太大影响。这样可以减少模型的内存占用并提升运行速度,使其更适合智能手机和嵌入式系统等处理能力有限的设备。
为了进一步提升效率,Pavel 介绍了 Hugging Face Optimum 库。这是一套用于优化和部署模型的工具。开发者只需几行代码即可应用量化技术,并将模型转换为高效格式,例如 ONNX (开放神经网络交换),从而让模型能够在包括云服务器和边缘设备在内的不同硬件上流畅运行。

图 3。Pavel 介绍了 Optimum 库及其功能。
最后,Pavel 提到了 Torch Compile 的优势。Torch Compile 是 PyTorch 中的一项功能,可以优化 AI 模型处理数据的方式,使模型运行得更快、更高效。Hugging Face 将 Torch Compile 集成到其 Transformers 和 Optimum 库中,让开发者只需进行极少的代码修改即可利用这些性能提升。
通过优化模型的计算结构,Torch Compile 可以缩短推理时间,并将帧率从每秒 29 帧提高到每秒 150 帧,同时不会影响准确性或质量。
使用 Hugging Face 工具部署模型#
随后,Pavel 简要介绍了开发者在选定合适的模型并确定最佳开发方式后,如何使用 Hugging Face 工具扩展和部署 Vision AI 模型。
例如,开发者可以使用 Gradio 和 Streamlit 部署交互式 AI 应用。Gradio 允许开发者为机器学习模型创建基于 Web 的界面,而 Streamlit 则可以通过简单的 Python 脚本构建交互式数据应用。
Pavel 还指出:“你不需要从头开始编写所有内容。”他指的是 Hugging Face 提供的指南、训练笔记本和示例脚本。这些资源可以帮助开发者快速入门,无需从零构建所有内容。

图 4。Pavel 在 YV24 讨论 Hugging Face 的功能。
Hugging Face Hub 的优势#
在主题演讲即将结束时,Pavel 总结了使用 Hugging Face Hub 的优势。他强调,该平台简化了模型管理和协作。他还特别提到了指南、笔记本和教程的可用性,这些资源可以帮助初学者和专家理解并实现 AI 模型。
他解释道:“Hub 上已经有很多很棒的 Spaces。你可以找到类似的项目,克隆共享代码,修改几行代码,将模型替换成自己的模型,然后再将其推送回去。”他鼓励开发者充分利用该平台的灵活性。
要点总结#
在 YV24 的演讲中,Pavel 分享了 Hugging Face 如何提供支持 AI 模型训练、优化和部署的工具。例如,Transformers、Optimum 和 Torch Compile 等创新工具可以帮助开发者提升模型性能。
随着 AI 模型变得更加高效,量化和边缘部署方面的进步也让模型更容易在资源受限的设备上运行。这些改进与 Hugging Face 等工具以及 Ultralytics YOLO11 等先进计算机视觉模型相结合,是构建可扩展、高性能 Vision AI 应用的关键。
加入我们不断壮大的社区!访问我们的 GitHub 仓库了解 AI,并查看我们的 YOLO 许可证,开始你的 Vision AI 项目。对医疗保健领域的计算机视觉或农业领域的计算机视觉等创新感兴趣?访问我们的解决方案页面,了解更多信息!









