借助 Hugging Face 的 Transformer 驱动开源计算机视觉
与 Hugging Face 一起深入探索开源计算机视觉!了解迁移学习和 Transformer,并探索超过 8,000 个模型。加入 Merve Noyan,获取洞见与实践演示,助力开发者探索 AI 创新。

在我们继续探索 YOLO VISION 2023(YV23)活动亮点之际,让我们认识一下 Merve Noyan。她是 Hugging Face 的开发者倡导工程师。Hugging Face 是领先的 NLP 平台,提供预训练模型,助力高效开发语言应用。在演讲中,Merve 分享了她对开源计算机视觉世界的一些精彩见解。
和我们一起踏上探索迁移学习、Transformer 与开源计算机视觉生态的精彩旅程。
揭开迁移学习的面纱:快速回顾#
Merve 以迁移学习的快速入门介绍拉开了演讲序幕。迁移学习就像一根魔杖,能让我们将知识从一个神经网络迁移到另一个神经网络。想象一下,先在模型的早期层训练边缘和角点等通用特征,然后针对具体任务对其进行微调。这就是迁移学习的本质:减少对数据的依赖并提升准确率。
Merve 重点介绍了 ResNet 和 Inception 等经典卷积骨干网络,为接下来的变革之旅做好了铺垫。
Transformer 登场:揭开谜题#
Transformer 有什么特别之处?Merve 将其比作一道谜题,展示了它们与传统卷积模型的差异。其关键在于能够执行自监督学习,无需标注数据即可捕获特征。Vision Transformer、Data Efficient Transformer、CLIP 和 Swin Transformer 都是她介绍的众多 Transformer 模型中的明星。
与提供Transformer 模型支持的 Ultralytics 建立一些共同认知。该模型采用高效的混合编码器、具备 IoU 感知能力的查询选择机制,并支持调节推理速度。值得注意的是,它遵循其他 Ultralytics YOLOv8 模型所采用的熟悉模式,提供预测、训练、验证和导出选项。
一站式解决方案#
随后,Merve 深入介绍了 Hugging Face 丰富的产品与资源:其中包括用于经典计算机视觉任务的 8,000 多个模型,以及用于多模态应用的 10,000 个模型。Hugging Face Hub 还拥有超过 3,000 个数据集,为开发者和爱好者提供了一个充满可能性的实践平台。Merve 强调了其顺畅一致的使用体验,这得益于 Hugging Face 统一的 API,可为各种使用场景提供开箱即用的模型。
使用 Hugging Face 的实践体验#
演讲随后转入实践演示,展示了使用模型是多么轻松。从实例化模型和处理器,到使用 Trainer API 进行微调,Merve 清楚地表明,Hugging Face Transformers 库是开发者的得力助手。她还介绍了 Pipeline API,这是她个人最喜欢的功能之一,能够简化用户的工作流程。

图 1. Merve Noyan 在马德里 Google for Startups Campus 举行的 YV23 活动上进行演讲。
应用一瞥#
Merve 在演讲最后介绍了一些精彩的应用,包括用于视觉问答的 Plot 模型、用于图像描述的 Blip,以及功能强大的 Segment Anything 模型(用于图像分割)。Hugging Face 生态系统的 Pipeline API 成为了焦点,让用户无需深入了解技术细节即可轻松使用模型。
最后的点睛之笔是 Merve 展示如何使用 Elysian Diffusion 创建视觉错觉。这一引人入胜的体验为 AI 世界增添了有趣的变化。
简而言之!#
总而言之,Merve 的演讲让我们深受启发,迫不及待地想要探索开源计算机视觉的无限可能。Hugging Face 真正让 AI 变得触手可及、有趣且令人兴奋,帮助开发者释放创造力。让我们共同期待开源社区的未来,以及其中蕴含的精彩创新!









