Zero-Shot Learning
探索零样本学习(ZSL),无需训练数据即可检测和分类对象。了解 Ultralytics YOLO-World 如何实现实时开放词汇检测。
零样本学习(ZSL)是一种机器学习范式,使人工智能模型能够识别、分类或检测在训练阶段从未遇到过的对象。在传统的监督学习中,模型需要为要识别的每个特定类别提供数千个带标签的示例。ZSL 通过利用辅助信息(通常是文本描述、语义属性或嵌入)来弥合已见类别与未见类别之间的差距,从而消除了这种严格依赖。这种能力使人工智能(AI)系统更加灵活、可扩展,并能够处理动态环境;在这类环境中,为每一种可能的对象收集完整数据并不现实。
零样本学习的工作原理#
ZSL 的核心机制是利用共享语义空间,将知识从熟悉的概念迁移到陌生的概念。模型不是仅仅通过记忆黑白条纹的像素模式来学习识别“斑马”,而是学习视觉特征与语义属性之间的关系(例如“类似马的形状”“条纹图案”“四条腿”),这些属性源自自然语言处理(NLP)。
这一过程通常依赖能够对齐图像和文本表示的多模态模型。例如,OpenAI 的 CLIP等基础研究展示了模型如何通过自然语言监督学习视觉概念。当 ZSL 模型遇到未见过的对象时,它会提取视觉特征,并将其与语义向量字典进行比较。如果视觉特征与新类别的语义描述相匹配,模型就能正确地对其进行分类,从而有效执行“零样本”预测。这种方法是现代基础模型的基础,使其能够在大量任务之间实现泛化。
实际应用#
零样本学习使系统能够超越初始训练数据进行泛化,正在推动各行各业的创新。
-
**开放词汇目标检测:**现代架构(如 YOLO-World)利用 ZSL 根据用户定义的文本提示来检测对象。这使得系统能够在无法预先定义固定类别列表的场景中执行目标检测,例如在庞大的视频档案中搜索特定物品。Google Research的研究人员仍在不断拓展这些开放词汇能力的边界。
-
**医学诊断:**在医疗领域的 AI中,获取罕见疾病的带标签数据通常既困难又昂贵。ZSL 模型可以利用常见病症以及医学文献中对罕见症状的描述进行训练,这些文献可从 PubMed 等数据库中获取,从而使系统无需大量阳性病例数据集,就能在医学影像中标记潜在的罕见异常。
-
**野生动物保护:**对于农业领域的 AI和生态学而言,识别很少被拍摄到的濒危物种至关重要。ZSL 允许保护工作者利用生物数据库(如生命大百科)中定义的基于属性的描述来检测这些动物。
使用 Ultralytics 进行零样本检测#
Ultralytics YOLO-World模型展示了零样本学习的实际应用。它允许用户在运行时动态定义自定义类别,而无需重新训练模型。这是通过将强大的检测骨干网络与能够理解自然语言的文本编码器连接起来实现的。
下面的 Python 示例演示了如何使用 ultralytics 软件包,通过 YOLO-World 检测未明确包含在标准训练集中的对象。
from ultralytics import YOLOWorld
# Load a pre-trained YOLO-World model capable of Zero-Shot Learning
model = YOLOWorld("yolov8s-world.pt")
# Define custom classes via text prompts (e.g., specific accessories)
# The model adjusts to detect these new classes without retraining
model.set_classes(["blue backpack", "red apple", "sunglasses"])
# Run inference on an image to detect the new zero-shot classes
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Display the results
results[0].show()与相关概念的区别#
要全面理解 ZSL,最好将其与计算机视觉(CV)中使用的类似学习策略区分开来:
- **少样本学习(FSL):**ZSL 不需要目标类别的任何示例,而 FSL 会向模型提供一个非常小的支持集(通常为 1 到 5 个示例)以进行适应。ZSL 完全依赖语义推理而非视觉示例,因此通常被认为更具挑战性。
- **单样本学习:**FSL 的一个子集,模型恰好从一个带标签的示例中学习。ZSL 则存在根本区别,因为它甚至不需要新类别的一张图像。
- **迁移学习:**这是一个广义术语,指将知识从一个任务迁移到另一个任务。ZSL 是迁移学习的一种具体类型,它利用语义属性将知识迁移到未见类别,而无需在新数据上进行传统的微调。
挑战与未来展望#
尽管 ZSL 具有巨大潜力,但它也面临一些挑战,例如域偏移问题:训练期间学习到的语义属性无法与未见类别的视觉外观完美对应。此外,ZSL 模型还可能受到偏差影响,其对已见类别的预测准确率显著高于对未见类别的准确率。
斯坦福大学人工智能实验室和 IEEE 计算机学会等机构的研究仍在持续解决这些局限。随着计算机视觉工具变得更加稳健,ZSL 有望成为标准功能,减少对大规模数据标注工作的依赖。对于希望在部署高级模型前高效管理数据集的团队,Ultralytics Platform提供了用于标注和数据集管理的综合工具。









