Zero-Shot Learning
探索零样本学习 (ZSL) 以在没有训练数据的情况下检测和分类对象。了解 Ultralytics YOLO-World 如何实现实时开放词汇检测。
零样本学习(ZSL)是一种机器学习范式,使人工智能模型能够识别、分类或检测在训练阶段从未遇到过的对象。在传统的监督学习中,模型需要针对每个需要识别的具体类别提供数千个带标签的示例。ZSL通过利用辅助信息(通常是文本描述、语义属性或嵌入)来弥合已见类和未见类之间的差距,从而消除了这种严格的依赖性。这一功能使人工智能(AI)系统具有显著更高的灵活性、可扩展性,并能够处理无法为每个可能对象收集详尽数据的动态环境。
零样本学习的工作原理#
ZSL的核心机制涉及使用共享的语义空间将知识从熟悉的概念转移到不熟悉的实体。模型不是仅通过记忆黑白条纹的像素模式来学习识别“斑马”,而是学习从自然语言处理(NLP)衍生的视觉特征与语义属性(例如,“马的形状”、“条纹模式”、“四条腿”)之间的关系。
这个过程通常依赖于对齐图像和文本表示的多模态模型。例如,诸如OpenAI的CLIP之类的基础研究展示了模型如何从自然语言监督中学习视觉概念。当ZSL模型遇到未见过的对象时,它会提取视觉特征并将其与语义向量字典进行比较。如果视觉特征与新类别的语义描述相吻合,模型就能对其进行正确分类,从而有效地执行“零样本”预测。这种方法是现代基础模型的基础,能够在大量任务中进行泛化。
实际应用#
零样本学习通过使系统能够泛化超出其初始训练数据范围的能力,正在推动各行各业的创新。
-
开放词汇对象检测: 诸如YOLO-World之类的现代架构利用ZSL根据用户定义的文本提示检测对象。这允许在事先无法定义固定类别列表的场景中进行对象检测,例如在庞大的视频档案中搜索特定项目。Google Research的研究人员继续突破这些开放词汇能力的边界。
-
医学诊断: 在医疗保健中的AI中,获取罕见疾病的标记数据通常既困难又昂贵。ZSL模型可以对常见病症以及来自诸如PubMed等数据库的医学文献中的罕见症状描述进行训练,从而使系统能够在医学影像中标记潜在的罕见异常,而无需海量的阳性病例数据集。
-
野生动物保护: 对于农业和生态学中的AI而言,识别很少被拍摄到的濒危物种至关重要。ZSL允许保护主义者使用在诸如生命百科全书等生物数据库中定义的基于属性的描述来检测这些动物。
使用 Ultralytics 进行零样本检测#
Ultralytics YOLO-World模型体现了实际应用中的零样本学习。它允许用户在运行时动态定义自定义类别,而无需重新训练模型。这是通过将强大的检测主干与理解自然语言的文本编码器连接起来实现的。
以下Python示例演示了如何使用YOLO-World通过ultralytics包检测不属于标准训练集显式部分的物体。
from ultralytics import YOLOWorld
# Load a pre-trained YOLO-World model capable of Zero-Shot Learning
model = YOLOWorld("yolov8s-world.pt")
# Define custom classes via text prompts (e.g., specific accessories)
# The model adjusts to detect these new classes without retraining
model.set_classes(["blue backpack", "red apple", "sunglasses"])
# Run inference on an image to detect the new zero-shot classes
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Display the results
results[0].show()与相关概念的区别#
为了充分理解ZSL,将其与计算机视觉(CV)中使用的类似学习策略进行区分会很有帮助:
- 少样本学习(FSL): 虽然ZSL需要目标类的零个示例,但FSL为模型提供了一个非常小的支持集(通常为1到5个示例)来进行适应。ZSL通常被认为更具挑战性,因为它完全依赖于语义推理而不是视觉示例。
- 单样本学习: FSL的一个子集,其中模型从正好一个标记示例中学习。ZSL的根本不同之处在于它甚至在没有新类别单张图像的情况下也能运行。
- 迁移学习: 这个广泛的术语指的是将知识从一个任务转移到另一个任务。ZSL是迁移学习的一种特定类型,它使用语义属性将知识转移到未见过的类,而无需在全盘新数据上进行传统的微调。
挑战与未来展望#
虽然 ZSL 提供了巨大的潜力,但它也面临挑战,例如 域偏移问题 (domain shift problem),即训练期间学到的语义属性不能完美地映射到未知类的视觉外观上。此外,ZSL 模型可能会遭受偏差,即已知类的预测准确率明显高于未知类。
来自斯坦福大学AI实验室和IEEE计算机协会等组织的研究继续解决这些局限性。随着计算机视觉工具变得更加强大,ZSL预计将成为一项标准功能,从而减少对大规模数据标注工作的依赖。对于希望在部署高级模型之前高效管理数据集的团队,Ultralytics Platform提供了用于标注和数据集管理的全面工具。






