Self-Supervised Learning
探索自监督学习如何消除手动标注的需求。了解生成式和对比式 SSL 方法,提升 Ultralytics YOLO26 的性能。
自监督学习(SSL)是一种机器学习范式,系统不依赖外部人工提供的标签,而是从数据本身生成监督信号,从而学习理解数据。在传统的 监督学习 中,模型需要大量人工标注的数据,例如标记为“猫”或“狗”的图像,而生成这些数据既昂贵又耗时。SSL 通过创建“前置任务”绕过了这一瓶颈,在这些任务中,模型必须预测输入数据中隐藏或缺失的部分,从而有效地自行学习复杂任务(如 目标检测 和分类)所需的底层结构与特征。
自监督学习的核心机制#
SSL 背后的基本思想是遮蔽或隐藏一部分数据,并迫使 神经网络(NN) 重建这部分数据,或预测同一数据不同视图之间的关系。这一过程会创建丰富且通用的表示,之后可以针对特定的下游应用进行微调。
SSL 主要有两种方法:
- 生成式方法: 模型学习生成像素或词语来填补空白。在 自然语言处理(NLP) 中,一个经典示例是预测句子中的下一个词。在计算机视觉领域,掩码自编码器(MAE) 等技术会遮挡图像中的随机图像块,并要求模型重建缺失的像素,迫使模型“理解”视觉上下文。
- 对比学习: 这种方法教会模型区分相似和不相似的数据点。通过对图像应用 数据增强 技术(例如裁剪、颜色抖动或旋转),模型会学习到这些修改后的版本表示同一个对象(正样本对),同时将其他图像视为不同的对象(负样本对)。SimCLR 等热门框架高度依赖这一原理。
实际应用#
自监督学习已成为在各种领域构建强大 基础模型 的基石。它能够利用海量无标签数据,因此具有很强的可扩展性。
- 医学影像: 获取专家标注的医学扫描图像既困难又昂贵。SSL 允许模型在数千张无标签 X 光片或 MRI 扫描图像上进行预训练,以学习通用的解剖学特征。随后,该预训练模型可以使用少量带标签的示例进行微调,从而在 肿瘤检测 或疾病诊断中实现高准确率。
- 自动驾驶: 自动驾驶汽车每天会生成数 TB 的视频数据。SSL 使这些系统能够从原始视频片段中学习时间动态和空间理解,而无需逐帧标注。通过预测未来帧或对象运动,这有助于改进 车道检测 和障碍物规避。
区分 SSL 与相关术语#
区分 SSL 与 无监督学习 非常重要。虽然这两种方法都利用无标签数据,但无监督学习通常侧重于在没有特定预测任务的情况下发现隐藏模式或分组(聚类)。相比之下,SSL 将学习过程定义为一个监督任务,其中的标签会根据数据结构本身自动生成。此外,半监督学习 将少量带标签数据与大量无标签数据结合起来,而纯 SSL 则完全从无标签数据集生成自己的标签,然后再进行任何微调。
在 Ultralytics 中使用预训练权重#
在 Ultralytics 生态系统中,YOLO26 等模型会显著受益于先进的训练策略。这些策略通常会在 ImageNet 或 COCO 等大型数据集上进行预训练时融入类似 SSL 的原理。这样可以确保用户将模型部署到特定任务时,特征提取器已经具备较强的鲁棒性。
用户可以利用这些强大的预训练表示,通过 Ultralytics Platform 在自己的自定义数据集上微调模型。
下面是一个简明示例,展示如何加载预训练的 Ultralytics YOLO26 模型,并开始在新数据集上对其进行微调,同时利用模型在初始大规模训练期间学到的特征:
from ultralytics import YOLO
# Load a pre-trained YOLO26 model (weights learned from large-scale data)
model = YOLO("yolo26n.pt")
# Fine-tune the model on a specific dataset (e.g., COCO8)
# This leverages the robust feature representations learned during pre-training
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)SSL 的未来#
随着 Meta AI 和 Google DeepMind 等大型实验室的研究人员继续改进这些技术,SSL 正在推动 生成式 AI 和计算机视觉的发展边界。通过降低对带标签数据的依赖,SSL 正在推动高性能 AI 的普及,让规模较小的团队也能为 野生动物保护 或 工业检测 等细分应用构建复杂模型。









