Model Weights
了解模型权重如何充当 AI 的知识。探索 Ultralytics YOLO26 如何使用优化后的权重,实现更快、更准确的训练和推理。
模型权重是机器学习模型中的可学习参数,用于将输入数据转换为预测输出。在神经网络中,这些权重表示不同层之间神经元连接的强度。模型初始化时,这些权重通常会被设为随机的小数值,这意味着模型一无所知。通过称为训练的过程,模型会根据自身产生的错误迭代调整这些权重,逐步学会识别数据中的模式、特征和关系。你可以将模型权重看作 AI 的“记忆”或“知识”;它们存储了系统从其训练数据中学到的内容。
权重在学习中的作用#
训练神经网络的主要目标是找到一组最优的模型权重,使模型预测与实际真值之间的误差最小化。这个过程包括将数据传递通过网络——这一步称为前向传播——然后使用特定的损失函数计算损失值。如果预测不正确,像随机梯度下降 (SGD)这样的优化算法,或YOLO26中使用的新型 Muon 优化器,会计算每个权重对误差的贡献程度。
通过称为反向传播的技术,算法会略微更新权重,以减少下一次产生的误差。这个循环会重复数千次或数百万次,直到模型权重趋于稳定,并且系统达到较高的准确率。训练完成后,权重会被冻结并保存,使模型能够在新的、未见过的数据上进行推理部署。
模型权重与偏置#
区分权重和偏置非常重要,因为它们协同工作,但用途不同。模型权重决定神经元之间连接的强度和方向(控制激活函数的斜率),而偏置则允许将激活函数向左或向右平移。即使所有输入特征都为零,这种偏移也能确保模型更好地拟合数据。权重和偏置共同构成了定义卷积神经网络 (CNNs)等架构行为的可学习参数。
实际应用#
模型权重是使 AI 系统能够应用于各个行业的核心组件。以下是两个具体的应用示例:
- **零售业中的计算机视觉:**在一个智能超市系统中,YOLO26 等模型会使用训练好的权重识别货架上的商品。这些权重已经“学会”了视觉特征,例如谷物盒的形状或汽水罐的颜色,使系统能够高效地检测商品、管理库存,甚至实现自动结账流程。
- **医学图像分析:**在医疗保健领域,深度学习模型会利用专门的权重分析 X 射线或 MRI 扫描。例如,经过肿瘤检测训练的模型会使用其权重区分健康组织与潜在异常。这些权重能够捕捉像素数据中复杂的非线性模式,而这些模式可能对人眼来说非常细微,从而帮助放射科医生更快地做出诊断。
保存和加载权重#
在实践中,使用模型权重包括将训练好的参数保存到文件中,并在之后加载这些参数以进行预测或微调。在 Ultralytics 生态系统中,这些参数通常存储为 .pt(PyTorch)文件。
下面是一个将预训练权重加载到 YOLO 模型中并运行预测的简单示例:
from ultralytics import YOLO
# Load a model with pre-trained weights (e.g., YOLO26n)
model = YOLO("yolo26n.pt")
# Run inference on an image using the loaded weights
results = model("https://ultralytics.com/images/bus.jpg")
# Print the number of detected objects
print(f"Detected {len(results[0].boxes)} objects.")迁移学习与微调#
模型权重最强大的特性之一是可移植性。开发者通常不会从头开始训练模型——这需要海量数据集和大量计算能力——而是使用迁移学习。这个过程包括使用在大型数据集(如 COCO 或 ImageNet)上预训练了权重的模型,并将其适配到特定任务。
例如,你可以获取通用目标检测器的权重,然后在较小的太阳能电池板数据集上对其进行微调。由于预训练权重已经理解边缘、形状和纹理,模型的收敛速度会快得多,并且所需的标注数据也更少。Ultralytics Platform等工具简化了这一过程,使团队能够管理数据集、在云端训练模型,并将优化后的权重无缝部署到边缘设备。
压缩与优化#
现代 AI 研究通常致力于在不牺牲性能的情况下减小模型权重的文件大小,这一过程称为模型量化。通过降低权重的精度(例如,从 32 位浮点数降至 8 位整数),开发者可以显著减少内存使用量并提高推理速度。这对于将模型部署到移动电话或 Raspberry Pi 设备等资源受限的硬件上至关重要。此外,剪枝等技术会移除对输出贡献很小的权重,进一步精简模型,使其适用于实时应用。









