Machine Learning Operations (MLOps)
探索简化 AI 部署的 MLOps 要素。了解如何使用 Ultralytics YOLO26 和我们的平台管理 CI/CD、数据版本控制和监控。
机器学习运维(MLOps)是一套实践、原则和技术,旨在简化将机器学习(ML)模型从实验开发过渡到可靠生产部署的过程。通过将数据科学的探索性与 DevOps 的严谨纪律相结合,MLOps 旨在统一人工智能(AI)应用程序的发布周期。传统软件开发主要关注代码版本控制,而 MLOps 则引入了管理大规模数据和不断演进的模型行为等额外复杂性。这种整体方法确保了 AI 系统在其整个生命周期中保持可扩展性、准确性和受控性。
MLOps 的支柱#
成功的 MLOps 实施依赖于弥合三个不同学科之间的鸿沟:数据工程、机器学习和 DevOps。
- 持续集成和交付(CI/CD): 就像标准软件使用 CI/CD 管道来自动化测试和部署一样,MLOps 管道可以自动化模型训练和验证。这确保了对代码或数据的更改在更新到达生产环境之前会自动触发验证模型性能的步骤。
- 数据和模型版本控制: 在传统编码中,你只需对源代码进行版本控制。而在 MLOps 中,团队必须使用诸如 DVC(数据版本控制)之类的工具来跟踪训练数据的变化以及模型超参数。这保证了可复现性,使工程师能够从历史记录中重新创建任何特定的模型版本。
- 持续监控: 部署后,模型可能会因为概念漂移而性能下降,即目标变量的统计属性随时间发生变化。MLOps 涉及设置可观测性系统来跟踪诸如推理延迟和准确率等指标,在需要重新训练时自动向团队发出警报。
实际应用#
MLOps 是现代企业 AI 的中坚力量,使企业能够可靠地从单个模型扩展到数千个部署的端点。
-
Predictive Maintenance in Manufacturing: Factories use computer vision to identify defects on assembly lines. An MLOps pipeline ensures that as new product lines are introduced, object detection models are retrained with new images, versioned, and automatically deployed to factory edge devices without downtime. This ensures quality inspection remains consistent even as manufacturing conditions change.
-
智能零售库存: 零售商部署摄像头来跟踪货架库存。由于商店照明和产品包装频繁更换,模型漂移是一个持续存在的风险。MLOps 系统监控置信度分数;如果置信度下降,系统会标记图像以进行标注并在云端启动重新训练周期,将更新后的模型推送至门店以维持自动化库存管理。
使用 Ultralytics 实施 MLOps#
任何 MLOps 工作流中的关键一步都是实验跟踪。这确保了每次训练运行都记录有其特定的配置,使团队能够在必要时复现结果或回滚到以前的版本。
以下示例演示了如何训练 YOLO26 模型(这是 Ultralytics 推出的、推荐用于所有新项目的最新最先进模型),同时启用项目跟踪。这自然会创建生产管道所需的工件。
from ultralytics import YOLO
# Load the YOLO26 model (recommended for superior speed and accuracy)
model = YOLO("yolo26n.pt")
# Train the model while specifying project and name for organized logging
# This creates a structured directory of artifacts (weights, charts, args)
# which is essential for reproducibility in MLOps pipelines.
results = model.train(data="coco8.yaml", epochs=10, project="mlops_experiments", name="run_v1")通过将训练运行组织到特定的项目中,团队可以轻松集成诸如 MLflow 或 TensorBoard 等工具来可视化随时间变化的性能指标。随着组织规模的扩大,他们通常会将这些工作流迁移到 Ultralytics Platform,该平台提供了一个统一的界面,用于管理数据集、远程训练以及将模型部署到诸如 TensorRT 等各种格式以获得优化的推理速度。
MLOps 与相关概念的对比#
为了有效地实施这些实践,区分 MLOps 与生态系统中的相关术语非常重要。
- MLOps 与 DevOps: DevOps 专注于软件应用程序的持续交付。MLOps 通过将“数据”和“模型”作为一等公民加入其中,扩展了这些原则。在 DevOps 中,代码更改会触发构建;而在 MLOps 中,数据分布的变化或精度的下降也可以触发新的管道执行。
- MLOps 与模型服务: 模型服务专门指用于托管模型和处理推理请求的基础设施。MLOps 是一个更广泛的伞形概念,它涵盖了服务,但也包括训练、治理和监控阶段。
- MLOps 与 AutoML: 自动机器学习(AutoML)专注于自动化模型创建过程(例如选择算法)。MLOps 管理该模型在创建之后的生命周期,并使运行 AutoML 工具的管道实现运营化。






