在 Lightning AI 上对 Ultralytics YOLO 模型进行自定义训练
探索在 YOLO Vision 2024 上展示的 Lightning AI 如何通过更快的模型训练、部署和协作来简化可扩展的视觉 AI 开发。

无论你是经验丰富的 AI 开发者,还是刚开始探索 vision AI,拥有一个可靠的环境来上手和实验像 Ultralytics YOLO11 这样的计算机视觉模型都是关键。环境是指高效设计、测试和部署 AI 模型所需的工具、资源和基础设施。
虽然有多个在线平台提供不同的 AI 工具,但许多平台并未提供涵盖从数据准备到模型部署的整个 AI 生命周期的统一环境。而作为一体化 AI 开发平台的 Lightning AI,正好可以介入并简化从数据准备到部署的整个流程。
在由 Ultralytics 主办的年度混合活动 YOLO Vision 2024 (YV24) 上,展示了简化 AI 开发的重要意义,该活动聚焦于 AI 和计算机视觉的最新进展。Lightning AI 首席技术官 Luca Antiga 发表了题为“Going YOLO on Lightning Studios”的主旨演讲,他在演讲中详细阐述了如何使用 Lightning AI 快速、顺畅地训练 Ultralytics YOLO 模型,而无需陷入技术复杂性中。
在本文中,我们将深入探讨 Luca 演讲的核心要点,内容涵盖从现实世界的计算机视觉应用,到使用 Lightning AI 训练和部署 Ultralytics YOLO 模型的现场演示。让我们开始吧!
利用 Lightning AI 和 Ultralytics YOLO 简化 AI 开发#
Luca 在主题演讲的开篇分享了他对 YOLO 模型在各行各业影响力的看法和赞赏。他强调了 YOLO 模型如何应用于制造业和农业等领域。他说:“我很欣赏 YOLO 对开发者社区产生的影响——那些需要解决实际、具体问题的人们——这与我非常有共鸣。”
结合人们对 AI 训练日益增长的兴趣,他介绍了 Lightning AI,这是一个旨在让 AI 模型开发变得更快速、更简单、更易于让每个人使用的平台。它对于支持 AI 的迭代式进步特别有用,能帮助开发者完善和优化模型。

图 1. Luca Antiga 在 YV24 上远程介绍 Lightning Studios。
他还指出,Lightning AI 类似于 PyTorch Lightning,这是一个简化训练 AI 模型过程的框架。然而,不同之处在于 Lightning AI 是一个更全面的平台,为整个 AI 开发过程(而不仅仅是训练 AI 模型)提供了更广泛的工具和功能。
Lightning AI 的一个核心组件是 Lightning Studios,它提供了一个直观的工作区来设计、训练和部署 AI 模型,使整个工作流程无缝且高效。你可以将 Lightning Studios 视为运行在云端的可复现 AI 开发环境。例如,它提供了一个类似于 Jupyter Notebook 的环境,可以复制并与其他开发者共享,从而有助于提高协作效率。
Luca 随后阐述了 Lightning Studios 的优势,他表示:“复现你的环境不再是问题。如果你需要从 CPU [中央处理器] 机器切换到 GPU [图形处理器] 机器,或者在数千台机器上发起训练,你的环境将保持持久。”
设置用于训练和开发的 Lightning Studios#
接下来,Luca 演示了使用 Lightning Studios 上手有多么迅速。只需点击几下,你就可以打开一个新的 studio,并访问诸如 Jupyter Notebooks 和 VS Code 等工具和环境,所有这些都已配置好并随时可以进行编码。他展示了在不同机器之间切换是多么容易。如果你正在处理的任务需要更强大的算力,你可以轻松地从 CPU 切换到更强大的 GPU。GPU 仅在在使用时保持活跃;否则,它将进入睡眠状态,从而节省你的额度。
Luca 还提到了使用 Studio Templates 的好处。它们是由社区预先制作的 AI 编码环境,你无需进行任何设置即可直接使用。为 AI 项目配置环境可能非常耗时,而 Studio Templates 可以帮助提高工作效率。这些环境预装了 AI 项目所需的一切,例如已安装的依赖项、模型权重、数据、代码等。

图 2. Luca 解释什么是 Studio Templates。
在 Lightning Studios 上训练 Ultralytics YOLO 模型#
随后,Luca 进入了现场演示环节,重点介绍了如何使用 Lightning Studio 来训练 Ultralytics YOLO 模型。他打开了一个 Studio Template,里面已经安装好了所有依赖项,并启动了一台配备四个 GPU 的机器以加速训练过程。关于数据,他表示你可以选择将数据直接存储在机器上,或者从云端流式传输数据,从而使训练过程更快、更高效。
几秒钟之内,机器就准备就绪,Luca 迅速启动了训练会话。在演示过程中,一个小问题导致机器意外停止,但 Lightning Studios 无缝地从中断处恢复了训练,确保没有任何进度丢失。Luca 指出,这种可靠性即使在遇到意外中断时也能支持流畅的工作流。
在继续演示的过程中,他展示了使用 TensorBoard(一个用于实时可视化机器学习指标的工具)监控训练进度是多么容易。Lightning Studio 通过自动生成 URL 让使你或同一工作区中的队友无需进行额外设置即可访问 TensorBoard 视图,从而让这一点变得更加简单。这简化了协作并让每个人保持同步。

图 3. 关于在 Lightning Studios 上训练 Ultralytics YOLO 模型的流程图。图片由作者提供。
使用 LitServe 部署 Ultralytics YOLO 模型#
演示结束后,Luca 将演讲重点转向了一个新项目:LitServe,这是 Lightning AI 最近推出的产品。LitServe 简化了将训练好的模型转化为可扩展服务的过程,使其他人可以使用该服务,从而消除了复杂部署管道的需求。它旨在处理从封装模型到以最小的精力部署模型的所有事务。
为了实时展示这一点,Luca 使用预训练的 Ultralytics YOLOv8 模型为观众做了一个快速演示。他能够在几秒钟内创建一个简单的 API 来处理传入的请求并返回图像预测结果。这意味着任何人都可以向该 API 发送带有图像的请求,并几乎立即获得诸如目标检测等计算机视觉任务的结果。在后台,Ultralytics YOLOv8 模型作为服务部署,能够高效处理请求、处理图像并以极低的延迟交付预测结果。

图 4. Luca 在 YV24 上展示 Lightning AI 的 LitServe。
他针对一张披萨图片运行了推理,Ultralytics YOLOv8 成功识别出了披萨、勺子和餐桌等物体。他解释说,虽然由于“冷启动”的原因,第一次请求耗时稍长,但系统预热后,后续请求的速度会快得多。
Luca 接着问:“如果我想向外界公开这个服务该怎么办?”他概述了 API Builder 插件如何使将模型转化为实时、生产就绪的服务变得简单。通过自定义域名、增强的安全性和无缝集成等功能,你可以轻松地让任何人访问你的模型。
使用 Lightning Studios 的关键优势#
在演讲结尾,Luca 谈到了 Lightning Studio 在 AI 开发方面的可扩展性和灵活性。他提到该平台可以跨多台机器训练模型,扩展至 10,000 个节点,并具有容错训练功能,可在任何中断后自动恢复。
例如,如果 GPU 集群上的训练任务由于硬件问题或服务器重启而中断,Lightning Studios 会确保进程从上次中断的地方精确恢复。这使其非常适合大规模 AI 项目,例如在 ImageNet 或 COCO 等海量数据集上训练深度学习模型。
以下是 Luca 提到的 Lightning Studios 的其他一些关键优势:
- 免费月度 GPU 点数:用户每月获得 15 个免费 GPU 点数,该点数会自动补足,确保你可以在没有额外成本的情况下进行实验和开发。
- 增强协作: Lightning Studio 的共享团队空间和可复现环境使团队成员能够无缝协作,确保跨项目的一致性和效率。
- 灵活的实例选项:它为你提供了在可中断和不可中断实例之间进行选择的灵活性,使用户能够通过可中断选项节省 GPU 机器的成本。
- 与现有工具集成:该平台集成了 SSH (Secure Socket Shell) 和 VS Code 等远程开发工具,提供了在本地或云端工作的灵活性。
关键要点#
Luca 在 YV24 上的主题演讲强调了 AI 如何与 Ultralytics YOLO 模型和 Lightning AI 等工具相结合,正在改变我们解决现实世界问题的方式。它们使开发者能够更轻松地训练和部署专为解决各行业特定问题而设计的模型。
他说明了 Lightning Studios 如何使整个开发过程更快速、更易于获取,让开发者能够轻松创建强大的解决方案。在像 Lightning AI 这样尖端平台的核心,计算机视觉模型正在改变 AI 解决方案应对挑战的方式。特别是,利用最新的 Ultralytics YOLO11 模型,开发者可以构建产生深远影响的解决方案。
加入我们的社区以随时了解 AI 及其在实际中的应用。查看我们的 GitHub 仓库,探索自动驾驶汽车中的 AI 和医疗保健中的计算机视觉等领域的创新。






