使用 Ultralytics YOLO11 构建 AI 驱动的无人机应用
学习如何使用 Ultralytics YOLO11 构建 AI 驱动的无人机应用,实现实时目标检测和基于无人机的计算机视觉任务。

店内购物和网上购物看似相似,但依赖不同的物流方式。实体店需要补充货架上的商品,而线上订单则依赖送货上门。得益于技术进步,这两种购物体验正在同步重塑。
例如,配送领域正在发生重大转变。AI 驱动的无人机正在改变商品送达我们家中的方式。预计未来十年,这些智能无人机将处理约 8.08 亿次配送,让天空成为日常商业配送的最新路线。
配送无人机使用人工智能(AI)和计算机视觉来导航并绕开障碍物,计算机视觉是 AI 的一个子领域,用于分析视觉数据。像 Ultralytics YOLO11 这样的计算机视觉模型可以帮助无人机实时检测和跟踪物体,使其更好地理解并与周围环境交互。

图 1。将包裹送往目的地的配送无人机。
美团和 DJI 等公司已经在无人机中集成计算机视觉。事实上,无人机在各个行业中的快速普及,推动AI 无人机市场预计到 2031 年增长至 2069 亿美元。
在本文中,我们将深入了解如何将 Ultralytics YOLO11 等计算机视觉模型应用于无人机配送等基于无人机的应用。我们将通过一个示例,展示如何在这些技术用于真实场景之前对其进行开发和测试。
使用 Ultralytics YOLO11 在无人机上检测房屋#
配送无人机的一项关键能力是在导航过程中检测房屋。为了重现这一能力并了解其工作原理,我们将训练一个能够识别航拍无人机拍摄画面中房屋的计算机视觉模型。为此,我们将对 Ultralytics YOLO11 进行自定义训练,即使用带标签的示例对预训练 YOLO11 模型进行微调,使其能够识别和检测房屋。
为此,我们需要高质量的无人机视频数据。有趣的是,即使无法使用真实无人机,我们仍然可以生成逼真的航拍画面。下面来看看具体方法。
使用 Google Earth Studio 创建模拟无人机镜头#
Google Earth Studio 是一款基于 Web 的动画工具,用户可以利用 Google Earth 的卫星和 3D 影像创建静态和动画内容。我们可以使用它来创建逼真的航拍画面。
第一步是打开 Google Earth Studio 并创建一个项目,如下所示。
你需要使用 Google 账号登录。

图 2。在 Google Earth Studio 上创建项目。
登录后,你可以为模拟无人机视频选择一个位置。使用页面左上角的搜索栏,你可以搜索地点。在本教程中,我们将选择加拿大。此外,由于我们要训练一个用于检测房屋的模型,因此无人机视频应包含房屋的航拍视角。

图 3。使用 Google Earth Studio 选择位置。
接下来,我们可以设置第一个和最后一个时间帧,以捕捉模拟无人机镜头的运动。选择无人机镜头的起始位置后,使用蓝色菱形设置第一帧,如下所示。

图 4。使用蓝色菱形设置第一帧。
接下来,我们可以选择最后一帧来确定无人机的目的地。这将帮助我们为无人机画面创建移动效果。为此,将滑块(如下方高亮显示)向右拖动到特定时间,以便为无人机镜头创建移动效果。再次使用蓝色菱形设置最后一个点。

图 5。移动滑块设置最后一帧。
最后,你可以点击页面右上角的红色“Render”按钮保存并渲染项目。这样就能得到无人机镜头的最终视频输出,成功创建模拟无人机视频画面。

图 6。渲染最终输出视频。
如何标注无人机数据?#
现在我们已经创建了模拟无人机视频画面,下一步是对其中的房屋进行标记或标注。我们还需要分离视频中的各个帧。
首先,我们将安装 LabelImg。LabelImg 是一款开源图像标注工具。你可以通过 pip 包安装程序直接从终端安装它,运行以下命令:“pip install labelImg”。
安装完成后,你可以在终端或命令提示符中使用“labelImg”命令运行该工具。这会打开如下所示的页面。

图 7。LabelImg 工具界面。
与此同时,我们可以使用在线视频转图像转换器或名为 FFmpeg 的工具将视频拆分为帧。FFmpeg 是一组用于处理音频、视频、字幕及相关元数据等多媒体内容的库和工具。
你可以使用以下终端命令分离无人机视频画面中的每一帧:
ffmpeg -i input_video.mp4 frame_%04d.png分离出无人机画面的各个帧后,我们就可以开始标注其中的物体(房屋)。通过 LabelImg 工具导航到图像文件夹,我们可以标注每张图像中的物体。请确保保存并核验每张已标注的图像。完成图像标注后,我们就可以使用这些数据训练 Ultralytics YOLO11 了。

图 8。保存已标注图像的示例。
Ultralytics YOLO11 模型训练工作流程#
开始训练 Ultralytics YOLO11 之前,我们将整理图像和标签。首先创建两个文件夹:一个名为 "train",另一个名为 "valid"。将图像分配到这两个文件夹中。然后,在每个文件夹内分别创建用于存放图像及其对应标签文件(文本格式)的子文件夹,如下所示。

图 9。创建图像和标签文件夹的示例。
然后,我们可以按以下步骤开始训练 Ultralytics YOLO11 模型:
- 步骤 1: 安装 Ultralytics Python 软件包。你可以在终端中运行命令“pip install ultralytics”完成安装。如果遇到安装问题,请查看我们的故障排除指南,其中提供了帮助你解决问题的提示和技巧。
- 步骤 2: 成功安装软件包后,创建一个名为 ‘data.yaml’ 的文件。这是训练模型所必需的配置文件。在 data.yaml 文件中加入以下信息:训练数据集的路径、验证数据集的路径、类别数量 (nc) 以及类别名称列表 (names),如下所示。

图 10。data.yaml 文件示例。
- 步骤 3: 配置好 ‘data.yaml’ 文件后,你可以使用以下 Python 代码开始训练模型。此代码会加载预训练的 Ultralytics YOLO11 模型,并根据你的配置进行训练。
from ultralytics import YOLO
# Load a YOLO11 model
model = YOLO("yolo11n.pt") # choose your model, e.g., YOLO11 nano
# Train the model with your data and settings
model.train(data="data.yaml", epochs=100, imgsz=640)- 步骤 4: 训练完成后,你应该会看到类似于下方所示的输出。这意味着你已经成功训练了用于无人机应用的 Ultralytics YOLO11 模型。

图 11。模型训练后显示的输出。
在无人机上使用 Ultralytics YOLO11 运行预测#
现在可以通过称为推理的过程,使用训练好的 Ultralytics YOLO11 模型进行预测。推理是指利用模型根据训练期间学到的知识分析新的、未见过的数据。在本例中,模型可以通过在物体周围绘制边界框,在图像或视频中查找并标注房屋等特定物体。
要运行预测,你可以使用训练好的 Ultralytics YOLO11 模型处理输入视频,代码如下。在本例中,我们将使用训练时所用的同一个模拟无人机视频,但如果你愿意,也可以使用其他视频文件。
# Import library
from ultralytics import YOLO
# Load the YOLO model
model = YOLO("best.pt") # Choose your custom-trained model
# Predict the results from the model
results = model.predict(source="path/to/original/video.mp4", show=True, save=True)运行此代码后,包含预测结果和边界框的输出视频文件将被保存。

图 12。输出视频文件中的一帧。
将 Ultralytics YOLO11 集成到无人机中用于各种应用#
使用无人机配送包裹时检测房屋,只是计算机视觉和 Ultralytics YOLO11 的一种应用示例。以下是计算机视觉、YOLO11 和航拍无人机的其他一些现实应用:
-
监控与安防: AI 无人机可用于实时监控大范围区域。它们可以检测入侵、跟踪可疑活动,并提升国家边境和大型公共活动的安全性。
-
灾害响应与搜救: 配备热成像摄像头和目标检测功能的无人机可以帮助在灾区定位幸存者。它们还可以评估损失并运送应急物资。
-
农业与精准农业: 集成计算机视觉的无人机可用于分析作物健康状况并检测疾病,帮助农民提高产量、降低成本。
-
测绘与地理空间分析: 通过采集高分辨率 3D 地图,AI 无人机可以协助城市规划和土地测量。与传统方法相比,它们能够更快、更准确地评估地形。
要点总结#
由计算机视觉驱动的 AI 无人机正在改变许多行业,从配送包裹到协助应急救援和农业作业。在本指南中,我们介绍了如何创建模拟无人机视频、标注其中的物体、训练 Ultralytics YOLO11,以及使用它检测房屋。
将目标检测应用于无人机画面可以让无人机变得更加智能,使其能够实时自动识别和跟踪物体。随着技术不断进步,AI 驱动的无人机可能会在加快配送、提升安全性和协助灾害响应方面发挥更大的作用。
加入我们的社区,探索我们的 GitHub 代码仓库,进一步了解视觉 AI;查看我们的许可选项,开始你的计算机视觉项目。对制造业中的 AI或汽车行业中的计算机视觉等创新感兴趣?访问我们的解决方案页面,了解更多信息。









