如何使用 Ultralytics YOLO 文档的“参考”部分
了解如何使用 Ultralytics YOLO 文档的“参考”部分,来理解 Ultralytics Python 包的底层逻辑。

如今,人工智能(AI)变得比以往任何时候都更加触手可及,任何人都可以深入探索并快速开始使用各种 AI 模型来完成不同的尖端任务。
例如,computer vision 是人工智能的一个分支,它让计算机能够解释和理解来自图像和视频的视觉信息,而像 Ultralytics YOLO11 这样的计算机 vision 模型非常容易上手。
Ultralytics YOLO11 支持目标检测、实例分割和图像分类等任务,可用于自动驾驶、安全监控和零售分析等应用。

图 1. Ultralytics YOLO11 可用于检测各种对象。
具体来说,Ultralytics Python package 提供了用户友好的工具,可以快速训练、定制和部署这些 AI 模型,让所有技能水平的用户都能轻松构建高级的计算机 vision 应用。
不过,如果你有兴趣深入了解一切是如何运作的或者创建你自己的定制内容,Ultralytics 文档的 Reference section 是一个极好的资源。它涵盖了 Ultralytics Python package 的内部运作机制,包括你的数据如何被处理、模型训练过程以及如何可视化预测结果。
在本文中,我们将仔细了解 Ultralytics 文档的参考部分,以及在从事计算机视觉项目时如何使用它。让我们开始吧!
深入了解 Ultralytics YOLO 模型的工作原理#
使用 Ultralytics Python package 简单直接。你只需几行代码就可以训练 YOLO 模型或在图像中 detect objects。
然而,一旦你熟悉了计算机 vision 模型的使用,Ultralytics 文档的参考部分将帮助你更深入地了解 how the code works 以及该 package 支持哪些函数。它还包含易于遵循的解释、可配置选项以及指向 Ultralytics GitHub repository 中相关代码的链接。
它解释了 Ultralytics Python 软件包的结构,并涵盖了模型设置、数据加载、训练过程以及如何生成和返回预测结果等关键组件。
所有内容都组织在清晰的类别中,因此很容易找到你需要的信息。例如,如果你正在使用自己的数据集训练模型,可以前往参考部分中关于数据的内容,它会让你更清楚地了解数据将如何被用于模型训练。
如何开始使用参考部分#
如果你前往 Ultralytics YOLO 文档中的参考部分,你会发现在页面左侧有一个包含不同参考类别的菜单。每个类别代表 Ultralytics codebase 的特定部分,例如 models、数据处理或训练函数。
点击某个类别将带你进入一个提供更多详细信息的页面。

Fig 2. 在左侧,你会找到一个包含不同参考类别的菜单。
同样,在页面右侧,你会找到目录,它将每个参考页面分解为关键组件,如函数(可重用的代码块)、类(创建对象的蓝图)和方法(定义在类内部的函数)。这让你能够轻松直接地跳转到你寻找的内容。

Fig 3. 在右侧,你会找到你正在查看的具体参考页面的目录。
Ultralytics GitHub 仓库的结构#
Ultralytics GitHub repository 根据 Ultralytics package 的不同部分组织成子目录或子包,例如模型、训练和 data。文档中的参考部分遵循相同的结构,这使得理解所有部分如何组合在一起变得更加容易。
以下是你将在 Ultralytics GitHub 仓库和 Ultralytics 文档参考部分中看到的一些主要子目录或类别:
- Models:本节重点介绍不同的模型及其 modes,例如进行预测、验证性能和导出训练好的模型。
- Engine(引擎):它包含用于训练、验证、预测、导出和评估模型的核心逻辑。
- Data(数据):它管理数据集的加载、处理和增强方式。这包括用于创建数据加载器(将数据批量输入模型的工具)、应用变换(对图像进行的调整,如调整大小或翻转,以帮助模型更好地学习)以及为训练准备数据(整理和格式化图像与标签)的功能。
- Utils(工具):本部分提供在代码库中使用的各种辅助函数,如可视化工具、文件处理和指标计算。
- HUB:它连接到 Ultralytics HUB(一个无代码计算机 vision 平台),通过 API 启用登录、上传模型和管理数据集等云功能。
- Trackers(追踪器):它为涉及视频或逐帧图像序列的应用实现了对象追踪逻辑。
GitHub 仓库中的每个子目录在文档中都有相应的对应部分。这种结构是有意为之的,旨在让用户更容易在阅读文档和探索源代码之间进行切换。
事实上,在许多参考页面中,实际的源代码也会显示出来,因此你无需离开文档即可准确查看函数和类是如何实现的。

Fig 4. 参考页面中也包含了源代码。
理解模型、引擎和数据组件#
既然我们已经了解了参考部分是如何组织的,那么让我们仔细看看 Ultralytics 软件包的三个关键部分:模型、引擎和数据。
models 子目录包含定义每种模型工作方式的代码。它按模型类型(如 YOLO、FastSAM 或 RT-DETR)和任务(如检测、分割或分类)进行组织。在每个任务内部,你会找到处理特定操作的文件或模块 - 例如,模型如何进行预测、如何接受训练,或者其 performance 如何被评估。
同时,Engine 子目录在后台运行,管理整个流程。虽然 Models 子目录侧重于每个模型应该做什么,但 Engine 子目录侧重于如何以一致且高效的方式执行这些任务。
此外,Data 子目录负责加载和准备数据集。这部分代码库确保你的训练数据干净、结构化且多样化,从而帮助模型更好地学习并提升泛化能力。
这种清晰的划分使得代码更易于维护,同时也为用户提供了自定义的灵活性。
使用参考部分的示例#
你可能想知道,为什么了解 Ultralytics 代码库的不同部分很重要?如果你知道哪部分代码处理什么功能,就更容易找到所需的信息、进行修改或解决问题。
以下是如何使用文档参考部分的一些示例:
- 如果你在问:“模型如何进行预测?”,你可以前往参考部分的 Models 类别,选择一种模型类型(如 YOLO),选择一个任务(如 detect),然后打开 Predict 页面查看详情。
- 如果你想了解 data augmentations 是如何应用的,可以浏览 Data 类别下的 Augment 页面。它列出了用于提高模型性能和训练数据多样性的内置增强技术。
通过参考部分探索结果#
当你试图理解模型返回的输出时,“参考”部分也很有帮助。在像 Ultralytics YOLO11 这样的模型被用于对图像运行推理后,它会返回一组描述检测结果的集合。
例如,在相机画面中,它可能会检测到一个人并使用 bounding box 标出其位置,同时附带置信度得分 - 一个介于 0 和 1 之间的值,表示模型对检测结果的确定程度。
如果你正试图理解如何在你的项目中使用该输出,参考部分可以指导你。它包含一个关于 Results module 的页面,详细剖析了包含的内容以及如何在代码中访问它。其中包含有关如何查看检测框、检查置信度得分、显示结果或保存结果的详细信息。

Fig 5. YOLO11 返回的结果如何进行可视化的示例。
关键要点#
Ultralytics 文档可帮助你了解如何有效地使用 YOLO 模型。它解释了关键流程,例如训练模型、准备数据以及处理结果。每个页面都有清晰的解释和示例代码片段,帮助你快速上手。
如果你对幕后工作原理感到好奇,文档的参考部分也进行了分步解析。它展示了代码的结构、每个部分的功能以及它们是如何协同工作的。这使得学习、自定义以及自信地构建自己的计算机视觉项目变得更容易。
加入 our active community 并探索 GitHub repository 以了解更多关于用 AI 构建的内容。准备好启动你自己的计算机 vision 构想了吗?访问 our licensing options 以开始使用。访问我们的解决方案页面,了解 vision AI in automotive 和 AI in healthcare 如何产生影响。






