什么是 YOLOE?让计算机视觉模型更进一步
了解 YOLOE 如何通过简单的提示词或照片查找对象。它无需重新训练或微调模型,即可实现更智能、更快速的计算机视觉。

目标检测是计算机视觉中的一项关键任务,目标是在图像或视频中识别并定位对象。它是计算机视觉的重要组成部分。计算机视觉是人工智能(AI)的一个领域,能够让机器理解和解读视觉数据。例如,目标检测可以帮助识别图片中的汽车,或在视频流中发现人物。
支持目标检测等计算机视觉任务的最知名模型系列之一,是 YOLO(只看一次)模型系列。YOLO 模型专为速度和准确性而设计,并在不断改进。例如,较新的版本之一 Ultralytics YOLO11 在真实场景中表现出色,即使面对更复杂的环境,也能提供准确结果。
一个名为 YOLOE 的新模型进一步推动了这一进展,旨在扩展 YOLO 模型的能力。传统模型需要重新训练才能识别新对象,而 YOLOE 可以根据简单的文本或图像提示,检测此前未见过的对象,因此能够更好地适应不断变化的环境。
本文将深入了解YOLOE 的独特之处、它与之前 YOLO 模型的比较,以及如何立即开始使用它。让我们开始吧!
YOLOE 概览#
YOLOE 是一种让目标检测更进一步的计算机视觉模型。它于 2025 年 3 月由清华大学的研究人员推出。YOLOE 与传统模型的不同之处在于,它采用了开放词汇检测。
大多数模型都经过训练,只能识别固定的对象列表,而 YOLOE 允许你使用简短描述或示例图像指定要查找的内容。例如,如果你要查找“绿色背包”,可以输入这段描述或向模型展示一张照片,YOLOE 就会在场景中定位它。
此外,即使没有任何提示,YOLOE 也能自行检测许多日常对象。这种识别此前从未见过的对象的能力称为零样本检测。在任务或关注对象可能意外变化的动态环境中,这项能力尤其有用。

图 1。了解 YOLOE 的能力。
YOLOE 的主要功能#
YOLOE 支持多种功能,旨在提升其在实际应用中的性能。凭借同时处理结构化和非结构化输入的能力,YOLOE 为目标检测和分割带来了新的可能性。
以下是该模型提供的一些主要功能:
- 基于提示的检测: YOLOE 可以根据简短的文本提示或示例图像搜索对象。这意味着每次任务发生变化时,你都不需要重新训练模型;只需描述或向模型展示你要查找的内容即可。
- 实例分割:除了在对象周围绘制边界框外,YOLOE 还可以使用实例分割勾勒出对象的精确形状。当对象相互重叠,或你需要了解对象的精确边界时,这项功能尤其有用。
- 无需提示的对象识别: 即使没有具体指令,YOLOE 也能识别对象。它使用一组预先学习的描述来快速识别对象,使整个过程更快、更高效。
YOLOE 与其他 YOLO 模型的比较#
现在我们对 YOLOE 有了更好的了解,接下来看看 YOLO 系列中一些与它相似的模型。
随着计算机视觉不断发展,YOLO 模型也在持续进步。例如,Ultralytics YOLOv8 支持了分割和分类等新任务,而后续版本(如 Ultralytics YOLO11)则专注于提升更多任务中的准确性和性能。
此外,YOLO-World 于 2024 年 1 月发布,引入了使用文字提示的能力,让用户可以描述想要查找的对象。YOLO-World 是零样本检测的优秀选择,但缺少实例分割和视觉提示支持等功能。
YOLOE 在 YOLO-World 的基础上增加了这些能力,提升了灵活性和性能,为实际计算机视觉应用提供了更具影响力的工具。

图 2。 YOLO-World 和 YOLOE 都支持零样本检测。
使用 Ultralytics Python 包运行 YOLOE#
无论你是想检测特定对象,还是想探索图像中的所有内容,开始使用 YOLOE 都很简单。Ultralytics Python 包支持该模型,因此可以轻松将它集成到你的项目中。接下来,让我们逐步了解如何使用它。
安装 Ultralytics 包#
第一步是使用 ‘pip’ 等包管理器安装 Ultralytics Python 包。你可以在终端或命令提示符中运行 “pip install ultralytics” 命令完成安装。
安装包后,你就拥有了加载模型、进行预测以及试验不同检测模式所需的一切。如果在安装过程中遇到问题,Ultralytics 官方文档提供了有用的故障排除部分。
使用 YOLOE 运行预测有几种不同方式。运行预测是指使用训练好的模型,在图像或视频中识别并定位对象。这些不同方法可以让你根据具体需求自定义与模型的交互方式。
下面让我们逐一讨论这些方法。
使用文本或图像提示检测特定对象#
YOLOE 可以根据简短的文本描述检测对象。例如,如果你要查找正在移动的马,可以使用类似 "horse walking" 的提示。
首先,加载预训练的 YOLOE 模型,并按照下面代码片段所示设置提示(即你希望模型查找内容的描述)。
from ultralytics import YOLOE
model = YOLOE("yoloe-11l-seg.pt")
prompt = ["horse walking"]
model.set_classes(prompt, model.get_text_pe(prompt))设置好模型和提示后,你就可以在图像或视频上运行模型。将代码中的文件路径替换为你的图像或视频文件路径:
results = model.predict("path/to/your/image.jpg")
results[0].show()这会显示图像,并根据你的提示清晰标记检测到的对象。你可以根据要查找的内容,更改提示来搜索不同对象,例如 "red suitcase"、"bicycle" 或 "zebra"。

图 3。使用 YOLOE 通过文本提示检测特定对象的示例。
同样,你也可以使用图像通过 Ultralytics Python 包向 YOLOE 提供提示。在视觉提示模式下,模型会使用该图像,在另一个场景中查找外观相似的物品。对于难以描述或缺少明确标签的对象,这项功能尤其有用。
如需详细了解相关代码,可以查看 Ultralytics 文档。
使用 YOLOE 进行通用目标检测#
在某些情况下,你可能并不确切知道要搜索什么,或者并没有要查找的特定对象。这时,无需提示模式就派上用场了。
使用此选项时,你无需输入描述或提供示例图像。YOLOE 会自行分析图像,并检测所有能够识别的内容,例如人物、动物、家具或日常对象。
这种方式可以让你在不给模型任何具体指令的情况下探索场景,非常实用。无论你是在扫描拥挤的房间,还是在查看活动频繁的录像,无需提示模式都能让你快速了解图像中有哪些内容。
你可以使用以下代码在无需提示模式下运行 YOLOE。首先加载模型,然后由模型处理图像并自动检测其中的对象。最后显示结果,并突出显示检测到的对象。
请务必将文件路径替换为图像的实际路径。
from ultralytics import YOLOE
model = YOLOE("yoloe-11l-seg-pf.pt")
results = model.predict("path/to/image.jpg")
results[0].show()下图展示了 YOLOE 在无需提示模式下可以检测到的内容。

图 4。在无需提示模式下使用 YOLOE。
YOLOE 的实时应用#
YOLOE 能够响应文本和图像提示,因此是实时应用的可靠工具。它的灵活性在节奏快速且时效性和准确性至关重要的环境中尤其有用。
让我们探索一些 YOLOE 在现实场景中的应用示例。
改善行李处理:实时行李检测#
在繁忙的机场中,定位特定行李可能很困难,尤其是在处理丢失行李时。YOLOE 可以帮助扫描实时视频,并根据“红色行李”这样的简单提示快速识别物品,从而简化这一过程。
如果行李丢失或放错位置,工作人员可以轻松更改提示,搜索其他物品,例如“黑色手提箱”。这种即时适应能力可以帮助机场工作人员快速找到正确的行李,无需查看数小时的录像或重新训练模型,从而让行李处理和丢失行李问题的解决速度更快、效率更高。
使用 YOLOE 监控公共空间#
市场、咖啡馆等拥挤公共空间的监控录像通常包含人物、物体和活动的混合内容,并且这些内容会在一天中不断变化。YOLOE 可以使用无需提示模式实时分析这些录像,自动检测包、桌子或自行车等物品,而无需具体指令。

图 5。YOLOE 可以在繁忙的公共空间中检测各种对象。
这对于安保团队发现无人看管的物品或跟踪人群移动尤其有用。YOLOE 可以同时检测多个对象,因此在活动或繁忙时段管理公共空间更加容易,帮助团队及时掌握信息并迅速应对。
YOLOE 的优缺点#
以下是使用 YOLOE 进行计算机视觉应用时的一些主要优势:
- 实时性能:YOLOE 针对快速、高效的处理进行了优化,即使在实时视频流或繁忙公共空间等动态环境中,也能实现实时检测。
- 可扩展性:YOLOE 具备良好的可扩展性,适用于各种应用,从安全和监控到零售、医疗保健及自动驾驶车辆。
- 易于使用:由于 Ultralytics Python 包支持 YOLOE,因此可以轻松将它集成到现有的计算机视觉项目中。
不过,使用 YOLOE 时也需要注意一些限制。以下是需要考虑的几个因素:
- 需要充足的训练数据:虽然 YOLOE 支持零样本检测,但它在未见过的对象上的性能取决于其从训练数据中进行泛化的能力。在某些情况下,要在高度专业化的任务中取得良好表现,可能需要额外数据或微调。
- 对输入质量敏感:低质量图像或视频可能会影响模型的准确性。模糊或光线不足的输入会降低模型准确检测对象的能力,因此高质量输入对于获得最佳性能非常重要。
要点总结#
YOLOE 允许用户通过文本或图像提示引导检测,为计算机视觉带来了更高的灵活性。它在场景快速变化且无法重新训练的真实环境中表现出色。
从行李处理到公共空间监控,YOLOE 都能轻松适应新任务。随着 AI 变得更加普及,YOLOE 这样的模型正帮助更多行业以实用、高效的方式使用视觉技术。
加入我们的社区,并探索我们的 GitHub 代码仓库,进一步了解 AI 创新。在我们的解决方案页面上,了解零售中的 AI和医疗保健中的计算机视觉等领域的最新进展。查看我们的许可选项,立即开始使用计算机视觉!









