Real-time Inference
探索实时推理为 AI 预测带来的即时响应。了解 Ultralytics YOLO26 如何为边缘设备和机器人提供低延迟结果。
实时推理是指经过训练的机器学习 (ML)模型接收实时输入数据并几乎即时生成预测的过程。与离线处理不同,离线处理会收集数据并在稍后统一分析,而实时推理则即时进行,使系统能够快速、灵活地响应其环境。这项能力是现代人工智能 (AI)应用的核心,使设备能够在几毫秒内感知、理解并处理数据。
低延迟的重要性#
评估实时性能的主要指标是推理延迟。它衡量的是从数据输入模型的时刻(例如视频摄像头传入一帧画面的时刻)到模型生成输出的时刻(例如生成边界框或分类标签)之间的时间延迟。要使应用被视为“实时”,延迟必须足够低,以匹配输入数据流的速度。
例如,在以每秒 30 帧(FPS)运行的视频理解任务中,系统处理每一帧的严格时间预算约为 33 毫秒。如果推理耗时更长,系统就会产生延迟,可能导致丢帧或响应延迟。要实现这一点,通常需要使用GPU或NVIDIA Jetson等专用边缘 AI设备进行硬件加速。
实时推理与批量推理#
区分实时工作流和批处理非常有帮助。虽然两者都涉及生成预测,但它们的目标和架构存在显著差异:
- 实时推理: 优先考虑低延迟。它会在单个数据点(或非常小的批次)到达后立即进行处理。这对于自动驾驶汽车等交互式应用至关重要,因为汽车必须即时检测到行人,才能及时刹车。
- 批量推理: 优先考虑高吞吐量。它会收集大量数据并一次性完成处理。这适用于非紧急任务,例如生成每晚的库存报告或分析历史大数据趋势。
实际应用#
在瞬间做出决策的能力推动了各行业的转型,使动态环境中的自动化成为可能。
- 智能制造: 在制造业中的 AI中,传送带上方的摄像头利用实时推理执行自动化质量控制。目标检测模型可以即时识别高速移动产品中的缺陷或异物。如果检测到异常,系统会触发机械臂立即移除该物品,确保只有高质量商品进入包装环节。
- 监控与安防: 现代安防系统依靠计算机视觉监控周界。这些摄像头不只是录制画面,还会运行实时人员检测或人脸识别,在未经授权的访问发生时立即向安保人员发出警报。
- 机器人技术: 在机器人领域的 AI中,机器人利用姿态估计在复杂的物理空间中导航。仓库机器人必须持续推断障碍物和工作人员的位置,以安全、高效地规划路径。
优化与部署#
为实时应用部署模型通常需要进行优化,以确保模型能够在目标硬件上高效运行。模型量化等技术会降低模型权重的精度(例如从 float32 降至 int8),从而减少内存使用量并提高推理速度,同时对准确率的影响极小。
开发者可以利用Ultralytics Platform简化这一流程。该平台简化了训练过程,并允许用户将模型导出为针对不同硬件优化的格式,例如用于 NVIDIA GPU 的TensorRT、用于 Intel CPU 的OpenVINO,或用于移动端部署的TFLite。
代码示例#
以下 Python 代码片段演示了如何使用 ultralytics 库在网络摄像头视频流上运行实时推理。它使用YOLO26 Nano 模型,该模型专为边缘设备上的高速性能而设计。
from ultralytics import YOLO
# Load the YOLO26 Nano model, optimized for speed and real-time tasks
model = YOLO("yolo26n.pt")
# Run inference on the default webcam (source="0")
# 'stream=True' returns a generator for memory-efficient processing
# 'show=True' displays the video feed with bounding boxes in real-time
results = model.predict(source="0", stream=True, show=True)
# Iterate through the generator to process frames as they arrive
for result in results:
# Example: Print the number of objects detected in the current frame
print(f"Detected {len(result.boxes)} objects")








