Real-time Inference
探索实时推理的力量,实现即时 AI 预测。了解 Ultralytics YOLO26 如何为边缘设备和机器人技术提供低延迟结果。
实时推理是指已训练的机器学习 (ML)模型接收实时输入数据并几乎瞬间生成预测的过程。与离线处理(即稍后集中收集和分析数据)不同,实时推理是即时进行的,使系统能够以速度和敏捷性对环境作出反应。这种能力是现代人工智能 (AI)应用的核心,允许设备在几毫秒内感知、解释数据并采取行动。
低延迟的重要性#
评估实时性能的主要指标是推理延迟。这衡量的是数据输入模型的那一刻(例如来自摄像机的帧)到模型产生输出的那一刻(例如边界框或分类标签)之间的时间延迟。要让应用被视为“实时的”,延迟必须足够低,以匹配传入数据流的速度。
例如,在以每秒 30 帧 (FPS) 运行的视频理解任务中,系统有大约 33 毫秒的严格时间预算来处理每一帧。如果推理耗时更长,系统就会引入延迟,可能导致丢帧或响应延迟。实现这一点通常需要使用GPU或诸如NVIDIA Jetson之类的专用边缘 AI设备进行硬件加速。
实时推理与批量推理#
区分实时工作流与批处理会很有帮助。虽然两者都涉及生成预测,但它们的目标和架构存在显着差异:
- 实时推理: 优先考虑低延迟。它在单个数据点(或极小的批次)到达时立即对其进行处理。这对于诸如自动驾驶汽车之类的交互式应用至关重要,在这种应用中,汽车必须立即检测到行人以便及时刹车。
- 批量推理: 优先考虑高吞吐量。它收集大量数据并一次性全部处理。这适用于不紧急的任务,例如生成夜间库存报告或分析历史大数据趋势。
实际应用#
在动态环境中实现自动化,从而通过瞬间决策能力改变了各行各业。
- 智能制造: 在制造业中的 AI 中,放置在传送带上方的摄像机使用实时推理来执行自动化质量控制。对象检测模型可以即时识别高速移动的产品中的缺陷或异物。如果检测到异常,系统会触发机械臂立即移除该物品,确保只有高质量的商品进入包装环节。
- 监控与安全: 现代安全系统依靠计算机视觉来监控周边。这些摄像机不仅记录画面,还运行实时的行人检测或人脸识别,以便在未经授权的访问发生时立即向安保人员发出警报。
- 机器人技术: 在机器人领域的 AI 领域,机器人使用姿态估计来导航复杂的物理空间。仓库机器人必须持续推断障碍物和人类工人的位置,以便安全高效地规划其路径。
优化与部署#
为实时应用部署模型通常需要进行优化,以确保它们在目标硬件上高效运行诸如模型量化之类的技术会降低模型权重的精度(例如,从 float32 降到 int8),以减少内存使用量并提高推理速度,同时对准确率的影响微乎其微。
开发者可以利用Ultralytics 平台来简化此流程。该平台简化了训练过程,并允许用户将模型导出到优化的格式,例如用于 NVIDIA GPU 的TensorRT、用于 Intel CPU 的OpenVINO或用于移动端部署的TFLite。
代码示例#
以下 Python 代码片段演示了如何使用 ultralytics 库对网络摄像头源运行实时推理。它使用了专门为边缘设备上的高速性能而设计的 YOLO26 Nano 模型。
from ultralytics import YOLO
# Load the YOLO26 Nano model, optimized for speed and real-time tasks
model = YOLO("yolo26n.pt")
# Run inference on the default webcam (source="0")
# 'stream=True' returns a generator for memory-efficient processing
# 'show=True' displays the video feed with bounding boxes in real-time
results = model.predict(source="0", stream=True, show=True)
# Iterate through the generator to process frames as they arrive
for result in results:
# Example: Print the number of objects detected in the current frame
print(f"Detected {len(result.boxes)} objects")





