TensorRT
探索 TensorRT 如何针对 NVIDIA GPU 优化深度学习模型。立即了解如何将 Ultralytics YOLO26 导出为 TensorRT,以实现低延迟、高速推理。
TensorRT 是 NVIDIA 开发的高性能深度学习推理软件开发工具包(SDK)。它旨在优化神经网络模型以进行部署,为深度学习应用提供低推理延迟和高吞吐量。TensorRT 作为优化编译器运行,可接收 PyTorch 和 TensorFlow 等热门框架训练的网络,并对其进行重构,使其能够在 NVIDIA GPU 上高效执行。对于速度和效率至关重要的生产环境,这项能力对于运行复杂 AI 模型非常关键。
TensorRT 如何优化模型#
TensorRT 的核心功能是将训练好的神经网络转换为针对目标硬件专门调优的优化“引擎”。它通过以下几种先进技术实现这一点:
- **层融合:**优化器将神经网络的多个层合并为单个内核,从而减少内存访问开销并提升执行速度。
- **精度校准:**TensorRT 支持降低精度的模式,例如混合精度(FP16)和整数量化(INT8)。通过减少用于表示数字的位数(通常只会造成极小的精度损失),开发者可以显著加速数学运算并减少内存使用。这属于模型量化的一种形式。
- **内核自动调优:**该软件会根据所使用的具体 GPU 架构,自动选择最佳的数据层和算法,通过 CUDA 充分利用硬件的并行处理能力。
实际应用#
TensorRT 能够以极低的延迟处理海量数据,因此被广泛应用于依赖计算机视觉和复杂 AI 任务的行业,这些任务对时效性要求很高。
-
**自动驾驶系统:**在汽车领域的 AI中,自动驾驶汽车必须处理来自多个摄像头的视频流,以即时检测行人、标志和障碍物。借助 TensorRT,目标检测网络等感知模型可以在毫秒级分析帧,使车辆控制系统能够及时做出关乎安全的决策。
-
**工业自动化:**现代工厂利用制造业中的 AI进行自动化光学检测。高速摄像头捕捉装配线上的产品图像,经过 TensorRT 优化的模型则实时识别缺陷或异常。这确保质量控制能够跟上高速生产环境的节奏;这些模型通常直接部署在工厂车间的边缘 AI设备上,例如 NVIDIA Jetson 平台。
将 TensorRT 与 Ultralytics YOLO 结合使用#
借助现代 AI 工具,将 TensorRT 集成到你的工作流中非常简单。ultralytics 包提供了一种无缝方法,可将标准 PyTorch 模型转换为 TensorRT 引擎。这样,用户就能将 Ultralytics YOLO26 的先进架构与 NVIDIA GPU 的硬件加速结合起来。对于希望在导出前管理数据集和训练流水线的团队,Ultralytics Platform 提供了一个全面的环境,用于准备模型以进行此类高性能部署。
下面的示例演示了如何将 Ultralytics YOLO26 模型导出为 TensorRT 引擎文件(.engine),并将其用于实时推理:
from ultralytics import YOLO
# Load the latest stable YOLO26 model (nano size)
model = YOLO("yolo26n.pt")
# Export the model to TensorRT format (creates 'yolo26n.engine')
# This step optimizes the computational graph for your specific GPU
model.export(format="engine")
# Load the optimized TensorRT engine for high-speed inference
trt_model = YOLO("yolo26n.engine")
# Run inference on an image source
results = trt_model("https://ultralytics.com/images/bus.jpg")TensorRT 与 ONNX 及训练框架的比较#
了解 TensorRT 与模型部署领域中经常提到的其他术语之间的区别非常重要:
- **与 PyTorch/TensorFlow 的比较:**PyTorch 等框架主要用于模型训练和研究,具有灵活且易于调试的特点。TensorRT 是专门用于尽可能快速执行训练后模型的推理引擎,并不用于训练。
- 与 ONNX 的比较:ONNX(开放神经网络交换(ONNX))格式充当不同框架之间的中间桥梁。ONNX 提供互操作性(例如,将模型从 PyTorch 转移到其他平台),而 TensorRT 则专注于针对特定硬件进行优化。通常,模型会先转换为 ONNX,然后由 TensorRT 解析以生成最终引擎。
对于希望最大限度提升其AI 智能体或视觉系统性能的开发者而言,理解从训练框架过渡到 TensorRT 这类优化运行时,是专业机器学习运维(MLOps)中的关键一步。









