GPU (Graphics Processing Unit)
了解 GPU 如何加速 AI 和深度学习。探索并行计算在训练 Ultralytics YOLO26 模型和优化实时推理方面的强大能力。
图形处理器(GPU)是一种专门的电子电路,最初旨在加速显示输出帧缓冲区中图像的操作和创建。虽然其根源在于渲染用于游戏和专业可视化的计算机图形学,但 GPU 已经演变为现代人工智能(AI)的基础引擎。与使用少数强大核心按顺序处理任务的标准处理器不同,GPU 架构由数千个更小、高效的核心组成,旨在同时处理多个任务。这种被称为并行计算的能力,使其在支撑深度学习(DL)和复杂神经网络(NN)的大规模矩阵和向量运算时极具效率。
加速 AI 工作负载#
GPU 对机器学习(ML)不可或缺的首要原因在于其执行高速矩阵乘法的功能。像 PyTorch 和 TensorFlow 这样的深度学习框架经过专门优化,能够利用这种硬件加速。这大大缩短了模型训练的时间,通常能将在标准处理器上需要数周计算的任务缩短至在 GPU 上只需数小时。这些设备的计算吞吐量通常以 FLOPS(每秒浮点运算次数)来衡量,这是评估硬件处理诸如 YOLO26 等尖端模型严格需求能力的关键指标。
硬件区别:GPU vs. CPU vs. TPU#
要了解硬件格局,区分 GPU 与其他处理单元非常有用:
- CPU(中央处理器):计算机的通用“大脑”。CPU 擅长顺序处理和复杂的逻辑分支,但对于大规模 AI 训练所需的大规模并行处理效率较低。
- GPU(图形处理器):训练和推理的行业标准。像 NVIDIA 这样的领先制造商利用 CUDA 等软件生态系统,允许开发者直接为通用计算编写 GPU 程序。
- TPU(张量处理器):一种专门为神经网络机器学习开发的专用集成电路(ASIC)。虽然针对特定的张量运算效率极高,但在处理更广泛的计算任务时,它们的通用性不如 GPU。
实际应用#
高性能 GPU 的应用推动了各行各业的创新:
- 自动驾驶汽车:自动驾驶汽车必须每秒处理来自摄像头、雷达和激光雷达传感器的数吉字节数据。GPU 实现了实时推理,使车辆的车载计算机能够运行目标检测模型,即时识别行人、交通标志和障碍物。
- 医学图像分析:在医疗保健领域,GPU 加速了 MRI 和 CT 等高分辨率扫描的处理。它们使复杂的图像分割算法能够精确勾勒出肿瘤或器官,协助放射科医生做出更快、更准确的诊断,而无需仅依赖人工检查。
使用 GPU 进行训练#
当使用 ultralytics 包时,使用 GPU 非常简单且强烈推荐用于高效的工作流。该库支持自动设备检测,但用户也可以显式指定设备。
以下示例演示了如何在第一个可用的 GPU 上训练 YOLO26 模型:
from ultralytics import YOLO
# Load the YOLO26n model
model = YOLO("yolo26n.pt")
# Train the model on the first available GPU (device=0)
# This significantly accelerates training compared to CPU usage
results = model.train(data="coco8.yaml", epochs=5, imgsz=640, device=0)部署与优化#
除了训练之外,GPU 在模型部署中也起着至关重要的作用。为了在推理过程中实现效率最大化,模型通常会转换为诸如 TensorRT 等优化格式,该格式会重新构架神经网络以完美契合特定的 GPU 架构,从而减少延迟。对于无法访问高端本地硬件的开发者,Ultralytics Platform 提供了基于云的解决方案来管理数据集并在强力的远程 GPU 集群上训练模型。这种便利性推动了边缘 AI 的创新,使复杂的计算机视觉(CV)任务能够在现场更小、更省电的设备上部署。






