GPU (Graphics Processing Unit)
了解 GPU 如何加速 AI 和深度学习。探索并行计算在训练 Ultralytics YOLO26 模型和优化实时推理方面的强大能力。
图形处理器(GPU)是一种专用电子电路,最初设计用于加速帧缓冲区中图像的处理和生成,以便输出到显示设备。虽然 GPU 起源于游戏和专业可视化领域中的计算机图形学渲染,但如今已发展成为现代人工智能(AI)的基础引擎。标准处理器使用少量高性能核心按顺序处理任务,而 GPU 架构由数千个更小、更高效的核心组成,旨在同时处理多个任务。这种称为并行计算的能力,使 GPU 非常适合执行支撑深度学习(DL)和复杂神经网络(NN)的大规模矩阵和向量运算。
加速 AI 工作负载#
GPU 对机器学习(ML)不可或缺的主要原因在于,它能够高速执行矩阵乘法。像 PyTorch 和 TensorFlow 这样的深度学习框架经过专门优化,可以充分利用这种硬件加速能力。因此,模型训练所需的时间会显著缩短:原本在标准处理器上需要数周的计算,通常可以在 GPU 上缩短至数小时。这些设备的计算吞吐量通常以 FLOPS(每秒浮点运算次数)衡量,这是评估硬件处理 YOLO26 等最先进模型严苛计算需求能力的关键指标。
硬件区别:GPU、CPU 与 TPU#
要了解硬件格局,区分 GPU 与其他处理单元会很有帮助:
- CPU(中央处理器):计算机的通用“大脑”。CPU 擅长顺序处理和复杂的逻辑分支,但在大规模 AI 训练所需的海量并行计算方面效率较低。
- GPU(图形处理器):训练和推理的行业标准。像NVIDIA这样的领先制造商利用CUDA等软件生态系统,让开发者能够直接为 GPU 编程,以执行通用计算。
- TPU(张量处理器):专为神经网络机器学习开发的专用集成电路(ASIC)。虽然 TPU 在特定张量运算方面效率很高,但在更广泛的计算任务中不如 GPU 灵活。
实际应用#
高性能 GPU 的应用推动了多个不同行业的创新:
- 自动驾驶汽车:自动驾驶汽车每秒都必须处理来自摄像头、雷达和 LiDAR 传感器的数 GB 数据。GPU 支持实时推理,使车辆的车载计算机能够运行目标检测模型,即时识别行人、交通标志和障碍物。
- 医学图像分析:在医疗领域,GPU 可加速处理 MRI 和 CT 等高分辨率扫描图像。GPU 支持复杂的图像分割算法,精准 delineate 肿瘤或器官,帮助放射科医生更快、更准确地进行诊断,而不必完全依赖人工检查。
使用 GPU 进行训练#
使用 ultralytics 软件包时,利用 GPU 非常简单,并且强烈推荐这样做,以实现高效的工作流。该库支持自动检测设备,但你也可以显式指定设备。
以下示例演示了如何在第一块可用 GPU 上训练YOLO26模型:
from ultralytics import YOLO
# Load the YOLO26n model
model = YOLO("yolo26n.pt")
# Train the model on the first available GPU (device=0)
# This significantly accelerates training compared to CPU usage
results = model.train(data="coco8.yaml", epochs=5, imgsz=640, device=0)部署与优化#
除了训练之外,GPU 在模型部署中也发挥着关键作用。为了最大限度地提高推理效率,模型通常会转换为TensorRT等优化格式。TensorRT 会重构神经网络,使其与特定 GPU 架构完美匹配,从而降低延迟。对于无法使用高端本地硬件的开发者,Ultralytics Platform提供基于云的解决方案,用于管理数据集,并在强大的远程 GPU 集群上训练模型。这种可访问性推动了边缘 AI的发展,使复杂的计算机视觉(CV)任务能够部署到现场更小型、更节能的设备上。









