GPU (Graphics Processing Unit)
Erfahre, wie GPUs KI und Deep Learning beschleunigen. Entdecke die Möglichkeiten der parallelen Berechnung für das Training von Ultralytics YOLO26-Modellen und die Optimierung der Inferenz in Echtzeit.
Ein Grafikprozessor (GPU) ist eine spezialisierte elektronische Schaltung, die ursprünglich entwickelt wurde, um die Verarbeitung und Erstellung von Bildern in einem Bildpuffer für die Bildschirmausgabe zu beschleunigen. Obwohl ihre Ursprünge in der Darstellung von Computergrafiken für Spiele und professionelle Visualisierung liegen, haben sich GPUs zum grundlegenden Motor moderner künstlicher Intelligenz (AI) entwickelt. Im Gegensatz zu einem Standardprozessor, der einige wenige leistungsstarke Kerne verwendet, um Aufgaben nacheinander zu verarbeiten, besteht die Architektur einer GPU aus Tausenden kleinerer, effizienter Kerne, die für die gleichzeitige Verarbeitung mehrerer Aufgaben ausgelegt sind. Diese als parallele Datenverarbeitung bezeichnete Fähigkeit macht GPUs besonders effizient für die umfangreichen Matrix- und Vektoroperationen, auf denen Tiefenlernen (DL) und komplexe neuronale Netze (NN) beruhen.
Beschleunigung von AI-Workloads#
Der wichtigste Grund, warum GPUs für maschinelles Lernen (ML) unverzichtbar sind, ist ihre Fähigkeit, Matrixmultiplikationen mit hoher Geschwindigkeit auszuführen. Frameworks für Deep Learning wie PyTorch und TensorFlow sind speziell darauf optimiert, diese Hardwarebeschleunigung zu nutzen. Dadurch verkürzt sich die Zeit für das Trainieren von Modellen erheblich: Was auf einem Standardprozessor oft Wochen dauern würde, lässt sich auf einer GPU häufig in Stunden erledigen. Der Rechendurchsatz dieser Geräte wird typischerweise in FLOPS (Gleitkommaoperationen pro Sekunde) gemessen – eine wichtige Kennzahl, um die Fähigkeit der Hardware zur Verarbeitung der hohen Anforderungen moderner Modelle wie YOLO26 zu bewerten.
Hardwareunterschiede: GPU vs. CPU vs. TPU#
Um die Hardwarelandschaft zu verstehen, ist es hilfreich, die GPU von anderen Recheneinheiten zu unterscheiden:
- CPU (Zentralprozessor): Das universell einsetzbare „Gehirn“ eines Computers. CPUs sind besonders gut für die sequenzielle Verarbeitung und komplexe Logikverzweigungen geeignet, arbeiten bei der für das Training großer AI-Modelle erforderlichen massiven Parallelverarbeitung jedoch weniger effizient.
- GPU (Grafikprozessor): Der Industriestandard für Training und Inferenz. Führende Hersteller wie NVIDIA nutzen Softwareökosysteme wie CUDA, damit Entwickler die GPU direkt für universelle Berechnungen programmieren können.
- TPU (Tensorprozessor): Eine speziell für maschinelles Lernen mit neuronalen Netzen entwickelte anwendungsspezifische integrierte Schaltung (ASIC). Sie ist zwar für bestimmte Tensoroperationen sehr effizient, aber für allgemeinere Rechenaufgaben weniger vielseitig als GPUs.
Anwendungen in der Praxis#
Der Einsatz leistungsstarker GPUs hat Innovationen in verschiedensten Branchen vorangetrieben:
- Autonome Fahrzeuge: Selbstfahrende Autos müssen jede Sekunde Gigabytes an Daten von Kameras, Radar- und LiDAR-Sensoren verarbeiten. GPUs ermöglichen Inferenz in Echtzeit, sodass der Bordcomputer des Fahrzeugs Modelle zur Objekterkennung ausführen kann, die Fußgänger, Verkehrsschilder und Hindernisse sofort erkennen.
- Medizinische Bildanalyse: Im Gesundheitswesen beschleunigen GPUs die Verarbeitung hochauflösender Aufnahmen wie MRT- und CT-Scans. Sie ermöglichen anspruchsvolle Algorithmen zur Bildsegmentierung, mit denen sich Tumoren oder Organe präzise abgrenzen lassen. Dadurch können Radiologen schneller und genauer diagnostizieren, ohne sich ausschließlich auf eine manuelle Untersuchung zu verlassen.
Training mit GPUs#
Bei Verwendung des Pakets ultralytics ist der Einsatz einer GPU unkompliziert und für effiziente Arbeitsabläufe sehr empfehlenswert. Die Bibliothek unterstützt die automatische Geräteerkennung, du kannst das Gerät aber auch ausdrücklich angeben.
Das folgende Beispiel zeigt, wie du ein YOLO26-Modell auf der ersten verfügbaren GPU trainierst:
from ultralytics import YOLO
# Load the YOLO26n model
model = YOLO("yolo26n.pt")
# Train the model on the first available GPU (device=0)
# This significantly accelerates training compared to CPU usage
results = model.train(data="coco8.yaml", epochs=5, imgsz=640, device=0)Bereitstellung und Optimierung#
Neben dem Training spielen GPUs eine entscheidende Rolle bei der Bereitstellung von Modellen. Um die Effizienz während der Inferenz zu maximieren, werden Modelle häufig in optimierte Formate wie TensorRT konvertiert. Dabei wird das neuronale Netz so umstrukturiert, dass es exakt zur jeweiligen GPU-Architektur passt und die Latenz reduziert. Entwicklern ohne Zugriff auf leistungsstarke lokale Hardware bietet die Ultralytics Platform cloudbasierte Lösungen zur Verwaltung von Datensätzen und zum Training von Modellen auf leistungsfähigen GPU-Clustern in der Cloud. Diese Zugänglichkeit fördert Innovationen im Bereich Edge AI, da sich komplexe Aufgaben der Computer Vision (CV) auf kleineren, energieeffizienten Geräten vor Ort bereitstellen lassen.









