GPU (Graphics Processing Unit)
GPUがどのようにAIとディープラーニングを加速するかを学びます。Ultralytics YOLO26モデルのトレーニングやリアルタイム推論の最適化において、並列コンピューティングの威力を体験してください。
Graphics Processing Unit (GPU) は、もともとディスプレイ出力用のフレームバッファ内での画像の操作と生成を高速化するために設計された特殊な電子回路です。そのルーツはゲームやプロフェッショナル向けビジュアライゼーションのためのコンピュータグラフィックスのレンダリングにありますが、GPUは現代の人工知能 (AI)の基本的なエンジンへと進化しました。いくつかの強力なコアを使用してタスクを順次処理する標準的なプロセッサとは異なり、GPUアーキテクチャは、複数のタスクを同時に処理するように設計された何千もの小型で効率的なコアで構成されています。並列計算として知られるこの機能により、GPUはディープラーニング (DL)や複雑なニューラルネットワーク (NN)の基礎となる大規模な行列演算およびベクトル演算において非常に効率的になります。
AIワークロードの高速化#
機械学習 (ML)においてGPUが不可欠である最大の理由は、高速な行列乗算を実行できる能力です。PyTorchやTensorFlowなどのディープラーニングフレームワークは、このハードウェアアクセラレーションを活用するように特別に最適化されています。これにより、モデルのトレーニング時間が大幅に短縮され、標準的なプロセッサでは数週間かかる計算がGPUでは数時間で済むようになります。これらのデバイスの計算スループットは通常、最先端モデルのYOLO26などの厳格な要求を処理するハードウェアの能力を測定するための重要な指標であるFLOPS (Floating Point Operations Per Second) で測定されます。
ハードウェアの違い: GPU vs. CPU vs. TPU#
ハードウェアの全体像を理解するために、GPUと他の処理ユニットとの違いを区別すると役立ちます。
- CPU (Central Processing Unit): コンピュータの汎用的な「頭脳」。CPUは順次処理や複雑なロジック分岐に優れていますが、大規模なAIトレーニングに必要な大規模並列処理に対しては効率が劣ります。
- GPU (Graphics Processing Unit): トレーニングと推論における業界標準。NVIDIAなどの主要メーカーは、開発者が汎用計算のためにGPUを直接プログラミングできるようにするためにCUDAなどのソフトウェアエコシステムを利用しています。
- TPU (Tensor Processing Unit): ニューラルネットワークの機械学習専用に開発された特定用途向け集積回路 (ASIC)。特定のテンソル演算に対しては非常に効率的ですが、より幅広い計算タスクにおいてはGPUほど汎用性が高くありません。
実社会での応用#
高性能GPUの実装は、さまざまな業界におけるイノベーションを促進してきました。
- 自動運転車: 自動運転車は、カメラ、レーダー、LiDARセンサーからの数ギガバイトのデータを毎秒処理する必要があります。GPUはリアルタイム推論を可能にし、車両の車載コンピュータが歩行者、交通標識、障害物を瞬時に識別する物体検出モデルを実行できるようにします。
- 医療画像分析: ヘルスケア分野において、GPUはMRIやCTなどの高解像度スキャンの処理を加速します。GPUにより、高度な画像セグメンテーションアルゴリズムで腫瘍や臓器を正確に描出できるようになり、放射線科医が手動検査のみに頼ることなく、より迅速かつ正確な診断を下すことが支援されます。
GPUでの学習#
ultralyticsパッケージを使用する場合、GPUの利用は簡単であり、効率的なワークフローのために強く推奨されます。ライブラリはデバイスの自動検出をサポートしていますが、ユーザーが明示的にデバイスを指定することも可能です。
次の例は、利用可能な最初のGPUでYOLO26モデルをトレーニングする方法を示しています:
from ultralytics import YOLO
# Load the YOLO26n model
model = YOLO("yolo26n.pt")
# Train the model on the first available GPU (device=0)
# This significantly accelerates training compared to CPU usage
results = model.train(data="coco8.yaml", epochs=5, imgsz=640, device=0)デプロイと最適化#
トレーニングを超えて、GPUはモデルのデプロイにおいて重要な役割を果たします。推論中の効率を最大化するため、モデルはしばしばTensorRTのような最適化されたフォーマットに変換されます。これによりニューラルネットワークが特定のGPUアーキテクチャに完全に一致するように再構築され、レイテンシが削減されます。ハイエンドなローカルハードウェアにアクセスできない開発者向けに、Ultralytics Platformはデータセットを管理し、強力なリモートGPUクラスター上でモデルをトレーニングするためのクラウドベースのソリューションを提供します。このアクセシビリティがエッジAIのイノベーションを駆動し、複雑なコンピュータビジョン (CV)タスクを現場のより小型で電力効率の高いデバイスにデプロイすることを可能にします。






