GPU (Graphics Processing Unit)
GPUがAIとディープラーニングを高速化する方法を学べます。並列コンピューティングの力を活用してUltralytics YOLO26モデルをトレーニングし、リアルタイム推論を最適化する方法をご確認ください。
グラフィックス・プロセッシング・ユニット(GPU)は、もともとディスプレイ出力用のフレームバッファ内で画像の操作や生成を高速化するために設計された専用電子回路です。GPUは、ゲームやプロフェッショナルなビジュアライゼーション向けのコンピューターグラフィックスのレンダリングを起源としていますが、現在では現代の人工知能(AI)を支える中核エンジンへと進化しています。標準的なプロセッサが少数の高性能コアを使用してタスクを順次処理するのに対し、GPUアーキテクチャは、複数のタスクを同時に処理するよう設計された、数千個の小型で効率的なコアで構成されています。この能力は並列コンピューティングと呼ばれ、ディープラーニング(DL)や複雑なニューラルネットワーク(NN)の基盤となる大規模な行列演算やベクトル演算において、GPUを極めて効率的なものにしています。
AIワークロードの高速化#
GPUが機械学習(ML)に不可欠である主な理由は、高速な行列乗算を実行できることです。PyTorchやTensorFlowなどのディープラーニングフレームワークは、このハードウェアアクセラレーションを活用するよう特に最適化されています。その結果、モデルのトレーニングにかかる時間が大幅に短縮され、標準的なプロセッサでは数週間かかる計算を、GPUでは数時間で完了できることもあります。これらのデバイスの計算スループットは、通常、FLOPS(1秒あたりの浮動小数点演算数)で測定されます。これは、YOLO26のような最先端モデルが要求する厳しい処理をハードウェアが実行する能力を評価する重要な指標です。
ハードウェアの違い:GPU、CPU、TPU#
ハードウェアの全体像を理解するには、GPUを他のプロセッシングユニットと区別すると分かりやすくなります。
- CPU(中央処理装置):コンピューターの汎用的な「頭脳」です。CPUは逐次処理や複雑なロジック分岐を得意としますが、大規模なAIトレーニングに必要な大規模並列処理では効率が劣ります。
- GPU(グラフィックス・プロセッシング・ユニット):トレーニングと推論における業界標準です。NVIDIAなどの主要メーカーは、CUDAなどのソフトウェアエコシステムを活用し、開発者が汎用コンピューティング向けにGPUを直接プログラミングできるようにしています。
- TPU(テンソル・プロセッシング・ユニット):アプリケーション特化型集積回路(ASIC)の一種で、ニューラルネットワークの機械学習専用に開発されています。特定のテンソル演算では非常に効率的ですが、より幅広いコンピューティングタスクにおける汎用性はGPUに劣ります。
実世界での利用例#
高性能GPUの実装は、さまざまな業界でイノベーションを促進してきました。
- 自動運転車:自動運転車は、カメラ、レーダー、LiDARセンサーから毎秒数ギガバイトのデータを処理する必要があります。GPUはリアルタイム推論を可能にし、車載コンピューター上で物体検出モデルを実行して、歩行者、交通標識、障害物を瞬時に識別できるようにします。
- 医用画像解析:医療分野では、GPUがMRIやCTなどの高解像度スキャンの処理を高速化します。高度な画像セグメンテーションアルゴリズムを使用して腫瘍や臓器の範囲を正確に特定できるため、放射線科医は手作業による確認だけに頼ることなく、より迅速かつ正確な診断を行えます。
GPUを使用したトレーニング#
ultralyticsパッケージを使用する場合、効率的なワークフローのためにGPUを利用することは簡単であり、強く推奨されます。このライブラリはデバイスの自動検出に対応していますが、ユーザーがデバイスを明示的に指定することもできます。
次の例では、最初に利用可能なGPUでYOLO26モデルをトレーニングする方法を示します。
from ultralytics import YOLO
# Load the YOLO26n model
model = YOLO("yolo26n.pt")
# Train the model on the first available GPU (device=0)
# This significantly accelerates training compared to CPU usage
results = model.train(data="coco8.yaml", epochs=5, imgsz=640, device=0)デプロイと最適化#
トレーニングだけでなく、GPUはモデルのデプロイでも重要な役割を果たします。推論時の効率を最大化するため、モデルはTensorRTなどの最適化フォーマットに変換されることがよくあります。これによりニューラルネットワークが特定のGPUアーキテクチャに完全に適合するよう再構成され、レイテンシが短縮されます。高性能なローカルハードウェアを利用できない開発者向けに、Ultralytics Platformは、データセットの管理や高性能なリモートGPUクラスターでのモデルのトレーニングを行うためのクラウドベースのソリューションを提供しています。この利用しやすさがエッジAIのイノベーションを促進し、複雑なコンピュータービジョン(CV)タスクを、現場の小型で電力効率に優れたデバイスにデプロイできるようにしています。









