YOLO12の解説:実世界のアプリケーションとユースケース
最新のコンピュータービジョンモデル、YOLO12をご紹介します。アテンション中心のアーキテクチャとFlashAttention技術が、さまざまな業界の物体検出タスクをどのように強化するかを解説します。

コンピュータービジョンは、機械が画像や動画を理解できるようにする人工知能(AI)の一分野です。AIの研究者や開発者が常に限界に挑戦しているため、驚異的な速さで進歩している分野です。AIコミュニティは、モデルをより高速で賢く、効率的にすることを常に目指しています。最新のブレークスルーの1つがYOLO12です。YOLO(You Only Look Once)モデルシリーズに新たに加わったモデルで、2025年2月18日にリリースされました。
YOLO12は、University at Buffalo, SUNY(ニューヨーク州立大学)と中国科学院大学の研究者によって開発されました。独自の新しいアプローチとして、YOLO12はアテンションメカニズムを導入し、画像全体を均等に処理するのではなく、最も重要な部分にモデルが集中できるようにしています。
また、処理を高速化しながら使用メモリを削減する技術であるFlashAttentionと、人間が自然に中央の物体へ注目する方法を模倣するよう設計されたエリアアテンションメカニズムも備えています。
これらの改善により、YOLO12nはYOLOv10nより2.1%、YOLO12mはYOLO11mより1.0%高い精度を実現しています。ただし、トレードオフもあります。YOLO12nはYOLOv10nより9%遅く、YOLO12mはYOLO11mより3%遅くなります。

図1. YOLO12を使用して物体を検出する例です。
この記事では、YOLO12の違い、以前のバージョンとの比較、適用可能な分野について説明します。
YOLO12のリリースまでの道のり#
YOLOモデルシリーズは、リアルタイム物体検出用に設計されたコンピュータービジョンモデルの集合です。つまり、画像や動画内の物体をすばやく識別して位置を特定できます。時間の経過とともに、各バージョンは速度、精度、効率の面で改善されてきました。
例えば、2020年にリリースされたUltralytics YOLOv5は、高速でカスタムトレーニングとデプロイが容易だったため、広く利用されるようになりました。その後、Ultralytics YOLOv8は、インスタンスセグメンテーションや物体追跡などのコンピュータービジョンタスクへの追加サポートを提供し、これをさらに改善しました。
さらに最近では、Ultralytics YOLO11が、速度と精度のバランスを維持しながらリアルタイム処理の改善に重点を置きました。例えば、YOLO11mはYOLOv8mよりパラメーター数が22%少ない一方で、物体検出モデルの評価に広く使用されるベンチマークデータセットCOCOにおいて、より優れた検出性能を実現しました。
これらの進歩を基盤として、YOLO12は視覚情報の処理方法に変化をもたらします。画像のすべての部分を均等に扱うのではなく、最も関連性の高い領域を優先することで、検出精度を向上させます。簡単に言えば、YOLO12は従来の改善を基盤としながら、より高い精度を目指しています。
YOLO12の主な機能#
YOLO12は、リアルタイム処理速度を維持しながら、コンピュータービジョンタスクを強化する複数の改善を導入しています。YOLO12の主な機能の概要は次のとおりです。
- アテンション中心のアーキテクチャ:画像のすべての部分を均等に扱うのではなく、最も重要な領域にYOLO12が集中します。これにより精度が向上し、不要な処理が削減されるため、複雑な画像でも検出がより正確かつ効率的になります。
- FlashAttention: YOLO12は、使用メモリを削減しながら画像解析を高速化します。FlashAttention(メモリ効率に優れたアルゴリズム)によってデータ処理を最適化し、ハードウェアへの負荷を軽減することで、リアルタイムタスクをよりスムーズかつ信頼性の高いものにします。
- Residual Efficient Layer Aggregation Networks(R-ELAN):YOLO12はR-ELANを使用してレイヤーをより効率的に構成し、モデルによるデータの処理と学習の方法を改善します。これにより、トレーニングがより安定し、物体認識がより正確になり、計算要件も低くなるため、さまざまな環境で効率的に実行できます。
これらの機能が実際にどのように機能するかを理解するために、ショッピングモールを考えてみましょう。YOLO12は、買い物客の追跡、鉢植えや販促看板などの店舗装飾の識別、置き忘れられた物や放置された物の検出に役立ちます。
アテンション中心のアーキテクチャによって最も重要な細部に集中し、FlashAttentionによってシステムに過度な負荷をかけずにすべてを高速に処理できます。これにより、モール運営者はセキュリティの向上、店舗レイアウトの整理、ショッピング体験全体の改善を容易に実現できます。

図2. YOLO12を使用したショッピングモール内の物体検出です。
ただし、YOLO12には考慮すべき制限もあります。
- トレーニング時間の増加: アーキテクチャの特性により、YOLO12はUltralytics YOLO11と比較してより長いトレーニング時間を必要とします。
- エクスポート時の課題:YOLO12モデルをエクスポートする際、特に特定のデプロイ環境に統合する場合に、一部のユーザーは困難に直面する可能性があります。
YOLO12の性能ベンチマークを理解する#
YOLO12には複数のバリアントがあり、それぞれ異なるニーズに合わせて最適化されています。小型バージョン(nanoとsmall)は速度と効率を優先しており、モバイルデバイスやエッジコンピューティングに適しています。mediumとlargeのバージョンは速度と精度のバランスを取り、YOLO12x(extra large)は、産業オートメーション、医療画像処理、高度な監視システムなど、高精度が求められる用途向けに設計されています。
これらのバリエーションにより、YOLO12はモデルサイズに応じて異なるレベルの性能を発揮します。ベンチマークテストでは、YOLO12の一部のバリアントが精度でYOLOv10とUltralytics YOLO11を上回り、より高い平均適合率(mAP)を達成しています。
ただし、YOLO12m、YOLO12l、YOLO12xなど一部のモデルはYOLO11より画像処理が遅く、検出精度と速度の間にトレードオフがあることを示しています。それでもYOLO12は効率的で、多くの他のモデルより少ないパラメーター数で動作しますが、YOLO11よりは多くのパラメーターを使用します。そのため、生の速度よりも精度が重視される用途に適しています。

図3. Ultralytics YOLO11とYOLO12の比較です。
Ultralytics PythonパッケージでYOLO12を使用する#
YOLO12はUltralytics Pythonパッケージでサポートされており、簡単に使用できるため、初心者にも専門家にも利用しやすくなっています。数行のコードだけで、ユーザーは事前トレーニング済みモデルを読み込み、画像や動画に対してさまざまなコンピュータービジョンタスクを実行し、カスタムデータセットでYOLO12をトレーニングできます。Ultralytics Pythonパッケージによりプロセスが効率化され、複雑なセットアップ手順が不要になります。
例えば、YOLO12を物体検出に使用するための手順は次のとおりです。
- Ultralyticsパッケージをインストールする: まず、YOLO12を効率的に実行するために必要なツールを提供するUltralytics Pythonパッケージをインストールします。これにより、すべての依存関係が正しく設定されます。
- 事前トレーニング済みのYOLO12モデルを読み込む: タスクに必要な精度と速度のレベルに応じて、適切なYOLO12のバリアント(nano、small、medium、large、extra large)を選択します。
- 画像または動画を提供する: 解析したい画像または動画ファイルを入力します。YOLO12はリアルタイム検出のためにライブ動画フィードを処理することもできます。
- 検出プロセスを実行する: モデルが視覚データをスキャンして物体を識別し、その周囲にバウンディングボックスを配置します。検出した各物体に、予測クラスと信頼度スコアのラベルを付けます。
- 検出設定を調整する: 信頼度しきい値などのパラメーターを変更して、検出精度と性能を微調整することもできます。
- 出力を保存または使用する: 検出した物体を含む処理済みの画像または動画を保存したり、さらなる解析、自動化、意思決定のためにアプリケーションへ統合したりできます。
これらの手順により、YOLO12は監視や小売業での追跡から医療画像処理、自動運転車まで、さまざまな用途で簡単に使用できます。
YOLO12の実用的な用途#
YOLO12は、物体検出、インスタンスセグメンテーション、画像分類、姿勢推定、方向付き物体検出(OBB)をサポートしているため、さまざまな実世界の用途で使用できます。

図4. YOLO12は物体検出やインスタンスセグメンテーションなどのタスクをサポートします。
ただし、前述のとおり、YOLO12モデルは速度よりも精度を優先するため、以前のバージョンと比較して画像処理にやや時間がかかります。このトレードオフにより、YOLO12はリアルタイム速度よりも精度が重要な次のような用途に適しています。
- 医療画像処理:YOLO12は、X線画像やMRIで腫瘍や異常を高精度に検出するようカスタムトレーニングできます。そのため、診断のために正確な画像解析を必要とする医師や放射線科医にとって有用なツールになります。
- 製造業における品質管理:生産プロセス中の製品欠陥の特定に役立ち、市場に出る製品の品質を確保しながら、廃棄物を削減して効率を向上させます。
- 法医学分析:法執行機関は、YOLO12を微調整して監視映像を解析し、証拠を収集できます。犯罪捜査では、重要な細部を特定するために精度が不可欠です。
- 精密農業:農家はYOLO12を使用して作物の健康状態を解析し、病気や害虫の発生を検出し、土壌の状態を監視できます。正確な評価は農業戦略の最適化に役立ち、収量と資源管理の改善につながります。
YOLO12を始める#
YOLO12を実行する前に、システムが必要な要件を満たしていることを確認することが重要です。
技術的には、YOLO12は専用のGPU(画像処理装置)であれば実行できます。デフォルトではFlashAttentionを必要としないため、FlashAttentionなしでもほとんどのGPUシステムで動作します。ただし、FlashAttentionを有効にすると、大規模なデータセットや高解像度画像を扱う際に特に有用です。処理速度の低下を防ぎ、メモリ使用量を削減し、処理効率を向上させることができます。
FlashAttentionを使用するには、次のいずれかのシリーズに属するNVIDIA GPUが必要です。Turing(T4、Quadro RTX)、Ampere(RTX 30シリーズ、A30、A40、A100)、Ada Lovelace(RTX 40シリーズ)、またはHopper(H100、H200)です。
使いやすさとアクセシビリティを考慮し、Ultralytics Pythonパッケージは、インストールが非常に技術的で複雑になる可能性があるため、現時点ではFlashAttentionによる推論をサポートしていません。YOLO12の開始方法と性能の最適化について詳しくは、Ultralytics公式ドキュメントをご確認ください。
主なポイント#
コンピュータービジョンが進歩するにつれて、モデルはより正確かつ効率的になっています。YOLO12は、アテンション中心の処理とFlashAttentionにより、物体検出、インスタンスセグメンテーション、画像分類などのコンピュータービジョンタスクを改善し、メモリ使用量を最適化しながら精度を高めます。
同時に、コンピュータービジョンはかつてないほど利用しやすくなっています。YOLO12はUltralytics Pythonパッケージを通じて簡単に使用でき、速度よりも精度を重視しているため、医療画像処理、産業検査、ロボティクスなど、精度が重要な用途に適しています。
AIに興味がありますか?GitHubリポジトリにアクセスし、コミュニティに参加してください。自動運転車におけるAIや農業におけるコンピュータービジョンなどの分野のイノベーションを、ソリューションページでご覧ください。ライセンスオプションを確認し、ビジョンAIプロジェクトを実現してください。🚀









