Albumentationsのデータ拡張を使用してデータを多様化
多様なトレーニングデータでモデルパフォーマンスを向上させるため、Ultralytics YOLO11のカスタムトレーニング時にAlbumentationsでデータ拡張を行う方法を解説します。

コンピュータービジョンソリューションを構築する際、ビジョンAIモデルのトレーニング用に多様な画像セットを収集することは、プロセスの重要な部分になる場合があります。多くの時間と費用がかかることが多く、収集した画像がモデルの効果的な学習に十分な多様性を備えていない場合もあります。
たとえば、Ultralytics YOLO11のようなコンピュータービジョンモデルは、さまざまなアプリケーションに関連する多様なコンピュータービジョンタスク向けの画像データセットでカスタムトレーニングできます。多様なデータは、モデルの汎化性能を高め、現実世界の幅広いシナリオで物体やパターンを認識できるようにするため、重要です。
多様なデータが不足している場合は、画像データ拡張の手法が有効な解決策になります。回転、反転、明るさの調整などの手法によってデータセットの多様性を高め、より幅広い条件に対応するモデルの能力を向上させることができます。
そのため、Ultralyticsは画像データ拡張との統合をサポートしています。さまざまな変換機能を提供する人気のツール、Albumentationsを使用すると、多様なビジュアルデータを作成できます。この統合により、トレーニング画像が自動的に拡張されるため、YOLO11のトレーニングプロセスが簡素化され、モデルの性能向上につながります。
この記事では、Albumentations統合の使用方法、そのメリット、モデルのトレーニングへの影響について説明します。
Albumentationsとは何ですか?#
コンピュータービジョンモデルは、高品質な画像を幅広く学習することで、さまざまな環境にある物体を認識できます。現実世界のソースから大規模なデータセットを収集するには、時間と費用がかかり、効率もよくありません。この作業を効率化するには、画像データ拡張を使用して既存の画像から新しいバリエーションを作成できます。これにより、追加のデータを収集しなくても、モデルがさまざまなシナリオから学習できるようになります。
具体的には、2018年に効率的な画像データ拡張のために導入されたオープンソースライブラリ、Albumentationsを活用できます。回転や反転などの単純な幾何学的変更から、明るさ、コントラスト、ノイズ追加などのより複雑な調整まで、さまざまな処理をサポートしています。

図1.さまざまな種類の画像データ拡張の例。
Albumentationsの主な機能#
Albumentationsは高い性能で知られており、画像を高速かつ効率的に処理できます。OpenCVやNumPyなどの最適化されたライブラリを基盤としているため、大規模なデータセットも最小限の処理時間で処理でき、モデルのトレーニング中に高速なデータ拡張を行うのに適しています。
Albumentationsのその他の主な機能を以下に示します。
- 幅広い変換: Albumentationsは70種類を超える拡張機能を提供します。これらのバリエーションにより、照明、角度、背景が変化しても、モデルは物体を検出できるようになります。
- 速度に最適化: 単一命令・複数データ(SIMD)などの高度な最適化技術を使用します。これにより複数のデータポイントを一度に処理し、画像拡張を高速化するとともに、大規模なデータセットを効率的に処理できます。
- 3つの拡張レベル: データを3つの方法で拡張します。たとえば、ピクセルレベルの拡張では、物体を変更せずに明るさや色を調整します。一方、空間レベルの拡張では重要な詳細を維持しながら物体の位置を変更し、ミキシングレベルの拡張では異なる画像の一部を合成して新しいサンプルを作成します。
Albumentations統合を使用する理由#
データセットに拡張を適用する方法は多数あり、OpenCVなどのツールを使って独自に作成することもできます。それでも、Albumentationsのようなライブラリをサポートする統合を選ぶ理由は何でしょうか。
OpenCVなどのツールで拡張機能を手動で作成するには、多くの時間と一定の専門知識が必要です。最良の結果を得るために変換を微調整することも難しい場合があります。Albumentations統合を使用すれば、このプロセスが簡単になります。すぐに使用できる多くの変換機能が用意されているため、データセットの準備にかかる時間と労力を削減できます。
Albumentations統合を選ぶもう1つの理由は、Ultralyticsのモデルトレーニングパイプラインとスムーズに連携することです。トレーニング中に拡張が自動的に適用されるため、YOLO11のカスタムトレーニングがはるかに簡単になります。プロセスが簡素化されるので、データ準備への対応よりもモデルの改善に集中できます。
Albumentations統合の使用を開始する#
興味深いことに、Albumentations統合を使用してUltralytics YOLO11をトレーニングする方法は、想像するよりも簡単です。適切なライブラリをセットアップすると、統合によってトレーニング中に画像データ拡張が自動的に適用されます。同じデータセットを使用しながら、モデルがさまざまな画像のバリエーションから学習できるようになります。
次に、Ultralytics YOLO11をカスタムトレーニングする際のAlbumentations統合のインストール方法と使用方法を説明します。
Ultralytics PythonパッケージとAlbumentationsのインストール#
拡張を適用する前に、Ultralytics PythonパッケージとAlbumentationsの両方をインストールする必要があります。この統合は、両方のライブラリがデフォルトでシームレスに連携するように構築されているため、複雑な設定を心配する必要はありません。
以下の画像に示すように、Pythonライブラリをインストールするためのパッケージ管理ツールであるpipのコマンドを1つ実行するだけで、インストール全体を数分で完了できます。

図2. UltralyticsとAlbumentationsのインストール。
Albumentationsをインストールすると、Ultralyticsのモデルトレーニングモードによって、トレーニング中に画像拡張が自動的に適用されます。Albumentationsがインストールされていない場合、これらの拡張は適用されません。詳細については、Ultralytics公式ドキュメントを参照してください。
Albumentations統合を利用したUltralytics YOLO11のトレーニング#
Albumentations統合の内部で何が行われているのか、詳しく見ていきましょう。
Ultralytics YOLO11のトレーニング中に適用される拡張を詳しく見てみましょう。
- ぼかし: この変換は画像に軽いぼかしを加えます。焦点が合っていない場合でも、モデルが物体を検出できるようになります。
- メディアンぼかし: 画像内の物体のエッジを維持しながらランダムノイズを低減します。これにより、複雑な環境でモデルが物体を検出しやすくなります。
- グレースケール: 画像を白黒に変換することで、色ではなく形状やテクスチャにモデルが集中できるようになります。
- コントラスト制限適応ヒストグラム平坦化(CLAHE): この拡張は、特に低照度や霧など、暗すぎたり見えにくかったりする領域の画像コントラストを高めます。これにより、そのような領域の物体がより明瞭になり、モデルが識別しやすくなります。

図3.猫の画像にグレースケール拡張を適用した例。
Ultralytics YOLO11とAlbumentations統合の用途#
特定の用途向けにUltralytics YOLO11をカスタムトレーニングする場合、Albumentations統合はさまざまな条件に適応することでモデルの性能向上に役立ちます。この統合によって解決できる現実世界の用途と課題について説明します。
医療画像処理の改善#
医療分野のビジョンAIは、医師による医療画像のより正確な分析を支援し、診断と患者ケアの向上に役立っています。実際、医療機関のおよそ5分の1がすでにAIソリューションを利用しています。
しかし、こうしたコンピュータービジョンソリューションの作成には、さまざまな課題があります。医療スキャンは、機器、設定、さらには技師の経験などの要因に左右され、病院によって大きく異なる場合があります。明るさ、コントラスト、露出の違いはビジョンAIモデルの一貫性と精度に影響を与え、異なる環境で安定して動作することを難しくします。
ここで、Albumentationsのようなツールとの統合が重要になります。同じスキャンから複数の拡張バージョンを生成することで、Albumentationsはさまざまな画質からモデルが学習できるようにします。これによりモデルの堅牢性が高まり、高品質な画像と低品質な画像の両方で病気を正確に検出できるようになります。

図4.拡張されたX線画像。
セキュリティと監視の強化#
ビジョンAIのもう1つの興味深い用途は、セキュリティと監視です。リアルタイム物体検出により、セキュリティチームは潜在的な脅威を迅速に特定できます。
この用途に関する主な懸念は、セキュリティカメラが1日を通してさまざまな照明条件で映像を撮影することであり、こうした条件はモデルによる画像の理解に大きな影響を与える可能性があります。低照度環境、グレア、視界不良などの要因により、コンピュータービジョンモデルが物体を検出したり、潜在的な脅威を一貫して認識したりすることが難しくなります。
Albumentations統合は、さまざまな照明条件を再現する変換を適用することで役立ちます。これによりモデルは明るい環境と低照度環境の両方で物体を検出できるようになり、困難な条件下での信頼性と応答時間が向上します。
小売業務と顧客体験の再定義#
スーパーマーケットの通路での液体のこぼれ、店内を走る犬、商品ディスプレイを倒す子どもなどは、小売業におけるビジョンAI環境でエッジケースになり得る日常的な出来事の一例です。コンピュータービジョンは、買い物客の行動の追跡、来店者数の監視、棚の商品特定による顧客体験の向上にますます利用されています。しかし、こうした現実世界の状況をAIシステムが理解し、正確に処理することは困難です。
すべてのシナリオをコンピュータービジョンデータセットで表現できるわけではありませんが、Albumentations統合は、予期しない照明、通常とは異なる角度、遮蔽物など、さまざまな状況を網羅するようにデータを拡張します。これによりコンピュータービジョンモデルはさまざまな条件に適応し、動的な小売環境でエッジケースに対処して正確な予測を行う能力を高められます。
主なポイント#
モデルのトレーニング用に多様な現実世界のデータを収集するのは複雑ですが、Albumentationsはモデルが異なる条件に適応するのに役立つ画像バリエーションを作成することで、その作業を簡単にします。
UltralyticsがサポートするAlbumentations統合により、YOLO11のカスタムトレーニング中にこれらの拡張を適用するプロセスが簡素化されます。その結果、データセットの品質が向上し、より正確で信頼性の高いビジョンAIモデルを生成することで、幅広い業界にメリットをもたらします。
コミュニティに参加し、GitHubリポジトリを確認してAIについて詳しく学び、ライセンスオプションを確認してビジョンAIプロジェクトを始めましょう。製造業におけるAIや自動運転におけるコンピュータービジョンなどのイノベーションに関心がありますか?ソリューションページで詳細をご覧ください。









