Ultralytics Platformによるコンピュータービジョンのスマートなデータセット管理
コンピュータービジョンプロジェクトでUltralytics Platformを活用し、データセット管理を改善する方法をご紹介します。データセットを簡単に追跡、比較、改善できます。

Vision AI、つまりコンピュータービジョンは、初期の頃から大きく進化し、実験的な研究から現実世界のアプリケーションを支える重要なテクノロジーへと発展してきました。現在では、AI愛好家が、利用しやすいツールやフレームワークを使用して、物体検出やインスタンスセグメンテーションなどのタスク向けに高性能なモデルを構築できます。
しかし、こうしたアプリケーションが実験段階から本番環境へ移行するにつれて、データセット管理は依然として重要でありながら、見落とされがちな課題となっています。コンピュータービジョンデータセットの規模と複雑さが増すにつれ、チームは一貫したアノテーションの維持、バージョン間の変更の追跡、データ全体の品質確保に苦労することがよくあります。
最先端のモデルであっても、学習に使用したデータが不完全、不均衡、または適切に管理されていない場合、現実世界の環境では性能が低下する可能性があります。開発時の性能と現実世界での信頼性の間に広がるこの差が、より体系的なデータセット管理アプローチが必要とされる理由です。
もう一つの一般的な制約は、データ収集、アノテーション、学習が別々のツールで処理されることが多い点です。断片化されたワークフローでは、データセットを効率的に管理することが難しくなり、不整合のリスクが高まり、反復の速度も低下します。
データセット管理や断片化されたワークフローなど、Vision AIのボトルネックを解決するため、私たちは最近Ultralytics Platformをローンチしました。これは、データセット管理、アノテーション、学習、デプロイ、モニタリングを単一の統合ワークフローにまとめた、エンドツーエンドのワークスペースです。
コンピュータービジョンのライフサイクルの各段階を接続することで、データセットの変更を追跡し、バージョン間の性能を比較し、より良い結果を得るためにデータを継続的に改善しやすくなります。

図1. Ultralytics Platform内でデータセット画像を表示する例(出典)
この記事では、より信頼性の高いコンピュータービジョンモデルを構築するために、Ultralytics Platformがデータセットの追跡、比較、改善にどのように役立つかを詳しく説明します。始めましょう。
コンピュータービジョンにおけるデータセット管理の重要性#
コンピュータービジョンモデルの性能は、学習に使用するデータと密接に結び付いています。モデルの精度、つまり予測が正しい頻度は、アルゴリズムだけでなく、データセットが現実世界の状況をどの程度適切に表しているかにも左右されます。
簡単に言えば、モデルはデータから直接パターンを学習するため、データセット内の不足、バイアス、不整合は、モデルの予測方法に影響を与える可能性があります。つまり、データ品質の低さ、誤ったアノテーション、または画像における現実世界の変化(異なる照明条件、物体の角度、背景、遮蔽の度合いなど)のカバレッジ不足は、モデルアーキテクチャ自体が優れていても、精度を大幅に低下させる可能性があります。
これは、特定のユースケースや環境により適応できるよう、事前学習済みモデルを新しいデータや更新されたデータで追加学習するファインチューニングにも当てはまります。モデルの精度はデータに大きく依存するため、データを適切に管理することが不可欠です。
データセット管理には、データを正確かつ関連性のある状態に保つための整理、ラベリング、継続的な更新が含まれます。これにより、特に新しいデータでモデルを再学習またはファインチューニングする際に、時間の経過とともに性能を改善しやすくなります。
データセット品質が現実世界での信頼性に与える影響#
セキュリティ監視システムなどのコンピュータービジョンのユースケースは、適切なデータ管理が重要である理由を示す良い例です。これらのシステムは、さまざまな照明環境、カメラアングル、混雑度、部分的な遮蔽など、幅広い現実世界の条件で確実に動作する必要があります。
学習データがこうした変化をカバーしていない場合、または異なるシーンや条件における物体の見え方に多様性がない場合、モデルは物体を正確に検出することに苦労する可能性があります。例えば、明るく整理されたシーンを中心に学習したモデルは、低照度環境や混雑した状況では性能が低下することがあります。セキュリティシステムでは、これによりイベントの見逃しや誤警報が発生する可能性があります。
これを避けるには、クリーンで正確にラベル付けされているだけでなく、十分にバランスが取れ、継続的に更新されるデータセットを維持することが重要です。これには、データの不足を特定し、条件の変化に応じて新しい例を追加し、異なるクラスや環境が均等に表現されるようにすることが含まれます。
より完全で体系的なデータセットがあれば、モデルは現実世界の変動に対処し、より信頼性の高い予測を生成できるようになります。
データセット管理の主な要素#
では、データセット管理とは実際にどのようなものでしょうか。モデル開発プロセス全体でデータを効果的に使用できるように、データを整理し、ラベル付けし、維持することです。
例えば、データの整理には、データセットの構造化と、学習セット、検証セット、テストセットへの分割が含まれます。学習セットはモデルの学習に使用され、検証セットは開発中の性能監視と調整の指針に使用され、テストセットは完全に未知のデータに対して最終モデルがどの程度適切に動作するかを評価するために使用されます。
一方、ラベリングでは、クラスラベル、バウンディングボックス、セグメンテーションマスクなどの詳細を画像にアノテーションします。モデルはこれらのアノテーションから学習するため、意味のあるパターンを学習し、信頼性の高い予測を行えるようにするには、正確さと一貫性が不可欠です。
これに加えて、データセットの維持には、時間の経過に伴うデータの確認と更新が含まれます。これには、アノテーションエラーの修正、低品質または重複したデータの削除、不足しているケースや変化する条件をカバーする新しい例の追加などがあります。
より広い意味では、データセット管理は継続的なプロセスです。モデルが評価され、新しいデータが収集されるにつれて、データセットは現実世界の条件やエッジケースを反映するよう更新する必要があります。こうした更新を追跡し、異なるバージョンを比較することで、チームは何が性能を改善しているのか、またどこにさらなる変更が必要なのかを把握できます。
Ultralytics Platformでデータセットを管理する#
Ultralytics Platformは、データ準備からエクスポートまでをカバーする、単一環境内でデータセットを管理するための体系的なワークフローを提供します。個人の開発者とチームの双方をサポートするよう設計されており、単独で作業する場合でも、プロジェクト間で共同作業する場合でも、データセットを一貫して管理しやすくします。
各段階は、モデル開発ライフサイクル全体でデータセットを整理、処理、使用する方法を簡素化するよう設計されています。これらのステップを1か所にまとめることで、プラットフォームは断片化を減らし、ワークフロー間の一貫性をより簡単に維持できるようにします。
ここからは、関連する主なステップと、プラットフォームがそれぞれをどのようにサポートするかを見ていきましょう。
Ultralytics Platformへのデータセットのアップロード#
プラットフォームでデータセットを始める方法は柔軟で、データを取り込んだり再利用したりする複数の方法があります。独自のデータをアップロードすることも、プラットフォームで利用できるパブリックデータセットを使用してすぐに始めることもできます。また、コミュニティで共有されている既存のデータセットをクローンし、その上に構築することもできます。
プラットフォームのコミュニティ機能により、既存の成果を簡単に探索して再利用できます。数百万枚の画像やアノテーションを含む、他のユーザーが作成したデータセットにアクセスできるため、すべてを自分で収集してラベル付けすることなく、すぐに始められます。データセットをクローンするとワークスペース内にコピーが作成され、元のデータセットを保持したまま変更や拡張が可能になります。
アップロードでは、個別の画像、動画、ZIP、TAR、GZファイルなどのデータセットアーカイブに対応しています。また、YOLOやCOCOなど広く使用されているデータセット形式にも対応しているため、追加の変換なしで既存のデータセットやアノテーションを簡単にインポートできます。さらに、プラットフォームからエクスポートしたNDJSONファイルを使用してデータセットをアップロードできるため、プロジェクト間でデータセットをシームレスに再作成または再利用できます。
データがアップロードされると、プラットフォームは体系的なパイプラインを通じてデータを処理します。これには、ファイル形式とサイズの検証、必要に応じた画像のリサイズ、アノテーションの解析、データセット統計の生成が含まれます。
例えば、動画は学習に使用できるようフレームに変換され、画像は閲覧や分析をしやすくするために最適化・準備されます。処理後、データセットはプラットフォーム内でのアノテーション、分析、モデル学習に使用できる状態になります。
Ultralytics Platformでのデータアノテーション#
アップロード後、データセットはプラットフォーム内で直接確認してアノテーションできます。プラットフォームには、物体検出、インスタンスセグメンテーション、姿勢推定、回転バウンディングボックス(OBB)検出、画像分類など、さまざまなコンピュータービジョンタスクに対応する組み込みの画像アノテーションツールが用意されています。

図2. データラベリングにUltralytics Platformを使用(出典)
これらのツールを使用してアノテーションを手動で作成することも、SAMを利用したスマートアノテーションなどのAI支援機能で高速化することもできます。SAMを使用すると、画像を操作してマスク、バウンディングボックス、回転ボックスを生成できるため、精度を維持しながらラベリングプロセスを高速化できます。
Ultralytics Platformによるデータセット品質の分析#
データの準備とアノテーションに加えて、信頼性の高いコンピュータービジョンモデルを構築するには、データセットの品質を理解することが不可欠です。クラス分布、アノテーション品質、データセット分割、異なる条件におけるデータの表現方法などを明確に把握できなければ、モデル性能に影響する問題を見つけることは困難です。
Ultralytics Platformには、データセットをより効果的に分析するための組み込み機能があります。これらのインサイトはデータセットインターフェース内で直接確認でき、Images、Classes、Chartsなどのタブから利用できます。
Chartsタブでは、分割分布(学習、検証、テスト)、クラス頻度、画像内の物体の出現位置を示すアノテーションヒートマップなど、データセットレベルの統計を確認できます。
Classesタブではクラスごとのアノテーション数の内訳を確認でき、クラス不均衡を見つけやすくなります。一方、Imagesタブでは、サイズ、アノテーション数、個々の画像全体におけるラベルの分布など、画像レベルの詳細を確認できます。
これらのインサイトにより、クラス不均衡、欠落しているシナリオ、データ分布の偏りなどの問題を特定しやすくなります。例えば、特定のクラスの例が非常に少ないことや、ほとんどのアノテーションが画像内の特定の領域に集中していることに気付く場合があります。
データ分析に加えて、プラットフォームはデータセットのキュレーションとオーグメンテーションにも対応しています。これは、問題のあるデータを修正または削除してデータセットを改善し、既存データのバリエーションを作成してモデル性能を高めることを意味します。こうした改善は、アノテーションの更新、新しいデータの追加、分析結果に基づくデータセット分割の再編成によって、プラットフォーム内で直接行えます。
Ultralytics Platformからのデータセットのエクスポート#
データセットの準備と検証が完了すると、さまざまな環境で使用できるようエクスポートできます。これにより、コンピュータービジョンデータを、ローカル、クラウド、その他のツールやワークフローのいずれでモデルの学習を行う場合でも、希望する場所で柔軟に使用できます。
Ultralytics Platformは、YOLO、COCO、NDJSONなど複数のエクスポート形式に対応しており、データセットをさまざまな学習ワークフローやツールに簡単に統合できます。

図3. Ultralytics Platformからデータセットをエクスポート(出典)
データセットをエクスポートすると、画像、アノテーション、構造を含む、特定時点のデータの固定スナップショットが作成されます。新しいデータの追加、アノテーションの更新、分割の調整に伴ってデータセットは頻繁に変更されるため、これは便利な機能です。スナップショットをエクスポートすることで、特定の学習実行に使用したデータセットの正確なバージョンを保存できます。
これにより、後から結果を再現しやすくなります。同じデータ設定で再びモデルを学習し、異なるデータセットバージョン間で性能を比較できるためです。例えば、何が変わったのかを推測するのではなく、新しい画像の追加やアノテーションの修正によって実際にモデルの精度が向上したかを評価できます。
エクスポートは非同期で処理され、準備が完了すると、データセットをダウンロードしてローカル、クラウド、またはオフラインの学習環境で使用できます。
Ultralytics Platformでの反復によるデータセット品質の改善#
機械学習やディープラーニングのワークフローでは、現実世界のデータが学習時に使用したデータと異なることが多いため、データセット管理はデプロイ後も継続します。
モデルが新しい入力に遭遇すると、低照度環境、異なるカメラアングル、遮蔽、混雑したシーンなどの条件の不足やアノテーションエラーといったデータセットの問題がより明らかになり、時間の経過に伴うデータの改善が必要になります。
データセットを改善する方法はいくつかあります。低照度環境、異なるカメラアングル、遮蔽、混雑したシーンなど、不足している条件をカバーする新しい画像や動画を追加することで、データの盲点を減らせます。
同時に、正しくラベル付けされた物体や、正確なバウンディングボックスまたはマスクなど、アノテーションの正確さと一貫性を確保することで、モデルはより信頼性の高いパターンを学習できます。
通常は、モデルを学習させる、結果を評価する、エラーを特定する、データセットを改善する、再学習するというシンプルなループに従います。各ステップによって、誤ったアノテーション、欠落データ、十分に表現されていないケースなどの問題が明らかになります。
店舗内の商品を検出するリアルタイムの小売棚監視システムに取り組んでいるとします。データセットの初期バージョンには、特定の商品タイプ、照明条件、混雑した棚の配置が含まれていない可能性があります。評価中に、こうした状況でモデルが商品を検出するのに苦労していることに気付く場合があります。
性能を改善するには、こうした不足しているシナリオをカバーする新しい画像を収集し、必要に応じてアノテーションを更新します。このプロセスを繰り返すことで、時間の経過とともに、モデルは現実世界の条件でより正確かつ信頼性の高い動作をするようになります。
Ultralytics Platformは、データセットの更新を学習や評価と接続することで、このワークフローをサポートします。組み込みの実験追跡機能と性能メトリクスにより、進捗を監視し、時間の経過に伴ってデータセットを継続的に改善しやすくなります。
Ultralytics Platformによるデータセットの変更追跡#
モデル開発プロセスの一環として、データセットが時間とともに変化することについて簡単に説明しました。新しいデータが追加され、アノテーションが改善され、クラスが更新される中で、こうした変更を追跡することは、データ品質を維持し、モデル性能の一貫性を確保するうえで重要になります。
ここでは、データセットの追跡とバージョン管理をサポートするUltralytics Platformの主な機能を紹介します。
- データセットのバージョン管理: NDJSONスナップショットとして固定されたデータセットバージョンを作成できます。各バージョンには、特定時点での画像数、クラス数、アノテーション数、データセットサイズなどの重要な詳細が記録されます。これらのバージョンは保存され、後からダウンロードできるため、実験の再現や異なるデータセット状態間の結果比較が容易になります。
- Versionsタブ: すべてのデータセットバージョンはVersionsタブで整理され、バージョン履歴の表示、変更内容の説明の追加、時間の経過に伴うデータセットの変化の追跡ができます。
- モデルとの連携: Modelsタブには、データセットで学習したすべてのモデルが、mAPなどのメトリクスや学習の詳細とともに表示されます。データセットバージョンは学習実行に関連付けられるため、データの変更がモデル性能に与える影響を把握できます。
- Errorsタブ: Errorsタブには、処理中に失敗したファイルと、エラーの詳細および提案が表示されます。これにより、学習前に破損したファイルやサポートされていない形式などの問題を特定して修正できます。
- データセットインターフェース(ImagesおよびClassesタブ): これらのビューでは、画像の閲覧、アノテーションの確認、クラスラベルの管理、クラス分布の分析ができます。フィルタリング、並べ替え、未アノテーション画像の特定などの機能により、時間の経過に伴うデータセット品質の監視が簡単になります。
- 統計とチャート: 分割分布、クラス頻度、アノテーションヒートマップなどの組み込みデータ可視化機能により、データセットの変化に伴うデータ分布の変化を追跡し、不均衡を特定できます。

図4. Ultralytics Platformでデータセットのクラス分布を分析する画面(出典)
Ultralytics Platform内でデータセットを学習およびデプロイに接続する#
Ultralytics Platformは、AIモデル開発のさまざまな段階を単一のパイプラインに接続します。これにより、生データから本番環境対応のVision AIアプリケーションへ移行するプロセスが効率化されます。
データセットの準備とアノテーションが完了すると、Ultralytics YOLO26などのコンピュータービジョンモデルをプラットフォーム内で直接学習させることができます。学習中は、組み込みのダッシュボードを使用して、性能メトリクスの監視、実験の追跡、モデルの学習状況の評価ができます。

図5. Ultralytics Platformでモデルの学習メトリクスを表示する画面(出典)
学習後は、ブラウザー上で新しい画像に対してモデルを直接テストし、デプロイ前に予測を評価して改善領域を特定できます。モデルの性能が十分であれば、本番環境にデプロイできます。
プラットフォームは、モデルの複数形式へのエクスポート、または推論サービスや専用エンドポイントを介したデプロイに対応しており、さまざまな環境で実行できます。
デプロイ後は、組み込みのモニタリングツールによって、使用状況やモデルの挙動に関連するメトリクスなど、システム性能を時間の経過とともに追跡できます。これにより、現実世界のアプリケーションでVision AIシステムを維持・改善しやすくなります。
Ultralytics Platformでのデータセット管理のベストプラクティス#
Ultralytics Platformを使用してデータセットを管理する際に、覚えておくべき主なポイントを紹介します。
- フィルターを使用して不足を見つける: フィルタリングツールを使用して未ラベルまたは十分に表現されていないデータを特定し、アノテーションの完了とカバレッジの改善を効率化します。
- 早期にエラーを修正する: 品質管理のためにErrorsタブを使用し、学習前にアップロードの失敗、破損したファイル、サポートされていない形式を検出します。
- データセットを継続的に更新する: 新しいデータを追加し、アノテーションを修正し、出現したエッジケースを含めます。これによりカバレッジが改善され、モデルが現実世界のシナリオで信頼性の高い性能を発揮できるようになります。
- データセットの分割を慎重に管理する: 学習、検証、テストセットのバランスを適切に保ちます。必要に応じて、分割を手動で再編成することも、自動再分配を使用することもできます。
Ultralytics Platformの詳細については、公式のUltralyticsドキュメントをご覧ください。
主なポイント#
コンピュータービジョンプロジェクトが拡大するにつれ、データセットを効果的に管理することは、モデル開発と同じくらい重要になります。体系的なデータセット管理アプローチは、データ品質の向上、ワークフローの効率化、時間の経過に伴うモデル性能の改善を支援します。
Ultralytics Platformは、データセット管理、学習、デプロイを単一のワークフローにまとめることで、このプロセスを簡素化します。体系的なデータセット管理アプローチを採用することで、チームは複雑さを軽減し、効率を高め、よりスケーラブルで信頼性の高いコンピュータービジョンシステムを構築できます。
成長を続けるコミュニティに参加し、AIリソースについてはGitHubリポジトリをご覧ください。今すぐVision AIを構築するには、ライセンスオプションをご確認ください。AI in agricultureが農業をどのように変革しているか、またvision AI in healthcareが未来をどのように形作っているかについては、ソリューションページをご覧ください。









