Ultralytics Platformによるコンピュータービジョンのスマートなデータセット管理
コンピュータービジョンプロジェクトでUltralytics Platformを活用し、データセット管理を改善する方法をご紹介します。データセットを簡単に追跡、比較、改善できます。

ビジョンAI、つまりコンピュータービジョンは、黎明期から大きく進歩し、実験的な研究から現実世界のアプリケーションを支える重要なテクノロジーへと発展してきました。現在では、AI愛好家は利用しやすいツールやフレームワークを使って、物体検出やインスタンスセグメンテーションなどのタスク向けに高性能なモデルを構築できます。
しかし、こうしたアプリケーションが実験から本番環境へと移行するにつれ、データセット管理は依然として重要でありながら、見過ごされがちな課題となっています。コンピュータービジョンのデータセットの規模と複雑さが増すにつれて、チームはアノテーションの一貫性の維持、バージョン間の変更の追跡、データ全体の品質確保に苦労することが少なくありません。
最先端のモデルであっても、学習に使用したデータが不完全、不均衡、または適切に管理されていない場合、現実世界の環境では性能が低下することがあります。開発時の性能と現実世界での信頼性との間に広がるこのギャップこそ、データセット管理により体系的なアプローチが必要な理由です。
よくあるもう一つの制約は、データ収集、アノテーション、学習が別々のツールで行われることが多い点です。ワークフローが分断されると、データセットの効率的な管理が難しくなり、不整合のリスクが高まり、反復作業も遅くなります。
データセット管理や分断されたワークフローなど、ビジョンAIのボトルネックを解消するため、先日Ultralytics Platformをリリースしました。データセット管理、アノテーション、学習、デプロイ、モニタリングを、統合された単一のワークフローにまとめるエンドツーエンドのワークスペースです。
コンピュータービジョンのライフサイクルの各段階をつなぐことで、データセットの変更を追跡し、バージョン間の性能を比較し、より良い結果に向けてデータを継続的に改善しやすくなります。

図1. Ultralytics Platform内でデータセット画像を表示する例(出典)
この記事では、Ultralytics Platformがデータセットの追跡、比較、改善をどのように支援し、より信頼性の高いコンピュータービジョンモデルの構築につなげるかを詳しく見ていきます。それでは始めましょう。
コンピュータービジョンにおけるデータセット管理の重要性#
コンピュータービジョンモデルの性能は、学習に使用するデータと密接に関係しています。モデルの精度、つまり予測が正しい頻度は、アルゴリズムだけでなく、データセットが現実世界の状況をどれだけ適切に表しているかにも左右されます。
簡単に言えば、モデルはデータから直接パターンを学習するため、データセットの欠落、偏り、不整合は、予測方法に影響を与える可能性があります。つまり、データの品質が低いこと、不正確なアノテーション、あるいは照明条件、物体の角度、背景、オクルージョンの度合いなど、画像における現実世界の多様性を十分に網羅できていないことは、モデルのアーキテクチャ自体が優れていても、精度を大きく低下させる可能性があります。
これは、特定のユースケースや環境により適応させるため、事前学習済みモデルを新しいデータや更新されたデータで追加学習するファインチューニングにも当てはまります。モデルの精度はデータに大きく左右されるため、データを適切に管理することが不可欠です。
データセット管理には、データの正確性と関連性を保つための整理、ラベリング、継続的な更新が含まれます。これにより、特に新しいデータを使ってモデルを再学習またはファインチューニングする際に、時間の経過とともに性能を向上させやすくなります。
データセットの品質が現実世界での信頼性に与える影響#
セキュリティ監視システムなどのコンピュータービジョンのユースケースは、適切なデータ管理が不可欠である理由を示す好例です。こうしたシステムは、さまざまな照明環境、カメラアングル、混雑度、部分的なオクルージョンなど、幅広い現実世界の条件で安定して動作する必要があります。
学習データがこうした変化を網羅していない場合や、さまざまなシーンや条件での物体の見え方に多様性が不足している場合、モデルは物体を正確に検出するのに苦労する可能性があります。たとえば、明るく整理されたシーンを中心に学習したモデルは、暗い環境や混雑した状況では性能が低下することがあります。セキュリティシステムでは、これにより事象の見逃しや誤警報が発生する可能性があります。
これを避けるには、データセットをクリーンで正確にラベル付けされた状態に保つだけでなく、バランスよく維持し、継続的に更新することが重要です。つまり、データの不足箇所を特定し、状況の変化に応じて新しい例を追加し、さまざまなクラスや環境が均等に含まれるようにします。
より完全で体系的なデータセットを用意することで、モデルは現実世界の変動にうまく対応し、より信頼性の高い予測を行えるようになります。
データセット管理の主な要素#
では、データセット管理とは具体的にどのようなものでしょうか。モデル開発プロセス全体を通してデータを効果的に活用できるよう、整理、ラベリング、維持することです。
たとえば、データの整理には、データセットの構成と、学習セット、検証セット、テストセットへの分割が含まれます。学習セットはモデルの学習に使用し、検証セットは開発中の性能監視と調整の指針に使用します。テストセットは、最終モデルがまったく未学習のデータに対してどれだけ適切に動作するかを評価するために使用します。
一方、ラベリングでは、クラスラベル、バウンディングボックス、セグメンテーションマスクなどの情報を画像にアノテーションします。モデルはこうしたアノテーションから学習するため、意味のあるパターンを学び、信頼性の高い予測を行えるようにするには、正確性と一貫性が不可欠です。
さらに、データセットの維持には、時間の経過に応じたデータの確認と更新が含まれます。アノテーションの誤りの修正、品質の低いデータや重複データの削除、欠落したケースや変化する状況を網羅するための新しい例の追加などが該当します。
より広い視点で見ると、データセット管理は継続的なプロセスです。モデルの評価や新しいデータの収集に伴い、現実世界の状況やエッジケースを反映するよう、データセットを更新する必要があります。こうした更新を追跡し、異なるバージョンを比較することで、何が性能向上につながっているのか、どこにさらなる変更が必要なのかをチームが把握しやすくなります。
Ultralytics Platformによるデータセット管理#
Ultralytics Platformは、データ準備からエクスポートまでを網羅し、単一の環境内でデータセットを管理するための体系的なワークフローを提供します。個人の開発者とチームの両方を支援するよう設計されており、単独で作業する場合も、複数のプロジェクトで共同作業する場合も、一貫した方法でデータセットを簡単に管理できます。
各段階は、モデル開発ライフサイクル全体を通じて、データセットの整理、処理、使用を簡素化するよう設計されています。こうした手順を1か所にまとめることで、プラットフォームはワークフローの分断を抑え、ワークフロー全体の一貫性をより簡単に維持できるようにします。
続いて、主な手順と、それぞれをプラットフォームがどのように支援するかを見ていきましょう。
Ultralytics Platformへのデータセットのアップロード#
プラットフォームでデータセットを使い始める方法は柔軟で、データを取り込んだり再利用したりする手段が複数あります。独自のデータをアップロードするほか、プラットフォームで利用できる公開データセットを使ってすぐに始めることもできます。また、コミュニティで共有されている既存のデータセットを複製し、それを基に構築することも可能です。
プラットフォームのコミュニティ機能を使えば、既存の成果を簡単に見つけて再利用できます。数百万件の画像やアノテーションを含む、他のユーザーが作成したデータセットを利用できるため、すべてを自分で収集してラベル付けしなくても、すぐに作業を始められます。データセットを複製するとワークスペース内にコピーが作成され、元のデータセットを保持したまま変更や拡張を行えます。
アップロードでは、個々の画像や動画に加え、ZIP、TAR、GZファイルなどのデータセットアーカイブに対応しています。また、YOLOやCOCOなど広く使われているデータセット形式にも対応しているため、追加の変換を行わずに既存のデータセットやアノテーションを簡単にインポートできます。さらに、プラットフォームからエクスポートしたNDJSONファイルを使ってデータセットをアップロードできるため、プロジェクト間でのデータセットの再作成や再利用もスムーズです。
データをアップロードすると、プラットフォームは体系的なパイプラインを通じて処理します。これには、ファイル形式とサイズの検証、必要に応じた画像のリサイズ、アノテーションの解析、データセット統計の生成が含まれます。
たとえば、動画は学習に使用できるようフレームに変換され、画像は閲覧や分析がしやすいよう最適化および準備されます。処理後、データセットはプラットフォーム内でのアノテーション、分析、モデル学習に使用できる状態になります。
Ultralytics Platformでのデータアノテーション#
アップロード後、データセットをプラットフォーム内で直接確認し、アノテーションを付与できます。プラットフォームには、物体検出、インスタンスセグメンテーション、姿勢推定、回転バウンディングボックス(OBB)検出、画像分類など、さまざまなコンピュータービジョンタスクに対応する画像アノテーションツールが組み込まれています。

図2. Ultralytics Platformを使ったデータラベリング(出典)
これらのツールを使って手動でアノテーションを作成することも、SAMを活用したスマートアノテーションなどのAI支援機能で作業を効率化することもできます。SAMを使うと、画像を操作してマスク、バウンディングボックス、回転ボックスを生成できるため、正確性を保ちながらラベリング作業を迅速化できます。
Ultralytics Platformによるデータセット品質の分析#
データの準備やアノテーションに加え、信頼性の高いコンピュータービジョンモデルを構築するには、データセットの品質を理解することが不可欠です。クラス分布、アノテーション品質、データセットの分割、さまざまな条件におけるデータの表現状況などを明確に把握できないと、モデルの性能に影響する問題を見つけるのが難しくなります。
Ultralytics Platformには、データセットをより効果的に分析するための機能が組み込まれています。こうした情報は、Images、Classes、Chartsなどのタブから、データセットのインターフェース内で直接確認できます。
Chartsタブでは、学習、検証、テストの分割分布、クラス頻度、画像内の物体の出現位置を示すアノテーションヒートマップなど、データセット全体の統計を確認できます。
Classesタブでは、クラスごとのアノテーション数の内訳を確認できるため、クラスの不均衡を見つけやすくなります。一方、Imagesタブには、画像の寸法、アノテーション数、個々の画像におけるラベルの分布など、画像単位の詳細が表示されます。
こうした情報を使えば、クラスの不均衡、シナリオの欠落、データ分布の偏りなどの問題を見つけやすくなります。たとえば、特定のクラスの例が非常に少ないことや、ほとんどのアノテーションが画像内の特定の領域に集中していることに気付く場合があります。
データ分析に加えて、プラットフォームはデータセットのキュレーションと拡張にも対応しています。これは、問題のあるデータを修正または削除してデータセットを改善し、既存データのバリエーションを作成してモデルの性能を向上させることを意味します。分析結果を踏まえてアノテーションを更新したり、新しいデータを追加したり、データセットの分割を再編成したりすることで、こうした改善をプラットフォーム内で直接行えます。
Ultralytics Platformからのデータセットのエクスポート#
データセットの準備と検証が完了したら、さまざまな環境で使用できるようエクスポートできます。これにより、ローカル、クラウド、その他のツールやワークフローでモデルを学習する場合など、好みの場所でコンピュータービジョンデータを柔軟に活用できます。
Ultralytics PlatformはYOLO、COCO、NDJSONなど、複数のエクスポート形式に対応しているため、データセットをさまざまな学習ワークフローやツールに簡単に統合できます。

図3. Ultralytics Platformからのデータセットのエクスポート(出典)
データセットをエクスポートすると、画像、アノテーション、構成を含む、特定の時点におけるデータの固定スナップショットが作成されます。これは、新しいデータの追加、アノテーションの更新、分割の調整によって、データセットが頻繁に変更されるため便利です。スナップショットをエクスポートすることで、特定の学習実行で使用したデータセットの正確なバージョンを保持できます。
これにより、同じデータ設定で再度モデルを学習し、異なるデータセットバージョン間で性能を比較できるため、後から結果を再現しやすくなります。たとえば、何が変わったのかを推測するのではなく、新しい画像の追加やアノテーションの修正が実際にモデルの精度向上につながったかを評価できます。
エクスポートは非同期で処理され、準備が完了すると、データセットをダウンロードしてローカル、クラウド、オフラインの学習環境で使用できます。
Ultralytics Platformでの反復を通じたデータセット品質の向上#
機械学習やディープラーニングのワークフローでは、現実世界のデータが学習時に使用したデータと異なることが多いため、デプロイ後もデータセット管理を続ける必要があります。
モデルが新しい入力に遭遇すると、暗い環境、異なるカメラアングル、オクルージョン、混雑したシーンなどの条件の欠落をはじめとするデータセットの不足や、アノテーションの誤りが明らかになります。そのため、時間の経過に応じてデータを改善する必要があります。
データセットを改善する方法はいくつかあります。暗い環境、異なるカメラアングル、オクルージョン、混雑したシーンなど、欠落している条件を網羅する新しい画像や動画を追加すれば、データの死角を減らせます。
同時に、物体に正しいラベルを付け、バウンディングボックスやマスクを正確に設定するなど、アノテーションの正確性と一貫性を確保することで、モデルはより信頼性の高いパターンを学習できます。
通常は、モデルを学習する、結果を評価する、誤りを特定する、データセットを改善する、再学習するというシンプルなサイクルで進めます。各段階で、不正確なアノテーション、データの欠落、十分に代表されていないケースなどの問題が明らかになります。
店舗内の商品を検出するリアルタイムの小売店棚監視システムに取り組んでいるとしましょう。初期のデータセットには、特定の商品タイプ、照明条件、または商品が密集した棚の配置が含まれていない可能性があります。評価中に、こうした状況でモデルの検出性能が低下することに気付くかもしれません。
性能を向上させるには、欠落しているシナリオを網羅する新しい画像を収集し、必要に応じてアノテーションを更新できます。このプロセスを繰り返すことで、モデルは時間とともに現実世界の条件下でより正確かつ信頼性の高い動作をするようになります。
Ultralytics Platformは、データセットの更新を学習や評価と連携させることで、このワークフローを支援します。実験追跡機能と性能メトリクスが組み込まれているため、進捗を監視し、データセットを継続的に改善しやすくなります。
Ultralytics Platformを使ったデータセット変更の追跡#
モデル開発プロセスの一環として、データセットが時間とともにどのように変化するかを簡単に説明しました。新しいデータの追加、アノテーションの改善、クラスの更新に伴い、データ品質を維持し、モデル性能の一貫性を確保するうえで、こうした変更を追跡することが重要になります。
データセットの追跡とバージョン管理を支援する、Ultralytics Platformの主な機能をいくつか紹介します。
- データセットのバージョン管理: NDJSONスナップショットとして、固定されたデータセットのバージョンを作成できます。各バージョンには、特定の時点における画像数、クラス数、アノテーション数、データセットサイズなどの重要な情報が記録されます。バージョンは保存され、後からダウンロードできるため、実験の再現や異なるデータセット状態間での結果の比較が簡単になります。
- Versionsタブ: すべてのデータセットバージョンはVersionsタブに整理され、バージョン履歴の確認、変更内容の説明の追加、データセットが時間とともにどのように変化するかの追跡ができます。
- モデルとの連携: Modelsタブには、データセットで学習したすべてのモデルと、mAPなどのメトリクスや学習の詳細が表示されます。データセットのバージョンは学習実行と関連付けられているため、データの変更がモデル性能に与える影響を把握できます。
- Errorsタブ: Errorsタブでは、処理に失敗したファイルとエラーの詳細、推奨事項を確認できます。これにより、学習前に破損ファイルや未対応形式などの問題を特定して修正できます。
- データセットインターフェース(ImagesタブとClassesタブ): これらの画面では、画像の閲覧、アノテーションの確認、クラスラベルの管理、クラス分布の分析ができます。フィルタリングや並べ替え、未アノテーション画像の特定などの機能により、時間の経過に伴うデータセット品質の監視が簡単になります。
- 統計とチャート: 分割分布、クラス頻度、アノテーションヒートマップなどの組み込みデータ可視化機能により、データセットの変化に伴うデータ分布の追跡や、不均衡の特定が容易になります。

図4. Ultralytics Platformでデータセットのクラス分布を分析する例(出典)
Ultralytics Platform内でのデータセットと学習・デプロイの連携#
Ultralytics Platformは、AIモデル開発のさまざまな段階を単一のパイプラインに統合します。これにより、生データから本番環境に対応したビジョンAIアプリケーションへと移行するプロセスを効率化します。
データセットの準備とアノテーションが完了すると、プラットフォーム内でUltralytics YOLO26などのコンピュータービジョンモデルを直接学習させることができます。学習中は、組み込みのダッシュボードを使って性能メトリクスを監視し、実験を追跡し、モデルの学習状況を評価できます。

図5. Ultralytics Platformでモデル学習メトリクスを表示する画面(出典)
学習後は、新しい画像をブラウザー上で直接使ってモデルをテストし、予測を評価して、デプロイ前に改善点を特定できます。モデルが良好に動作したら、本番環境にデプロイできます。
プラットフォームは、モデルの複数形式へのエクスポート、または推論サービスや専用エンドポイントを通じたデプロイに対応しており、さまざまな環境でモデルを実行できます。
デプロイ後は、組み込みのモニタリングツールで、使用状況やモデルの挙動に関するメトリクスなど、システムの性能を時間の経過とともに追跡できます。これにより、現実世界のアプリケーションでビジョンAIシステムをより簡単に維持し、改善できます。
Ultralytics Platformでのデータセット管理のベストプラクティス#
Ultralytics Platformを使ってデータセットを管理する際に留意すべき主なポイントを紹介します。
- フィルターで不足箇所を見つける: フィルタリングツールを使って未ラベルまたは十分に代表されていないデータを特定すれば、アノテーションを完了し、網羅性を高めやすくなります。
- 早い段階でエラーを修正する: Errorsタブを品質管理に活用し、学習前にアップロードの失敗、破損ファイル、未対応形式を検出します。
- データセットを継続的に更新する: 新しいデータを追加し、アノテーションを修正し、エッジケースが見つかったら取り入れます。これにより網羅性が向上し、モデルが現実世界のシナリオで安定して動作するようになります。
- データセットの分割を慎重に管理する: 学習セット、検証セット、テストセットのバランスを適切に保ちます。必要に応じて分割を手動で再編成するか、自動再配分を利用できます。
Ultralytics Platformの詳細については、公式のUltralyticsドキュメントをご覧ください。
主なポイント#
コンピュータービジョンプロジェクトが大規模化するにつれ、データセットを効果的に管理することは、モデル開発と同じくらい重要になります。データセット管理に体系的なアプローチを採用することで、データ品質の向上、ワークフローの効率化、時間の経過に伴うモデル性能の改善が可能になります。
Ultralytics Platformは、データセット管理、学習、デプロイを単一のワークフローにまとめ、このプロセスを簡素化します。データセット管理に体系的なアプローチを採用することで、チームは複雑さを軽減し、効率を高め、よりスケーラブルで信頼性の高いコンピュータービジョンシステムを構築できます。
成長を続けるコミュニティに参加し、AIリソースについてはGitHubリポジトリをご覧ください。今すぐビジョンAIを活用した開発を始めるには、ライセンスオプションをご確認ください。農業分野のAIが農業をどのように変革しているか、また医療分野のビジョンAIがどのように未来を形作っているかについては、ソリューションページをご覧ください。









