Golden Dataset
ゴールデンデータセットとは何か、その構築と維持の方法を学び、信頼できる参照データを使用してAIモデルを評価し、リグレッションを防ぎ、デプロイの意思決定をサポートします。
ゴールデンデータセットとは、AIシステムの評価における信頼できる基準として使用される、慎重に厳選され、正確にラベリングされた、代表的な例のコレクションです。サイズを最大化するのではなく、意図されたアプリケーションに対する正確性、網羅性、および関連性を優先します。チームは、モデルの比較、回帰の確認、障害の調査、およびシステムがデプロイの準備ができているかどうかの判断を行うための安定した「正解キー」としてこれを使用します。
機械学習において、「ゴールデンデータセット」は、普遍的に標準化されたデータセットのタイプというよりも、非公式なエンジニアリング用語です。その正確な内容はタスクによって異なります。たとえば、オブジェクト検出のための検証済みバウンディングボックスを持つ画像、言語モデルのための承認された応答を持つプロンプト、または不正検出のための確認済みの結果を持つトランザクションなどです。
データセットをゴールデンたらしめるもの#
ゴールデンデータセットには、入力と、信頼できる期待される出力が含まれており、これらはしばしばグラウンドトゥルースと呼ばれます。コンピュータビジョンにおいて、これらの出力は、厳密なデータアノテーションを通じて生成されたクラスラベル、バウンディングボックス、セグメンテーションマスク、またはキーポイントである場合があります。
その主な品質は次のとおりです。
- ラベルの精度: ドメイン専門家または訓練を受けたレビュアーが、明確なガイドラインを使用してアノテーションを検証します。曖昧な例は、個人の解釈に任せるのではなく、一貫して解決されます。
- 代表的な網羅性: データセットは、一般的なケース、困難な例、稀なイベント、および関連するユーザーや環境グループを含む、重要な本番環境の条件を反映しています。
- タスクの整合性: すべての例は、倉庫の照明下での破損したパッケージの検出など、定義された要件を測定するのに役立ちます。
- 独立性: 例はトレーニングデータから分離されており、報告されたパフォーマンスが誤解を招くほど高くなる可能性があるデータリークを防ぎます。
- 追跡可能性: チームはデータソース、収集条件、アノテーションルール、レビュアー、および変更を記録します。MLflowデータセットトラッキングは、ハッシュ、スキーマ、ソース、およびデータセットの系統が再現性をどのようにサポートできるかを示しています。
- 管理された変更: 更新はバージョン管理され、レビューされます。モデルのスコアは、正確なデータセットのバージョンと評価設定が判明している場合にのみ意味を持ちます。
ゴールデンとは、欠陥がないことや、永続的に正しいことを意味するわけではありません。現実世界の条件や定義は変化する可能性があるため、履歴結果を静かに書き換えることなく、リファレンスセットを監査および更新する必要があります。
ゴールデンデータセットと関連用語の比較#
ゴールデンデータセットはいくつかの馴染みのある概念と重複していますが、信頼とガバナンスを重視しています。
- グラウンドトゥルースラベルは1つの例に対する受け入れられた答えであり、ゴールデンデータセットはレビューされた例とその受け入れられた答えのコレクションです。
- ベンチマークデータセットは通常、共通のタスクでシステムを比較するために共有されます。ゴールデンデータセットは多くの場合、非公開であり、1つの組織、製品、またはデプロイ環境に合わせて調整されています。
- 検証データは、開発中のモデルの選択とチューニングを導きます。それに基づく繰り返しの決定により、開発プロセスが徐々に過剰適合する可能性があります。
- テストデータは最終評価のために保持されます。ゴールデンデータセットは、個別の開発用部分と最終テスト用部分が含まれる場合もありますが、多くの場合、高品質なテストセットまたは回帰セットとして機能します。
- トレーニングデータはモデルのパラメータを学習させ、通常ははるかに大きいです。バージョン管理されたコピーが評価から意図的に除外されない限り、ゴールデンデータセットはトレーニングの外に維持されるべきです。
データ分割に関するGoogleのガイダンスでは、トレーニング、検証、およびテストの例を明確に区別しておくことが推奨されています。データが不足している場合、交差検証テクニックによって推定を改善できますが、保護された最終リファレンスセットは依然として価値があります。
実社会での応用#
製造上の欠陥検査: 工場では、許容可能な製品や、亀裂、部品の欠落、誤った組み立てなどの確認された欠陥を示すレビュー済み画像のゴールデンデータセットを作成する場合があります。これには、複数の生産ライン、カメラ位置、材料、および照明条件が含まれます。各候補モデルは、リリース前に同じセットで評価されます。小さな亀裂に対するリコールが低下した場合、チームは全体的な指標が許容範囲内であるように見えても、デプロイをブロックできます。
店舗の棚のモニタリング: 小売業者は、混雑した棚、空きスペース、部分的に隠れた製品、季節ごとのパッケージ、および反射を含む、検証済みの店舗画像を維持する場合があります。このデータセットは、ビジョンシステムが店舗環境全体で製品や在庫の欠品を確実に検出するかどうかを測定します。シナリオまたは製品カテゴリ別のパフォーマンスのレビューは、Microsoftの責任あるAIガイダンスで説明されている高エラーコホートを見つけるという広範な実践に従っています。
これらのアプリケーションは、全体的な精度だけでは不十分である理由を示しています。ゴールデンデータセットは、エラーが異なる結果をもたらす稀なクラス、ロケーション、デバイス、または条件に対するスライスベースの評価をサポートする必要があります。NIST AIリスク管理フレームワークコアでも同様に、文書化されたテストセット、適切な指標、およびデプロイに近い条件での評価が強調されています。
ゴールデンデータセットの構築と維持#
モデルの意図された動作と重要な障害モードを定義することから始めます。代表的な例を収集し、正確なアノテーション手順を記述し、レビュアーのキャリブレーションを実行し、ドメイン専門家との意見の相違を解決します。類似したコンテンツがトレーニングと評価の境界を越えないように、ほぼ重複するデータや関連するビデオフレームを同じ分割に保持します。
ビジョンプロジェクト向けに、Ultralytics Platformはクラウドのデータセット管理、アノテーション、トレーニング、およびデプロイをサポートしています。そのアノテーションワークフローにより、チームはラベルを作成および洗練することができ、一方データセットビューはクラス分布、アノテーションのない画像、分割、重複、および外れ値の検査に役立ちます。
承認された各リリースのバージョンを管理し、追加、削除、ラベルの修正、およびポリシーの変更を文書化します。AIのテスト、評価、検証、および確認に関するNISTガイダンスは、意味のある評価のためのより広範なフレームワークを提供します。デプロイ後、受信データをゴールデンリファレンスと比較し、変化する条件をモニタリングします。Azureのモデルモニタリングガイダンスでは、ドリフトやデータ品質のシグナルが、リファレンスセットの改訂が必要な時期をどのように明らかにできるかについて説明しています。
ビジョンモデルの評価#
Ultralytics YOLOは、検証モードを使用して、レビュー済みラベルに対して予測を評価できます。
from ultralytics import YOLO
# Load a pretrained object detection model
model = YOLO("yolo26n.pt")
# Evaluate predictions against a labeled reference split
metrics = model.val(data="coco8.yaml", split="val")
# Report the primary detection metric
print(f"mAP50-95: {metrics.box.map:.3f}")このワークフローは、ゴールデンデータセットのモデル側の役割を示しています。固定されたモデルを固定されたラベル付き分割に対して実行し、再現可能な指標を記録します。本番プロジェクトにおいて、チームはリリースを承認する前に、クラスごとの結果、混同行列、困難な例、およびアプリケーション固有の受け入れなしきい値も検査する必要があります。






