Golden Dataset
Un jeu de données de référence est un ensemble soigneusement annoté et représentatif, utilisé comme vérité de référence fiable pour l’évaluation de l’IA. Cet article explique comment en créer et en maintenir un.
Un jeu de données de référence est un ensemble d’exemples soigneusement sélectionnés, étiquetés avec précision et représentatifs, qui sert de référence fiable pour évaluer un système d’IA. Au lieu de maximiser sa taille, il privilégie l’exactitude, la couverture et la pertinence pour l’application visée. Les équipes l’utilisent comme un « corrigé » stable pour comparer les modèles, vérifier les régressions, examiner les défaillances et décider si un système est prêt à être déployé.
En apprentissage automatique, « jeu de données de référence » est un terme informel d’ingénierie plutôt qu’un type de jeu de données normalisé à l’échelle universelle. Son contenu exact dépend de la tâche : des images avec des boîtes englobantes vérifiées pour la détection d’objets, des requêtes avec des réponses approuvées pour un modèle de langage ou des transactions aux résultats confirmés pour la détection des fraudes.
Ce qui caractérise un jeu de données de référence#
Un jeu de données de référence contient des entrées et des sorties attendues fiables, souvent appelées vérité terrain. En vision par ordinateur, ces sorties peuvent être des étiquettes de classe, des boîtes englobantes, des masques de segmentation ou des points clés issus d’une annotation de données rigoureuse.
Ses principales qualités sont les suivantes :
- Exactitude des étiquettes : des spécialistes du domaine ou des évaluateurs formés vérifient les annotations en suivant des consignes claires. Les exemples ambigus sont traités de manière cohérente au lieu d’être laissés à l’interprétation de chacun.
- Couverture représentative : Le jeu de données reflète des conditions de production importantes, notamment les cas courants, les exemples difficiles, les événements rares et les groupes d’utilisateurs ou environnements pertinents.
- Adéquation à la tâche : Chaque exemple contribue à mesurer une exigence définie, comme la détection de colis endommagés sous l’éclairage d’un entrepôt.
- Indépendance : Les exemples sont séparés des données d’entraînement afin d’éviter les fuites de données, qui peuvent donner une image excessivement favorable des performances rapportées.
- Traçabilité : Les équipes consignent les sources des données, les conditions de collecte, les règles d’annotation, les réviseurs et les modifications. Le suivi des jeux de données avec MLflow montre comment les empreintes, les schémas, les sources et la lignée des jeux de données peuvent favoriser la reproductibilité.
- Modifications contrôlées : Les mises à jour sont versionnées et révisées. Un score de modèle n’a de sens que si la version exacte du jeu de données et les paramètres d’évaluation sont connus.
« Golden » ne signifie ni parfait ni correct de façon permanente. Les conditions et les définitions du monde réel peuvent évoluer : le jeu de référence doit donc être audité et actualisé sans réécrire silencieusement les résultats historiques.
Jeu de données de référence et termes apparentés#
Un jeu de données de référence recoupe plusieurs notions familières, mais met l’accent sur la fiabilité et la gouvernance :
- Une étiquette de vérité terrain est la réponse acceptée pour un exemple donné ; un jeu de données de référence est un ensemble d’exemples révisés et de leurs réponses acceptées.
- Un jeu de données de référence est généralement partagé pour comparer des systèmes sur une tâche commune. Un jeu de données de référence « golden » est souvent privé et adapté à une organisation, un produit ou un environnement de déploiement donné.
- Les données de validation orientent la sélection et le réglage du modèle pendant le développement. Les décisions répétées fondées sur ces données peuvent progressivement entraîner un surapprentissage du processus de développement.
- Les données de test sont mises de côté pour l’évaluation finale. Un jeu de données de référence « golden » sert souvent de jeu de test ou de régression de haute qualité, mais peut aussi comporter des parties distinctes pour le développement et le test final.
- Les données d’entraînement apprennent les paramètres du modèle et sont généralement beaucoup plus volumineuses. Un jeu de données de référence « golden » doit rester à l’écart de l’entraînement, sauf si une copie versionnée est volontairement retirée de l’évaluation.
Les recommandations de Google sur la répartition des jeux de données préconisent de séparer les exemples d’entraînement, de validation et de test. Lorsque les données sont rares, les techniques de validation croisée peuvent améliorer l’estimation, mais un jeu de référence final protégé reste précieux.
Applications concrètes#
Inspection des défauts de fabrication : une usine peut constituer un jeu de données de référence à partir d’images vérifiées montrant des produits conformes et des défauts confirmés, tels que des fissures, des composants manquants ou un assemblage incorrect. Il comprend plusieurs lignes de production, positions de caméra, matériaux et conditions d’éclairage. Chaque modèle candidat est évalué sur le même ensemble avant sa mise en production. Si le rappel diminue pour les petites fissures, l’équipe peut bloquer le déploiement même si la métrique globale semble acceptable.
Surveillance des rayons en magasin : Un détaillant peut conserver des images vérifiées de magasins montrant des rayons encombrés, des espaces vides, des produits partiellement masqués, des emballages saisonniers et des reflets. Ce jeu de données mesure si un système de vision détecte les produits et les ruptures de stock de manière fiable dans différents environnements de magasin. L’examen des performances par scénario ou catégorie de produit s’inscrit dans la pratique plus générale consistant à repérer les cohortes présentant beaucoup d’erreurs, décrite dans les recommandations de Microsoft sur l’IA responsable.
Ces applications montrent pourquoi la précision globale ne suffit pas. Le jeu de données de référence « golden » doit permettre une évaluation par sous-ensemble pour les classes, lieux, appareils ou conditions rares où les erreurs ont des conséquences différentes. Le NIST AI Risk Management Framework Core souligne également l’importance de jeux de test documentés, de métriques adaptées et d’évaluations réalisées dans des conditions proches du déploiement.
Constituer et maintenir un jeu de données de référence « golden »#
Commence par définir le comportement attendu du modèle et les principaux modes de défaillance. Recueille des exemples représentatifs, rédige des consignes d’annotation précises, calibre les réviseurs et règle les désaccords avec des experts du domaine. Regroupe les quasi-doublons et les images vidéo apparentées dans la même partition afin que des contenus visuellement similaires ne se retrouvent pas de part et d’autre de la séparation entre entraînement et évaluation.
Pour les projets de vision, Ultralytics Platform permet de gérer des jeux de données dans le cloud, de les annoter, d’entraîner des modèles et de les déployer. Son flux de travail d’annotation permet aux équipes de créer et d’affiner les étiquettes, tandis que les vues des jeux de données facilitent l’inspection des distributions de classes, des images non annotées, des partitions, des doublons et des valeurs aberrantes.
Versionne chaque livraison approuvée et documente les ajouts, les suppressions, les corrections d’étiquettes et les modifications de règles. Les recommandations du NIST sur les tests, l’évaluation, la validation et la vérification de l’IA proposent un cadre plus large pour une évaluation pertinente. Après le déploiement, compare les données entrantes à la référence « golden » et surveille l’évolution des conditions ; les recommandations d’Azure sur la surveillance des modèles expliquent comment les signaux de dérive et de qualité des données peuvent indiquer qu’il faut réviser le jeu de référence.
Évaluer un modèle de vision#
Ultralytics YOLO peut évaluer les prédictions par rapport à des étiquettes révisées avec le mode Validation :
from ultralytics import YOLO
# Load a pretrained object detection model
model = YOLO("yolo26n.pt")
# Evaluate predictions against a labeled reference split
metrics = model.val(data="coco8.yaml", split="val")
# Report the primary detection metric
print(f"mAP50-95: {metrics.box.map:.3f}")Ce flux de travail illustre le rôle du jeu de données de référence « golden » du côté du modèle : exécuter un modèle fixe sur une partition annotée fixe et consigner une métrique reproductible. Dans les projets de production, les équipes doivent aussi examiner les résultats par classe, les matrices de confusion, les exemples difficiles et les seuils d’acceptation propres à l’application avant d’approuver une livraison.










