Golden Dataset
Un conjunto de datos de referencia es un conjunto representativo y cuidadosamente etiquetado que sirve como patrón de referencia fiable para evaluar la IA. Explica cómo crearlo y mantenerlo.
Un conjunto de datos de referencia es una colección de ejemplos cuidadosamente seleccionados, etiquetados con precisión y representativos que se utiliza como referencia fiable para evaluar un sistema de IA. En lugar de maximizar el tamaño, prioriza la corrección, la cobertura y la pertinencia para la aplicación prevista. Los equipos lo utilizan como una «plantilla de respuestas» estable para comparar modelos, comprobar regresiones, investigar fallos y decidir si un sistema está listo para su implementación.
En aprendizaje automático, «conjunto de datos de referencia» es un término informal de ingeniería, no un tipo de conjunto de datos estandarizado universalmente. Su contenido exacto depende de la tarea: imágenes con cuadros delimitadores verificados para la detección de objetos, instrucciones con respuestas aprobadas para un modelo de lenguaje o transacciones con resultados confirmados para la detección de fraude.
Qué caracteriza a un conjunto de datos de referencia#
Un conjunto de datos de referencia contiene entradas y resultados esperados fiables, a menudo denominados verdad de referencia. En visión artificial, estos resultados pueden ser etiquetas de clase, cuadros delimitadores, máscaras de segmentación o puntos clave obtenidos mediante una anotación de datos rigurosa.
Sus principales cualidades son:
- Precisión de las etiquetas: Expertos en el dominio o revisores formados verifican las anotaciones siguiendo directrices claras. Los ejemplos ambiguos se resuelven de manera coherente, en lugar de dejarse a la interpretación individual.
- Cobertura representativa: El conjunto de datos refleja condiciones de producción importantes, incluidos casos habituales, ejemplos difíciles, eventos poco frecuentes y grupos de usuarios o entornos relevantes.
- Alineación con la tarea: Cada ejemplo ayuda a medir un requisito definido, como detectar paquetes dañados con la iluminación de un almacén.
- Independencia: Los ejemplos están separados de los datos de entrenamiento para evitar la filtración de datos, que puede hacer que el rendimiento comunicado parezca engañosamente alto.
- Trazabilidad: Los equipos registran las fuentes de datos, las condiciones de recopilación, las reglas de anotación, los revisores y los cambios. El seguimiento de conjuntos de datos de MLflow muestra cómo los hashes, los esquemas, las fuentes y el linaje de los conjuntos de datos pueden facilitar la reproducibilidad.
- Cambios controlados: Las actualizaciones se versionan y se revisan. La puntuación de un modelo solo es significativa si se conocen la versión exacta del conjunto de datos y los ajustes de evaluación.
«Dorado» no significa perfecto ni correcto para siempre. Las condiciones y definiciones del mundo real pueden cambiar, por lo que el conjunto de referencia debe auditarse y actualizarse sin modificar silenciosamente los resultados históricos.
Conjunto de datos de referencia frente a términos relacionados#
Un conjunto de datos de referencia comparte características con varios conceptos conocidos, pero hace hincapié en la confianza y la gobernanza:
- Una etiqueta de referencia es la respuesta aceptada para un ejemplo; un conjunto de datos de referencia es una colección de ejemplos revisados y sus respuestas aceptadas.
- Un conjunto de datos de referencia suele compartirse para comparar sistemas en una tarea común. Un conjunto de datos de referencia interno suele ser privado y estar adaptado a una organización, producto o entorno de implementación concretos.
- Los datos de validación guían la selección y el ajuste del modelo durante el desarrollo. Las decisiones reiteradas basadas en ellos pueden provocar que el proceso de desarrollo se sobreajuste gradualmente.
- Los datos de prueba se reservan para la evaluación final. Un conjunto de datos de referencia suele servir como conjunto de prueba o de regresión de alta calidad, aunque también puede contener partes separadas para el desarrollo y las pruebas finales.
- Los datos de entrenamiento enseñan los parámetros del modelo y suelen ser mucho más voluminosos. Un conjunto de datos de referencia debe mantenerse fuera del entrenamiento, salvo que se retire deliberadamente de la evaluación mediante una copia versionada.
La guía de Google sobre la división de conjuntos de datos recomienda mantener separados los ejemplos de entrenamiento, validación y prueba. Si los datos son escasos, las técnicas de validación cruzada pueden mejorar la estimación, pero sigue siendo valioso contar con un conjunto de referencia final protegido.
Aplicaciones en el mundo real#
Inspección de defectos de fabricación: Una fábrica puede crear un conjunto de datos de referencia con imágenes revisadas que muestran productos aceptables y defectos confirmados, como grietas, componentes ausentes o montajes incorrectos. Incluye varias líneas de producción, posiciones de cámara, materiales y condiciones de iluminación. Cada modelo candidato se evalúa con el mismo conjunto antes de su lanzamiento. Si la exhaustividad disminuye para las grietas pequeñas, el equipo puede bloquear el despliegue aunque la métrica global parezca aceptable.
Supervisión de estanterías en tiendas: Un minorista puede mantener imágenes verificadas de tiendas con estanterías abarrotadas, espacios vacíos, productos parcialmente ocultos, envases de temporada y reflejos. Este conjunto de datos mide si un sistema de visión detecta de forma fiable los productos y las roturas de stock en distintos entornos comerciales. Revisar el rendimiento por escenario o categoría de producto sigue la práctica más general de identificar grupos con muchos errores que se describe en la guía de IA responsable de Microsoft.
Estas aplicaciones muestran por qué la precisión global no basta. El conjunto de datos de referencia debe permitir una evaluación por segmentos de clases, ubicaciones, dispositivos o condiciones poco frecuentes en las que los errores tengan consecuencias distintas. El núcleo del Marco de gestión de riesgos de IA de NIST también hace hincapié en los conjuntos de prueba documentados, las métricas adecuadas y la evaluación en condiciones similares a las de implementación.
Creación y mantenimiento de un conjunto de datos de referencia#
Empieza por definir el comportamiento previsto del modelo y los modos de fallo importantes. Recopila ejemplos representativos, redacta instrucciones de anotación precisas, calibra a los revisores y resuelve los desacuerdos con expertos del dominio. Mantén los casi duplicados y los fotogramas relacionados de un vídeo en la misma partición para evitar que contenido visualmente similar cruce la separación entre entrenamiento y evaluación.
Para proyectos de visión, Ultralytics Platform admite la gestión de conjuntos de datos en la nube, la anotación, el entrenamiento y la implementación. Su flujo de trabajo de anotación permite a los equipos crear y perfeccionar etiquetas, mientras que las vistas de conjuntos de datos ayudan a inspeccionar distribuciones de clases, imágenes sin anotar, particiones, duplicados y valores atípicos.
Versiona cada publicación aprobada y documenta las incorporaciones, eliminaciones, correcciones de etiquetas y cambios de política. La guía de NIST sobre pruebas, evaluación, validación y verificación de la IA ofrece un marco más amplio para realizar evaluaciones significativas. Tras la implementación, compara los datos entrantes con la referencia dorada y supervisa los cambios en las condiciones; la guía de Azure sobre la supervisión de modelos explica cómo las señales de deriva y calidad de los datos pueden revelar cuándo es necesario revisar un conjunto de referencia.
Evaluación de un modelo de visión#
Ultralytics YOLO puede evaluar las predicciones comparándolas con etiquetas revisadas mediante el modo de validación:
from ultralytics import YOLO
# Load a pretrained object detection model
model = YOLO("yolo26n.pt")
# Evaluate predictions against a labeled reference split
metrics = model.val(data="coco8.yaml", split="val")
# Report the primary detection metric
print(f"mAP50-95: {metrics.box.map:.3f}")Este flujo de trabajo muestra la función del conjunto de datos de referencia en el lado del modelo: ejecutar un modelo fijo con una partición etiquetada fija y registrar una métrica reproducible. En proyectos de producción, los equipos también deben inspeccionar los resultados por clase, las matrices de confusión, los ejemplos difíciles y los umbrales de aceptación específicos de la aplicación antes de aprobar una publicación.










