Data Labeling
Aprende los fundamentos del etiquetado de datos para machine learning. Descubre tipos clave, como la detección de objetos, y cómo acelerar los flujos de trabajo con Ultralytics YOLO26.
El etiquetado de datos es el proceso fundamental de identificar datos sin procesar —como imágenes, fotogramas de vídeo, texto o audio— y añadir etiquetas o metadatos informativos para proporcionar contexto. En el ámbito del aprendizaje automático (ML), los algoritmos no pueden comprender de forma inherente el mundo físico; necesitan un «profesor» que los guíe. Esta guía se proporciona mediante conjuntos de datos etiquetados utilizados durante el aprendizaje supervisado. Las etiquetas representan la verdad fundamental, es decir, las respuestas correctas que el modelo intenta predecir. Tanto si entrenas un clasificador sencillo como una arquitectura compleja como Ultralytics YOLO26, la precisión, la coherencia y la calidad de estas etiquetas son los principales factores que determinan el éxito de un modelo.
Etiquetado de datos frente a anotación de datos#
Aunque en las conversaciones informales estos términos suelen utilizarse indistintamente, existe una diferencia sutil que conviene señalar. «Etiquetado de datos» suele referirse al acto general de asignar una categoría o etiqueta a un dato (por ejemplo, marcar un correo electrónico como «spam»). En cambio, la anotación de datos suele ser más específica de la visión artificial (CV) e implica delimitar con precisión los objetos mediante cajas delimitadoras, polígonos o puntos clave. Sin embargo, en la mayoría de los flujos de trabajo de operaciones de aprendizaje automático (MLOps), ambos términos describen la creación de datos de entrenamiento de alta calidad.
Tipos principales en visión artificial#
El método de etiquetado cambia en función de la tarea que debe realizar el modelo. Entre los tipos habituales se incluyen:
- Clasificación de imágenes: Asignar una única etiqueta a una imagen completa, como identificar una condición meteorológica como «nublado» o «soleado».
- Detección de objetos: Dibujar cajas delimitadoras 2D alrededor de objetos diferenciados para enseñar al modelo qué es el objeto y dónde se encuentra.
- Segmentación de instancias: Crear máscaras o polígonos pixel a pixel alrededor de los objetos, algo esencial para determinar sus formas y límites con precisión.
- Estimación de pose: Marcar puntos clave específicos de un sujeto, como las articulaciones del esqueleto, para analizar el movimiento o la postura.
Aplicaciones en el mundo real#
La utilidad del etiquetado de datos se extiende prácticamente a todos los sectores que emplean IA.
-
Vehículos autónomos: Los coches autónomos dependen de conjuntos de datos masivos en los que cada vehículo, peatón, señal de tráfico y marca vial se etiqueta meticulosamente. Estos datos etiquetados permiten al sistema de percepción desplazarse de forma segura por entornos complejos. Las empresas de vehículos autónomos invierten mucho en el etiquetado a nivel de píxel para garantizar el cumplimiento de los requisitos de seguridad.
-
Agricultura de precisión: En la agricultura moderna, la IA en la agricultura se utiliza para detectar enfermedades de los cultivos o supervisar las etapas de crecimiento. Los agricultores utilizan modelos entrenados con imágenes etiquetadas de hojas «sanas» y «enfermas» para automatizar los tratamientos, reducir el uso de productos químicos y aumentar el rendimiento.
El flujo de trabajo de etiquetado#
Crear un conjunto de datos etiquetado suele ser la parte que más tiempo consume de un proyecto de IA. El proceso suele seguir un enfoque de «humano en el circuito» (HITL), en el que los anotadores humanos verifican las etiquetas para garantizar una alta precisión. Los flujos de trabajo modernos aprovechan herramientas como Ultralytics Platform, que simplifica la gestión de conjuntos de datos y permite a los equipos colaborar en las anotaciones. También pueden emplearse técnicas avanzadas como el aprendizaje activo, en el que un modelo preetiqueta los datos y las personas solo corrigen las predicciones con un nivel de confianza bajo, lo que acelera considerablemente el proceso.
El siguiente ejemplo muestra cómo utilizar un modelo Ultralytics YOLO26 preentrenado para generar automáticamente etiquetas (etiquetado automático) para una imagen nueva, que después pueden corregir las personas:
from ultralytics import YOLO
# Load the YOLO26n model (nano version)
model = YOLO("yolo26n.pt")
# Run inference on an image to detect objects
results = model("https://ultralytics.com/images/bus.jpg")
# Save the detection results to a text file in standard YOLO format
# This file can now be used as a starting point for data labeling
results[0].save_txt("bus_labels.txt")








