Data Labeling
Aprende los fundamentos del etiquetado de datos para machine learning. Descubre tipos clave como la detección de objetos y cómo acelerar los flujos de trabajo usando Ultralytics YOLO26.
La etiquetación de datos es el proceso fundamental de identificar datos sin procesar —como imágenes, fotogramas de vídeo, texto o audio— y añadir etiquetas informativas o metadatos para proporcionar contexto. En el ámbito del aprendizaje automático (ML), los algoritmos no pueden entender intrínsecamente el mundo físico; requieren un "profesor" que los guíe. Esta guía se presenta en forma de conjuntos de datos etiquetados utilizados durante el aprendizaje supervisado. Las etiquetas sirven como la verdad de terreno, representando las respuestas correctas que el modelo se esfuerza por predecir. Ya sea entrenando un clasificador simple o una arquitectura compleja como Ultralytics YOLO26, la precisión, consistencia y calidad de estas etiquetas son los determinantes principales del éxito de un modelo.
Etiquetado de datos frente a anotación de datos#
Aunque los términos se usan a menudo indistintamente en una conversación informal, existe una sutil distinción que vale la pena señalar. La "etiquetación de datos" se refiere generalmente al acto amplio de asignar una categoría o etiqueta a un fragmento de datos (por ejemplo, etiquetar un correo electrónico como "spam"). En contraste, la anotación de datos suele ser más específica de la visión artificial (CV), implicando la delimitación precisa de objetos mediante cuadros delimitadores, polígonos o puntos clave. Sin embargo, dentro de la mayoría de los flujos de trabajo de operaciones de ML (MLOps), ambos términos describen la creación de datos de entrenamiento de alta calidad.
Tipos principales en Computer Vision#
El método de etiquetado cambia según la tarea que el modelo deba realizar. Los tipos comunes incluyen:
- Clasificación de Imágenes: Asignar una única etiqueta a toda una imagen, como identificar una condición meteorológica como "nublado" o "soleado".
- Detección de Objetos: Dibujar cuadros delimitadores en 2D alrededor de objetos distintos para enseñar al modelo qué es el objeto y dónde está ubicado.
- Segmentación de Instancias: Crear máscaras de píxeles perfectos o polígonos alrededor de los objetos, lo cual es esencial para determinar formas y límites precisos.
- Estimación de Postura: Marcar puntos clave específicos en un sujeto, como las articulaciones esqueléticas, para analizar el movimiento o la postura.
Aplicaciones en el mundo real#
La utilidad del etiquetado de datos se extiende a prácticamente todos los sectores que emplean IA.
-
Vehículos Autónomos: Los coches autónomos dependen de conjuntos de datos masivos donde cada vehículo, peatón, señal de tráfico y marcador de carril está etiquetado meticulosamente. Estos datos etiquetados permiten que el sistema de percepción navegue por entornos complejos de manera segura. Las empresas de vehículos autónomos invierten fuertemente en el etiquetado a nivel de píxel para garantizar el cumplimiento de la seguridad.
-
Agricultura de Precisión: En la agricultura moderna, la IA en la agricultura se utiliza para detectar enfermedades de los cultivos o supervisar las etapas de crecimiento. Los agricultores utilizan modelos entrenados con imágenes etiquetadas de hojas "sanas" frente a hojas "enfermas" para automatizar el tratamiento, reduciendo el uso de químicos y aumentando el rendimiento.
El flujo de trabajo de etiquetado#
Crear un conjunto de datos etiquetado suele ser la parte que más tiempo consume en un proyecto de IA. El proceso normalmente implica un enfoque de "Humano en el Bucle" (HITL), donde los anotadores humanos verifican las etiquetas para garantizar una alta precisión. Los flujos de trabajo modernos aprovechan herramientas como la Plataforma Ultralytics, que simplifica la gestión de conjuntos de datos y permite a los equipos colaborar en las anotaciones. También se pueden emplear técnicas avanzadas como el aprendizaje activo, donde un modelo preetiqueta los datos y los humanos solo corrigen las predicciones de baja confianza, acelerando significativamente el proceso.
El siguiente ejemplo muestra cómo usar un modelo YOLO26 preentrenado de Ultralytics para generar automáticamente etiquetas (etiquetado automático) para una imagen nueva, que luego pueden ser corregidas por humanos:
from ultralytics import YOLO
# Load the YOLO26n model (nano version)
model = YOLO("yolo26n.pt")
# Run inference on an image to detect objects
results = model("https://ultralytics.com/images/bus.jpg")
# Save the detection results to a text file in standard YOLO format
# This file can now be used as a starting point for data labeling
results[0].save_txt("bus_labels.txt")





