Label Smoothing
Aprende cómo el suavizado de etiquetas evita el sobreajuste y mejora la generalización de los modelos. Descubre cómo implementar esta técnica con Ultralytics YOLO26 para obtener mejores resultados.
El suavizado de etiquetas es una técnica de regularización ampliamente utilizada en aprendizaje automático para mejorar la generalización del modelo y evitar el sobreajuste. Al entrenar redes neuronales, el objetivo suele ser minimizar el error entre las predicciones y la verdad fundamental. Sin embargo, si un modelo adquiere demasiada confianza en sus predicciones —asignando una probabilidad cercana al 100 % a una sola clase—, a menudo empieza a memorizar el ruido específico de los datos de entrenamiento en lugar de aprender patrones robustos. Este fenómeno, conocido como sobreajuste, degrada el rendimiento en ejemplos nuevos que no se han visto. El suavizado de etiquetas aborda este problema evitando que el modelo prediga con certeza absoluta; en esencia, indica a la red que siempre existe un pequeño margen de error.
Mecánica de los objetivos suaves#
Para entender cómo funciona el suavizado de etiquetas, resulta útil contrastarlo con los objetivos «duros» estándar. En el aprendizaje supervisado tradicional, las etiquetas de clasificación suelen representarse mediante codificación one-hot. Por ejemplo, en una tarea para distinguir entre gatos y perros, una imagen de un «perro» tendría un vector objetivo de [0, 1]. Para ajustarse perfectamente a este vector, el modelo lleva sus puntuaciones internas, conocidas como logits, hacia el infinito, lo que puede provocar gradientes inestables y una incapacidad para adaptarse.
El suavizado de etiquetas sustituye estos 1 y 0 rígidos por objetivos «suaves». En lugar de asignar a la clase correcta una probabilidad objetivo de 1.0, podría asignársele 0.9, mientras que la masa de probabilidad restante (0.1) se distribuye uniformemente entre las clases incorrectas. Este cambio sutil modifica el objetivo de la función de pérdida, como la entropía cruzada, y evita que la función de activación (normalmente Softmax) se sature. El resultado es un modelo que aprende agrupaciones de clases más compactas en el espacio de características y consigue una mejor calibración del modelo, lo que significa que las probabilidades predichas reflejan con mayor precisión la probabilidad real de acierto.
Aplicaciones en el mundo real#
Esta técnica es especialmente importante en ámbitos donde la ambigüedad de los datos es inherente o los conjuntos de datos son propensos a contener errores de etiquetado.
- Diagnóstico médico: En el ámbito de la IA en la atención sanitaria, los datos clínicos rara vez son blancos o negros. Por ejemplo, en el análisis de imágenes médicas, una exploración puede mostrar características muy indicativas de una enfermedad, pero no concluyentes. Entrenar con etiquetas duras obliga al modelo a ignorar esta incertidumbre. Al aplicar suavizado de etiquetas, el modelo conserva cierto grado de escepticismo, algo vital para los sistemas de apoyo a la toma de decisiones, donde un exceso de confianza podría provocar un diagnóstico erróneo.
- Clasificación de imágenes a gran escala: Los enormes conjuntos de datos públicos, como ImageNet, suelen contener imágenes mal etiquetadas o imágenes que incluyen varios objetos válidos. Si un modelo intenta ajustar estos ejemplos ruidosos con una confianza del 100 %, aprende asociaciones incorrectas. El suavizado de etiquetas actúa como protección frente al ruido de las etiquetas y garantiza que unos pocos puntos de datos erróneos no desvíen drásticamente los pesos del modelo finales.
Implementación del suavizado de etiquetas con Ultralytics#
Los frameworks modernos de aprendizaje profundo simplifican la aplicación de esta técnica. Con el paquete ultralytics, puedes integrar fácilmente el suavizado de etiquetas en tu pipeline de entrenamiento para tareas de clasificación de imágenes o detección. Esto suele hacerse para extraer un rendimiento adicional de modelos de vanguardia como YOLO26.
El siguiente ejemplo muestra cómo entrenar un modelo de clasificación con el suavizado de etiquetas activado:
from ultralytics import YOLO
# Load a pre-trained YOLO26 classification model
model = YOLO("yolo26n-cls.pt")
# Train with label_smoothing set to 0.1
# The target for the correct class becomes 1.0 - 0.5 * 0.1 = 0.95 (depending on implementation specifics)
model.train(data="mnist", epochs=5, label_smoothing=0.1)Comparación con conceptos relacionados#
Es útil distinguir el suavizado de etiquetas de otras estrategias de regularización para entender cuándo utilizarlo.
- Frente a Dropout: Una capa de dropout desactiva neuronas aleatoriamente durante el entrenamiento para obligar a la red a aprender representaciones redundantes. Aunque ambos métodos evitan el sobreajuste, dropout modifica dinámicamente la arquitectura de la red, mientras que el suavizado de etiquetas modifica el objetivo de optimización (las propias etiquetas).
- Frente a la destilación de conocimiento: Ambas técnicas implican entrenar con objetivos suaves. Sin embargo, en la destilación de conocimiento, los objetivos suaves proceden de un modelo «profesor» y contienen información aprendida (por ejemplo, «esto se parece un 10 % a un gato»). En cambio, el suavizado de etiquetas utiliza objetivos suaves «no informativos» derivados matemáticamente (por ejemplo, «asigna un 10 % de probabilidad por igual a todas las demás clases»).
- Frente al aumento de datos: Las estrategias de aumento de datos modifican los datos de entrada (rotándolos, recortándolos o cambiando sus colores) para aumentar la variedad. El suavizado de etiquetas modifica las expectativas de salida. Los flujos de trabajo de entrenamiento integrales en la plataforma Ultralytics suelen combinar aumento de datos, dropout y suavizado de etiquetas para lograr la máxima precisión.
Al mitigar el problema del gradiente desvanecido en las capas finales y animar al modelo a aprender características más robustas, el suavizado de etiquetas sigue siendo un elemento básico de las arquitecturas modernas de aprendizaje profundo.









