CutMix
Descubre cómo la técnica de aumento de datos CutMix evita el sobreajuste. Aprende a aplicarla fácilmente para entrenar modelos robustos de Ultralytics YOLO26.
CutMix es una técnica avanzada de aumento de datos que se utiliza para entrenar modelos robustos de visión artificial recortando un parche rectangular de una imagen y pegándolo sobre una imagen objetivo. A diferencia de los aumentos más sencillos, que ajustan el brillo o la rotación, CutMix altera la composición fundamental de una muestra de entrenamiento. Cuando se intercambian los píxeles, las correspondientes etiquetas de referencia también se combinan proporcionalmente al área del parche. Esto ayuda a las redes neuronales artificiales a aprender a identificar objetos a partir de vistas parciales, obligando al modelo a basarse en múltiples características en lugar de centrarse únicamente en las partes más discriminativas de un objeto. Presentada por primera vez en un artículo académico de 2019, se ha convertido en una operación estándar en los frameworks de aprendizaje profundo para evitar el sobreajuste y mejorar la generalización en grandes conjuntos de datos.
Cómo funciona la técnica#
Durante el entrenamiento del modelo, el algoritmo selecciona aleatoriamente una coordenada central y el tamaño de una caja para extraer una región de una imagen secundaria. A continuación, este parche se superpone directamente a una imagen principal dentro del lote activo. Si la imagen principal contenía un perro y la secundaria un gato, la imagen final mostraría un parche de gato reemplazando una parte del perro. Las etiquetas de clasificación se actualizan mediante interpolación lineal en función del área exacta del parche; por ejemplo, se obtiene una etiqueta de 0,7 para perro y 0,3 para gato. En tareas de detección de objetos, se conservan las cajas delimitadoras que mantienen al menos un determinado porcentaje (a menudo el 10 %) de su área original dentro de la región pegada. Esta técnica se admite de forma nativa como hiperparámetro de entrenamiento cutmix en Ultralytics YOLO, lo que permite definir fácilmente la probabilidad de aplicar esta transformación.
Diferencias entre MixUp y Cutout#
CutMix está estrechamente relacionado con otras dos técnicas destacadas de aumento de datos, pero resuelve sus limitaciones específicas:
- Aumento MixUp: MixUp combina globalmente dos imágenes calculando una media ponderada de sus valores de píxel. Aunque es eficaz, a menudo produce imágenes fantasma semitransparentes y poco naturales que pueden confundir a los modelos al alterar la correlación espacial local. En cambio, CutMix conserva las intensidades de píxel originales dentro de las regiones recortadas, algo que los investigadores optimizaron posteriormente en enfoques como Attentive CutMix.
- Aumento Cutout: Cutout elimina información enmascarando una región rectangular aleatoria con píxeles negros o con la media del conjunto de datos. Aunque anima al modelo a observar el objeto completo, desperdicia valiosos tensores de entrenamiento. CutMix reemplaza ese espacio vacío con parches informativos de clasificación de imágenes procedentes de otras imágenes, lo que aumenta la eficiencia global del aprendizaje.
Aplicaciones en el mundo real#
Al entrenar los modelos para reconocer objetos con una oclusión considerable, CutMix mejora notablemente el rendimiento del aprendizaje automático en diversos sectores.
- IA para automoción y conducción autónoma: En los coches autónomos, enseña al sistema a identificar peatones o vehículos incluso cuando están parcialmente ocultos por señales de tráfico, mejorando la seguridad en entornos concurridos.
- Diagnóstico médico y segmentación de órganos: En el ámbito sanitario, este método se utiliza ampliamente para la segmentación de órganos y tumores, lo que permite a los modelos reconocer límites complejos de los tejidos incluso cuando las estructuras anatómicas se superponen.
- Teledetección para imágenes por satélite: Esta estrategia conserva clases densas y superpuestas, como edificios y vegetación, en vistas aéreas. Se investigan activamente variantes avanzadas para mejorar el reconocimiento de colas largas en datos muy desequilibrados.
Implementación práctica#
Integrar este aumento en una canalización de IA es sencillo. La mayoría de las bibliotecas de alto nivel lo admiten de forma nativa, como PyTorch Transforms y Keras Preprocessing Layers.
Al entrenar un modelo como YOLO26, configurar este aumento solo requiere ajustar un parámetro. Esto gestiona automáticamente tanto la aplicación de parches a las imágenes como la compleja lógica de recorte de las cajas delimitadoras.
from ultralytics import YOLO
# Initialize the recommended Ultralytics YOLO26 model
model = YOLO("yolo26n.pt")
# Train the model with CutMix enabled at a 50% probability
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, cutmix=0.5)Para los equipos que gestionan flujos de trabajo de visión a gran escala, Ultralytics Platform simplifica este proceso al permitir ajustar estas prácticas recomendadas de aumento de datos directamente desde una interfaz en la nube, agilizando el proceso desde la anotación hasta el despliegue del modelo.









