CutMix
Descobre como a técnica de aumento de dados CutMix evita o sobreajuste. Aprende a aplicá-la facilmente para treinar modelos Ultralytics YOLO26 robustos.
CutMix é uma técnica avançada de aumento de dados usada para treinar modelos robustos de visão computacional, recortando um fragmento retangular de uma imagem e colando-o sobre uma imagem-alvo. Ao contrário de aumentos mais simples, que ajustam o brilho ou a rotação, o CutMix altera a composição fundamental de uma amostra de treinamento. Quando os pixels são trocados, os rótulos de referência correspondentes também são combinados proporcionalmente à área do fragmento. Isso ajuda as redes neurais artificiais a aprender a identificar objetos a partir de visões parciais, forçando o modelo a depender de vários recursos em vez de se concentrar apenas nas partes mais discriminativas de um objeto. Introduzido pela primeira vez em um artigo acadêmico de 2019, tornou-se uma operação padrão em frameworks de aprendizagem profunda para evitar sobreajuste e melhorar a generalização em grandes conjuntos de dados.
Como a técnica funciona#
Durante o treinamento do modelo, o algoritmo seleciona aleatoriamente uma coordenada central e o tamanho de uma caixa para extrair uma região de uma imagem secundária. Esse fragmento é então sobreposto diretamente a uma imagem primária dentro do lote ativo. Se a imagem primária contivesse um cão e a secundária contivesse um gato, a imagem final apresentaria um fragmento de gato substituindo uma parte do cão. Os rótulos de classificação são atualizados usando interpolação linear com base na área exata do fragmento — por exemplo, resultando em um rótulo de 0,7 para cão e 0,3 para gato. Em tarefas de deteção de objetos, as caixas delimitadoras que mantêm pelo menos uma determinada percentagem (frequentemente 10%) da sua área original dentro da região colada são preservadas. Essa técnica é suportada nativamente como um hiperparâmetro de treinamento cutmix no Ultralytics YOLO, permitindo que os profissionais definam facilmente a probabilidade dessa transformação.
Diferenças entre MixUp e Cutout#
CutMix está intimamente relacionado com duas outras técnicas proeminentes de aumento de dados, mas resolve as suas limitações específicas:
- Aumento MixUp: O MixUp combina globalmente duas imagens calculando uma média ponderada dos seus valores de pixel. Embora seja eficaz, muitas vezes produz imagens fantasma semitransparentes e pouco naturais, que podem confundir os modelos ao perturbar a correlação espacial local. Em contrapartida, o CutMix preserva as intensidades originais dos pixels dentro das regiões recortadas, algo que os investigadores otimizaram ainda mais em abordagens como o Attentive CutMix.
- Aumento Cutout: O Cutout elimina informação ao mascarar uma região retangular aleatória com pixels pretos ou com a média do conjunto de dados. Embora incentive o modelo a observar o objeto inteiro, desperdiça tensores valiosos de treinamento. O CutMix substitui esse espaço vazio por fragmentos informativos de classificação de imagens provenientes de outras imagens, aumentando a eficiência geral da aprendizagem.
Aplicações no mundo real#
Ao treinar modelos para reconhecer objetos gravemente ocluídos, o CutMix aumenta significativamente o desempenho de aprendizagem automática em diversos setores.
- IA automóvel e condução autónoma: Em carros autónomos, ensina o sistema a identificar peões ou veículos mesmo quando estão parcialmente bloqueados por sinais de trânsito, aumentando a segurança em ambientes movimentados.
- Diagnóstico médico e segmentação de órgãos: Na área da saúde, este método é amplamente utilizado para a segmentação de órgãos e tumores, permitindo que os modelos reconheçam limites complexos dos tecidos mesmo quando as estruturas anatómicas se sobrepõem.
- Deteção remota para imagens de satélite: Esta estratégia preserva classes densas e sobrepostas, como edifícios e vegetação, em vistas aéreas. Variações avançadas são ativamente investigadas para melhorar o reconhecimento de cauda longa em dados fortemente desequilibrados.
Implementação na prática#
Integrar este aumento num pipeline de IA é simples. A maioria das bibliotecas de alto nível oferece suporte nativo, como PyTorch Transforms e Keras Preprocessing Layers.
Ao treinar um modelo como o YOLO26, configurar este aumento requer apenas o ajuste de um único parâmetro. Isso trata automaticamente tanto da aplicação dos fragmentos de imagem como da complexa lógica de recorte das caixas delimitadoras.
from ultralytics import YOLO
# Initialize the recommended Ultralytics YOLO26 model
model = YOLO("yolo26n.pt")
# Train the model with CutMix enabled at a 50% probability
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, cutmix=0.5)Para equipas que gerem fluxos de trabalho de visão em grande escala, a Ultralytics Platform simplifica esse processo ao permitir que os utilizadores ajustem estas boas práticas de aumento de dados diretamente numa interface na nuvem, agilizando o percurso desde a anotação até à implementação do modelo.









