Catastrophic Forgetting
Descobre como evitar o esquecimento catastrófico em redes neuronais. Explora estratégias comprovadas de mitigação ao treinar os teus modelos Ultralytics YOLO.
O esquecimento catastrófico, frequentemente referido como interferência catastrófica, é um fenómeno amplamente estudado em aprendizagem automática, no qual uma rede neuronal artificial perde abruptamente informações aprendidas anteriormente ao aprender novas tarefas. Quando um modelo é submetido a treino sequencial para se adaptar a um novo conjunto de dados, os algoritmos de otimização que utilizam retropropagação atualizam os pesos do modelo. Este processo substitui frequentemente, de forma inadvertida, as representações matemáticas necessárias para tarefas anteriores. Consequentemente, um sistema de IA altamente otimizado para o seu objetivo original pode sofrer uma degradação grave do desempenho nessas tarefas iniciais se for treinado exclusivamente com dados novos, sem contramedidas específicas.
Porque ocorre o esquecimento catastrófico#
Na aprendizagem profunda, o conhecimento de um modelo é armazenado numa rede distribuída de neurónios interligados. Durante o ajuste fino, funções de otimização como a descida estocástica do gradiente ajustam estas ligações para minimizar o erro nos dados novos. Se o novo conjunto de dados de treino não contiver exemplos das classes originais, o processo de otimização desloca os pesos em direção à distribuição dos dados novos, apagando efetivamente a "memória" da distribuição antiga. Estudos recentes sobre a mudança estrutural indicam que este colapso interno limita fundamentalmente a capacidade das modernas [redes neuronais](https://ultralytics-translation-4.invalid de alcançar uma aprendizagem ao longo da vida semelhante à humana, de forma imediata.
Diferenciação de conceitos relacionados#
É fundamental distinguir o esquecimento catastrófico de outros conceitos de IA:
- Esquecimento catastrófico vs. colapso do modelo: Enquanto o esquecimento ocorre devido à aprendizagem incremental de novas tarefas, o colapso do modelo consiste numa degradação gradual do desempenho na mesma tarefa, quando um modelo é treinado recursivamente com dados sintéticos gerados por outros modelos de IA.
- Esquecimento catastrófico vs. aprendizagem contínua: A aprendizagem contínua é a metodologia de investigação abrangente destinada a resolver o esquecimento catastrófico. Os algoritmos de aprendizagem contínua procuram permitir que os modelos adquiram sequencialmente novos conhecimentos sem esquecer os anteriores.
Exemplos do mundo real#
O esquecimento catastrófico representa um desafio significativo em vários domínios de IA que operam em ambientes reais dinâmicos:
- Sistemas autónomos: Nos pipelines de perceção de veículos autónomos, um sistema de visão computacional inicialmente treinado para reconhecer peões e sinais de trânsito padrão pode ser ajustado para reconhecer novos sinais de obras específicos de uma região. Sem salvaguardas, o sistema pode subitamente ter dificuldade em detetar peões de forma fiável, criando um grave risco de segurança.
- IA linguística e cognitiva: Ao personalizar modelos de linguagem de grande escala para tarefas específicas de um domínio — como diagnósticos médicos — o modelo pode esquecer o seu alinhamento conversacional ou as suas capacidades gerais de raciocínio. Uma análise comparativa recente sobre LLMs mostra que o ajuste fino padrão com textos altamente especializados frequentemente desgasta o alinhamento de segurança anterior, fazendo com que os modelos percam as suas capacidades primárias de seguir instruções.
Como superar o esquecimento catastrófico#
Os engenheiros de IA utilizam várias estratégias para mitigar este problema e manter um dilema ideal entre plasticidade e estabilidade:
- Reprodução e fusão de conjuntos de dados: O método mais fiável consiste em misturar um subconjunto dos dados de treino originais com os dados novos. Ferramentas como a Ultralytics Platform simplificam a gestão e o controlo de versões de conjuntos de dados combinados, garantindo que as classes originais sejam efetivamente reproduzidas durante o treino.
- Consolidação elástica de pesos (EWC): Esta técnica de regularização limita as atualizações dos parâmetros que eram essenciais para tarefas antigas. Ao identificar e preservar estes pesos fundamentais, os modelos reduzem o esquecimento, conforme destacado em experiências recentes sobre como superar o esquecimento das redes.
- Ajuste Fino Eficiente em Parâmetros (PEFT): Métodos como a Adaptação de Baixo Posto (LoRA) congelam os pesos principais pré-treinados e inserem pequenas matrizes treináveis na rede, evitando que o conhecimento base seja sobrescrito.
- Congelamento de camadas: Em execuções de treino mais curtas, congelar as camadas backbone e neck garante que os extratores de características essenciais permaneçam intactos.
- Otimização sem gradiente: Novas arquiteturas demonstraram recentemente que os métodos baseados na passagem direta também podem mitigar eficazmente o esquecimento em ambientes onde as atualizações de gradiente são limitadas.
Exemplo de implementação em IA de visão#
Ao adaptar o Ultralytics YOLO para uma nova tarefa de deteção de objetos, congelar camadas é uma abordagem eficaz e acessível. O exemplo seguinte demonstra como treinar um modelo Ultralytics YOLO26 com um novo conjunto de dados, evitando o esquecimento catastrófico através do congelamento das 10 camadas iniciais.
from ultralytics import YOLO
# Load a pretrained Ultralytics YOLO26 model
model = YOLO("yolo26n.pt")
# Train on a combined dataset while freezing core backbone layers
# The 'freeze=10' argument prevents catastrophic forgetting of foundational visual features
results = model.train(data="combined_dataset.yaml", epochs=20, freeze=10, lr0=0.001)
# Evaluate the model to ensure it retains performance on old and new tasks
metrics = model.val()





