Capsule Networks (CapsNet)
Explora as Redes de Cápsulas (CapsNets) e como resolvem as limitações das CNNs. Aprende sobre roteamento dinâmico, hierarquias espaciais e a comparação entre CapsNets e YOLO26.
As redes de cápsulas, frequentemente abreviadas como CapsNets, representam uma arquitetura avançada no campo do deep learning, concebida para superar limitações específicas encontradas nas redes neuronais tradicionais. Introduzidas por Geoffrey Hinton e pela sua equipa, as CapsNets procuram imitar mais de perto a organização neuronal biológica do cérebro humano do que os modelos padrão. Ao contrário de uma típica rede neuronal convolucional (CNN), que é excelente na deteção de características, mas frequentemente perde relações espaciais devido à redução da amostragem, uma rede de cápsulas organiza os neurónios em grupos chamados "cápsulas". Estas cápsulas codificam não só a probabilidade de presença de um objeto, mas também as suas propriedades específicas, como orientação, tamanho e textura, preservando eficazmente as relações espaciais hierárquicas nos dados visuais.
A limitação das CNNs tradicionais#
Para compreender a inovação das CapsNets, é útil observar como funcionam os modelos padrão de visão computacional. Uma CNN convencional utiliza camadas de extração de características seguidas de camadas de pooling — especificamente max pooling — para reduzir a carga computacional e obter invariância à translação. Isto significa que uma CNN consegue identificar um "gato", independentemente do local onde este se encontra na imagem.
No entanto, este processo frequentemente descarta dados precisos sobre a localização, dando origem ao "problema de Picasso": uma CNN pode classificar corretamente um rosto mesmo que a boca esteja na testa, simplesmente porque todas as características necessárias estão presentes. As CapsNets resolvem este problema removendo as camadas de pooling e substituindo-as por um processo que respeita as hierarquias espaciais dos objetos.
Como funcionam as redes de cápsulas#
O elemento fundamental desta arquitetura é a cápsula, um conjunto aninhado de neurónios que produz um vetor em vez de um valor escalar. Na matemática vetorial, um vetor tem magnitude e direção. Numa CapsNet:
- Magnitude (Comprimento): Representa a probabilidade de uma entidade específica existir na entrada atual.
- Direção (Orientação): Codifica os parâmetros de instanciação, como a estimativa da pose, a escala e a rotação do objeto.
As cápsulas das camadas inferiores (que detetam formas simples, como contornos) preveem a saída das cápsulas das camadas superiores (que detetam objetos complexos, como olhos ou pneus). Esta comunicação é gerida por um algoritmo chamado "encaminhamento dinâmico" ou "encaminhamento por concordância". Se a previsão de uma cápsula de nível inferior estiver alinhada com o estado da cápsula de nível superior, a ligação entre ambas é reforçada. Isto permite que a rede reconheça objetos a partir de diferentes perspetivas 3D sem exigir o enorme volume de aumento de dados normalmente necessário para ensinar às CNNs a rotação e a escala.
Principais diferenças: CapsNets vs. CNNs#
Embora ambas as arquiteturas sejam fundamentais para a visão computacional (CV), diferem na forma como processam e representam os dados visuais:
- Escalar vs. Vetorial: Os neurónios das CNNs utilizam saídas escalares para indicar a presença de características. As CapsNets utilizam vetores para codificar a presença (comprimento) e os parâmetros da pose (orientação).
- Encaminhamento vs. Pooling: As CNNs utilizam pooling para reduzir a amostragem dos dados, perdendo frequentemente detalhes da localização. As CapsNets utilizam encaminhamento dinâmico para preservar os dados espaciais, sendo altamente eficazes em tarefas que exigem rastreamento preciso de objetos.
- Eficiência dos dados: Como as cápsulas compreendem implicitamente as perspetivas 3D e as transformações afins, conseguem frequentemente generalizar a partir de menos dados de treino do que as CNNs, que podem exigir muitos exemplos para aprender todas as rotações possíveis de um objeto.
Aplicações no mundo real#
Embora as CapsNets sejam frequentemente mais dispendiosas do ponto de vista computacional do que modelos otimizados como o YOLO26, oferecem vantagens distintas em domínios especializados:
-
Análise de imagens médicas: Na área da saúde, a orientação e a forma precisas de uma anomalia são fundamentais. Os investigadores aplicaram CapsNets à segmentação de tumores cerebrais, onde o modelo tem de distinguir um tumor do tecido circundante com base em hierarquias espaciais subtis que as CNNs padrão podem suavizar. Podes consultar investigação relacionada em Redes de cápsulas em imagiologia médica.
-
Reconhecimento de dígitos sobrepostos: As CapsNets alcançaram resultados de última geração no conjunto de dados MNIST, especificamente em cenários onde os dígitos se sobrepõem. Como a rede acompanha a "pose" de cada dígito, consegue separar dois números sobrepostos (por exemplo, um '3' sobre um '5') como objetos distintos, em vez de os fundir num único mapa de características confuso.
Contexto prático e implementação#
As redes de cápsulas são principalmente uma arquitetura de classificação. Embora ofereçam robustez teórica, as aplicações industriais modernas favorecem frequentemente CNNs de alta velocidade ou Transformers para obter desempenho em tempo real. No entanto, é útil compreender os benchmarks de classificação utilizados para as CapsNets, como o MNIST.
O exemplo seguinte demonstra como treinar um moderno modelo de classificação YOLO no conjunto de dados MNIST utilizando o pacote ultralytics. Isto é paralelo à tarefa de benchmark principal utilizada para validar as redes de cápsulas.
from ultralytics import YOLO
# Load a YOLO26 classification model (optimized for speed and accuracy)
model = YOLO("yolo26n-cls.pt")
# Train the model on the MNIST dataset
# This dataset helps evaluate how well a model learns handwritten digit features
results = model.train(data="mnist", epochs=5, imgsz=32)
# Run inference on a sample image
# The model predicts the digit class (0-9)
predict = model("https://docs.ultralytics.com/datasets/classify/mnist")O futuro das cápsulas e da IA para visão#
Os princípios subjacentes às redes de cápsulas continuam a influenciar a investigação em segurança da IA e interpretabilidade. Ao modelarem explicitamente as relações entre partes e o todo, as cápsulas oferecem uma alternativa de "caixa de vidro" à natureza de "caixa preta" das redes neuronais profundas, tornando as decisões mais explicáveis. Os desenvolvimentos futuros procuram combinar a robustez espacial das cápsulas com a velocidade de inferência de arquiteturas como o YOLO11 ou o mais recente YOLO26, para melhorar o desempenho na deteção de objetos 3D e na robótica. Os investigadores também estão a explorar Capsules de matriz com encaminhamento EM para reduzir ainda mais o custo computacional do algoritmo de concordância.
Para os programadores que procuram gerir conjuntos de dados e treinar modelos de forma eficiente, a Ultralytics Platform disponibiliza um ambiente unificado para anotar dados, treinar na cloud e implementar modelos que equilibram a velocidade das CNNs com a precisão necessária para tarefas complexas de visão.









