Transformer
Explora a arquitetura Transformer e o mecanismo de autoatenção. Aprende como alimentam modelos de IA como o RT-DETR e o Ultralytics YOLO26 para obter maior precisão.
Um Transformer é uma arquitetura de aprendizagem profunda que depende de um mecanismo chamado autoatenção para processar dados de entrada sequenciais, como linguagem natural ou características visuais. Introduzido originalmente por investigadores da Google no artigo marcante Attention Is All You Need, o Transformer revolucionou o campo da inteligência artificial (AI) ao eliminar as limitações de processamento sequencial das anteriores Redes Neurais Recorrentes (RNNs). Em vez disso, os Transformers analisam sequências inteiras de dados em simultâneo, permitindo uma paralelização massiva e tempos de treino significativamente mais rápidos em hardware moderno, como GPUs.
Como funcionam os Transformers#
A principal inovação do Transformer é o mecanismo de autoatenção. Este permite que o modelo pondere a importância de diferentes partes dos dados de entrada em relação umas às outras. Por exemplo, numa frase, o modelo pode aprender que a palavra "bank" está mais relacionada com "money" do que com "river", com base no contexto envolvente.
Esta arquitetura é geralmente constituída por dois componentes principais:
- Codificador: Processa os dados de entrada numa representação numérica rica ou embedding.
- Descodificador: Utiliza a saída do codificador para gerar o resultado final, como uma frase traduzida ou uma caixa delimitadora prevista.
No domínio da visão computacional (CV), os modelos utilizam normalmente uma variante chamada Transformer de Visão (ViT). Em vez de processar tokens de texto, a imagem é dividida em patches de tamanho fixo (por exemplo, 16x16 píxeis). Estes patches são achatados e tratados como uma sequência, permitindo que o modelo capture o "contexto global" — compreendendo as relações entre partes distantes de uma imagem — de forma mais eficaz do que uma Rede Neural Convolucional (CNN) padrão.
Transformers vs. conceitos relacionados#
É importante distinguir a arquitetura Transformer de termos relacionados:
- Mecanismo de Atenção: Este é o conceito geral de focar em partes específicas dos dados. O Transformer é uma arquitetura específica construída inteiramente em torno de camadas de atenção, enquanto outros modelos podem utilizar a atenção apenas como um pequeno complemento.
- Modelo de Linguagem de Grande Escala (LLM): Termos como "GPT" referem-se a modelos específicos treinados com grandes quantidades de texto. Quase todos os LLMs modernos utilizam a arquitetura Transformer como motor subjacente.
Aplicações no mundo real#
A versatilidade dos Transformers levou à sua adoção em vários setores:
-
Imagiologia Médica: Na AI na Saúde, os Transformers são utilizados para tarefas complexas, como a análise de imagens médicas. A sua capacidade de compreender relações espaciais globais ajuda a detetar anomalias subtis em exames de MRI ou CT de alta resolução que as CNNs, focadas em características locais, poderiam não identificar.
-
Sistemas Autónomos: No caso dos veículos autónomos, compreender a trajetória de peões e de outros veículos é fundamental. Os Transformers destacam-se na compreensão de vídeo ao acompanhar objetos ao longo dos fotogramas, prevendo movimentos futuros para garantir uma navegação segura.
Deteção de Objetos com Transformers#
Embora as CNNs tenham tradicionalmente dominado a deteção de objetos, os modelos baseados em Transformer, como o Transformer de Deteção em Tempo Real (RT-DETR), surgiram como alternativas poderosas. O RT-DETR combina a velocidade dos backbones CNN com a precisão das cabeças de descodificação Transformer.
No entanto, os modelos Transformer puros podem ser computacionalmente pesados. Para muitas aplicações de edge, os modelos híbridos altamente otimizados, como o YOLO26 — que integram mecanismos de atenção eficientes com processamento convolucional rápido — oferecem um equilíbrio superior entre velocidade e precisão. Podes gerir facilmente o treino e a implementação destes modelos através da Ultralytics Platform, que simplifica o fluxo de trabalho desde a anotação do dataset até à exportação do modelo.
Exemplo em Python: Utilizar RT-DETR#
O exemplo seguinte demonstra como realizar inferência utilizando um modelo baseado em Transformer dentro do pacote ultralytics. Este código carrega um modelo RT-DETR pré-treinado e deteta objetos numa imagem.
from ultralytics import RTDETR
# Load a pre-trained Real-Time Detection Transformer (RT-DETR) model
model = RTDETR("rtdetr-l.pt")
# Run inference on an image URL
# The model uses self-attention to identify objects with high accuracy
results = model("https://ultralytics.com/images/bus.jpg")
# Display the detection results with bounding boxes
results[0].show()Para mais informações sobre os fundamentos matemáticos, a documentação do PyTorch sobre camadas Transformer oferece uma análise técnica aprofundada, enquanto o guia da IBM sobre Transformers apresenta uma perspetiva empresarial de alto nível.









