Ultralytics YOLO27:
Voltar ao Glossário da Ultralytics

Vision Transformer (ViT)

Explora o potencial dos Vision Transformer (ViT). Aprende como a autoatenção e a tokenização em patches revolucionam a visão computacional para além das CNN com a Ultralytics.

Um Vision Transformer (ViT) é uma arquitetura de aprendizagem profunda que adapta os mecanismos de autoatenção originalmente concebidos para o Processamento de Linguagem Natural (NLP) para resolver tarefas visuais. Ao contrário de uma Rede Neural Convolucional (CNN) tradicional, que processa imagens através de uma hierarquia de grelhas de píxeis locais, um ViT trata uma imagem como uma sequência de blocos discretos. Esta abordagem foi popularizada pelo artigo de investigação marcante "An Image is Worth 16x16 Words", que demonstrou que arquiteturas puramente baseadas em Transformer poderiam alcançar desempenho de última geração em visão computacional (CV) sem depender de camadas convolucionais. Ao tirar partido da atenção global, os ViTs conseguem captar dependências de longo alcance em toda a imagem desde a primeira camada.

Como funcionam os Transformers de visão#

A inovação fundamental do ViT é a forma como estrutura os dados de entrada. Para tornar uma imagem compatível com um Transformer padrão, o modelo divide a informação visual numa sequência de vetores, imitando a forma como um modelo de linguagem processa uma frase composta por palavras.

  1. Tokenização de blocos: A imagem de entrada é dividida numa grelha de quadrados de tamanho fixo, normalmente com 16x16 píxeis. Cada quadrado é achatado num vetor, tornando-se efetivamente um token visual.

  2. Projeção linear: Estes blocos achatados passam por uma camada linear treinável para criar embeddings densos. Esta etapa mapeia os valores brutos dos píxeis para um espaço de alta dimensionalidade que o modelo consegue processar.

  3. Codificação posicional: Como a arquitetura processa sequências em paralelo e não possui uma compreensão inerente da ordem ou do espaço, são adicionadas codificações posicionais aprendíveis aos embeddings dos blocos. Isto permite que o modelo retenha informação espacial sobre a posição de cada bloco na imagem original.

  4. Mecanismo de autoatenção: A sequência entra no codificador Transformer, onde a autoatenção permite que cada bloco interaja simultaneamente com todos os outros blocos. Isto permite que a rede aprenda o contexto global, compreendendo a relação entre um píxel no canto superior esquerdo e outro no canto inferior direito.

  5. Cabeça de classificação: Para tarefas como a classificação de imagens, é frequentemente acrescentado um "token de classe" especial no início da sequência. O estado de saída final deste token serve como representação agregada da imagem, que é depois introduzida num classificador, como um perceptron multicamadas (MLP).

Transformers de visão vs. CNNs#

Embora ambas as arquiteturas procurem compreender dados visuais, diferem significativamente na sua filosofia operacional. As CNNs possuem um forte "viés indutivo" conhecido como invariância à translação, o que significa que assumem inerentemente que as características locais, como contornos e texturas, são importantes independentemente da sua posição. Isto torna as CNNs altamente eficientes em termos de dados e eficazes em conjuntos de dados mais pequenos.

Por outro lado, os Transformers de visão têm menos viés específico para imagens. Têm de aprender relações espaciais de raiz utilizando grandes quantidades de dados de treino, como os conjuntos de dados JFT-300M ou ImageNet completos. Embora isto torne o treino mais exigente do ponto de vista computacional, permite que os ViTs aumentem de escala de forma notável; com dados suficientes e capacidade computacional, podem superar as CNNs ao captar estruturas globais complexas que as convoluções locais podem não detetar.

Aplicações no mundo real#

A capacidade de compreender o contexto global torna os ViTs particularmente úteis em ambientes complexos e críticos.

  • Análise de imagens médicas: Na IA na área da saúde, os ViTs são utilizados para analisar exames de alta resolução, como MRIs ou lâminas de histopatologia. Por exemplo, na deteção de tumores, um ViT pode correlacionar anomalias texturais subtis nos tecidos com alterações estruturais mais amplas em toda a lâmina, identificando padrões malignos que o processamento local poderia não detetar.
  • Imagens de satélite e sensoriamento remoto: Os ViTs destacam-se na análise de imagens de satélite, onde as relações entre objetos abrangem grandes distâncias. Por exemplo, relacionar uma área de desflorestação com uma estrada de exploração madeireira distante exige compreender o "panorama geral" de uma paisagem, uma tarefa em que a atenção global de um ViT supera o campo recetivo limitado das CNNs padrão.

Utilização de Transformers com a Ultralytics#

A biblioteca ultralytics suporta arquiteturas baseadas em Transformer, sobretudo o RT-DETR (Transformer de Deteção em Tempo Real). Embora o YOLO26, modelo principal, seja frequentemente preferido pelo equilíbrio entre velocidade e precisão em dispositivos periféricos, o RT-DETR oferece uma alternativa poderosa para cenários que priorizam o contexto global.

O exemplo seguinte em Python demonstra como carregar um modelo pré-treinado baseado em Transformer e executar inferência:

from ultralytics import RTDETR

# Load a pre-trained RT-DETR model (Vision Transformer-based)
model = RTDETR("rtdetr-l.pt")

# Run inference on an image source
# The model uses self-attention to detect objects globally
results = model("https://ultralytics.com/images/bus.jpg")

# Display the detection results
results[0].show()

Perspetivas futuras#

A investigação está a evoluir rapidamente para resolver o elevado custo computacional dos ViTs. Técnicas como FlashAttention estão a tornar estes modelos mais rápidos e eficientes em termos de memória. Além disso, as arquiteturas híbridas que combinam a eficiência das CNNs com a atenção dos Transformers estão a tornar-se comuns. Para equipas que procuram gerir estes fluxos de trabalho avançados, a Plataforma Ultralytics oferece um ambiente unificado para anotar dados, treinar modelos complexos através da nuvem e implementá-los em diversos endpoints.

Explore solutions

Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais

Vamos construir juntos o futuro da IA!

Começa a tua jornada com o futuro da aprendizagem automática