Ultralytics YOLO27:
Torna al glossario di Ultralytics

Vision Transformer (ViT)

Esplora la potenza dei Vision Transformer (ViT). Scopri come la self-attention e la tokenizzazione delle patch stanno rivoluzionando la visione artificiale oltre le CNN con Ultralytics.

Un Vision Transformer (ViT) è un'architettura di deep learning che adatta i meccanismi di self-attention originariamente progettati per l'elaborazione del linguaggio naturale (NLP) per risolvere attività di tipo visivo. A differenza di una tradizionale rete neurale convoluzionale (CNN), che elabora le immagini attraverso una gerarchia di griglie locali di pixel, un ViT tratta un'immagine come una sequenza di patch discrete. Questo approccio è stato reso popolare dal fondamentale articolo di ricerca "An Image is Worth 16x16 Words", che ha dimostrato come le architetture basate esclusivamente su Transformer potessero raggiungere prestazioni all'avanguardia nella visione artificiale (CV) senza affidarsi a livelli convoluzionali. Sfruttando l'attenzione globale, i ViT possono catturare dipendenze a lungo raggio nell'intera immagine fin dal primo livello.

Come funzionano i Vision Transformer#

L'innovazione fondamentale del ViT riguarda il modo in cui struttura i dati di input. Per rendere un'immagine compatibile con un Transformer standard, il modello scompone l'informazione visiva in una sequenza di vettori, riproducendo il modo in cui un modello linguistico elabora una frase composta da parole.

  1. Tokenizzazione delle patch: l'immagine di input viene suddivisa in una griglia di quadrati di dimensioni fisse, in genere di 16x16 pixel. Ogni quadrato viene appiattito in un vettore, diventando di fatto un token visivo.

  2. Proiezione lineare: queste patch appiattite passano attraverso un livello lineare addestrabile per creare embedding densi. Questo passaggio mappa i valori grezzi dei pixel in uno spazio ad alta dimensionalità che il modello può elaborare.

  3. Codifica posizionale: poiché l'architettura elabora le sequenze in parallelo e non possiede una comprensione intrinseca dell'ordine o dello spazio, alle rappresentazioni delle patch vengono aggiunte codifiche posizionali apprendibili. Ciò consente al modello di mantenere le informazioni spaziali sulla posizione di ciascuna patch nell'immagine originale.

  4. Meccanismo di self-attention: la sequenza entra nell'encoder del Transformer, dove la self-attention consente a ogni patch di interagire simultaneamente con tutte le altre. Questo permette alla rete di apprendere il contesto globale, comprendendo la relazione tra un pixel nell'angolo in alto a sinistra e uno nell'angolo in basso a destra.

  5. Testa di classificazione: per attività come la classificazione delle immagini, spesso all'inizio della sequenza viene anteposto uno speciale "token di classe". Lo stato di output finale di questo token funge da rappresentazione aggregata dell'immagine, che viene quindi fornita a un classificatore, come un percettrone multistrato (MLP).

Vision Transformer a confronto con le CNN#

Sebbene entrambe le architetture mirino a comprendere i dati visivi, differiscono significativamente nella loro filosofia operativa. Le CNN possiedono un forte "bias induttivo" noto come invarianza alla traslazione, ovvero presuppongono intrinsecamente che le caratteristiche locali, come bordi e texture, siano importanti indipendentemente dalla loro posizione. Ciò rende le CNN altamente efficienti dal punto di vista dei dati ed efficaci su dataset più piccoli.

Al contrario, i Vision Transformer presentano un bias meno specifico per le immagini. Devono apprendere da zero le relazioni spaziali utilizzando enormi quantità di dati di addestramento, come i dataset JFT-300M o l'intero dataset ImageNet. Sebbene ciò renda l'addestramento più oneroso dal punto di vista computazionale, consente ai ViT di scalare molto bene; con dati sufficienti e potenza di calcolo, possono superare le CNN catturando strutture globali complesse che le convoluzioni locali potrebbero non rilevare.

Applicazioni nel mondo reale#

La capacità di comprendere il contesto globale rende i ViT particolarmente utili in ambienti complessi e ad alto rischio.

  • Analisi delle immagini mediche: nell'AI per l'assistenza sanitaria, i ViT vengono utilizzati per analizzare scansioni ad alta risoluzione come MRI o vetrini di istopatologia. Ad esempio, nel rilevamento dei tumori, un ViT può correlare sottili anomalie nella texture dei tessuti con cambiamenti strutturali più ampi nell'intero vetrino, identificando pattern maligni che l'elaborazione locale potrebbe trascurare.
  • Immagini satellitari e telerilevamento: i ViT eccellono nell'analisi delle immagini satellitari, dove le relazioni tra gli oggetti si estendono su grandi distanze. Ad esempio, collegare un sito di deforestazione a una strada forestale distante richiede la comprensione del "quadro generale" di un paesaggio, un'attività in cui l'attenzione globale di un ViT supera il campo ricettivo limitato delle CNN standard.

Utilizzare i Transformer con Ultralytics#

La libreria ultralytics supporta le architetture basate su Transformer, in particolare RT-DETR (Transformer per il rilevamento in tempo reale). Sebbene il modello di punta YOLO26 sia spesso preferito per il suo equilibrio tra velocità e accuratezza sui dispositivi edge, RT-DETR offre un'alternativa potente per gli scenari che danno priorità al contesto globale.

Il seguente esempio in Python mostra come caricare un modello basato su Transformer preaddestrato ed eseguire l'inferenza:

from ultralytics import RTDETR

# Load a pre-trained RT-DETR model (Vision Transformer-based)
model = RTDETR("rtdetr-l.pt")

# Run inference on an image source
# The model uses self-attention to detect objects globally
results = model("https://ultralytics.com/images/bus.jpg")

# Display the detection results
results[0].show()

Prospettive future#

La ricerca si sta evolvendo rapidamente per affrontare l'elevato costo computazionale dei ViT. Tecniche come FlashAttention stanno rendendo questi modelli più veloci ed efficienti in termini di memoria. Inoltre, stanno diventando comuni le architetture ibride che combinano l'efficienza delle CNN con l'attenzione dei Transformer. Per i team che desiderano gestire questi flussi di lavoro avanzati, la Ultralytics Platform offre un ambiente unificato per annotare i dati, addestrare modelli complessi tramite il cloud e distribuirli su endpoint diversi.

Explore solutions

Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più
Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più
Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più

Costruiamo insieme il futuro dell'AI!

Inizia il tuo percorso verso il futuro del machine learning