Transformer
Esplora l'architettura Transformer e il meccanismo di self-attention. Scopri come alimentano modelli di IA come RT-DETR e Ultralytics YOLO26 per ottenere un'accuratezza superiore.
Un Transformer è un'architettura di deep learning che si basa su un meccanismo chiamato self-attention per elaborare dati di input sequenziali, come il linguaggio naturale o le caratteristiche visive. Introdotto originariamente dai ricercatori di Google nell'articolo fondamentale Attention Is All You Need, il Transformer ha rivoluzionato il campo dell'intelligenza artificiale (AI) eliminando i limiti dell'elaborazione sequenziale delle precedenti reti neurali ricorrenti (RNNs). Al contrario, i Transformer analizzano simultaneamente intere sequenze di dati, consentendo un'enorme parallelizzazione e tempi di addestramento significativamente più rapidi sull'hardware moderno, come le GPU.
Come funzionano i Transformer#
L'innovazione principale del Transformer è il meccanismo di self-attention. Questo consente al modello di valutare l'importanza delle diverse parti dei dati di input in relazione tra loro. Ad esempio, in una frase, il modello può imparare che la parola "bank" è più strettamente correlata a "money" che a "river" in base al contesto circostante.
Questa architettura è generalmente composta da due componenti principali:
- Encoder: Elabora i dati di input trasformandoli in una rappresentazione numerica ricca o in un embedding.
- Decoder: Utilizza l'output dell'encoder per generare il risultato finale, come una frase tradotta o un bounding box previsto.
Nel campo della visione artificiale (CV), i modelli utilizzano generalmente una variante chiamata Vision Transformer (ViT). Invece di elaborare token di testo, l'immagine viene suddivisa in patch di dimensioni fisse (ad esempio, 16x16 pixel). Queste patch vengono appiattite e trattate come una sequenza, consentendo al modello di cogliere il "contesto globale", ovvero di comprendere le relazioni tra parti distanti di un'immagine, in modo più efficace rispetto a una rete neurale convoluzionale (CNNs) standard.
Transformer e concetti correlati#
È importante distinguere l'architettura Transformer dai termini correlati:
- Meccanismo di attenzione: È il concetto generale di concentrarsi su parti specifiche dei dati. Il Transformer è una specifica architettura costruita interamente attorno a livelli di attenzione, mentre altri modelli potrebbero utilizzare l'attenzione solo come piccola aggiunta.
- Modello linguistico di grandi dimensioni (LLM): Termini come "GPT" si riferiscono a modelli specifici addestrati su enormi quantità di testo. Quasi tutti gli LLM moderni utilizzano l'architettura Transformer come motore sottostante.
Applicazioni nel mondo reale#
La versatilità dei Transformer ne ha favorito l'adozione in vari settori:
-
Imaging medico: Nell'AI nel settore sanitario, i Transformer vengono utilizzati per attività complesse come l'analisi di immagini mediche. La loro capacità di comprendere le relazioni spaziali globali aiuta a rilevare anomalie sottili nelle scansioni MRI o CT ad alta risoluzione che le CNN, focalizzate sulle caratteristiche locali, potrebbero non individuare.
-
Sistemi autonomi: Per i veicoli autonomi, comprendere la traiettoria dei pedoni e degli altri veicoli è fondamentale. I Transformer eccellono nella comprensione dei video monitorando gli oggetti attraverso i fotogrammi e prevedendo i movimenti futuri per garantire una navigazione sicura.
Rilevamento degli oggetti con i Transformer#
Sebbene le CNN abbiano tradizionalmente dominato il rilevamento degli oggetti, i modelli basati su Transformer come il Transformer per il rilevamento in tempo reale (RT-DETR) sono emersi come potenti alternative. RT-DETR combina la velocità dei backbone CNN con la precisione delle teste di decodifica Transformer.
Tuttavia, i modelli basati esclusivamente su Transformer possono essere pesanti dal punto di vista computazionale. Per molte applicazioni edge, i modelli ibridi altamente ottimizzati come YOLO26, che integrano efficienti meccanismi di attenzione con una rapida elaborazione convoluzionale, offrono un equilibrio superiore tra velocità e accuratezza. Puoi gestire facilmente l'addestramento e la distribuzione di questi modelli tramite la Ultralytics Platform, che semplifica il flusso di lavoro dall'annotazione del dataset all'esportazione del modello.
Esempio Python: utilizzo di RT-DETR#
L'esempio seguente mostra come eseguire l'inferenza utilizzando un modello basato su Transformer all'interno del pacchetto ultralytics. Questo codice carica un modello RT-DETR pre-addestrato e rileva gli oggetti in un'immagine.
from ultralytics import RTDETR
# Load a pre-trained Real-Time Detection Transformer (RT-DETR) model
model = RTDETR("rtdetr-l.pt")
# Run inference on an image URL
# The model uses self-attention to identify objects with high accuracy
results = model("https://ultralytics.com/images/bus.jpg")
# Display the detection results with bounding boxes
results[0].show()Per ulteriori informazioni sui fondamenti matematici, la documentazione PyTorch sui livelli Transformer offre approfondimenti tecnici, mentre la guida di IBM ai Transformer fornisce una prospettiva aziendale di alto livello.









