Che cos’è YOLOE? Portare oltre i modelli di computer vision
Scopri come YOLOE consenta di trovare oggetti utilizzando un semplice prompt o una foto. Permette di ottenere una computer vision più intelligente e rapida senza riaddestrare o ottimizzare i modelli.

Il rilevamento degli oggetti è un'attività fondamentale della visione artificiale, il cui obiettivo è identificare e localizzare gli oggetti nelle immagini o nei video. È una parte cruciale della visione artificiale, un campo dell'intelligenza artificiale (AI) che consente alle macchine di comprendere e interpretare i dati visivi. Ad esempio, il rilevamento degli oggetti può aiutare a identificare un'auto in un'immagine o a individuare una persona in un flusso video.
Una delle serie di modelli più note a supporto delle attività di computer vision, come il rilevamento degli oggetti, è la serie di modelli YOLO (si guarda una sola volta). Progettati per offrire velocità e precisione, i modelli YOLO sono migliorati costantemente nel tempo. Ad esempio, una delle versioni più recenti, Ultralytics YOLO11, offre buone prestazioni in situazioni reali, fornendo risultati accurati anche in ambienti più complessi.
Per portare avanti ulteriormente questo progresso, un nuovo modello chiamato YOLOE mira ad ampliare le capacità dei modelli YOLO. A differenza dei modelli tradizionali, che richiedono un nuovo addestramento per riconoscere oggetti nuovi, YOLOE può seguire semplici prompt testuali o visivi per rilevare oggetti che non ha mai visto prima, risultando molto più adattabile agli ambienti che cambiano.
In questo articolo analizzeremo più da vicino ciò che rende unico YOLOE, il suo confronto con i precedenti modelli YOLO e come puoi iniziare a utilizzarlo oggi. Iniziamo!
Panoramica di YOLOE#
YOLOE è un modello di computer vision che porta il rilevamento degli oggetti a un livello superiore. È stato introdotto nel marzo 2025 da ricercatori della Tsinghua University. Ciò che distingue YOLOE dai modelli tradizionali è l'uso del rilevamento a vocabolario aperto.
Mentre la maggior parte dei modelli viene addestrata per riconoscere un elenco fisso di oggetti, YOLOE ti consente di specificare cosa cercare usando una breve descrizione o un'immagine di esempio. Ad esempio, se cerchi uno “zaino verde”, puoi digitare la descrizione o mostrare al modello una foto, e YOLOE lo localizzerà nella scena.
Inoltre, anche senza alcun prompt, YOLOE può rilevare autonomamente molti oggetti di uso quotidiano. Questa capacità di riconoscere oggetti che non ha mai visto prima è chiamata rilevamento zero-shot. È particolarmente utile negli ambienti dinamici, dove l'attività o gli oggetti di interesse possono cambiare inaspettatamente.

Fig. 1. Uno sguardo alle capacità di YOLOE.
Funzionalità principali di YOLOE#
YOLOE supporta un'ampia gamma di funzionalità progettate per migliorarne le prestazioni nelle applicazioni reali. Grazie alla capacità di gestire input sia strutturati sia non strutturati, YOLOE apre nuove possibilità per il rilevamento e la segmentazione degli oggetti.
Ecco alcune delle funzionalità principali offerte dal modello:
- Rilevamento basato sui prompt: YOLOE può cercare oggetti sulla base di un breve prompt testuale o di un'immagine di esempio. Questo significa che non devi riaddestrare il modello ogni volta che cambia la tua attività: ti basta descrivere o mostrare al modello ciò che stai cercando.
- Segmentazione delle istanze: oltre a disegnare riquadri di delimitazione intorno agli oggetti, YOLOE può delinearne la forma esatta usando la segmentazione delle istanze. È particolarmente utile quando gli oggetti si sovrappongono o quando devi conoscere i confini precisi di un oggetto.
- Riconoscimento degli oggetti senza prompt: YOLOE può riconoscere gli oggetti anche senza istruzioni specifiche. Utilizza un insieme di descrizioni apprese in precedenza per identificare rapidamente gli oggetti, rendendo il processo più rapido ed efficiente.
Confronto tra YOLOE e altri modelli YOLO#
Ora che abbiamo compreso meglio cos'è YOLOE, diamo un'occhiata ad alcuni modelli simili della famiglia YOLO.
Con il progresso della computer vision, sono progrediti anche i modelli YOLO. Ad esempio, Ultralytics YOLOv8 ha introdotto il supporto per nuove attività, come la segmentazione e la classificazione, mentre le versioni successive, come Ultralytics YOLO11, si sono concentrate sul miglioramento della precisione e delle prestazioni per una gamma più ampia di attività.
Inoltre, YOLO-World è stato rilasciato nel gennaio 2024 e ha introdotto la possibilità di utilizzare prompt scritti, consentendo agli utenti di descrivere gli oggetti che desiderano trovare. Sebbene YOLO-World fosse un'ottima opzione per il rilevamento zero-shot, non disponeva di funzionalità come la segmentazione delle istanze e il supporto per i prompt visivi.
YOLOE si basa su YOLO-World aggiungendo queste funzionalità, migliorando flessibilità e prestazioni e offrendo uno strumento più efficace per le applicazioni di computer vision nel mondo reale.

Fig. 2. YOLO-World e YOLOE supportano entrambi il rilevamento zero-shot.
Utilizzare YOLOE con il pacchetto Python Ultralytics#
Che tu voglia rilevare oggetti specifici o esplorare tutto ciò che è presente in un'immagine, iniziare a usare YOLOE è semplice. Questo modello è supportato dal pacchetto Python Ultralytics, che ne facilita l'integrazione nei tuoi progetti. Vediamo ora come utilizzarlo.
Installazione del pacchetto Ultralytics#
Il primo passaggio consiste nell'installare il pacchetto Python Ultralytics usando un gestore di pacchetti come ‘pip.’ Puoi farlo eseguendo il comando “pip install ultralytics” nel terminale o nel prompt dei comandi.
Una volta installato il pacchetto, avrai tutto ciò che ti serve per caricare il modello, eseguire previsioni e sperimentare diverse modalità di rilevamento. Se riscontri problemi durante l'installazione, la documentazione ufficiale di Ultralytics offre un'utile sezione per la risoluzione dei problemi.
Esistono diversi modi per usare YOLOE per eseguire previsioni. Eseguire previsioni significa utilizzare il modello addestrato per identificare e localizzare gli oggetti nelle immagini o nei video. Questi diversi metodi ti consentono di personalizzare il modo in cui interagisci con il modello in base alle tue esigenze specifiche.
Esaminiamo ciascuno di questi metodi, uno alla volta.
Rilevare oggetti specifici con prompt testuali o visivi#
YOLOE può rilevare oggetti sulla base di una breve descrizione testuale. Ad esempio, se cerchi un cavallo in movimento, puoi usare un prompt come "horse walking".
Per iniziare, carica prima il modello YOLOE preaddestrato e imposta il prompt (la descrizione di ciò che vuoi che il modello cerchi), come mostrato nel frammento di codice seguente.
from ultralytics import YOLOE
model = YOLOE("yoloe-11l-seg.pt")
prompt = ["horse walking"]
model.set_classes(prompt, model.get_text_pe(prompt))Dopo aver impostato il modello e il prompt, puoi eseguire il modello su un'immagine o un video. Sostituisci il percorso del file nel codice con il percorso del file immagine o video:
results = model.predict("path/to/your/image.jpg")
results[0].show()Verrà visualizzata l'immagine con l'oggetto rilevato chiaramente contrassegnato in base al prompt. Puoi modificare il prompt per cercare oggetti diversi, come "red suitcase", "bicycle" o "zebra", a seconda di ciò che stai cercando.

Fig. 3. Un esempio dell'uso di YOLOE per rilevare oggetti specifici usando un prompt testuale.
Allo stesso modo, puoi usare un'immagine come prompt per YOLOE con il pacchetto Python Ultralytics. Nella modalità con prompt visivo, il modello usa l'immagine per trovare elementi dall'aspetto simile in un'altra scena. È particolarmente utile per gli oggetti difficili da descrivere o privi di etichette chiare.
Per esaminare più dettagliatamente il codice, puoi consultare la documentazione di Ultralytics.
Rilevamento generale degli oggetti con YOLOE#
In alcuni casi, potresti non sapere esattamente cosa cercare oppure potresti non essere alla ricerca di un oggetto particolare. È qui che la modalità senza prompt si rivela utile.
Con questa opzione non devi digitare una descrizione né fornire un'immagine di esempio. YOLOE analizza semplicemente le immagini autonomamente e rileva tutto ciò che è in grado di riconoscere, come persone, animali, mobili o oggetti di uso quotidiano.
È un modo utile per esplorare una scena senza impartire istruzioni specifiche al modello. Che tu stia analizzando una stanza affollata o esaminando filmati ricchi di attività, la modalità senza prompt ti offre una rapida panoramica di ciò che è presente nell'immagine.
Puoi usare il codice seguente per eseguire YOLOE in modalità senza prompt. Prima viene caricato il modello, quindi l'immagine viene elaborata e gli oggetti al suo interno vengono rilevati automaticamente. Infine, vengono visualizzati i risultati e gli oggetti rilevati vengono evidenziati.
Assicurati di sostituire il percorso del file con il percorso effettivo della tua immagine.
from ultralytics import YOLOE
model = YOLOE("yoloe-11l-seg-pf.pt")
results = model.predict("path/to/image.jpg")
results[0].show()L'immagine mostrata di seguito è un esempio di ciò che YOLOE può rilevare in modalità senza prompt.

Fig. 4. Utilizzare YOLOE in modalità senza prompt.
Applicazioni di YOLOE in tempo reale#
La capacità di YOLOE di rispondere a prompt testuali e visivi lo rende uno strumento affidabile per le applicazioni in tempo reale. La sua flessibilità è particolarmente utile negli ambienti frenetici, dove tempistiche e precisione sono essenziali.
Esploriamo alcuni esempi reali di come può essere utilizzato YOLOE.
Migliorare la gestione dei bagagli: rilevamento dei bagagli in tempo reale#
Negli aeroporti affollati, individuare bagagli specifici può essere difficile, soprattutto quando si cercano bagagli smarriti. YOLOE può semplificare questo processo aiutando ad analizzare video in diretta e a identificare rapidamente gli oggetti sulla base di semplici prompt come “red bag”.
Se una borsa è scomparsa o è stata collocata nel posto sbagliato, il personale può facilmente modificare il prompt per cercare un oggetto diverso, come una “black suitcase.” Questa capacità di adattarsi istantaneamente può aiutare il personale aeroportuale a localizzare rapidamente il bagaglio corretto senza esaminare ore di filmati o riaddestrare il modello, rendendo la gestione dei bagagli e la risoluzione dei problemi relativi ai bagagli smarriti molto più rapide ed efficienti.
Monitorare gli spazi pubblici con YOLOE#
I filmati di sorveglianza di spazi pubblici, come mercati e bar affollati, spesso includono un insieme di persone, oggetti e attività che cambia durante la giornata. YOLOE può analizzare questi filmati in tempo reale usando la modalità senza prompt, rilevando automaticamente oggetti come borse, tavoli o biciclette senza bisogno di istruzioni specifiche.

Fig. 5. YOLOE può rilevare vari oggetti in uno spazio pubblico affollato.
È particolarmente utile per i team addetti alla sicurezza, che possono individuare oggetti incustoditi o monitorare il movimento della folla. La capacità di YOLOE di rilevare più oggetti contemporaneamente semplifica la gestione degli spazi pubblici durante eventi o periodi di grande affluenza, aiutando i team a rimanere informati e reattivi.
Vantaggi e svantaggi di YOLOE#
Ecco alcuni dei principali vantaggi dell'uso di YOLOE per le applicazioni di computer vision:
- Prestazioni in tempo reale: YOLOE è ottimizzato per un'elaborazione rapida ed efficiente, consentendo il rilevamento in tempo reale anche in ambienti dinamici, come i flussi video in diretta o gli spazi pubblici affollati.
- Scalabilità: YOLOE è scalabile e funziona bene in un'ampia varietà di applicazioni, dalla sicurezza e sorveglianza alla vendita al dettaglio, all'assistenza sanitaria e ai veicoli autonomi.
- Facilità d'uso: poiché YOLOE è supportato dal pacchetto Python Ultralytics, è facile integrarlo nei tuoi progetti di computer vision esistenti.
Tuttavia, ci sono alcune limitazioni da tenere presenti quando usi YOLOE. Ecco un paio di fattori da considerare:
- Richiede dati di addestramento sufficienti: sebbene YOLOE supporti il rilevamento zero-shot, le sue prestazioni sugli oggetti non visti dipendono dalla capacità di generalizzare a partire dai dati di addestramento. In alcuni casi, potrebbe richiedere dati aggiuntivi o un fine-tuning per ottenere buone prestazioni in attività altamente specializzate.
- Sensibilità alla qualità dell'input: la precisione del modello può essere influenzata da immagini o video di bassa qualità. Un input sfocato o scarsamente illuminato può ridurre la capacità del modello di rilevare accuratamente gli oggetti, quindi un input di alta qualità è importante per ottenere prestazioni ottimali.
Punti chiave#
YOLOE offre maggiore flessibilità nella computer vision, consentendo agli utenti di guidare il rilevamento con prompt testuali o visivi. Funziona bene nelle situazioni reali in cui le scene cambiano rapidamente e non è possibile eseguire un nuovo addestramento.
Dalla gestione dei bagagli al monitoraggio degli spazi pubblici, YOLOE si adatta facilmente a nuove attività. Con l'accessibilità sempre maggiore dell'AI, modelli come YOLOE aiutano più settori a usare la tecnologia visiva in modi pratici ed efficienti.
Unisciti alla nostra community ed esplora il nostro repository GitHub per saperne di più sulle innovazioni nell'AI. Scopri gli ultimi progressi in ambiti come AI nel settore retail e computer vision nell'assistenza sanitaria nelle nostre pagine dedicate alle soluzioni. Consulta le nostre opzioni di licenza e inizia oggi stesso a usare la computer vision!









