Capire la segmentazione di concetti tramite prompt
Esplora la segmentazione di concetti tramite prompt, scopri in cosa differisce dai metodi tradizionali e come i modelli correlati, come YOLOE-26, abilitano funzionalità a vocabolario aperto.

La Vision AI sta avanzando rapidamente e viene ampiamente utilizzata per analizzare immagini e video in ambienti reali. Ad esempio, applicazioni che vanno dai sistemi di gestione del traffico all'analisi del settore retail vengono integrate con modelli di computer vision.
In molte di queste applicazioni, i modelli di visione, come i modelli di rilevamento degli oggetti, vengono addestrati a riconoscere un insieme predefinito di oggetti, tra cui veicoli, persone e attrezzature. Durante l'addestramento, questi modelli ricevono numerosi esempi annotati per imparare l'aspetto di ciascun oggetto e distinguere un oggetto dagli altri nella scena.
Per le attività di segmentazione, i modelli fanno un ulteriore passo avanti producendo contorni precisi a livello di pixel attorno a questi oggetti. Ciò consente ai sistemi di capire esattamente dove si trova ciascun oggetto nell'immagine.
Questo funziona bene finché il sistema deve riconoscere solo ciò su cui è stato addestrato. Tuttavia, negli ambienti reali, ciò accade raramente.
Le scene visive sono generalmente dinamiche. Compaiono nuovi oggetti e nuovi concetti visivi, le condizioni cambiano e spesso gli utenti vogliono segmentare oggetti che non facevano parte della configurazione di addestramento originale.
Questi limiti sono particolarmente evidenti nella segmentazione. Con la continua evoluzione della Vision AI, cresce la necessità di modelli di segmentazione più flessibili, in grado di adattarsi a nuovi concetti senza dover essere riaddestrati ripetutamente. Ecco perché la segmentazione di concetti tramite prompt (PCS) sta attirando sempre più attenzione.
Invece di basarsi su un elenco fisso di categorie di oggetti, gli utenti possono descrivere ciò che vogliono segmentare usando testo, prompt visivi o immagini di esempio. I modelli possono quindi identificare e segmentare tutte le regioni che corrispondono al concetto descritto, anche se tale concetto non era stato incluso esplicitamente durante l'addestramento.
In questo articolo vedremo come funziona la segmentazione di concetti tramite prompt, in cosa differisce dagli approcci tradizionali e dove viene utilizzata oggi.
Che cos'è la segmentazione di concetti tramite prompt?#
Nella maggior parte dei casi, i modelli di segmentazione vengono addestrati a riconoscere un breve elenco di tipi di oggetti. Questo funziona bene quando un sistema di Vision AI deve rilevare e segmentare solo un insieme specifico di oggetti.
Nelle applicazioni del mondo reale, tuttavia, le scene visive sono dinamiche. Compaiono nuovi oggetti, i requisiti delle attività cambiano e spesso gli utenti devono segmentare concetti che non erano inclusi nell'insieme di etichette originale. Gestire queste situazioni generalmente richiede la raccolta di nuovi dati e annotazioni di alta qualità, oltre al riaddestramento del modello, aumentando i costi e rallentando la distribuzione.
La segmentazione di concetti tramite prompt risolve questo problema consentendo agli utenti di indicare al modello cosa cercare, invece di scegliere da un elenco fisso di etichette. Gli utenti descrivono l'oggetto o l'idea che stanno cercando e il modello evidenzia tutte le aree corrispondenti nell'immagine. In questo modo è molto più semplice collegare l'intento dell'utente ai pixel effettivi di un'immagine.

Fig. 1. Uno sguardo all'utilizzo dei prompt concettuali per la segmentazione (Fonte)
Guidare la segmentazione con diversi tipi di prompt#
I modelli che supportano la segmentazione di concetti tramite prompt sono flessibili perché possono accettare diversi tipi di input. In altre parole, esiste più di un modo per indicare al modello cosa cercare, ad esempio tramite descrizioni testuali, indicazioni visive o immagini di esempio.
Vediamo più da vicino ciascun approccio:
- Prompt testuali: brevi frasi come “autobus scolastico” o “area tumorale” possono essere utilizzate per descrivere il concetto da segmentare. Il modello interpreta il significato delle parole e identifica le regioni corrispondenti.
- Prompt visivi: questi prompt utilizzano punti, riquadri o schizzi approssimativi all'interno dell'immagine come indicazioni. Questi segnali guidano la ricerca e contribuiscono a definire il contorno finale.
- Immagini esemplificative: immagini di riferimento o piccoli ritagli rappresentano il concetto di interesse. Il modello cerca regioni visivamente simili e le segmenta in base all'aspetto visivo.
La differenza tra PCS e la segmentazione tradizionale#
Prima di approfondire il funzionamento della segmentazione di concetti tramite prompt, confrontiamola con diversi metodi tradizionali di segmentazione degli oggetti.
PCS consente di creare modelli a vocabolario aperto e guidati da prompt. Può lavorare con nuove idee descritte tramite prompt, mentre la segmentazione tradizionale non può farlo. Esistono diversi tipi di approcci tradizionali alla segmentazione, ciascuno con le proprie ipotesi e limitazioni.
Ecco una panoramica di alcuni tipi chiave di segmentazione tradizionale:
- Segmentazione semantica: ogni pixel dell'immagine viene etichettato come parte di una categoria, ad esempio strada, edificio o persona. Tutti i pixel con la stessa etichetta vengono raggruppati, quindi il modello non separa le singole istanze degli oggetti.
- Segmentazione delle istanze: il modello identifica e segmenta i singoli oggetti, quindi due persone o due automobili vengono trattate come elementi separati.
- Segmentazione panottica: questa tecnica combina la segmentazione semantica e la segmentazione delle istanze per fornire una visione completa della scena, comprendendo sia le regioni di sfondo sia i singoli oggetti.
Tutti questi approcci si basano su un elenco predefinito di categorie di oggetti. Funzionano bene entro questi limiti, ma gestiscono con difficoltà i concetti che ne restano al di fuori. Quando è necessario segmentare un nuovo oggetto specifico, di solito servono ulteriori dati di addestramento e il fine-tuning del modello.
PCS mira a cambiare questa situazione. Invece di essere vincolata a categorie predefinite, consente di descrivere ciò che vuoi segmentare in un'immagine al momento dell'inferenza.
L'evoluzione dei modelli PCS#
Vediamo ora come i modelli di segmentazione si sono evoluti verso la segmentazione di concetti tramite prompt.
Un popolare modello fondazionale che ha segnato una svolta nella segmentazione è stato SAM, ovvero il modello Segment Anything. È stato introdotto nel 2023. Invece di basarsi su categorie di oggetti predefinite, SAM consentiva agli utenti di guidare la segmentazione utilizzando semplici prompt visivi, come punti o riquadri di delimitazione.
Con SAM, gli utenti non dovevano più selezionare un'etichetta. Potevano semplicemente indicare la posizione di un oggetto e il modello ne generava una maschera. Questo rendeva la segmentazione più flessibile, ma gli utenti dovevano comunque mostrare al modello dove cercare.
SAM 2, rilasciato nel 2024, ha sviluppato questa idea gestendo scene più complesse ed estendendo la segmentazione tramite prompt ai video. Ha migliorato la robustezza in diverse condizioni di illuminazione, forme degli oggetti e situazioni di movimento, continuando però a basarsi principalmente su prompt visivi per guidare la segmentazione.
Il modello SAM 3 rappresenta il passo più recente di questa evoluzione. È stato rilasciato l'anno scorso ed è un modello unificato che combina la comprensione visiva con la guida linguistica, consentendo un comportamento coerente nelle attività di segmentazione di immagini e video.
Con SAM 3, gli utenti non sono limitati a indicare o disegnare prompt. Possono invece descrivere tramite testo ciò che vogliono segmentare e il modello cerca nell'immagine o nei fotogrammi video le regioni che corrispondono a tale descrizione.
La segmentazione viene guidata dai concetti anziché da categorie di oggetti fisse, supportando l'uso di un vocabolario aperto in scene diverse e nel tempo. SAM 3 opera infatti in un ampio spazio di concetti appresi, fondato su un'ontologia derivata da fonti come Wikidata e ampliata attraverso dati di addestramento su larga scala.

Fig. 2. Un esempio di utilizzo di prompt con SAM 3 e segmentazione di una singola immagine (Fonte)
Rispetto alle versioni precedenti, che si basavano soprattutto su prompt geometrici, SAM 3 rappresenta un passo verso una segmentazione più flessibile e guidata dai concetti. Questo lo rende più adatto alle applicazioni del mondo reale, dove gli oggetti o le idee di interesse possono cambiare e non possono sempre essere definiti in anticipo.
Esplorare il funzionamento della segmentazione visiva tramite prompt#
Quindi, come funziona la segmentazione di concetti tramite prompt? Si basa su grandi modelli di visione-linguaggio preaddestrati, ovvero modelli addestrati su enormi raccolte di immagini e, in molti casi, su testi associati. Questo addestramento consente loro di apprendere pattern visivi generali e significati semantici.
La maggior parte dei modelli PCS utilizza architetture basate su Transformer, che elaborano un'intera immagine alla volta per comprendere le relazioni tra le diverse regioni. Un vision Transformer estrae le caratteristiche visive dall'immagine, mentre un codificatore testuale converte le parole in rappresentazioni numeriche che il modello può utilizzare.
Durante l'addestramento, questi modelli possono apprendere da diversi tipi di supervisione, tra cui maschere a livello di pixel che definiscono i contorni esatti degli oggetti, riquadri di delimitazione che ne indicano approssimativamente la posizione ed etichette a livello di immagine che descrivono ciò che appare in un'immagine. L'addestramento con diversi tipi di dati annotati aiuta il modello a catturare sia i dettagli più fini sia i concetti visivi più ampi.
Al momento dell'inferenza, cioè quando il modello viene effettivamente utilizzato per effettuare previsioni, PCS segue un processo guidato dai prompt. Un utente fornisce indicazioni tramite descrizioni testuali, suggerimenti visivi come punti o riquadri oppure immagini di esempio. Il modello codifica sia il prompt sia l'immagine in una rappresentazione interna condivisa o in embeddings e identifica le regioni che corrispondono al concetto descritto.
Un decoder delle maschere converte quindi questa rappresentazione condivisa in maschere di segmentazione precise a livello di pixel. Poiché il modello collega le caratteristiche visive al significato semantico, può segmentare nuovi concetti anche se non erano stati inclusi esplicitamente durante l'addestramento.
Inoltre, spesso è possibile perfezionare l'output modificando il prompt o aggiungendo ulteriori indicazioni, aiutando il modello a gestire scene complesse o ambigue. Questo processo iterativo supporta l'ottimizzazione pratica durante la distribuzione.
I modelli di segmentazione di concetti tramite prompt vengono generalmente valutati in base alla loro capacità di segmentare concetti mai visti in precedenza e alle loro prestazioni in modo robusto su scene diverse. I benchmark si concentrano spesso sulla qualità delle maschere, sulla generalizzazione e sull'efficienza computazionale, rispecchiando i requisiti della distribuzione nel mondo reale.
Casi d'uso della PCS nel mondo reale#
Vediamo ora dove la segmentazione di concetti tramite prompt viene già utilizzata e sta iniziando ad avere un impatto concreto.
Segmentazione flessibile delle immagini per l'imaging medico#
L'imaging medico comprende numerose strutture biologiche, patologie e tipologie di scansioni, e ogni giorno si presentano nuovi casi. I modelli di segmentazione tradizionali faticano a gestire questa varietà.
PCS si adatta naturalmente a questo ambito perché consente ai medici di descrivere ciò che vogliono trovare invece di scegliere da un elenco breve e rigido. Con frasi testuali o prompt visivi, PCS può essere utilizzata per segmentare direttamente organi o aree sospette, senza riaddestrare il modello per ogni nuova attività. Questo facilita la gestione di esigenze cliniche diverse, riduce la necessità di disegnare manualmente le maschere e funziona con molti tipi di imaging.
Un ottimo esempio è MedSAM-3, che adatta l'architettura SAM 3 alla PCS tramite prompt testuali nell'imaging medico. Questo modello può ricevere prompt con termini anatomici e patologici espliciti, come i nomi di organi quali fegato o rene e concetti relativi alle lesioni, come tumore o lesione. Dato un prompt, il modello segmenta direttamente la regione corrispondente nell'immagine medica.
MedSAM-3 integra anche modelli linguistici di grandi dimensioni multimodali (MLLMs o LLM multimodali), in grado di ragionare sia sul testo sia sulle immagini. Questi modelli operano in una configurazione con un agente nel ciclo, in cui i risultati vengono perfezionati iterativamente per migliorare la precisione nei casi più complessi.

Fig. 3. Una pipeline di MedSAM-3 per la segmentazione di tumori tramite prompt testuali in immagini mediche (Fonte)
MedSAM-3 offre buone prestazioni su dati radiografici, MRI, CT, ecografici e video, evidenziando come PCS possa consentire workflow di imaging medico più flessibili ed efficienti in contesti clinici reali.
Segmentazione adattiva per la chirurgia robotica e l'automazione#
La chirurgia robotica si basa su sistemi di visione per tracciare gli strumenti e comprendere scene chirurgiche in rapido cambiamento. Gli strumenti si muovono velocemente, l'illuminazione varia e possono comparire nuovi strumenti in qualsiasi momento, rendendo difficile mantenere sistemi di etichette predefinite.
Con PCS, i robot possono tracciare gli strumenti, guidare le telecamere e seguire le fasi chirurgiche in tempo reale. Questo riduce l'annotazione manuale e rende i sistemi più semplici da adattare a procedure diverse. I chirurghi o i sistemi automatizzati possono utilizzare prompt testuali come “pinza”, “bisturi” o “strumento per telecamera” per indicare cosa segmentare in un'immagine.

Fig. 4. Segmentazione degli strumenti chirurgici utilizzati durante la chirurgia robotica (Fonte)
Segmentazione a vocabolario aperto con Ultralytics YOLOE-26#
Un altro interessante modello all'avanguardia correlato alla segmentazione di concetti tramite prompt è il nostro Ultralytics YOLOE-26. Il nostro modello porta la segmentazione a vocabolario aperto e guidata da prompt nella famiglia di modelli Ultralytics YOLO.
YOLOE-26 è basato sull'architettura Ultralytics YOLO26 e supporta la segmentazione delle istanze a vocabolario aperto. YOLOE-26 consente agli utenti di guidare la segmentazione in diversi modi.
Supporta prompt testuali, in cui brevi frasi fondate visivamente possono specificare l'oggetto target, oltre a prompt visivi, che forniscono indicazioni aggiuntive basate sugli indizi presenti nell'immagine. Inoltre, YOLOE-26 include una modalità senza prompt per l'inferenza zero-shot, in cui il modello rileva e segmenta gli oggetti da un vocabolario integrato senza richiedere prompt all'utente.
YOLOE-26 è ideale per applicazioni come l'analisi video, la percezione robotica e i sistemi edge, in cui le categorie degli oggetti possono cambiare, ma bassa latenza e throughput affidabile restano essenziali. È anche particolarmente utile per l'etichettatura dei dati e la cura dei dataset, poiché semplifica i workflow automatizzando parte del processo di annotazione.
Vantaggi e svantaggi della segmentazione di concetti tramite prompt#
Ecco alcuni dei principali vantaggi dell'utilizzo della segmentazione di concetti tramite prompt:
- Iterazione e prototipazione più rapide: le nuove attività di segmentazione possono essere testate rapidamente modificando i prompt invece di ricostruire i dataset o riaddestrare i modelli, accelerando così la sperimentazione e lo sviluppo.
- Adattabilità tra domini: lo stesso modello PCS può spesso essere applicato a domini diversi, come l'imaging medico, la robotica o l'analisi video, con modifiche minime al workflow.
- Perfezionamento interattivo: gli utenti possono modificare iterativamente i prompt o aggiungere indicazioni per migliorare i risultati, facilitando la gestione di scene ambigue o casi limite senza riaddestramento.
Sebbene PCS offra vantaggi evidenti, ecco alcune limitazioni da considerare:
- Sensibilità ai prompt: piccole variazioni nel modo in cui un prompt viene scritto o fornito possono influenzare l'output. Prompt troppo vaghi o troppo specifici possono portare a una segmentazione incompleta o errata.
- Comportamento meno prevedibile: poiché il modello interpreta i prompt invece di selezionare da etichette fisse, i risultati possono variare maggiormente tra scene e input diversi, il che può rappresentare un problema per le pipeline strettamente controllate.
- Interpretazione ambigua dei concetti: alcuni concetti sono soggettivi o definiti in modo approssimativo, il che può causare risultati di segmentazione incoerenti tra utenti o tra immagini.
- Affidabilità limitata per target altamente specifici: i modelli basati su prompt sono generalmente meno affidabili per attività strettamente definite e specifiche per istanza, come il rilevamento dei difetti, che richiedono un'identificazione precisa e coerente di caratteristiche sottili.
Scegliere tra segmentazione tramite prompt e segmentazione tradizionale#
Quando esplori la segmentazione tramite prompt, potresti chiederti per quali applicazioni sia più indicata e quando un modello di computer vision tradizionale come Ultralytics YOLO26 sia più adatto al problema che stai cercando di risolvere. La segmentazione tramite prompt funziona bene per gli oggetti generici, ma non è adatta ai casi d'uso che richiedono risultati molto precisi e coerenti.
Il rilevamento dei difetti è un buon esempio. Nella produzione, i difetti sono spesso piccoli e difficili da notare, come graffi, ammaccature, disallineamenti o irregolarità della superficie. Possono inoltre variare notevolmente in base ai materiali, all'illuminazione e alle condizioni di produzione.
Questi problemi sono difficili da descrivere con un semplice prompt e ancora più difficili da rilevare in modo affidabile per un modello generico. In generale, i modelli basati su prompt tendono a non rilevare i difetti o a produrre risultati instabili, mentre i modelli addestrati specificamente sui dati relativi ai difetti sono molto più affidabili per i sistemi di ispezione del mondo reale.
Punti chiave#
La segmentazione di concetti tramite prompt rende i sistemi di visione più semplici da adattare al mondo reale, dove compaiono continuamente nuovi oggetti e nuove idee. Invece di essere vincolati a etichette fisse, gli utenti possono semplicemente descrivere ciò che vogliono segmentare e lasciare che il modello faccia il resto, risparmiando tempo e riducendo il lavoro manuale. Pur presentando ancora alcune limitazioni, PCS sta già cambiando il modo in cui la segmentazione viene utilizzata nella pratica ed è destinata probabilmente a diventare una componente fondamentale dei futuri sistemi di visione.
Scopri di più sull'AI visitando il nostro repository GitHub e unendoti alla nostra community. Consulta le nostre pagine dedicate alle soluzioni per saperne di più sull'AI nella robotica e sulla computer vision nella produzione. Scopri le nostre opzioni di licenza per iniziare oggi stesso a utilizzare la Vision AI!









