Ultralytics YOLO27:
AI per la visione

Florence-2: il più recente modello linguistico-visivo di Microsoft

Scopri Florence-2, il modello linguistico-visivo di Microsoft che offre prestazioni migliori nel rilevamento degli oggetti, nella segmentazione e nello zero-shot, con grande efficienza.

ABAbirami Vina8 min read
Il modello linguistico-visivo Florence-2 di Microsoft

Nel giugno 2024, Microsoft ha presentato Florence-2, un modello linguistico-visivo multimodale (VLM) progettato per gestire un'ampia gamma di attività, tra cui rilevamento degli oggetti, segmentazione, generazione di didascalie per immagini e grounding. Florence-2 stabilisce un nuovo punto di riferimento per le prestazioni zero-shot, ovvero può svolgere attività senza un addestramento specifico preliminare, e vanta dimensioni inferiori rispetto ad altri modelli linguistico-visivi all'avanguardia.

È più di un semplice altro modello: la versatilità e le prestazioni migliorate di Florence-2 possono avere un impatto significativo su diversi settori, aumentando la precisione e riducendo la necessità di un addestramento esteso. In questo articolo esploreremo le funzionalità innovative di Florence-2, confronteremo le sue prestazioni con quelle di altri VLM e parleremo delle sue potenziali applicazioni.

Che cos'è Florence-2?#

Florence-2 è in grado di gestire diverse attività all'interno di un unico framework unificato. Le straordinarie capacità del modello sono dovute in parte al suo enorme dataset di addestramento, chiamato FLD-5B. FLD-5B include 5,4 miliardi di annotazioni distribuite su 126 milioni di immagini. Questo dataset completo è stato creato appositamente per fornire a Florence-2 le capacità necessarie a gestire un'ampia gamma di attività di visione artificiale con elevata precisione ed efficienza.

Ecco una panoramica più dettagliata delle attività supportate da Florence-2:

  • Rilevamento degli oggetti: può identificare e localizzare gli oggetti nelle immagini con elevata precisione.
  • Segmentazione: questa attività consiste nel dividere un'immagine in segmenti significativi per facilitarne l'analisi e l'interpretazione.
  • Generazione di didascalie per immagini: Florence-2 è in grado di generare didascalie descrittive per le immagini, fornendo contesto e dettagli.
  • Grounding visivo: il modello può associare frasi o parole specifiche di una didascalia alle regioni corrispondenti nell'immagine.
  • Prestazioni zero-shot: può svolgere attività senza un addestramento specifico.

Diagramma dell'addestramento di Florence-2

Fig. 1 Comprendere l'addestramento di Florence-2.

Il modello supporta attività basate sia sul testo sia sulle regioni. Per le attività che coinvolgono regioni specifiche di un'immagine, al vocabolario del modello vengono aggiunti token speciali per la localizzazione. Questi token aiutano il modello a comprendere forme diverse, come rettangoli intorno agli oggetti (rappresentazione box), forme a quattro lati (rappresentazione quad box) e forme con molti lati (rappresentazione poligonale). Il modello viene addestrato utilizzando un metodo chiamato perdita di entropia incrociata, che lo aiuta ad apprendere confrontando le sue previsioni con le risposte corrette e regolando di conseguenza i propri parametri interni.

Creazione del dataset FLD-5B#

Il dataset FLD-5B include diversi tipi di annotazioni: descrizioni testuali, coppie di regioni e testo e combinazioni di testo, frasi e regioni. È stato creato attraverso un processo in due fasi che comprendeva la raccolta e l'annotazione dei dati. Le immagini provenivano da dataset popolari come ImageNet-22k, Object 365, Open Images, Conceptual Captions e LAION. Le annotazioni nel dataset FLD-5B sono per lo più sintetiche, ovvero generate automaticamente anziché etichettate manualmente.

Diagramma della creazione del dataset FLD-5B

Fig. 2 Creazione del dataset FLD-5B.

Inizialmente, modelli specializzati in attività specifiche, come il rilevamento degli oggetti o la segmentazione, hanno creato queste annotazioni. In seguito, è stato utilizzato un processo di filtraggio e miglioramento per assicurarsi che le annotazioni fossero dettagliate e accurate. Dopo aver rimosso il rumore, il dataset è stato sottoposto a un perfezionamento iterativo, durante il quale gli output di Florence-2 sono stati utilizzati per aggiornare e migliorare continuamente le annotazioni.

Comprendere l'architettura del modello Florence-2#

L'architettura del modello Florence-2 segue un approccio di apprendimento sequence-to-sequence. Ciò significa che il modello elabora una sequenza di input (come un'immagine con un prompt testuale) e genera una sequenza di output (come una descrizione o un'etichetta) passo dopo passo. Nel framework sequence-to-sequence, ogni attività viene trattata come un problema di traduzione: il modello acquisisce un'immagine di input e un prompt specifico per l'attività e genera l'output corrispondente.

Diagramma dell'architettura del modello linguistico-visivo Florence-2

Fig. 3 Architettura del modello linguistico-visivo Florence-2.

Al centro dell'architettura del modello si trova un transformer encoder-decoder multimodale, che combina un encoder per immagini e un encoder-decoder multimodale. L'encoder per immagini, chiamato DaViT (Data-efficient Vision Transformer), elabora le immagini di input convertendole in embedding di token visivi: rappresentazioni compatte dell'immagine che catturano informazioni sia spaziali (dove si trovano gli elementi) sia semantiche (che cosa sono). Questi token visivi vengono quindi combinati con gli embedding testuali (rappresentazioni del testo), consentendo al modello di integrare senza difficoltà dati testuali e visivi.

Confronto tra Florence-2 e altri VLM#

Florence-2 si distingue dagli altri modelli linguistico-visivi per le sue straordinarie capacità zero-shot. A differenza di modelli come PaliGemma, che richiedono un fine-tuning esteso per adattarsi a diverse attività, Florence-2 funziona bene fin da subito. Inoltre, Florence-2 è in grado di competere con modelli più grandi come GPT-4V e Flamingo, che spesso hanno molti più parametri ma non eguagliano sempre le prestazioni di Florence-2. Ad esempio, Florence-2 ottiene risultati zero-shot migliori di Kosmos-2, nonostante Kosmos-2 abbia più del doppio dei parametri.

Nei test di benchmark, Florence-2 ha mostrato prestazioni notevoli in attività come la generazione di didascalie su COCO e la comprensione delle espressioni referenziali. Ha superato modelli come PolyFormer e UNINEXT nelle attività di rilevamento degli oggetti e segmentazione sul dataset COCO. È una scelta altamente competitiva per le applicazioni del mondo reale, in cui sono fondamentali sia le prestazioni sia l'efficienza delle risorse.

Applicazioni di Florence-2#

Florence-2 può essere utilizzato in molti settori diversi, come intrattenimento, accessibilità, istruzione e così via. Vediamo alcuni esempi per comprendere meglio.

Applicazioni della generazione di didascalie per immagini#

Quando ti trovi su una piattaforma di streaming e cerchi di decidere cosa guardare, potresti leggere il riassunto di un film per aiutarti a scegliere. E se la piattaforma potesse anche fornire una descrizione dettagliata della locandina del film? Florence-2 può renderlo possibile attraverso la generazione di didascalie per immagini, che produce testo descrittivo per le immagini. Florence-2 può generare descrizioni dettagliate delle locandine dei film, rendendo le piattaforme di streaming più inclusive per gli utenti con disabilità visive. Analizzando gli elementi visivi di una locandina, come personaggi, scenari e testo, Florence-2 può creare descrizioni dettagliate che ne trasmettono il contenuto e l'atmosfera. L'immagine seguente mostra il livello di dettaglio che Florence-2 può offrire nella sua descrizione.

Esempio di didascalia per un'immagine generata da Florence-2

Fig. 4 Un esempio di didascalia per un'immagine generata da Florence-2.

Ecco altri esempi di situazioni in cui la generazione di didascalie per immagini può essere utile:

  • E-commerce: la generazione di didascalie per immagini può fornire descrizioni delle immagini dei prodotti dettagliate, aiutando i clienti a comprendere più chiaramente le caratteristiche e i dettagli dei prodotti.
  • Viaggi e turismo: può fornire descrizioni dettagliate di luoghi di interesse e attrazioni nelle guide e nelle app di viaggio.
  • Istruzione: la generazione di didascalie per immagini può etichettare e descrivere immagini e diagrammi didattici, favorendo l'insegnamento e l'apprendimento.
  • Immobiliare: può fornire descrizioni dettagliate delle immagini degli immobili, evidenziando caratteristiche e dotazioni per i potenziali acquirenti.

Utilizzare il grounding visivo mentre si cucina#

Florence-2 può essere utilizzato anche per arricchire le esperienze culinarie. Ad esempio, un ricettario online potrebbe usare Florence-2 per applicare il grounding visivo ed etichettare le parti di un'immagine complessa di una ricetta. Il grounding visivo è utile perché collega parti specifiche dell'immagine al testo descrittivo corrispondente. Ogni ingrediente e ogni passaggio possono essere etichettati e spiegati con precisione, rendendo più facile per chi cucina a casa seguire la ricetta e comprendere il ruolo di ciascun componente nel piatto.

Esempio di grounding visivo con Florence-2

Fig. 5 Un esempio di grounding visivo con Florence-2.

OCR basato sulle regioni per i documenti finanziari#

L'OCR con elaborazione basata sulle regioni, che si concentra sull'estrazione del testo da aree specifiche all'interno di un documento, può rivelarsi utile in ambiti come la contabilità. Le aree designate dei documenti finanziari possono essere analizzate per estrarre automaticamente informazioni importanti, come i dettagli delle transazioni, i numeri di conto e le date di scadenza. Riducendo la necessità di inserire manualmente i dati, questa tecnologia minimizza gli errori e accelera i tempi di elaborazione. Gli istituti finanziari possono utilizzarla per semplificare attività come l'elaborazione delle fatture, la riconciliazione delle ricevute e la compensazione degli assegni, ottenendo transazioni più rapide e un servizio clienti migliore.

Esempio di OCR con regioni utilizzando Florence-2

Fig. 6 Un esempio di estrazione OCR basata sulle regioni con Florence-2.

Segmentazione basata sulle regioni nelle applicazioni industriali#

La segmentazione basata sulle regioni, che consiste nel dividere un'immagine in parti significative per un'analisi mirata e un'ispezione dettagliata, può favorire applicazioni industriali che migliorano precisione ed efficienza in vari processi. Concentrandosi su aree specifiche di un'immagine, questa tecnologia consente un'ispezione e un'analisi dettagliate di componenti e prodotti. Nel controllo qualità, può identificare difetti o irregolarità nei materiali, come crepe o disallineamenti, assicurando che sul mercato arrivino solo prodotti della massima qualità.

Esempio di segmentazione basata sulle regioni con Florence-2

Fig. 7 Un esempio di segmentazione basata sulle regioni con Florence-2.

Migliora inoltre le linee di assemblaggio automatizzate guidando i bracci robotici verso parti specifiche e ottimizzando il posizionamento e l'assemblaggio dei componenti. Analogamente, nella gestione dell'inventario, aiuta a monitorare le condizioni e la posizione delle merci, favorendo una logistica più efficiente e riducendo i tempi di inattività. Nel complesso, la segmentazione basata sulle regioni aumenta precisione e produttività, consentendo di ridurre i costi e migliorare la qualità dei prodotti negli ambienti industriali.

Punti chiave#

Stiamo iniziando a osservare una tendenza: i modelli di IA diventano più leggeri mantenendo al contempo prestazioni elevate. Florence-2 rappresenta un importante passo avanti nel campo dei modelli linguistico-visivi. Può gestire diverse attività, come il rilevamento degli oggetti, la segmentazione, la generazione di didascalie per immagini e il grounding, con prestazioni zero-shot straordinarie. Nonostante le dimensioni ridotte, Florence-2 è efficiente e multifunzionale, il che lo rende estremamente utile per applicazioni in diversi settori. Modelli come Florence-2 aprono nuove possibilità, ampliando il potenziale delle innovazioni nell'IA.

Scopri di più sull'IA visitando il nostro repository GitHub e unendoti alla nostra community. Visita le nostre pagine sulle soluzioni per conoscere le applicazioni dell'IA nella produzione e nell'agricoltura. 🚀

Explore solutions

Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più
Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più
Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più

Costruiamo insieme il futuro dell'AI!

Inizia il tuo percorso verso il futuro del machine learning