Ultralytics YOLO27:
AI per la visione

Migliorare le applicazioni di IA con RAG e computer vision

Scopri come combinare la generazione aumentata dal recupero (RAG) con la computer vision aiuti i sistemi di IA a interpretare documenti, elementi visivi e contenuti complessi del mondo reale.

ABAbirami Vina10 min read
Migliorare le applicazioni di IA con RAG e computer vision

L'uso di strumenti di intelligenza artificiale come ChatGPT o Gemini sta rapidamente diventando un modo comune per trovare informazioni. Che tu stia scrivendo un messaggio, riassumendo un documento o rispondendo a una domanda, questi strumenti offrono spesso una soluzione più rapida e semplice.

Tuttavia, se hai usato modelli linguistici di grandi dimensioni (LLMs) alcune volte, probabilmente ne hai notato i limiti. Quando ricevono richieste altamente specifiche o sensibili al fattore tempo, possono fornire risposte errate, spesso con grande sicurezza.

Questo accade perché gli LLM autonomi si basano esclusivamente sui dati con cui sono stati addestrati. Non hanno accesso agli aggiornamenti più recenti né a conoscenze specialistiche al di fuori di quel dataset. Di conseguenza, le loro risposte possono essere obsolete o inaccurate.

Per contribuire a risolvere questo problema, i ricercatori hanno sviluppato un metodo chiamato generazione aumentata dal recupero (RAG). RAG migliora i modelli linguistici consentendo loro di recuperare informazioni aggiornate e pertinenti da fonti affidabili quando rispondono alle domande.

In questo articolo analizzeremo come funziona RAG e come migliora gli strumenti di intelligenza artificiale recuperando informazioni pertinenti e aggiornate. Vedremo anche come opera insieme alla visione artificiale, un campo dell'intelligenza artificiale incentrato sull'interpretazione dei dati visivi, per aiutare i sistemi a comprendere non solo il testo, ma anche immagini, layout e documenti visivamente complessi.

Comprendere la generazione aumentata dal recupero (RAG)#

Quando poni una domanda a un chatbot di intelligenza artificiale, generalmente ti aspetti qualcosa di più di una semplice risposta dal suono convincente. Idealmente, una buona risposta dovrebbe essere chiara, accurata e realmente utile. Per fornirla, il modello di intelligenza artificiale ha bisogno di qualcosa in più delle sole competenze linguistiche: deve anche avere accesso alle informazioni corrette, soprattutto per argomenti specifici o sensibili al fattore tempo.

RAG è una tecnica che aiuta a colmare questa lacuna. Combina la capacità del modello linguistico di comprendere e generare testo con la possibilità di recuperare informazioni pertinenti da fonti esterne. Invece di basarsi esclusivamente sui dati di addestramento, il modello recupera attivamente contenuti di supporto da basi di conoscenza affidabili mentre elabora la risposta.

Principali casi d'uso di RAG

Fig. 1. Principali casi d'uso di RAG. Immagine dell'autore.

Puoi immaginarlo come il fatto di porre una domanda a qualcuno che consulta una fonte affidabile prima di rispondere. La risposta è comunque formulata con parole proprie, ma si basa sulle informazioni più pertinenti e aggiornate.

Questo approccio aiuta gli LLM a fornire risposte più complete, accurate e adattate alla domanda dell'utente, rendendoli molto più affidabili nelle applicazioni reali in cui l'accuratezza è davvero importante.

Uno sguardo al funzionamento di RAG#

RAG migliora il modo in cui un modello linguistico di grandi dimensioni risponde introducendo due passaggi fondamentali: recupero e generazione. Innanzitutto, recupera informazioni pertinenti da una base di conoscenza esterna. Poi usa tali informazioni per generare una risposta ben formulata e consapevole del contesto.

Vediamo un esempio semplice per capire come funziona questo processo. Immagina di usare un assistente di intelligenza artificiale per gestire le tue finanze personali e di voler verificare se hai rispettato il tuo obiettivo di spesa mensile.

Il processo inizia quando poni all'assistente una domanda come: "Ho rispettato il mio budget questo mese?" Invece di basarsi solo su ciò che ha appreso durante l'addestramento, il sistema usa un componente di recupero per cercare nei tuoi documenti finanziari più recenti, come estratti conto o riepiloghi delle transazioni. Si concentra sulla comprensione dell'intento alla base della tua domanda e raccoglie le informazioni più pertinenti.

Dopo aver recuperato tali informazioni, entra in gioco il modello linguistico. Elabora sia la tua domanda sia i dati estratti dai tuoi documenti per generare una risposta chiara e utile. Invece di elencare dettagli grezzi, la risposta riassume le tue spese e ti offre un'indicazione diretta e significativa, ad esempio confermando se hai raggiunto il tuo obiettivo e segnalando le principali aree di spesa.

Questo approccio aiuta l'LLM a fornire risposte non solo accurate, ma anche fondate sulle tue informazioni reali e aggiornate, rendendo l'esperienza molto più utile rispetto a un modello che lavora esclusivamente con dati di addestramento statici.

Comprendere il funzionamento di RAG

Fig. 2. Comprendere il funzionamento di RAG.

La necessità di sistemi RAG multimodali#

In genere, le informazioni non vengono sempre condivise sotto forma di testo semplice. Dalle scansioni mediche e dai diagrammi alle diapositive delle presentazioni e ai documenti scansionati, gli elementi visivi contengono spesso dettagli importanti. Gli LLM tradizionali, progettati principalmente per leggere e comprendere il testo, possono avere difficoltà con questo tipo di contenuti.

Tuttavia, RAG può essere usato insieme alla visione artificiale per colmare questa lacuna. Quando vengono combinati, formano quello che è noto come sistema RAG multimodale: una configurazione in grado di gestire sia testo sia contenuti visivi, aiutando i chatbot di intelligenza artificiale a fornire risposte più accurate e complete.

Al centro di questo approccio ci sono i modelli visione-linguaggio (VLMs), progettati per elaborare e analizzare entrambi i tipi di input. In questa configurazione, RAG recupera le informazioni più pertinenti da grandi fonti di dati, mentre il VLM, abilitato dalla visione artificiale, interpreta immagini, layout e diagrammi.

Questo è particolarmente utile per documenti del mondo reale, come moduli scansionati, referti medici o diapositive di presentazioni, in cui dettagli essenziali possono trovarsi sia nel testo sia negli elementi visivi. Ad esempio, quando analizza un documento che include immagini insieme a tabelle e paragrafi, un sistema multimodale può estrarre gli elementi visivi, generare un riepilogo di ciò che mostrano e combinarlo con il testo circostante per fornire una risposta più completa e utile.

RAG multimodale che usa immagini e testo per fornire risposte migliori

Fig. 3. RAG multimodale usa immagini e testo per fornire risposte migliori.

Applicazioni di RAG per i dati visivi#

Ora che abbiamo discusso cos'è RAG e come funziona con la visione artificiale, esaminiamo alcuni esempi reali e progetti di ricerca che mostrano come viene usato questo approccio.

Comprendere i documenti visivi con VisRAG#

Supponiamo che tu stia cercando di estrarre informazioni utili da un rapporto finanziario o da un documento legale scansionato. Questi tipi di file spesso includono non solo testo, ma anche tabelle, grafici e layout che aiutano a spiegare le informazioni. Un modello linguistico tradizionale potrebbe trascurare o interpretare erroneamente questi elementi visivi, causando risposte incomplete o inaccurate.

VisRAG è stato creato dai ricercatori per affrontare questa sfida. È una pipeline RAG basata su VLM che tratta ogni pagina come un'immagine invece di elaborare solo il testo. Questo consente al sistema di comprendere sia il contenuto sia la struttura visiva. Di conseguenza, può individuare le parti più pertinenti e fornire risposte più chiare, accurate e basate sul contesto completo del documento.

VisRAG legge i documenti come immagini per acquisire contenuto e layout

Fig. 4. VisRAG può leggere i documenti come immagini per acquisire il contenuto testuale e il layout.

Risposta a domande visive con RAG#

La risposta a domande visive (VQA) è un'attività in cui un sistema di intelligenza artificiale risponde a domande sulle immagini. Molti sistemi VQA esistenti si concentrano sulla risposta a domande riguardanti un singolo documento senza dover cercare informazioni aggiuntive: questo è noto come impostazione chiusa.

VDocRAG è un framework RAG che adotta un approccio più realistico. Integra la VQA con la capacità di recuperare prima i documenti pertinenti. Questo è utile nelle situazioni reali in cui la domanda di un utente potrebbe riguardare uno dei molti documenti disponibili e il sistema deve trovare quello corretto prima di rispondere. A questo scopo, VDocRAG usa i VLM per analizzare i documenti come immagini, preservandone sia il testo sia la struttura visiva.

Questo rende VDocRAG particolarmente efficace in applicazioni come la ricerca aziendale, l'automazione dei documenti e l'assistenza clienti. Può aiutare i team a estrarre rapidamente risposte da documenti complessi e formattati visivamente, come manuali o documenti sulle policy, in cui comprendere il layout è importante tanto quanto leggere le parole.

La differenza tra VDocRAG e le soluzioni basate su LLM

Fig. 5. La differenza tra VDocRAG e le soluzioni basate su LLM.

Migliorare la generazione di didascalie per immagini con RAG#

La generazione di didascalie per immagini consiste nel creare una descrizione scritta di ciò che accade in un'immagine. Viene usata in numerose applicazioni, dal rendere più accessibili i contenuti online al supportare la ricerca di immagini, la moderazione dei contenuti e i sistemi di raccomandazione.

Tuttavia, per i modelli di intelligenza artificiale non è sempre facile generare didascalie accurate. È particolarmente difficile quando l'immagine mostra qualcosa di diverso da ciò su cui il modello è stato addestrato. Molti sistemi di generazione di didascalie dipendono fortemente dai dati di addestramento, quindi, di fronte a scene non familiari, le didascalie possono risultare vaghe o inaccurate.

Per affrontare questo problema, i ricercatori hanno sviluppato Re-ViLM, un metodo che introduce la generazione aumentata dal recupero (RAG) nella generazione di didascalie per immagini. Invece di generare una didascalia da zero, Re-ViLM recupera da un database coppie simili immagine-testo e le usa per guidare l'output della didascalia.

Questo approccio basato sul recupero aiuta il modello a fondare le proprie descrizioni su esempi pertinenti, migliorando sia l'accuratezza sia la fluidità. I primi risultati mostrano che Re-ViLM genera didascalie più naturali e consapevoli del contesto usando esempi reali, contribuendo a ridurre le descrizioni vaghe o inaccurate.

Re-ViLM migliora le didascalie delle immagini recuperando esempi visivo-testuali

Fig. 6. Re-ViLM migliora le didascalie delle immagini recuperando esempi visivo-testuali.

Vantaggi e svantaggi dell'uso di RAG per comprendere i dati visivi#

Ecco una rapida panoramica dei vantaggi dell'applicazione delle tecniche di generazione aumentata dal recupero per recuperare e usare informazioni visive:

  • Migliori capacità di riepilogo: i riepiloghi possono integrare informazioni provenienti dagli elementi visivi, come gli andamenti dei grafici o gli elementi delle infografiche, non solo dal testo.
  • Ricerca e recupero più affidabili: i passaggi di recupero possono identificare pagine visive pertinenti anche quando nel testo non sono presenti parole chiave, usando la comprensione basata sulle immagini.
  • Supporto per documenti scansionati, scritti a mano o basati su immagini: le pipeline RAG abilitate dai VLM possono elaborare contenuti che risulterebbero illeggibili per i modelli basati solo sul testo.

Nonostante questi vantaggi, ci sono ancora alcune limitazioni da tenere presenti quando si usa RAG per lavorare con dati visivi. Ecco alcune delle principali:

  • Elevati requisiti computazionali: analizzare sia immagini sia testo richiede più memoria e potenza di elaborazione, il che può rallentare le prestazioni o aumentare i costi.
  • Problemi di privacy dei dati e sicurezza: i documenti visivi, soprattutto in settori come quello sanitario o finanziario, possono contenere informazioni sensibili che complicano i flussi di lavoro di recupero ed elaborazione.
  • Tempi di inferenza più lunghi: poiché l'elaborazione visiva aggiunge complessità, la generazione delle risposte può richiedere più tempo rispetto ai sistemi basati solo sul testo.

Punti chiave#

La generazione aumentata dal recupero sta migliorando il modo in cui i modelli linguistici di grandi dimensioni rispondono alle domande, consentendo loro di recuperare informazioni pertinenti e aggiornate da fonti esterne. Quando vengono abbinati alla visione artificiale, questi sistemi possono elaborare non solo il testo, ma anche contenuti visivi come grafici, tabelle, immagini e documenti scansionati, portando a risposte più accurate e complete.

Questo approccio rende gli LLM più adatti alle attività del mondo reale che coinvolgono documenti complessi. Combinando il recupero e la comprensione visiva, questi modelli possono interpretare più efficacemente formati diversi e fornire informazioni più utili in contesti pratici e quotidiani.

Unisciti alla nostra community in crescita! Esplora il nostro repository GitHub per approfondire l'intelligenza artificiale. Vuoi iniziare i tuoi progetti di visione artificiale? Dai un'occhiata alle nostre opzioni di licenza. Scopri di più sull'intelligenza artificiale nel settore sanitario e sulla visione artificiale nel settore della vendita al dettaglio nelle nostre pagine dedicate alle soluzioni!

Explore solutions

Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più
Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più
Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più

Costruiamo insieme il futuro dell'AI!

Inizia il tuo percorso verso il futuro del machine learning