YOLO Vision 2026:
Vision AI

Migliorare le applicazioni di IA con RAG e computer vision

Scopri come la combinazione di Retrieval-Augmented Generation (RAG) con la computer vision aiuta i sistemi di IA a interpretare documenti, elementi visivi e contenuti complessi del mondo reale.

ABAbirami Vina4 min read
Migliorare le applicazioni di IA con RAG e computer vision

L'utilizzo di strumenti AI come ChatGPT o Gemini sta rapidamente diventando un modo comune per trovare informazioni. Che tu stia scrivendo un messaggio, riassumendo un documento o rispondendo a una domanda, questi strumenti offrono spesso una soluzione più rapida e semplice.

Ma se hai usato i large language models (LLMs) qualche volta, avrai probabilmente notato i loro limiti. Quando ricevono query altamente specifiche o sensibili al tempo, possono rispondere con risposte errate, spesso con molta sicurezza.

Ciò accade perché gli LLM autonomi si affidano esclusivamente ai dati su cui sono stati addestrati. Non hanno accesso agli ultimi aggiornamenti o a conoscenze specializzate al di fuori di tale set di dati. Di conseguenza, le loro risposte possono essere obsolete o imprecise.

Per contribuire a risolvere questo problema, i ricercatori hanno sviluppato un metodo chiamato retrieval-augmented generation (RAG). Il RAG potenzia i modelli linguistici consentendo loro di recuperare informazioni fresche e pertinenti da fonti attendibili quando rispondono alle query.

In questo articolo esploreremo come funziona il RAG e come migliora gli strumenti di intelligenza artificiale recuperando informazioni pertinenti e aggiornate. Esamineremo anche come funziona insieme alla computer vision, un campo dell'intelligenza artificiale focalizzato sull'interpretazione dei dati visivi, per aiutare i sistemi a comprendere non solo il testo ma anche immagini, layout e documenti visivamente complessi.

Comprendere la retrieval-augmented generation (RAG)#

Quando poniamo una domanda a un chatbot di intelligenza artificiale, in genere ci aspettiamo qualcosa di più di una semplice risposta che suoni bene. Idealmente, una buona risposta dovrebbe essere chiara, accurata e genuinamente utile. Per offrire ciò, il AI model ha bisogno di qualcosa in più rispetto alle competenze linguistiche; ha anche bisogno di accesso alle informazioni giuste, specialmente per argomenti specifici o sensibili al tempo.

Il RAG è una tecnica che aiuta a colmare questo divario. Unisce la capacità del modello linguistico di comprendere e generare testo con il potere di recuperare informazioni pertinenti da fonti esterne. Invece di fare affidamento esclusivamente sui dati di addestramento, il modello estrae attivamente contenuti di supporto da basi di conoscenza attendibili mentre formula la sua risposta.

Key RAG use cases

Fig 1. Casi d'uso chiave del RAG. Immagine dell'autore.

Puoi immaginarlo come fare una domanda a qualcuno e chiedergli di consultare un riferimento affidabile prima di rispondere. La risposta rimane espressa con le sue parole, ma è informata dalle informazioni più pertinenti e aggiornate.

Questo approccio aiuta gli LLM a rispondere con risposte più complete, accurate e su misura per la query dell'utente, rendendoli molto più affidabili in applicazioni reali dove la precisione conta davvero.

Uno sguardo a come funziona il RAG#

Il RAG migliora il modo in cui un large language model risponde introducendo due passaggi chiave: recupero e generazione. Innanzitutto, recupera le informazioni pertinenti da una base di conoscenza esterna. Quindi, utilizza tali informazioni per generare una risposta ben formata e consapevole del contesto.

Diamo un'occhiata a un semplice esempio per vedere come funziona questo processo. Immagina di usare un assistente di intelligenza artificiale per gestire le tue finances personali e voler controllare se sei rimasto entro il tuo obiettivo di spesa per il mese.

Il processo inizia quando chiedi all'assistente qualcosa come: "Sono rimasto nel budget questo mese?". Invece di fare affidamento solo su ciò che ha appreso durante l'addestramento, il sistema utilizza un retriever per cercare tra i tuoi documenti finanziari più recenti (come estratti conto o riepiloghi delle transazioni). Si concentra sulla comprensione dell'intento dietro la tua domanda e raccoglie le informazioni più pertinenti.

Una volta recuperate tali informazioni, il modello linguistico prende il sopravvento. Elabora sia la tua domanda che i dati estratti dai tuoi record per generare una risposta chiara e utile. Piuttosto che elencare dettagli grezzi, la risposta riassume le tue spese e ti fornisce un insight diretto e significativo, come la conferma del raggiungimento dell'obiettivo e l'indicazione delle principali aree di spesa.

Questo approccio aiuta l'LLM a fornire risposte che non sono solo accurate, ma anche basate sulle tue informazioni reali e aggiornate, rendendo l'esperienza molto più utile di un modello che lavora solo con dati di addestramento statici.

Understanding how RAG works

Fig 2. Comprendere come funziona il RAG.

Il bisogno di sistemi RAG multimodali#

In genere, le informazioni non sono sempre condivise in semplice testo. Da scansioni mediche e diagrammi a diapositive di presentazione e documenti scansionati, gli elementi visivi contengono spesso dettagli importanti. Gli LLM tradizionali, costruiti principalmente per leggere e comprendere il testo, possono avere difficoltà con questo tipo di contenuto.

Tuttavia, il RAG può essere utilizzato insieme alla computer vision per colmare tale divario. Quando i due vengono riuniti, formano quello che è noto come sistema RAG multimodale: una configurazione in grado di gestire sia testo che elementi visivi, aiutando i chatbot AI a fornire risposte più accurate e complete.

Al centro di questo approccio ci sono i vision-language models (VLMs), progettati per elaborare e ragionare su entrambi i tipi di input. In questa configurazione, il RAG recupera le informazioni più pertinenti da grandi fonti di dati, mentre il VLM, abilitato dalla computer vision, interpreta immagini, layout e diagrammi.

Ciò è particolarmente utile per documenti del mondo reale, come moduli scansionati, referti medici o diapositive di presentazione, dove dettagli vitali possono essere trovati sia nel testo che negli elementi visivi. Ad esempio, quando si analizza un documento che include immagini insieme a tabelle e paragrafi, un sistema multimodale può estrarre elementi visivi, generare un riepilogo di ciò che mostrano e combinarlo con il testo circostante per fornire una risposta più completa e utile.

Multimodal RAG using images and text to provide better answers

Fig 3. Il RAG multimodale utilizza immagini e testo per fornire risposte migliori.

Applicazioni del RAG per dati visivi#

Ora che abbiamo discusso cosa sia il RAG e come funzioni con la computer vision, diamo un'occhiata ad alcuni esempi del mondo reale e progetti di ricerca che mostrano come questo approccio venga utilizzato.

Comprendere i documenti visivi con VisRAG#

Diciamo che stai cercando di estrarre informazioni da un report finanziario o da un legal document scansionato. Questi tipi di file spesso includono non solo testo, ma anche tabelle, grafici e layout che aiutano a spiegare le informazioni. Un modello linguistico semplice potrebbe trascurare o interpretare male questi elementi visivi, portando a risposte incomplete o imprecise.

VisRAG è stato creato dai ricercatori per affrontare questa sfida. È una pipeline RAG basata su VLM che tratta ogni pagina come un'immagine anziché elaborare solo il testo. Questo consente al sistema di comprendere sia il contenuto che la sua struttura visiva. Di conseguenza, può trovare le parti più pertinenti e fornire risposte più chiare, più accurate e basate sul contesto completo del documento.

VisRAG reading documents as images to capture content and layout

Fig 4. VisRAG può leggere documenti come immagini per catturare il contenuto testuale e il layout.

Risposta visiva alle domande con RAG#

La visual question answering (VQA) è un'attività in cui un sistema AI risponde a domande sulle immagini. Molti sistemi VQA esistenti si concentrano sulla risposta a domande su un singolo documento senza la necessità di cercare informazioni aggiuntive; questo è noto come ambiente chiuso.

VDocRAG è un framework RAG che adotta un approccio più realistico. Integra la VQA con la capacità di recuperare prima i documenti pertinenti. Questo è utile in situazioni del mondo reale in cui la domanda di un utente potrebbe applicarsi a uno tra molti documenti, e il sistema deve trovare quello giusto prima di rispondere. Per fare ciò, VDocRAG utilizza i VLM per analizzare i documenti come immagini, preservando sia il testo che la struttura visiva.

Questo rende VDocRAG particolarmente efficace in applicazioni come la ricerca aziendale, l'automazione dei documenti e il customer support. Può aiutare i team a estrarre rapidamente risposte da documenti complessi e formattati visivamente, come manuali o file di policy, in cui comprendere il layout è importante tanto quanto leggere le parole.

The difference between VDocRAG and LLM-based solutions

Fig 5. La differenza tra VDocRAG e soluzioni basate su LLM.

Migliorare la didascalia delle immagini con RAG#

Image captioning comporta la generazione di una descrizione scritta di ciò che sta accadendo in un'immagine. Viene utilizzato in una varietà di applicazioni, dal rendere i contenuti online più accessibili all'alimentare la ricerca di immagini, fino al supporto della moderazione dei contenuti e dei sistemi di raccomandazione.

Tuttavia, generare didascalie accurate non è sempre facile per i modelli AI. È particolarmente difficile quando l'immagine mostra qualcosa di diverso da ciò su cui il modello è stato addestrato. Molti sistemi di didascalia si affidano pesantemente ai dati di addestramento, quindi quando si trovano di fronte a scene sconosciute, le loro didascalie possono risultare vaghe o imprecise.

Per affrontare questo problema, i ricercatori hanno sviluppato Re-ViLM, un metodo che porta la retrieval-augmented generation (RAG) nell'image captioning. Invece di generare una didascalia da zero, Re-ViLM recupera coppie immagine-testo simili da un database e le usa per guidare l'output della didascalia.

Questo approccio basato sul recupero aiuta il modello a basare le sue descrizioni su esempi pertinenti, migliorando sia l'accuratezza che la fluidità. I primi risultati mostrano che Re-ViLM genera didascalie più naturali e consapevoli del contesto utilizzando esempi reali, contribuendo a ridurre le descrizioni vaghe o imprecise.

Re-ViLM improving image captions by retrieving visual-text examples

Fig 6. Re-ViLM migliora le didascalie delle immagini recuperando esempi visivo-testuali.

Pro e contro dell'utilizzo del RAG per comprendere i dati visivi#

Ecco una rapida panoramica dei vantaggi dell'applicazione di tecniche di retrieval-augmented generation per recuperare e utilizzare le informazioni visive:

  • Funzionalità di summarization avanzate: I riassunti possono incorporare approfondimenti da elementi visivi (come tendenze dei grafici o elementi di infografica), non solo dal testo.
  • Ricerca e recupero più robusti: i passaggi di recupero possono identificare pagine visive pertinenti anche quando le parole chiave non sono presenti nel testo, utilizzando la comprensione basata sulle immagini.
  • Supporto per documenti scansionati, scritti a mano o basati su immagini: le pipeline RAG abilitate dai VLM possono elaborare contenuti che sarebbero illeggibili per i modelli di solo testo.

Nonostante questi vantaggi, ci sono ancora alcune limitazioni da tenere a mente quando si utilizza il RAG per lavorare con i dati visivi. Ecco alcune delle principali:

  • Elevati requisiti di calcolo: l'analisi di immagini e testo utilizza più memoria e potenza di elaborazione, il che può rallentare le prestazioni o aumentare i costi.
  • Problemi di data privacy e sicurezza: I documenti visivi, specialmente in settori come la sanità o la finanza, possono contenere informazioni sensibili che complicano i flussi di lavoro di recupero ed elaborazione.
  • Tempi di inferenza più lunghi: poiché l'elaborazione visiva aggiunge complessità, la generazione delle risposte può richiedere più tempo rispetto ai sistemi di solo testo.

Punti chiave#

La retrieval-augmented generation sta migliorando il modo in cui i large language model rispondono alle domande consentendo loro di recuperare informazioni pertinenti e aggiornate da fonti esterne. Se abbinati alla computer vision, questi sistemi possono elaborare non solo testo ma anche contenuti visivi, come grafici, tabelle, immagini e documenti scansionati, portando a risposte più accurate e complete.

Questo approccio rende gli LLM più adatti a compiti del mondo reale che coinvolgono documenti complessi. Unendo recupero e comprensione visiva, questi modelli possono interpretare formati diversi in modo più efficace e fornire insight che risultano più utili in contesti pratici e quotidiani.

Unisciti alla nostra community in crescita! Esplora il nostro GitHub repository per approfondire l'intelligenza artificiale. Pronto a iniziare i tuoi progetti di computer vision? Dai un'occhiata alle nostre licensing options. Scopri di più su AI in healthcare e computer vision in retail sulle nostre pagine delle soluzioni!

Explore solutions

Real-time AI that works with your team

AI nella Robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica guida la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Real-time AI that works with your team

IA nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza in magazzino in tempo reale.
Scopri di più
Real-time AI that works with your team

AI nel settore Retail

Reimmagina il retail con i modelli Ultralytics YOLO. La Vision AI alimenta il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e insight più intelligenti sui clienti.
Scopri di più
Real-time AI that works with your team

IA nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La vision AI nella sanità potenzia l'imaging medico più rapido, diagnosi più intelligenti e il monitoraggio dei pazienti.
Scopri di più
Real-time AI that works with your team

IA nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI guida il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione della linea di assemblaggio.
Scopri di più
Real-time AI that works with your operation

AI nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, l'assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Real-time AI tailored to your operation

AI in Agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Potenzia il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per rese più elevate e intelligenti.
Scopri di più
Real-time AI that works with your team

AI nella Robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica guida la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Real-time AI that works with your team

IA nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza in magazzino in tempo reale.
Scopri di più
Real-time AI that works with your team

AI nel settore Retail

Reimmagina il retail con i modelli Ultralytics YOLO. La Vision AI alimenta il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e insight più intelligenti sui clienti.
Scopri di più
Real-time AI that works with your team

IA nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La vision AI nella sanità potenzia l'imaging medico più rapido, diagnosi più intelligenti e il monitoraggio dei pazienti.
Scopri di più
Real-time AI that works with your team

IA nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI guida il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione della linea di assemblaggio.
Scopri di più
Real-time AI that works with your operation

AI nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, l'assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Real-time AI tailored to your operation

AI in Agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Potenzia il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per rese più elevate e intelligenti.
Scopri di più
Real-time AI that works with your team

AI nella Robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica guida la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Real-time AI that works with your team

IA nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza in magazzino in tempo reale.
Scopri di più
Real-time AI that works with your team

AI nel settore Retail

Reimmagina il retail con i modelli Ultralytics YOLO. La Vision AI alimenta il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e insight più intelligenti sui clienti.
Scopri di più
Real-time AI that works with your team

IA nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La vision AI nella sanità potenzia l'imaging medico più rapido, diagnosi più intelligenti e il monitoraggio dei pazienti.
Scopri di più
Real-time AI that works with your team

IA nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI guida il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione della linea di assemblaggio.
Scopri di più
Real-time AI that works with your operation

AI nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, l'assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Real-time AI tailored to your operation

AI in Agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Potenzia il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per rese più elevate e intelligenti.
Scopri di più

Costruiamo insieme il futuro dell'AI!

Inizia il tuo viaggio con il futuro del machine learning