Multimodal RAG
Esplora il RAG multimodale per elaborare testo, immagini e video. Scopri come Ultralytics YOLO26 migliora le pipeline di retrieval dell'AI per ottenere risposte più accurate e sensibili al contesto.
La generazione aumentata dal recupero multimodale (RAG multimodale) è un framework avanzato di intelligenza artificiale (AI) che estende i sistemi RAG tradizionali per elaborare e ragionare su diversi tipi di dati, come testo, immagini, video e audio. Mentre la generazione aumentata dal recupero (RAG) standard migliora l'accuratezza di un modello linguistico di grandi dimensioni (LLM) recuperando documenti testuali pertinenti, il RAG multimodale consente ai modelli di "vedere" e "sentire" recuperando il contesto da una knowledge base multimediale. Questo approccio basa la generazione del modello su prove visive o uditive concrete, riducendo significativamente le allucinazioni negli LLM e consentendo attività complesse come la risposta a domande visive su dataset privati. Grazie all'apprendimento multimodale, questi sistemi possono sintetizzare le informazioni provenienti dalla query dell'utente (ad esempio, testo) e dagli asset recuperati (ad esempio, un diagramma o un fotogramma di sorveglianza) per produrre risposte complete e consapevoli del contesto.
Come funziona il RAG multimodale#
L'architettura di un sistema RAG multimodale rispecchia in genere la pipeline standard "Retrieve-then-Generate", ma si adatta ai dati non testuali. Questo processo si basa in larga misura su database vettoriali e spazi semantici condivisi.
-
Indicizzazione: I dati provenienti da varie fonti—PDF, video, presentazioni—vengono elaborati. I modelli di estrazione delle caratteristiche convertono queste diverse modalità in vettori numerici ad alta dimensionalità, noti come embedding. Ad esempio, un modello come CLIP di OpenAI allinea gli embedding di immagini e testo, così che l'immagine di un cane e la parola "cane" risultino matematicamente vicine.
-
Recupero: Quando un utente pone una domanda (ad esempio, "Mostrami il difetto in questa scheda elettronica"), il sistema esegue una ricerca semantica nel database vettoriale per trovare le immagini o i videoclip più pertinenti che corrispondono all'intento della query.
-
Generazione: Il contesto visivo recuperato viene fornito a un modello visione-linguaggio (VLM). Il VLM elabora sia il prompt testuale dell'utente sia le caratteristiche dell'immagine recuperata per generare una risposta finale, "dialogando" di fatto con i dati.
Applicazioni nel mondo reale#
Il RAG multimodale sta trasformando i settori industriali, consentendo agli agenti AI di interagire con il mondo fisico attraverso i dati visivi.
- Manutenzione industriale e produzione: Nell'AI nella produzione, i tecnici possono interrogare un sistema con una foto di un componente di una macchina danneggiato. Il sistema RAG multimodale recupera registri storici di manutenzione simili, schemi tecnici e video tutorial per guidare il processo di riparazione. Ciò riduce i tempi di inattività e rende accessibile il know-how degli esperti.
- Scoperta nel retail e nell'e-commerce: Le applicazioni che utilizzano l'AI nel retail consentono ai clienti di caricare l'immagine di un outfit di loro gradimento. Il sistema recupera articoli visivamente simili dall'inventario attuale e genera consigli di stile o confronti tra prodotti, creando un'esperienza di acquisto altamente personalizzata.
Distinzione tra termini correlati#
Per comprendere la nicchia specifica del RAG multimodale, è utile distinguerlo dai concetti correlati:
- RAG multimodale vs. modello multimodale: Un modello multimodale (come GPT-4o o Gemini) crea la risposta. Il RAG multimodale è l'architettura che fornisce al modello dati esterni e privati (immagini, documenti) sui quali non è stato addestrato. Il modello è il motore; il RAG è la linea di alimentazione.
- RAG multimodale vs. fine-tuning: Il fine-tuning aggiorna permanentemente i pesi del modello per apprendere una nuova attività o uno stile. Il RAG fornisce conoscenze temporanee al momento dell'inferenza. Il RAG è preferibile per dati dinamici (ad esempio, l'inventario giornaliero), per i quali il riaddestramento frequente non è pratico.
Implementazione con Ultralytics#
Gli sviluppatori possono creare il componente di recupero di una pipeline RAG multimodale utilizzando Ultralytics YOLO. Rilevando e classificando gli oggetti all'interno delle immagini, YOLO fornisce metadati strutturati che possono essere indicizzati per il recupero basato sul testo o utilizzati per ritagliare regioni pertinenti dell'immagine destinate a un VLM. La Ultralytics Platform semplifica l'addestramento di questi modelli di visione specializzati affinché riconoscano oggetti personalizzati fondamentali per il tuo dominio specifico.
L'esempio seguente mostra come utilizzare YOLO26 per estrarre il contesto visivo (oggetti rilevati) da un'immagine, che potrebbe poi essere passato a un LLM come parte di un workflow RAG.
from ultralytics import YOLO
# Load the YOLO26 model (smaller, faster, and more accurate)
model = YOLO("yolo26n.pt")
# Run inference on an image to 'retrieve' visual content
results = model("https://ultralytics.com/images/bus.jpg")
# Extract detected class names to form a text context
detected_objects = results[0].boxes.cls.tolist()
object_names = [model.names[int(cls)] for cls in detected_objects]
print(f"Retrieved Context: Image contains {', '.join(object_names)}")
# Output: Retrieved Context: Image contains bus, person, person, personApprofondimenti e risorse#
- Documentazione di LangChain: Una guida completa alla creazione di pipeline di recupero, incluso il supporto multimodale.
- Guida multimodale di LlamaIndex: Documentazione dettagliata sull'indicizzazione e il recupero di tipi di dati complessi per gli LLM.
- Google Cloud Vertex AI Search: Funzionalità di ricerca vettoriale di livello enterprise per la creazione di applicazioni RAG scalabili.
- Soluzioni Ultralytics: Scopri come la computer vision si integra con sistemi AI più ampi in vari settori.









