YOLO Vision 2026:
Torna al glossario Ultralytics

Multimodal RAG

Esplora la RAG multimodale per elaborare testo, immagini e video. Scopri come Ultralytics YOLO26 migliora le pipeline di recupero IA per risposte più accurate e consapevoli del contesto.

La Retrieval Augmented Generation Multimodale (RAG Multimodale) è un framework avanzato di intelligenza artificiale (AI) che estende i sistemi RAG tradizionali per elaborare e ragionare su diversi tipi di dati, come testo, immagini, video e audio. Mentre lo standard Retrieval Augmented Generation (RAG) migliora la precisione di un Large Language Model (LLM) recuperando documenti testuali pertinenti, la RAG Multimodale consente ai modelli di "vedere" e "sentire" recuperando il contesto da una base di conoscenza mista. Questo approccio fonda la generazione del modello su prove visive o uditive concrete, riducendo significativamente le allucinazioni negli LLM e consentendo attività complesse come la risposta a domande visive su dataset privati. Sfruttando l'apprendimento multimodale, questi sistemi possono sintetizzare le informazioni da una query dell'utente (ad es., testo) e da asset recuperati (ad es., un diagramma o un fotogramma di sorveglianza) per produrre risposte complete e consapevoli del contesto.

Come funziona la Multimodal RAG#

L'architettura di un sistema RAG Multimodale rispecchia tipicamente la pipeline standard "Recupera e genera" (Retrieve-then-Generate), adattandola però ai dati non testuali. Questo processo si basa fortemente sui database vettoriali e su spazi semantici condivisi.

  1. Indicizzazione: I dati provenienti da varie fonti (PDF, video, presentazioni) vengono elaborati. I modelli di estrazione delle caratteristiche convertono queste diverse modalità in vettori numerici ad alta dimensionalità noti come embedding. Ad esempio, un modello come OpenAI's CLIP allinea gli embedding di immagini e testo in modo che la foto di un cane e la parola "cane" siano vicine dal punto di vista matematico.

  2. Recupero: Quando un utente pone una domanda (ad es., "Mostrami il difetto in questo circuito stampato"), il sistema esegue una ricerca semantica nel database vettoriale per trovare le immagini o le clip video più pertinenti che corrispondono all'intento della query.

  3. Generazione: Il contesto visivo recuperato viene immesso in un Vision-Language Model (VLM). Il VLM elabora sia il prompt di testo dell'utente sia le caratteristiche dell'immagine recuperata per generare una risposta finale, "chattando" efficacemente con i dati.

Applicazioni nel mondo reale#

La RAG Multimodale sta trasformando le industrie consentendo agli agenti AI di interagire con il mondo fisico attraverso i dati visivi.

  • Manutenzione industriale e produzione: Nell'intelligenza artificiale nella produzione, i tecnici possono interrogare un sistema con la foto di una parte di macchina rotta. Il sistema RAG Multimodale recupera registri di manutenzione storici simili, schemi tecnici e tutorial video per guidare il processo di riparazione. Questo riduce i tempi di inattività e democratizza la conoscenza specialistica.
  • Retail e scoperta nell'e-commerce: Le applicazioni che utilizzano l'intelligenza artificiale nel retail consentono ai clienti di caricare l'immagine di un abito che gradiscono. Il sistema recupera articoli visivamente simili dall'inventario attuale e genera consigli di stile o confronti di prodotti, creando un'esperienza di shopping altamente personalizzata.

Differenziazione dei termini correlati#

Per comprendere la nicchia specifica della Multimodal RAG, è utile distinguerla da concetti correlati:

  • RAG Multimodale vs Modello multimodale: Un modello multimodale (come GPT-4o o Gemini) crea la risposta. La RAG Multimodale è l'architettura che alimenta quel modello con dati esterni e privati (immagini, documenti) su cui non è stato addestrato. Il modello è il motore; la RAG è la linea del carburante.
  • RAG Multimodale vs Fine-tuning: Il fine-tuning aggiorna permanentemente i pesi del modello per apprendere un nuovo compito o stile. La RAG fornisce conoscenza temporanea al momento dell'inferenza. La RAG è preferita per dati dinamici (ad es., inventario giornaliero) in cui frequenti riaddestramenti non sono pratici.

Implementazione con Ultralytics#

Gli sviluppatori possono creare il componente di recupero di una pipeline RAG Multimodale utilizzando Ultralytics YOLO. Rilevando e classificando gli oggetti all'interno delle immagini, YOLO fornisce metadati strutturati che possono essere indicizzati per il recupero basato su testo o utilizzati per ritagliare regioni di immagine pertinenti per un VLM. La Piattaforma Ultralytics semplifica l'addestramento di questi modelli di visione specializzati per riconoscere oggetti personalizzati cruciali per il tuo dominio specifico.

Il seguente esempio dimostra l'uso di YOLO26 per estrarre il contesto visivo (oggetti rilevati) da un'immagine, che potrebbe quindi essere passato a un LLM come parte di un flusso di lavoro RAG.

from ultralytics import YOLO

# Load the YOLO26 model (smaller, faster, and more accurate)
model = YOLO("yolo26n.pt")

# Run inference on an image to 'retrieve' visual content
results = model("https://ultralytics.com/images/bus.jpg")

# Extract detected class names to form a text context
detected_objects = results[0].boxes.cls.tolist()
object_names = [model.names[int(cls)] for cls in detected_objects]

print(f"Retrieved Context: Image contains {', '.join(object_names)}")
# Output: Retrieved Context: Image contains bus, person, person, person

Ulteriori letture e risorse#

  • Documentazione LangChain: Una guida completa alla creazione di pipeline di recupero, inclus il supporto multimodale.
  • Guida Multimodale LlamaIndex: Documentazione dettagliata sull'indicizzazione e il recupero di tipi di dati complessi per gli LLM.
  • Google Cloud Vertex AI Search: Capacità di ricerca vettoriale di livello aziendale per la creazione di applicazioni RAG scalabili.
  • Soluzioni Ultralytics: Esplora come la visione artificiale si integra con sistemi di intelligenza artificiale più ampi in vari settori.

Explore solutions

Real-time AI that works with your team

AI nella Robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica guida la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Real-time AI that works with your team

IA nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza in magazzino in tempo reale.
Scopri di più
Real-time AI that works with your team

AI nel settore Retail

Reimmagina il retail con i modelli Ultralytics YOLO. La Vision AI alimenta il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e insight più intelligenti sui clienti.
Scopri di più
Real-time AI that works with your team

IA nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La vision AI nella sanità potenzia l'imaging medico più rapido, diagnosi più intelligenti e il monitoraggio dei pazienti.
Scopri di più
Real-time AI that works with your team

IA nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI guida il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione della linea di assemblaggio.
Scopri di più
Real-time AI that works with your operation

AI nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, l'assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Real-time AI tailored to your operation

AI in Agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Potenzia il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per rese più elevate e intelligenti.
Scopri di più
Real-time AI that works with your team

AI nella Robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica guida la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Real-time AI that works with your team

IA nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza in magazzino in tempo reale.
Scopri di più
Real-time AI that works with your team

AI nel settore Retail

Reimmagina il retail con i modelli Ultralytics YOLO. La Vision AI alimenta il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e insight più intelligenti sui clienti.
Scopri di più
Real-time AI that works with your team

IA nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La vision AI nella sanità potenzia l'imaging medico più rapido, diagnosi più intelligenti e il monitoraggio dei pazienti.
Scopri di più
Real-time AI that works with your team

IA nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI guida il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione della linea di assemblaggio.
Scopri di più
Real-time AI that works with your operation

AI nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, l'assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Real-time AI tailored to your operation

AI in Agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Potenzia il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per rese più elevate e intelligenti.
Scopri di più
Real-time AI that works with your team

AI nella Robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica guida la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Real-time AI that works with your team

IA nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza in magazzino in tempo reale.
Scopri di più
Real-time AI that works with your team

AI nel settore Retail

Reimmagina il retail con i modelli Ultralytics YOLO. La Vision AI alimenta il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e insight più intelligenti sui clienti.
Scopri di più
Real-time AI that works with your team

IA nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La vision AI nella sanità potenzia l'imaging medico più rapido, diagnosi più intelligenti e il monitoraggio dei pazienti.
Scopri di più
Real-time AI that works with your team

IA nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI guida il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione della linea di assemblaggio.
Scopri di più
Real-time AI that works with your operation

AI nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, l'assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Real-time AI tailored to your operation

AI in Agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Potenzia il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per rese più elevate e intelligenti.
Scopri di più

Costruiamo insieme il futuro dell'AI!

Inizia il tuo viaggio con il futuro del machine learning