Ultralytics YOLO27:
Torna al glossario di Ultralytics

Multimodal RAG

Esplora il RAG multimodale per elaborare testo, immagini e video. Scopri come Ultralytics YOLO26 migliora le pipeline di retrieval dell'AI per ottenere risposte più accurate e sensibili al contesto.

La generazione aumentata dal recupero multimodale (RAG multimodale) è un framework avanzato di intelligenza artificiale (AI) che estende i sistemi RAG tradizionali per elaborare e ragionare su diversi tipi di dati, come testo, immagini, video e audio. Mentre la generazione aumentata dal recupero (RAG) standard migliora l'accuratezza di un modello linguistico di grandi dimensioni (LLM) recuperando documenti testuali pertinenti, il RAG multimodale consente ai modelli di "vedere" e "sentire" recuperando il contesto da una knowledge base multimediale. Questo approccio basa la generazione del modello su prove visive o uditive concrete, riducendo significativamente le allucinazioni negli LLM e consentendo attività complesse come la risposta a domande visive su dataset privati. Grazie all'apprendimento multimodale, questi sistemi possono sintetizzare le informazioni provenienti dalla query dell'utente (ad esempio, testo) e dagli asset recuperati (ad esempio, un diagramma o un fotogramma di sorveglianza) per produrre risposte complete e consapevoli del contesto.

Come funziona il RAG multimodale#

L'architettura di un sistema RAG multimodale rispecchia in genere la pipeline standard "Retrieve-then-Generate", ma si adatta ai dati non testuali. Questo processo si basa in larga misura su database vettoriali e spazi semantici condivisi.

  1. Indicizzazione: I dati provenienti da varie fonti—PDF, video, presentazioni—vengono elaborati. I modelli di estrazione delle caratteristiche convertono queste diverse modalità in vettori numerici ad alta dimensionalità, noti come embedding. Ad esempio, un modello come CLIP di OpenAI allinea gli embedding di immagini e testo, così che l'immagine di un cane e la parola "cane" risultino matematicamente vicine.

  2. Recupero: Quando un utente pone una domanda (ad esempio, "Mostrami il difetto in questa scheda elettronica"), il sistema esegue una ricerca semantica nel database vettoriale per trovare le immagini o i videoclip più pertinenti che corrispondono all'intento della query.

  3. Generazione: Il contesto visivo recuperato viene fornito a un modello visione-linguaggio (VLM). Il VLM elabora sia il prompt testuale dell'utente sia le caratteristiche dell'immagine recuperata per generare una risposta finale, "dialogando" di fatto con i dati.

Applicazioni nel mondo reale#

Il RAG multimodale sta trasformando i settori industriali, consentendo agli agenti AI di interagire con il mondo fisico attraverso i dati visivi.

  • Manutenzione industriale e produzione: Nell'AI nella produzione, i tecnici possono interrogare un sistema con una foto di un componente di una macchina danneggiato. Il sistema RAG multimodale recupera registri storici di manutenzione simili, schemi tecnici e video tutorial per guidare il processo di riparazione. Ciò riduce i tempi di inattività e rende accessibile il know-how degli esperti.
  • Scoperta nel retail e nell'e-commerce: Le applicazioni che utilizzano l'AI nel retail consentono ai clienti di caricare l'immagine di un outfit di loro gradimento. Il sistema recupera articoli visivamente simili dall'inventario attuale e genera consigli di stile o confronti tra prodotti, creando un'esperienza di acquisto altamente personalizzata.

Distinzione tra termini correlati#

Per comprendere la nicchia specifica del RAG multimodale, è utile distinguerlo dai concetti correlati:

  • RAG multimodale vs. modello multimodale: Un modello multimodale (come GPT-4o o Gemini) crea la risposta. Il RAG multimodale è l'architettura che fornisce al modello dati esterni e privati (immagini, documenti) sui quali non è stato addestrato. Il modello è il motore; il RAG è la linea di alimentazione.
  • RAG multimodale vs. fine-tuning: Il fine-tuning aggiorna permanentemente i pesi del modello per apprendere una nuova attività o uno stile. Il RAG fornisce conoscenze temporanee al momento dell'inferenza. Il RAG è preferibile per dati dinamici (ad esempio, l'inventario giornaliero), per i quali il riaddestramento frequente non è pratico.

Implementazione con Ultralytics#

Gli sviluppatori possono creare il componente di recupero di una pipeline RAG multimodale utilizzando Ultralytics YOLO. Rilevando e classificando gli oggetti all'interno delle immagini, YOLO fornisce metadati strutturati che possono essere indicizzati per il recupero basato sul testo o utilizzati per ritagliare regioni pertinenti dell'immagine destinate a un VLM. La Ultralytics Platform semplifica l'addestramento di questi modelli di visione specializzati affinché riconoscano oggetti personalizzati fondamentali per il tuo dominio specifico.

L'esempio seguente mostra come utilizzare YOLO26 per estrarre il contesto visivo (oggetti rilevati) da un'immagine, che potrebbe poi essere passato a un LLM come parte di un workflow RAG.

from ultralytics import YOLO

# Load the YOLO26 model (smaller, faster, and more accurate)
model = YOLO("yolo26n.pt")

# Run inference on an image to 'retrieve' visual content
results = model("https://ultralytics.com/images/bus.jpg")

# Extract detected class names to form a text context
detected_objects = results[0].boxes.cls.tolist()
object_names = [model.names[int(cls)] for cls in detected_objects]

print(f"Retrieved Context: Image contains {', '.join(object_names)}")
# Output: Retrieved Context: Image contains bus, person, person, person

Approfondimenti e risorse#

Explore solutions

Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più
Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più
Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più

Costruiamo insieme il futuro dell'AI!

Inizia il tuo percorso verso il futuro del machine learning