Ultralytics YOLO27:
Torna al glossario di Ultralytics

Multimodal AI

Esplora l'AI multimodale e scopri come integra testo e visione per una comprensione sensibile al contesto. Impara a usare Ultralytics YOLO26 e i modelli a vocabolario aperto oggi stesso.

L'AI multimodale si riferisce a una sofisticata classe di sistemi di intelligenza artificiale (AI) progettati per elaborare, interpretare e sintetizzare simultaneamente informazioni provenienti da diversi tipi di dati, o «modalità». A differenza dei tradizionali sistemi unimodali, specializzati in un'unica fonte di input—come l'elaborazione del linguaggio naturale (NLP) per il testo o la visione artificiale (CV) per le immagini—l'AI multimodale imita la percezione umana integrando flussi di dati eterogenei. Questa integrazione può includere la combinazione di dati visivi (immagini, video) con dati linguistici (testo, audio parlato) e informazioni sensoriali (LiDAR, radar, dati termici). Sfruttando questi input combinati, questi modelli raggiungono una comprensione più profonda e consapevole del contesto di scenari complessi del mondo reale, avvicinandosi alle ampie capacità dell'intelligenza artificiale generale (AGI).

Come funzionano i sistemi multimodali#

Il principale punto di forza dell'AI multimodale risiede nella sua capacità di mappare diversi tipi di dati in uno spazio matematico condiviso, dove possono essere confrontati e combinati. Questo processo comprende generalmente tre fasi fondamentali: codifica, allineamento e fusione.

  1. Estrazione delle caratteristiche: reti neurali specializzate elaborano ogni modalità in modo indipendente per identificare i pattern principali. Ad esempio, una rete neurale convoluzionale (CNN) può estrarre caratteristiche visive da una fotografia, mentre un Transformer elabora la didascalia associata.

  2. Allineamento ed embedding: le caratteristiche estratte vengono convertite in vettori numerici ad alta dimensionalità. Il modello impara ad allineare questi vettori in modo che concetti semanticamente simili (ad esempio, l'immagine di un gatto e la parola «gatto» nel testo) si trovino vicini tra loro nello spazio vettoriale. Questo risultato viene spesso ottenuto mediante tecniche come l'apprendimento contrastivo, un metodo utilizzato notoriamente in modelli come CLIP di OpenAI.

  3. Fusione dei dati: il sistema unisce i dati allineati utilizzando avanzate tecniche di fusione. Le architetture moderne utilizzano meccanismi di attenzione per ponderare dinamicamente l'importanza di una modalità rispetto a un'altra in base al contesto, consentendo al modello di concentrarsi sul testo quando l'immagine è ambigua, o viceversa.

Applicazioni nel mondo reale#

L'AI multimodale ha reso possibili capacità precedentemente irrealizzabili con i sistemi a modalità singola, promuovendo l'innovazione in diversi settori.

  • Risposta a domande visive (VQA): in questa applicazione, un utente può presentare un'immagine a un sistema di AI e porre domande in linguaggio naturale al riguardo. Ad esempio, una persona con disabilità visiva potrebbe caricare una foto di una dispensa e chiedere: «Mi è rimasta della pasta?». Il modello elabora il contenuto visivo e la domanda testuale per fornire una risposta specifica.
  • Veicoli autonomi: le auto a guida autonoma si basano fortemente su input multimodali, combinando dati provenienti da telecamere, nuvole di punti LiDAR e radar per muoversi in sicurezza. Questa ridondanza garantisce che, se un sensore si guasta (ad esempio, una telecamera accecata dal riverbero del sole), gli altri possano mantenere gli standard di sicurezza definiti dalla Società degli ingegneri automobilistici (SAE).
  • Diagnostica sanitaria: i sistemi avanzati di AI medica analizzano l'analisi di immagini mediche (come MRI o radiografie) insieme all'anamnesi testuale non strutturata del paziente e ai dati genetici. Questa visione completa aiuta i medici a formulare diagnosi più accurate, un argomento discusso frequentemente in Nature Digital Medicine.
  • AI generativa: gli strumenti che creano immagini a partire da prompt testuali, come Stable Diffusion, si basano interamente sulla capacità del modello di comprendere la relazione tra descrizioni linguistiche e texture visive.

Rilevamento a vocabolario aperto con Ultralytics#

Mentre i rilevatori di oggetti standard si basano su elenchi predefiniti di categorie, gli approcci multimodali come YOLO-World consentono agli utenti di rilevare oggetti utilizzando prompt testuali a vocabolario aperto. Questo colma il divario tra i comandi linguistici e il riconoscimento visivo nell'ecosistema Ultralytics.

L'esempio seguente mostra come utilizzare la libreria ultralytics per eseguire il rilevamento a vocabolario aperto, in cui il modello rileva gli oggetti in base a input testuali personalizzati:

from ultralytics import YOLOWorld

# Load a pretrained YOLO-World model (Multimodal: Text + Vision)
model = YOLOWorld("yolov8s-world.pt")

# Define custom text prompts (modalities) for the model to identify
model.set_classes(["person wearing a red hat", "blue backpack"])

# Run inference: The model aligns the text prompts with visual features
results = model.predict("https://ultralytics.com/images/bus.jpg")

# Show the results
results[0].show()

Distinguere i termini correlati#

Per orientarsi nel panorama del machine learning moderno, è utile distinguere l'«AI multimodale» dai concetti correlati:

  • Apprendimento multimodale: si riferisce alla disciplina accademica e alla metodologia per addestrare algoritmi su tipi di dati eterogenei. «AI multimodale» si riferisce generalmente all'applicazione pratica o al sistema risultante.
  • Modelli linguistici di grandi dimensioni (LLMs): gli LLM tradizionali sono unimodali e vengono addestrati esclusivamente su dati testuali. Tuttavia, il settore si sta spostando verso i «modelli multimodali di grandi dimensioni» (LMMs), in grado di elaborare nativamente immagini e testo, una tendenza supportata da framework come PyTorch e TensorFlow.
  • Modelli di visione specializzati: modelli come l'avanzato Ultralytics YOLO26 sono esperti altamente specializzati nelle attività visive. Mentre un modello multimodale generico potrebbe descrivere sommariamente una scena, i modelli specializzati eccellono nel rilevamento degli oggetti ad alta velocità e precisione e nell'elaborazione in tempo reale su hardware edge.

Prospettive future#

La traiettoria dell'AI multimodale punta verso sistemi dotati di capacità di ragionamento superiori. Ancorando con successo il linguaggio alla realtà visiva e fisica, questi modelli stanno andando oltre la correlazione statistica verso una comprensione autentica. La ricerca condotta da istituzioni come Google DeepMind e lo Stanford Center for Research on Foundation Models continua a spingere i limiti della capacità delle macchine di percepire ambienti complessi.

In Ultralytics stiamo integrando questi progressi nella Ultralytics Platform, consentendoti di gestire i dati, addestrare modelli e distribuire soluzioni che sfruttano l'intero spettro delle modalità disponibili, combinando la velocità di YOLO26 con la versatilità degli input multimodali.

Explore solutions

Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più
Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più
Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più

Costruiamo insieme il futuro dell'AI!

Inizia il tuo percorso verso il futuro del machine learning