Ultralytics YOLO27:
AI per la visione

Collegare l'elaborazione del linguaggio naturale e la computer vision

Scopri come l'elaborazione del linguaggio naturale (NLP) e la computer vision (CV) possono collaborare per trasformare i settori con sistemi di AI multimodali più intelligenti.

ABAbirami Vina9 min read
Collegare l'elaborazione del linguaggio naturale e la computer vision

L’elaborazione del linguaggio naturale (NLP) e la visione artificiale (CV) sono due rami distinti dell’intelligenza artificiale (AI) che hanno acquisito grande popolarità negli ultimi anni. Grazie ai progressi nell’AI, questi due rami sono oggi più interconnessi che mai.

Un ottimo esempio è il didascalicamento automatico delle immagini. La visione artificiale può essere utilizzata per analizzare e comprendere il contenuto di un’immagine, mentre l’elaborazione del linguaggio naturale può essere usata per generare una didascalia che la descriva. Il didascalicamento automatico delle immagini è comunemente utilizzato sulle piattaforme di social media per migliorare l’accessibilità e nei sistemi di gestione dei contenuti per aiutare a organizzare e taggare le immagini in modo efficiente.

Le innovazioni nell’NLP e nella Vision AI hanno portato a molti casi d’uso di questo tipo in diversi settori. In questo articolo analizzeremo più da vicino l’NLP e la visione artificiale e discuteremo del loro funzionamento. Esploreremo anche applicazioni interessanti che utilizzano entrambe queste tecnologie in combinazione. Iniziamo!

Comprendere l’NLP e la Vision AI#

L’NLP si concentra sull’interazione tra i computer e il linguaggio umano. Consente alle macchine di comprendere, interpretare e generare testo o parlato in modo significativo. Può essere utilizzato per attività come la traduzione, l’analisi del sentimento o la sintesi automatica.

La visione artificiale, invece, aiuta le macchine ad analizzare e gestire immagini e video. Può essere utilizzata per attività come il rilevamento di oggetti in una foto, il riconoscimento facciale, il tracciamento degli oggetti o la classificazione delle immagini. La tecnologia Vision AI consente alle macchine di comprendere e interagire meglio con il mondo visivo.

Un esempio di classificazione delle immagini

Fig. 1 Un esempio di classificazione delle immagini.

Quando viene integrato con la visione artificiale, l’NLP può attribuire un significato ai dati visivi combinando testo e immagini, consentendo una comprensione più approfondita. Come recita il proverbio, "un’immagine vale più di mille parole" e, se abbinata al testo, diventa ancora più potente, offrendo informazioni più ricche.

Esempi di collaborazione tra NLP e visione artificiale#

Probabilmente hai già visto NLP e visione artificiale lavorare insieme negli strumenti di uso quotidiano senza nemmeno accorgertene, ad esempio quando il tuo telefono traduce il testo di un’immagine.

Infatti, Google Translate utilizza sia l’elaborazione del linguaggio naturale sia la visione artificiale per tradurre il testo contenuto nelle immagini. Quando scatti una foto a un cartello stradale in un’altra lingua, la visione artificiale identifica ed estrae il testo, mentre l’NLP lo traduce nella lingua che preferisci.

NLP e CV collaborano per rendere il processo fluido ed efficiente, consentendo agli utenti di comprendere e utilizzare le informazioni tra lingue diverse in tempo reale. Questa perfetta integrazione delle tecnologie abbatte le barriere comunicative.

Funzionalità di Google Translate che traduce il testo di un’immagine

Fig. 2. La funzionalità Translate di Google.

Ecco altre applicazioni in cui NLP e visione artificiale collaborano:

  • Auto a guida autonoma: il CV può essere utilizzato per rilevare segnali stradali, corsie e ostacoli, mentre l’NLP può elaborare comandi vocali o il testo sui segnali stradali.
  • Lettori di documenti: la Vision AI può riconoscere il testo di documenti scansionati o scritto a mano, mentre l’elaborazione del linguaggio naturale può interpretare e sintetizzare le informazioni.
  • Ricerca visiva nelle app per lo shopping: la visione artificiale può identificare i prodotti nelle foto, mentre l’NLP elabora i termini di ricerca per migliorare i suggerimenti.
  • Strumenti didattici: il CV può riconoscere appunti scritti a mano o input visivi, mentre l’NLP può fornire spiegazioni o feedback basati sul contenuto.

Concetti chiave che collegano la visione artificiale e l’NLP#

Ora che abbiamo visto come vengono utilizzati la visione artificiale e l’elaborazione del linguaggio naturale, esploriamo come si combinano per abilitare l’AI cross-modale.

L’AI cross-modale combina la comprensione visiva della visione artificiale con la comprensione del linguaggio dell’NLP per elaborare e collegare informazioni provenienti da testo e immagini. Ad esempio, nel settore sanitario, l’AI cross-modale può aiutare ad analizzare una radiografia e generare un riepilogo scritto e chiaro dei potenziali problemi, aiutando i medici a prendere decisioni più rapide e accurate.

Comprensione del linguaggio naturale (NLU)#

La comprensione del linguaggio naturale è un sottoinsieme specifico dell’NLP che si concentra sull’interpretazione e sull’estrazione del significato dal testo analizzandone intento, contesto, semantica, tono e struttura. Mentre l’NLP elabora il testo grezzo, l’NLU consente alle macchine di comprendere il linguaggio umano in modo più efficace. Ad esempio, l’analisi sintattica è una tecnica di NLU che converte il testo scritto in un formato strutturato comprensibile alle macchine.

Diagramma della relazione tra NLP e NLU

Fig. 3. La relazione tra NLP e NLU.

L’NLU collabora con la visione artificiale quando i dati visivi contengono testo da comprendere. La visione artificiale, utilizzando tecnologie come il riconoscimento ottico dei caratteri (OCR), estrae il testo da immagini, documenti o video. Le attività possono includere la scansione di una ricevuta, la lettura del testo su un cartello o la digitalizzazione di appunti scritti a mano.

L’NLU elabora quindi il testo estratto per comprenderne significato, contesto e intento. Questa combinazione consente ai sistemi di fare più che limitarsi a riconoscere il testo. Possono categorizzare le spese riportate sulle ricevute oppure analizzare tono e sentimento. Insieme, la visione artificiale e l’NLU trasformano il testo visivo in informazioni significative e utilizzabili.

Prompt engineering#

Il prompt engineering è il processo di progettazione di prompt di input chiari, precisi e dettagliati per guidare i sistemi di AI generativa, come i modelli linguistici di grandi dimensioni (LLMs) e i modelli visione-linguaggio (VLMs), nella produzione degli output desiderati. Questi prompt fungono da istruzioni che aiutano il modello di AI a comprendere l’intento dell’utente.

Un prompt engineering efficace richiede la comprensione delle capacità del modello e la formulazione di input che massimizzino la sua capacità di generare risposte accurate, creative o ricche di informazioni. Questo è particolarmente importante per i modelli di AI che lavorano sia con testo sia con immagini.

Prendi ad esempio il modello DALL·E di OpenAI. Se gli chiedi di creare “un’immagine fotorealistica di un astronauta a cavallo”, può generare esattamente quell’immagine sulla base della tua descrizione. Questa capacità è molto utile in ambiti come il graphic design, dove i professionisti possono trasformare rapidamente idee testuali in mockup visivi, risparmiando tempo e aumentando la produttività.

Un’immagine creata utilizzando DALL-E di OpenAI

Fig. 4. Un’immagine creata utilizzando DALL-E di OpenAI.

Ti starai chiedendo come si colleghi tutto questo alla visione artificiale: non è semplicemente AI generativa? In realtà, le due tecnologie sono strettamente correlate. L’AI generativa si basa sui fondamenti della visione artificiale per creare output visivi completamente nuovi.

I modelli di AI generativa che creano immagini a partire da prompt testuali vengono addestrati su grandi dataset di immagini abbinate a descrizioni testuali. Questo consente loro di apprendere le relazioni tra il linguaggio e concetti visivi come oggetti, texture e relazioni spaziali.

Questi modelli non interpretano i dati visivi nello stesso modo dei sistemi tradizionali di visione artificiale, ad esempio riconoscendo gli oggetti nelle immagini del mondo reale. Utilizzano invece la comprensione appresa di questi concetti per generare nuovi elementi visivi sulla base dei prompt. Combinando questa conoscenza con prompt ben formulati, l’AI generativa può produrre immagini realistiche e dettagliate che corrispondono all’input dell’utente.

Risposta alle domande (QA)#

I sistemi di risposta alle domande sono progettati per comprendere le domande in linguaggio naturale e fornire risposte accurate e pertinenti. Utilizzano tecniche come il recupero delle informazioni, la comprensione semantica e il deep learning per interpretare e rispondere alle domande.

Modelli avanzati come GPT-4o di OpenAI possono gestire la risposta visiva alle domande (VQA), cioè analizzare e rispondere a domande sulle immagini. Tuttavia, GPT-4o non esegue direttamente attività di visione artificiale. Utilizza invece un encoder di immagini specializzato per elaborare le immagini, estrarre caratteristiche e combinarle con la propria comprensione del linguaggio per fornire risposte.

Capacità di ChatGPT di rispondere visivamente alle domande

Fig. 5. Capacità di ChatGPT di rispondere visivamente alle domande. Immagine dell’autore.

Altri sistemi possono spingersi oltre integrando completamente le capacità di visione artificiale. Questi sistemi possono analizzare direttamente immagini o video per identificare oggetti, scene o testo. Quando vengono combinati con l’elaborazione del linguaggio naturale, possono gestire domande più complesse sui contenuti visivi. Ad esempio, possono rispondere a domande come “Quali oggetti ci sono in questa immagine?” o “Chi è presente in questo filmato?”, rilevando e interpretando gli elementi visivi.

Apprendimento zero-shot (ZSL)#

L’apprendimento zero-shot (ZSL) è un metodo di machine learning che consente ai modelli di AI di gestire attività nuove e non viste senza essere addestrati specificamente su di esse. Lo fa utilizzando informazioni aggiuntive, come descrizioni o relazioni semantiche, per collegare ciò che il modello già conosce (classi viste) a categorie nuove e non viste.

Nell’elaborazione del linguaggio naturale, ZSL aiuta i modelli a comprendere e gestire argomenti sui quali non sono stati addestrati, basandosi sulle relazioni tra parole e concetti. Analogamente, nella visione artificiale, lo ZSL consente ai modelli di riconoscere oggetti o scene mai incontrati prima collegando caratteristiche visive, come ali o piume, a concetti noti, come gli uccelli.

Lo ZSL collega NLP e CV combinando la comprensione del linguaggio con il riconoscimento visivo, risultando particolarmente utile per le attività che coinvolgono entrambi. Ad esempio, nella risposta visiva alle domande, un modello può analizzare un’immagine comprendendo al contempo una domanda correlata per fornire una risposta accurata. È utile anche per attività come il didascalicamento delle immagini.

Punti chiave#

L’unione dell’elaborazione del linguaggio naturale e della visione artificiale ha portato a sistemi di AI in grado di comprendere sia il testo sia le immagini. Questa combinazione viene utilizzata in molti settori, dall’aiutare le auto a guida autonoma a leggere i segnali stradali, al miglioramento delle diagnosi mediche e alla maggiore sicurezza dei social media. Con il miglioramento di queste tecnologie, continueranno a semplificare la vita e ad aprire nuove opportunità in un’ampia gamma di ambiti. Per saperne di più, visita il nostro repository GitHub e partecipa alla nostra community. Esplora le applicazioni dell’AI nelle auto a guida autonoma e nell’agricoltura nelle nostre pagine dedicate alle soluzioni. 🚀

Explore solutions

Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più
Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più
Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più

Costruiamo insieme il futuro dell'AI!

Inizia il tuo percorso verso il futuro del machine learning