Large Language Model (LLM)
Esplora i fondamenti dei modelli linguistici di grandi dimensioni (LLM). Scopri l'architettura Transformer, la tokenizzazione e come combinare gli LLM con Ultralytics YOLO26.
Un modello linguistico di grandi dimensioni (LLM) è un sofisticato tipo di intelligenza artificiale (AI) addestrato su enormi set di dati per comprendere, generare e manipolare il linguaggio umano. Questi modelli rappresentano un'evoluzione significativa nell'apprendimento profondo (DL), utilizzando reti neurali con miliardi di parametri per acquisire schemi linguistici complessi, grammatica e relazioni semantiche. Al loro interno, la maggior parte degli LLM moderni si basa sull'architettura Transformer, che consente di elaborare sequenze di dati in parallelo anziché in modo sequenziale. Questa architettura impiega un meccanismo di autoattenzione, che permette al modello di valutare l'importanza di parole diverse in una frase rispetto alle altre, indipendentemente dalla loro distanza nel testo.
Meccanismi fondamentali degli LLM#
Il funzionamento di un LLM inizia con la tokenizzazione, un processo in cui il testo grezzo viene suddiviso in unità più piccole chiamate token (parole o sottoparole). Durante la fase di addestramento del modello, il sistema analizza petabyte di testo proveniente da Internet, libri e articoli. Esegue un apprendimento non supervisionato per prevedere il token successivo di una sequenza, apprendendo di fatto la struttura statistica del linguaggio.
Dopo questo addestramento iniziale, gli sviluppatori applicano spesso il fine-tuning per specializzare il modello in attività specifiche, come l'analisi medica o l'assistenza nella programmazione. Questa adattabilità spiega perché organizzazioni come lo Stanford Center for Research on Foundation Models li classifichino come "modelli di base": basi generali su cui vengono costruite applicazioni specifiche.
Applicazioni nel mondo reale#
Gli LLM sono passati dalla ricerca teorica ad applicazioni pratiche e di grande impatto in diversi settori:
- Assistenti virtuali intelligenti: il moderno servizio clienti si affida ampiamente ai chatbot basati sugli LLM. A differenza dei precedenti sistemi basati su regole, questi agenti sono in grado di gestire richieste articolate. Per migliorare la precisione e ridurre le allucinazioni, gli sviluppatori integrano la generazione aumentata dal recupero (RAG), consentendo al modello di consultare la documentazione aziendale esterna e aggiornata prima di rispondere.
- Sistemi multimodali visione-linguaggio: la frontiera dell'IA collega il testo ai dati visivi. I modelli visione-linguaggio (VLMs) consentono agli utenti di interrogare le immagini utilizzando il linguaggio naturale. Ad esempio, combinare un'interfaccia linguistica con un robusto rilevatore come YOLO26 permette ai sistemi di identificare e descrivere oggetti nei flussi video in tempo reale sulla base di comandi vocali.
Collegare testo e visione con il codice#
Sebbene gli LLM standard elaborino il testo, il settore si sta orientando verso l'IA multimodale. L'esempio seguente mostra come i prompt linguistici possano controllare attività di visione artificiale utilizzando YOLO-World, un modello che comprende descrittori testuali per il rilevamento a vocabolario aperto.
from ultralytics import YOLOWorld
# Load a model capable of understanding natural language prompts
model = YOLOWorld("yolov8s-world.pt")
# Define custom classes using text descriptions rather than fixed labels
model.set_classes(["person wearing a red helmet", "blue industrial machine"])
# Run inference to detect these specific text-defined objects
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Show results
results[0].show()Distinzione tra concetti correlati#
È importante distinguere gli LLM da termini più ampi o correlati:
- LLM e elaborazione del linguaggio naturale (NLP): l'NLP è il campo accademico generale che si occupa dell'interazione tra computer e linguaggio umano. Un LLM è uno specifico strumento o una specifica tecnologia utilizzata in questo campo per ottenere risultati all'avanguardia.
- LLM e IA generativa: l'IA generativa è una categoria che comprende qualsiasi IA in grado di creare nuovi contenuti. Gli LLM sono il sottoinsieme testuale di questa categoria, mentre modelli come Stable Diffusion rappresentano il sottoinsieme dedicato alla generazione di immagini.
Sfide e prospettive future#
Nonostante le loro capacità, gli LLM devono affrontare sfide relative ai pregiudizi nell'IA, poiché possono riprodurre inavvertitamente i pregiudizi presenti nei dati di addestramento. Inoltre, l'enorme potenza di calcolo necessaria per addestrare modelli come GPT-4 o Google Gemini solleva preoccupazioni riguardo al consumo energetico. La ricerca si concentra attualmente sulla quantizzazione dei modelli per rendere questi sistemi abbastanza efficienti da funzionare su hardware edge.
Per approfondimenti tecnici, l'articolo originale Attention Is All You Need fornisce la teoria di base dei Transformer. Puoi anche scoprire come NVIDIA stia ottimizzando l'hardware per questi carichi di lavoro massicci.









