Large Action Models (LAM)
Esplora i Large Action Models (LAM) e scopri come alimentano gli agenti autonomi di AI. Impara a integrare Ultralytics YOLO26 per workflow visione-azione e l'automazione delle attività.
I modelli di azioni di grandi dimensioni (LAM) sono una classe avanzata di intelligenza artificiale generativa, progettata per andare oltre la generazione di testo eseguendo autonomamente attività e interagendo con ambienti digitali. A differenza dei modelli tradizionali, che elaborano e producono esclusivamente testo, i LAM fungono da motore cognitivo centrale per gli agenti di IA, traducendo le intenzioni umane in azioni concrete e articolate in più passaggi. Colmando il divario tra la comprensione del linguaggio naturale e l'esecuzione nel mondo reale, questi modelli rappresentano un passo avanti significativo verso l'intelligenza artificiale generale (AGI) e sistemi altamente autonomi.
Come funzionano i modelli di azioni di grandi dimensioni#
I LAM si basano sull'architettura fondamentale dei tradizionali modelli fondazionali, ma sono addestrati specificamente per interfacciarsi con software, API e ambienti web. Utilizzando tecniche come l'apprendimento per rinforzo e il function calling, un LAM può suddividere una richiesta complessa dell'utente in passaggi logici, navigare nelle interfacce grafiche e invocare endpoint API. Ad esempio, i recenti sviluppi di Claude 3.5 computer use di Anthropic e della famiglia xLAM di Salesforce dimostrano come questi sistemi possano fare clic autonomamente sui pulsanti, compilare moduli e gestire flussi di lavoro proprio come farebbe un operatore umano.
Quando vengono abbinati a sistemi di computer vision, i LAM diventano ancora più potenti. Gli input visivi possono essere elaborati da modelli altamente efficienti come Ultralytics YOLO26, consentendo al LAM di "vedere" l'ambiente circostante, interpretare il contesto visivo e attivare azioni programmatiche specifiche in base a ciò che rileva.
Applicazioni nel mondo reale#
I LAM stanno trasformando il modo in cui i settori affrontano l'automazione delle attività, passando dall'assistenza passiva all'esecuzione attiva.
- IA nel commercio al dettaglio e assistenza clienti: invece di limitarsi a rispondere alle domande dei clienti, un LAM può elaborare autonomamente la restituzione di un prodotto. Se un utente chiede di annullare un ordine, il modello può navigare nel software di fatturazione dell'azienda, verificare la policy, emettere il rimborso e aggiornare il database dell'inventario senza intervento umano.
- IA nell'amministrazione sanitaria: in ambito clinico, i LAM coordinano flussi di lavoro complessi. Possono estrarre le richieste dei pazienti, verificare la disponibilità dei medici, aggiornare automaticamente le cartelle cliniche elettroniche (EHR) tramite il software medico interno e finalizzare la programmazione degli appuntamenti.
Automatizzare i flussi di lavoro di computer vision con il codice#
I LAM vengono spesso integrati con modelli di visione per automatizzare le ispezioni visive. L'esempio Python seguente dimostra come un ipotetico flusso di lavoro LAM potrebbe utilizzare ultralytics per analizzare un'immagine e attivare un'azione automatizzata sull'inventario in base ai risultati del rilevamento degli oggetti.
from ultralytics import YOLO
# Load the recommended Ultralytics YOLO26 model for an agentic vision task
model = YOLO("yolo26n.pt")
# The LAM commands the model to scan a warehouse shelf image
results = model.predict("inventory_shelf.jpg")
# The LAM extracts actionable data to autonomously trigger a supply reorder
for result in results:
detected_items = len(result.boxes)
if detected_items < 10:
print(f"Low inventory ({detected_items} items). Action triggered: Reordering supplies via API.")Gli utenti possono implementare e monitorare senza difficoltà questi tipi di flussi di lavoro integrati tra visione e azione utilizzando la Ultralytics Platform, che offre un'infrastruttura cloud affidabile per le moderne soluzioni di IA.
Distinzione tra concetti correlati#
Per comprendere appieno il panorama moderno dell'IA, è utile distinguere i LAM da altri termini strettamente correlati:
- LAM vs. modello linguistico di grandi dimensioni (LLM): un LLM è progettato esclusivamente per elaborare, riepilogare e generare linguaggio, come un predittore di testo altamente avanzato. Un LAM incorpora questa comprensione del linguaggio, ma è progettato specificamente per interagire con strumenti esterni e completare azioni digitali.
- LAM vs. IA agentica: "IA agentica" descrive il sistema generale o l'entità software che opera autonomamente. Il modello di azioni di grandi dimensioni è la rete neurale sottostante, il "cervello" che fornisce all'agente la capacità di pianificare ed eseguire tali azioni.
- LAM vs. RAG agentico: il RAG agentico si concentra sul recupero e sulla sintesi autonomi di informazioni esterne per migliorare l'accuratezza di una risposta generata. Un LAM si concentra sulla manipolazione dei sistemi e sulla modifica degli stati, ad esempio prenotando un volo o spostando file, anziché limitarsi a recuperare dati.








