Large Action Models (LAM)
Découvre les grands modèles d’action (LAM) et comment ils alimentent les agents autonomes d’IA. Apprends à intégrer Ultralytics YOLO26 dans des workflows de la vision vers l’action et l’automatisation des tâches.
Les grands modèles d'action (LAM) constituent une catégorie avancée d'intelligence artificielle générative conçue pour aller au-delà de la génération de texte en exécutant des tâches de manière autonome et en interagissant avec des environnements numériques. Contrairement aux modèles traditionnels qui se contentent de traiter et de produire du texte, les LAM agissent comme le moteur cognitif central des agents d'IA, en traduisant l'intention humaine en actions concrètes et exécutées en plusieurs étapes. En faisant le lien entre la compréhension du langage naturel et l'exécution dans le monde réel, ces modèles représentent une avancée majeure vers l'intelligence artificielle générale (AGI) et des systèmes hautement autonomes.
Fonctionnement des grands modèles d'action#
Les LAM s'appuient sur l'architecture fondamentale des modèles de fondation traditionnels, mais sont spécifiquement entraînés pour interagir avec des logiciels, des API et des environnements web. Grâce à des techniques telles que l'apprentissage par renforcement et l'appel de fonctions, un LAM peut décomposer une demande complexe d'utilisateur en étapes logiques, naviguer dans des interfaces utilisateur graphiques et exécuter des points de terminaison d'API. Par exemple, les développements récents liés à Claude 3.5 computer use d'Anthropic et à la famille xLAM de Salesforce montrent comment ces systèmes peuvent cliquer de manière autonome sur des boutons, remplir des formulaires et gérer des flux de travail comme le ferait un opérateur humain.
Associés à des systèmes de vision par ordinateur, les LAM deviennent encore plus puissants. Les entrées visuelles peuvent être traitées par des modèles très efficaces comme Ultralytics YOLO26, ce qui permet au LAM de « voir » son environnement, d'interpréter le contexte visuel et de déclencher des actions programmatiques spécifiques en fonction de ce qu'il détecte.
Applications concrètes#
Les LAM transforment la manière dont les secteurs abordent l'automatisation des tâches, en passant d'une assistance passive à une exécution active.
- IA dans le commerce de détail et le support client : Au lieu de se contenter de répondre aux questions des clients, un LAM peut traiter de manière autonome le retour d'un produit. Si un utilisateur demande l'annulation d'une commande, le modèle peut naviguer dans le logiciel de facturation de l'entreprise, vérifier la politique applicable, effectuer le remboursement et mettre à jour la base de données des stocks sans intervention humaine.
- IA dans l'administration des soins de santé : Dans les environnements cliniques, les LAM coordonnent des flux de travail complexes. Ils peuvent extraire les demandes des patients, vérifier les disponibilités des médecins, mettre automatiquement à jour les dossiers médicaux électroniques (EHR) via le logiciel médical interne et finaliser la prise de rendez-vous.
Automatisation des flux de travail de vision par ordinateur avec du code#
Les LAM sont fréquemment intégrés à des modèles de vision pour automatiser les inspections visuelles. L'exemple Python suivant montre comment un flux de travail hypothétique basé sur un LAM pourrait utiliser ultralytics pour analyser une image et déclencher une action automatisée sur les stocks en fonction des résultats de la détection d'objets.
from ultralytics import YOLO
# Load the recommended Ultralytics YOLO26 model for an agentic vision task
model = YOLO("yolo26n.pt")
# The LAM commands the model to scan a warehouse shelf image
results = model.predict("inventory_shelf.jpg")
# The LAM extracts actionable data to autonomously trigger a supply reorder
for result in results:
detected_items = len(result.boxes)
if detected_items < 10:
print(f"Low inventory ({detected_items} items). Action triggered: Reordering supplies via API.")Les utilisateurs peuvent déployer et surveiller facilement ces types de flux de travail intégrés combinant vision et action à l'aide de la Ultralytics Platform, qui fournit une infrastructure cloud robuste pour les solutions d'IA modernes.
Distinction entre concepts connexes#
Pour bien comprendre le paysage actuel de l'IA, il est utile de distinguer les LAM d'autres termes étroitement liés :
- LAM ou grand modèle de langage (LLM) : Un LLM est conçu exclusivement pour traiter, résumer et générer du langage, à la manière d'un prédicteur de texte hautement avancé. Un LAM intègre cette compréhension du langage, mais est spécifiquement conçu pour interagir avec des outils externes et accomplir des actions numériques.
- LAM ou IA agentique : L'« IA agentique » désigne le système global ou l'entité logicielle qui fonctionne de manière autonome. Le grand modèle d'action est le réseau neuronal sous-jacent — le « cerveau » — qui confère à l'agent sa capacité à planifier et à exécuter ces actions.
- LAM ou RAG agentique : Le RAG agentique se concentre sur la récupération et la synthèse autonomes d'informations externes afin d'améliorer la précision d'une réponse générée. Un LAM se concentre sur la manipulation de systèmes et la modification d'états (comme réserver un vol ou déplacer des fichiers), plutôt que sur la simple récupération de données.








