Large Language Model (LLM)
Explore les fondamentaux des grands modèles de langage (LLMs). Découvre l’architecture Transformer, la tokenisation et comment combiner les LLMs avec Ultralytics YOLO26.
Un grand modèle de langage (LLM) est un type sophistiqué d'intelligence artificielle (AI) entraîné sur d'immenses jeux de données pour comprendre, générer et manipuler le langage humain. Ces modèles représentent une évolution majeure de l'apprentissage profond (DL), en utilisant des réseaux neuronaux dotés de milliards de paramètres pour capturer des structures linguistiques complexes, la grammaire et les relations sémantiques. À la base, la plupart des LLM modernes reposent sur l'architecture Transformer, qui leur permet de traiter des séquences de données en parallèle plutôt que séquentiellement. Cette architecture utilise un mécanisme d'auto-attention, permettant au modèle d'évaluer l'importance de différents mots dans une phrase les uns par rapport aux autres, quelle que soit leur distance dans le texte.
Mécanismes fondamentaux des LLM#
Le fonctionnement d'un LLM commence par la tokenisation, un processus qui consiste à décomposer le texte brut en unités plus petites appelées tokens (mots ou sous-mots). Pendant la phase d'entraînement du modèle, le système analyse des pétaoctets de texte provenant d'Internet, de livres et d'articles. Il s'appuie sur l'apprentissage non supervisé pour prédire le token suivant d'une séquence, apprenant ainsi efficacement la structure statistique du langage.
Après cet entraînement initial, les développeurs appliquent souvent un ajustement fin pour spécialiser le modèle dans des tâches précises, comme l'analyse médicale ou l'assistance au codage. Cette adaptabilité explique pourquoi des organisations comme le Centre de recherche sur les modèles de fondation de Stanford les classent parmi les « modèles de fondation », c'est-à-dire de larges bases sur lesquelles sont construites des applications spécifiques.
Applications concrètes#
Les LLM sont passés de la recherche théorique à des applications pratiques à fort impact dans divers secteurs :
- Assistants virtuels intelligents : Le service client moderne repose largement sur des [chatbots](https://ultralytics-translation-0.invalid alimentés par des LLM. Contrairement aux anciens systèmes basés sur des règles, ces agents peuvent traiter des demandes nuancées. Pour améliorer la précision et réduire les hallucinations, les développeurs intègrent la génération augmentée par récupération (RAG), ce qui permet au modèle de consulter une documentation d'entreprise externe et à jour avant de répondre.
- Systèmes de vision-langage multimodaux : La frontière de l'IA relie le texte aux données visuelles. Les modèles vision-langage (VLMs) permettent aux utilisateurs d'interroger des images en langage naturel. Par exemple, combiner une interface linguistique avec un détecteur robuste comme YOLO26 permet aux systèmes d'identifier et de décrire des objets dans des flux vidéo en temps réel à partir de commandes vocales.
Relier le texte et la vision avec du code#
Alors que les LLM standard traitent le texte, le secteur s'oriente vers l'IA multimodale. L'exemple suivant montre comment des invites linguistiques peuvent contrôler des tâches de vision par ordinateur à l'aide de YOLO-World, un modèle qui comprend les descripteurs textuels pour la détection à vocabulaire ouvert.
from ultralytics import YOLOWorld
# Load a model capable of understanding natural language prompts
model = YOLOWorld("yolov8s-world.pt")
# Define custom classes using text descriptions rather than fixed labels
model.set_classes(["person wearing a red helmet", "blue industrial machine"])
# Run inference to detect these specific text-defined objects
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Show results
results[0].show()Distinction entre concepts connexes#
Il est important de distinguer les LLM des termes plus larges ou connexes :
- LLM et traitement automatique du langage naturel (NLP) : Le NLP est le domaine universitaire général qui étudie les interactions entre les ordinateurs et le langage humain. Un LLM est un outil ou une technologie spécifique utilisé dans ce domaine pour obtenir des résultats de pointe.
- LLM et IA générative : L'IA générative est une catégorie qui englobe toute IA capable de créer du contenu inédit. Les LLM constituent le sous-ensemble textuel de cette catégorie, tandis que des modèles comme Stable Diffusion représentent le sous-ensemble consacré à la génération d'images.
Défis et perspectives d’avenir#
Malgré leurs capacités, les LLM sont confrontés à des difficultés liées aux biais dans l'IA, car ils peuvent reproduire involontairement les préjugés présents dans leurs données d'entraînement. En outre, la puissance de calcul considérable nécessaire pour entraîner des modèles comme GPT-4 ou Google Gemini soulève des préoccupations concernant la consommation d'énergie. Les recherches portent actuellement sur la quantification des modèles afin de rendre ces systèmes suffisamment efficaces pour fonctionner sur du matériel en périphérie.
Pour approfondir les aspects techniques, l'article original Attention Is All You Need présente les fondements théoriques des Transformers. Tu peux également découvrir comment NVIDIA optimise le matériel pour ces charges de travail massives.









