Context Engineering
Découvre comment l'ingénierie du contexte structure les charges utiles de données pour l'IA. Apprends les principales stratégies pour optimiser les LLM et les workflows de vision avec Ultralytics YOLO26.
L'ingénierie du contexte est l'art et la science de sélectionner, gérer et structurer les informations fournies aux modèles d'intelligence artificielle lors de l'inférence. Alors que l'ingénierie des prompts se concentre principalement sur la rédaction d'instructions efficaces, l'ingénierie du contexte va plus loin en optimisant systématiquement la charge utile de tokens — comme les données en temps réel, les connaissances externes et les retours des outils — qui remplit la fenêtre de contexte d'un modèle. L'objectif est de garantir qu'un modèle de langage de grande taille (LLM) ou un modèle vision-langage (VLM) reçoive précisément les informations de contexte dont il a besoin pour raisonner correctement, sans subir de surcharge d'informations.
Comme l'explique une récente étude approfondie sur l'ingénierie du contexte pour les LLM, cette discipline consiste à formaliser la récupération, le traitement et la gestion des informations. Elle constitue essentiellement le pipeline de mémoire et d'intelligence des applications d'IA modernes.
Affinement du contexte métier de l'IA#
Pour les entreprises, les modèles d'IA généralistes sont souvent limités par leur isolement vis-à-vis des données propriétaires. L'ingénierie du contexte facilite l'affinement du contexte métier de l'IA, ce qui signifie que les sorties d'un modèle sont spécifiquement adaptées aux workflows et aux flux de données en temps réel propres à une organisation. En intégrant la génération augmentée par récupération (RAG), les entreprises peuvent intégrer de manière transparente le contexte nécessaire — provenant de wikis internes, de systèmes de gestion de la relation client ou d'API en temps réel — directement dans le pipeline de traitement du modèle.
L'une des avancées les plus importantes dans ce domaine est le protocole de contexte de modèle (MCP), une norme ouverte récemment présentée par Anthropic et hébergée par la Fondation Linux. MCP résout le vaste problème de l'intégration des données en fournissant un connecteur universel pour les assistants d'IA, ce qui permet aux développeurs de standardiser la manière dont ils injectent les connaissances contextuelles de l'organisation dans leurs workflows agentiques, sans créer de pipelines personnalisés pour chaque nouvelle source de données.
Stratégies : mémoire contextuelle des rôles et optimisation#
Une ingénierie du contexte efficace repose sur une gestion stratégique de la mémoire afin d'empêcher le modèle d'oublier des instructions essentielles ou de produire des hallucinations. En utilisant correctement ces techniques, les développeurs peuvent passer de requêtes de chat ponctuelles à des systèmes autonomes hautement fiables, capables d'exécuter des workflows d'entreprise en plusieurs étapes :
- Écrire le contexte : Injecter des données spécifiques à forte valeur directement dans le prompt système afin de guider le comportement immédiat.
- Sélectionner le contexte : Récupérer dynamiquement uniquement les extraits les plus pertinents depuis une base de données vectorielle afin de fournir des connaissances organisationnelles en temps réel.
- Compresser le contexte : Résumer de longs documents pour respecter les limites de mémoire des modèles de grande capacité comme GPT-4o ou Google Gemini.
- Isoler le contexte : Répartir les tâches entre plusieurs sous-agents afin que chacun ne reçoive que les informations de contexte nécessaires à son rôle spécifique, une pratique souvent appelée gestion de la mémoire contextuelle des rôles.
Applications concrètes de l’IA#
L'ingénierie du contexte transforme activement les solutions d'IA fondées sur le texte et la vision dans de nombreux secteurs :
- Agents d'entreprise multi-outils : Un assistant interne d'entreprise utilise l'ingénierie du contexte pour aider les équipes commerciales. Au lieu qu'un utilisateur colle des informations à plusieurs reprises, l'IA récupère de manière sécurisée les données clients en temps réel depuis un CRM via MCP. Elle résume ensuite les communications récentes et rédige un e-mail de suivi ciblé, ce qui rationalise considérablement les opérations quotidiennes.
- Imagerie médicale contextuelle : Dans le domaine de la santé, les seules données visuelles suffisent rarement. Un pipeline de vision par ordinateur peut utiliser Ultralytics YOLO26 pour détecter des anomalies sur des radiographies. L'ingénierie du contexte combine ces boîtes englobantes visuelles avec les dossiers médicaux électroniques du patient (âge, antécédents, médicaments actuels) avant de transmettre la charge utile unifiée à un modèle d'apprentissage profond pour permettre un raisonnement diagnostique complet.
Ingénierie du contexte en vision par ordinateur#
Bien qu'elle soit souvent associée aux modèles de langage, l'ingénierie du contexte devient essentielle pour déployer des systèmes robustes de détection d'objets. Lorsqu'ils intègrent des modèles comme Ultralytics YOLO26, conçus avec PyTorch ou TensorFlow, les développeurs peuvent utiliser le contexte pour enrichir leurs prédictions destinées aux analyses en aval.
L'exemple Python suivant montre comment extraire une inférence predict à l'aide du package ultralytics et la mettre en forme avec des métadonnées externes afin de créer une charge utile de contexte enrichie :
import json
from ultralytics import YOLO
# Load the recommended YOLO26 model
model = YOLO("yolo26n.pt")
# Execute inference on an image
results = model("patient_scan.jpg")
# Extract human-readable class names from the detected bounding boxes
detected_objects = [model.names[int(box.cls[0])] for box in results[0].boxes]
# Apply context engineering: merge visual AI outputs with external metadata
enriched_context = {
"patient_id": "PX-8923",
"clinical_history": "Chronic cough, non-smoker",
"yolo_visual_findings": detected_objects,
"scan_timestamp": "2026-06-25T09:03:00Z",
}
# Output the structured context, ready to be ingested by an MCP server or LLM
print(json.dumps(enriched_context, indent=4))Pour créer, annoter et gérer facilement des jeux de données destinés à ces pipelines de vision complexes, les équipes peuvent utiliser la Ultralytics Platform. Pour les organisations qui déploient commercialement ces solutions dans des environnements privés, une licence Enterprise garantit une intégration sécurisée et conforme des architectures avancées d'ingénierie du contexte.









