Prompt Enrichment
Apprends comment l'enrichissement de prompts automatise l'augmentation des entrées pour améliorer la précision de l'IA. Découvre comment utiliser cette technique avec Ultralytics YOLO26 pour des tâches de vision plus intelligentes.
L'enrichissement des prompts est le processus automatisé qui consiste à augmenter l'entrée initiale d'un utilisateur avec un contexte pertinent, des instructions spécifiques ou des données supplémentaires avant de la soumettre à un modèle d'Artificial Intelligence (AI). Cette technique agit comme une couche de middleware intelligente qui optimise l'interaction entre les humains et les machines, garantissant que les Large Language Models (LLMs) et les systèmes de vision par ordinateur reçoivent des requêtes complètes. En injectant des détails qu'un utilisateur pourrait omettre — tels que des préférences historiques, des données de localisation ou des contraintes techniques — l'enrichissement des prompts améliore considérablement la accuracy et la personnalisation de la sortie du modèle sans exiger que l'utilisateur soit un expert en rédaction d'instructions détaillées.
Le mécanisme de l'enrichissement#
La fonction principale de l'enrichissement des prompts est de combler le fossé entre une intention humaine vague et l'entrée précise et riche en données dont les modèles ont besoin pour des performances optimales. Lorsqu'une requête est reçue, le système l'analyse et récupère les informations de base nécessaires à partir d'un knowledge graph ou d'une base de données structurée. Ces données récupérées sont formatées par programme et ajoutées au prompt d'origine.
Par exemple, dans les flux de travail de Natural Language Processing (NLP), une question simple comme "Quel est le statut ?" est contextuellement insuffisante. Un système d'enrichissement identifie la session active, récupère le dernier numéro de commande d'une transactional database et réécrit le prompt comme suit : "L'utilisateur demande des informations sur la commande n°998, qui est actuellement en transit. Fournissez une mise à jour sur l'expédition en fonction de ce statut." Ce processus utilise souvent des vector databases pour trouver rapidement un contexte sémantiquement pertinent à injecter.
Applications concrètes#
L'enrichissement des prompts est essentiel pour déployer des applications d'generative AI robustes dans divers secteurs, en améliorant à la fois les systèmes textuels et basés sur la vision :
-
Support client sensible au contexte : Dans les services d'assistance automatisés, un chatbot utilise l'enrichissement pour accéder à l'historique des achats d'un client et à son environnement technique. Au lieu de demander à l'utilisateur la version de son appareil, le système la récupère à partir des métadonnées du compte et l'injecte dans le prompt. Cela permet à l'AI agent de fournir des étapes de dépannage immédiates et spécifiques à l'appareil, améliorant considérablement le customer experience.
-
Configuration dynamique de la vision par ordinateur : Dans les opérations de sécurité, un utilisateur peut simplement basculer un paramètre "Mode Nuit". En arrière-plan, l'enrichissement des prompts traduit cette intention de haut niveau en classes d'objets spécifiques pour un détecteur à vocabulaire ouvert comme YOLO-World. Le système enrichit le prompt pour rechercher spécifiquement une "lampe de poche", un "mouvement suspect" ou une "personne non autorisée", permettant au modèle d'adapter dynamiquement sa focalisation sur l'object detection.
Exemple : Enrichissement dynamique des classes#
L'exemple Python suivant démontre le concept d'enrichissement des prompts à l'aide du paquet ultralytics. Ici, l'intention de haut niveau d'un utilisateur est enrichie par programme en une liste de classes descriptives spécifiques que le modèle recherche.
from ultralytics import YOLO
def run_enriched_inference(user_mode):
"""Enriches a simple user mode into specific detection prompts."""
# Load a YOLO-World model capable of open-vocabulary detection
model = YOLO("yolov8s-world.pt")
# Enrichment Logic: Map simple user intent to detailed class prompts
context_map = {
"site_safety": ["hard hat", "safety vest", "gloves"],
"traffic": ["car", "bus", "traffic light", "pedestrian"],
}
# Inject the enriched context into the model
enriched_classes = context_map.get(user_mode, ["object"])
model.set_classes(enriched_classes)
# The model now looks for the specific enriched terms
print(f"Mode: {user_mode} -> Enriched Prompt: {enriched_classes}")
run_enriched_inference("site_safety")Enrichissement des prompts vs concepts apparentés#
Pour mettre en œuvre des Machine Learning Operations (MLOps) efficaces, il est utile de distinguer l'enrichissement des prompts de termes similaires :
- Retrieval-Augmented Generation (RAG) : Le RAG est une méthode spécifique d'enrichissement. Il fait strictement référence au mécanisme de récupération de documents pertinents à partir d'un corpus externe pour ancrer la réponse du modèle. L'enrichissement est le concept plus large qui inclut le RAG mais couvre également l'injection de données de session statiques, de métadonnées utilisateur ou de l'heure du système sans nécessairement effectuer une semantic search complexe.
- Prompt Engineering : Il s'agit de l'art manuel de concevoir des prompts efficaces. L'enrichissement est un processus automatisé qui applique les principes de l'ingénierie des prompts de manière dynamique à l'exécution.
- Prompt Tuning : Il s'agit d'une technique de parameter-efficient fine-tuning (PEFT) où des "prompts souples" (tensors apprenables) sont optimisés pendant l'entraînement. L'enrichissement des prompts se produit entièrement lors de l'real-time inference et ne modifie pas les model weights.
- Few-Shot Learning : Cela implique de fournir des exemples dans le prompt pour enseigner une tâche au modèle. Les systèmes d'enrichissement injectent souvent ces exemples de few-shot dynamiquement en fonction du type de tâche, combinant ainsi efficacement les deux concepts.
Pertinence dans les systèmes d'IA modernes#
À mesure que des modèles tels qu'Ultralytics YOLO26 et GPT-4 deviennent plus performants, le goulot d'étranglement se déplace souvent vers la qualité de l'entrée. L'enrichissement des prompts atténue les hallucinations in LLMs en ancrant le modèle dans des données factuelles et fournies. En computer vision (CV), il permet des systèmes de détection en zero-shot learning flexibles qui peuvent s'adapter instantanément à de nouveaux environnements sans réentraînement, simplement en modifiant les prompts textuels fournis au système. Cette flexibilité est cruciale pour construire des solutions d'multi-modal AI évolutives capables de raisonner à la fois sur le texte et sur les images. Les utilisateurs cherchant à gérer les ensembles de données utilisés pour ancrer ces systèmes s'appuient souvent sur des outils tels que l'Ultralytics Platform pour organiser et annoter efficacement leurs informations.






