Prompt Engineering
Maîtrise l’ingénierie des prompts pour l’IA et la vision par ordinateur. Découvre comment optimiser les entrées pour les LLM et les modèles multimodaux comme Ultralytics YOLO26 afin d’obtenir de meilleurs résultats.
L’ingénierie des prompts est le processus stratégique de conception, d’affinage et d’optimisation du texte d’entrée afin de guider les modèles d’intelligence artificielle (AI) vers la production de résultats précis, pertinents et de haute qualité. Ayant initialement gagné en importance avec l’essor des grands modèles de langage (LLMs) comme GPT-4, cette discipline est devenue une compétence essentielle pour interagir avec les systèmes d’IA générative dans différentes modalités, notamment le texte, l’image et la vidéo. Plutôt que de modifier les poids du modèle sous-jacents par réentraînement, l’ingénierie des prompts exploite les connaissances existantes du modèle en formulant la tâche de manière à ce que le système puisse la comprendre au mieux, faisant le lien entre l’intention humaine et l’exécution par la machine.
Mécanismes de la formulation efficace de prompts#
À la base, l’ingénierie des prompts repose sur la compréhension de la façon dont les modèles fondamentaux traitent le contexte et les instructions. Un prompt bien construit réduit l’ambiguïté en fournissant des contraintes explicites, les formats de sortie souhaités (comme JSON ou Markdown) ainsi que les informations contextuelles pertinentes. Les spécialistes expérimentés utilisent des techniques comme l’apprentissage few-shot, dans lequel l’utilisateur fournit quelques exemples de paires entrée-sortie dans le prompt afin de montrer le modèle souhaité.
Une autre stratégie puissante est la formulation de prompts par chaîne de raisonnement, qui encourage le modèle à décomposer les tâches de raisonnement complexes en étapes intermédiaires. Cela améliore considérablement les performances sur les requêtes exigeant un raisonnement logique. En outre, optimiser l’utilisation de la fenêtre de contexte—la limite de quantité de texte qu’un modèle peut traiter en une seule fois—est essentiel pour maintenir la cohérence lors de longues interactions. Des ressources externes, comme le guide d’OpenAI sur la conception de prompts, soulignent l’importance de l’affinage itératif pour gérer efficacement les cas limites.
Pertinence en vision par ordinateur#
Bien qu’elle soit souvent associée au texte, l’ingénierie des prompts devient de plus en plus essentielle en vision par ordinateur (CV). Les modèles multimodaux modernes et les détecteurs à vocabulaire ouvert, comme YOLO-World, permettent aux utilisateurs de définir les cibles de détection à l’aide du traitement du langage naturel (NLP), plutôt qu’avec des identifiants numériques de classe prédéfinis.
Dans ce contexte, le « prompt » est une description textuelle de l’objet (par exemple, « personne portant un casque rouge »). Cette capacité, appelée apprentissage zero-shot, permet aux systèmes de détecter des objets sur lesquels ils n’ont pas été explicitement entraînés, en exploitant les associations apprises entre les caractéristiques visuelles et les embeddings sémantiques. Pour les environnements de production à haut débit où les classes sont fixes, les développeurs peuvent éventuellement passer de modèles guidés par prompts à des modèles réentraînés plus efficaces comme YOLO26, mais l’ingénierie des prompts reste essentielle pour le prototypage rapide et la flexibilité.
Applications concrètes#
L’ingénierie des prompts crée de la valeur dans divers secteurs en permettant une automatisation flexible et intelligente :
- Analyse visuelle dynamique : Dans le domaine de l’IA dans le commerce de détail, les responsables de magasin utilisent des modèles de vision guidés par prompts pour rechercher des articles précis sans intervention technique. Un système peut être invité à suivre les « rayons vides » un jour, puis les « produits mal placés » le lendemain. Cette flexibilité permet aux entreprises d’adapter immédiatement leurs systèmes de détection d’objets aux tendances saisonnières.
- Création de contenu automatisée : Les équipes marketing s’appuient sur des prompts détaillés pour guider les générateurs texte-vers-image comme Stable Diffusion ou Midjourney. En concevant des prompts qui précisent l’éclairage, le style artistique et la composition, les designers peuvent générer rapidement des éléments visuels.
- Récupération intelligente des connaissances : Dans le support client, les ingénieurs conçoivent des « prompts système » qui demandent aux chatbots de répondre aux questions en utilisant uniquement les données vérifiées de l’entreprise. Il s’agit d’un composant essentiel de la génération augmentée par récupération (RAG), qui garantit que l’IA conserve une personnalité serviable tout en évitant les hallucinations des LLMs.
Implémentation avec Ultralytics#
L’exemple suivant montre comment l’ingénierie des prompts est appliquée par programmation à l’aide du package ultralytics. Ici, nous utilisons un modèle YOLO-World qui accepte des prompts textuels pour définir dynamiquement les objets à rechercher, contrairement aux modèles standard comme YOLO26, qui utilisent des listes de classes fixes.
from ultralytics import YOLO
# Load a YOLO-World model capable of interpreting text prompts
model = YOLO("yolov8s-world.pt")
# Apply prompt engineering to define custom classes dynamically
# The model maps these text descriptions to visual features
model.set_classes(["person in safety vest", "forklift", "blue hardhat"])
# Run inference on an image
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Show results - the model only detects objects matching the prompts
results[0].show()Distinction entre concepts connexes#
Pour déployer efficacement des solutions d’IA via la plateforme Ultralytics, il est important de distinguer l’ingénierie des prompts des techniques d’optimisation similaires :
- Ingénierie des prompts par rapport au prompt tuning : L’ingénierie des prompts consiste à élaborer manuellement des entrées en langage naturel. En revanche, le prompt tuning est une méthode d’affinage efficace en paramètres (PEFT) qui apprend des « prompts souples » (des embeddings vectoriels continus) au cours d’une phase d’entraînement. Ces prompts souples sont des optimisations mathématiques invisibles pour l’utilisateur.
- Ingénierie des prompts par rapport au fine-tuning : Le fine-tuning met à jour de manière permanente les poids d’un modèle à l’aide d’un jeu de données d’entraînement spécifique afin de le spécialiser pour une tâche. L’ingénierie des prompts ne modifie pas le modèle lui-même ; elle optimise uniquement l’entrée lors de l’inférence en temps réel.
- Ingénierie des prompts par rapport à l’injection de prompts : Alors que l’ingénierie est constructive, l’injection de prompts est une vulnérabilité de sécurité dans laquelle des entrées malveillantes manipulent le modèle pour qu’il ignore ses contraintes de sécurité. Garantir la sécurité de l’IA nécessite une défense robuste contre ces prompts adverses.









