Prompt Engineering
Maîtrise l'ingénierie de prompts pour l'IA et la vision par ordinateur. Apprends à optimiser les entrées pour les LLM et les modèles multimodaux comme Ultralytics YOLO26 pour obtenir des résultats supérieurs.
Le prompt engineering est le processus stratégique de conception, de raffinement et d'optimisation du texte d'entrée pour guider les modèles d'(Intelligence Artificielle (IA) vers la production de résultats précis, pertinents et de haute qualité. Gagnant initialement en popularité avec l'essor des grands modèles de langage (LLM) comme GPT-4, cette discipline est devenue une compétence essentielle pour interagir avec les systèmes d'(intelligence artificielle générative) à travers diverses modalités, y compris le texte, l'image et la vidéo. Plutôt que de modifier les poids du modèle sous-jacent par un réentraînement, le prompt engineering exploite les connaissances existantes du modèle en formulant la tâche d'une manière que le système peut le mieux comprendre, comblant ainsi le fossé entre l'intention humaine et l'exécution de la machine.
Les mécanismes d'un prompting efficace#
À la base, le prompt engineering repose sur la compréhension de la manière dont les modèles de fondation traitent le contexte et les instructions. Un prompt bien construit réduit l'ambiguïté en fournissant des contraintes explicites, des formats de sortie souhaités (tels que JSON ou Markdown) et des informations d'arrière-plan pertinentes. Les praticiens avancés utilisent des techniques telles que l'apprentissage à peu d'exemples (few-shot learning), où l'utilisateur fournit quelques exemples de paires d'entrées-sorties dans le prompt pour démontrer le modèle souhaité.
Une autre stratégie puissante est le prompting par chaîne de pensée (chain-of-thought prompting), qui encourage le modèle à décomposer des tâches de raisonnement complexes en étapes intermédiaires. Cela améliore considérablement les performances sur les requêtes lourdes en logique. De plus, optimiser l'utilisation de la fenêtre de contexte—la limite de la quantité de texte qu'un modèle peut traiter en une seule fois—est crucial pour maintenir la cohérence lors de longues interactions. Des ressources externes, telles que le guide d'OpenAI sur la conception de prompts, soulignent l'importance du raffinement itératif pour gérer efficacement les cas limites.
Pertinence en vision par ordinateur#
Bien qu'il soit souvent associé au texte, le prompt engineering est de plus en plus vital en (Vision par Ordinateur (CV)). Les modèles multimodaux modernes et les détecteurs à vocabulaire ouvert, tels que YOLO-World, permettent aux utilisateurs de définir des cibles de détection en utilisant le traitement automatique du langage naturel (NLP) plutôt que des ID de classe numériques prédéfinis.
Dans ce contexte, le "prompt" est une description textuelle de l'objet (par ex., "personne portant un casque rouge"). Cette capacité, connue sous le nom d'apprentissage zéro-coup (zero-shot learning), permet aux systèmes de détecter des objets sur lesquels ils n'ont pas été explicitement entraînés en tirant parti des associations apprises entre les caractéristiques visuelles et les embeddings sémantiques. Pour les environnements de production à haute vitesse où les classes sont fixes, les développeurs pourraient éventuellement passer de modèles guidés par des prompts à des modèles efficaces et réentraînés comme YOLO26, mais le prompt engineering reste la clé du prototypage rapide et de la flexibilité.
Applications concrètes#
L'ingénierie de prompts crée de la valeur dans diverses industries en permettant une automatisation flexible et intelligente :
- Analytique visuelle dynamique : Dans l'IA dans le commerce de détail, les gérants de magasin utilisent des modèles de vision basés sur des prompts pour rechercher des articles spécifiques sans intervention technique. Un système peut être invité à suivre des "rayons vides" un jour et des "produits mal placés" le lendemain. Cette flexibilité permet aux entreprises d'adapter immédiatement leurs systèmes de détection d'objets aux tendances saisonnières.
- Création de contenu automatisée : Les équipes marketing s'appuient sur des prompts détaillés pour guider les générateurs de texte à image comme Stable Diffusion ou Midjourney. En concevant des prompts qui spécifient l'éclairage, le style artistique et la composition, les concepteurs peuvent générer rapidement des actifs visuels.
- Récupération intelligente des connaissances : Dans le support client, les ingénieurs conçoivent des "prompts système" qui demandent aux chatbots de répondre aux requêtes en utilisant uniquement des données d'entreprise vérifiées. C'est un composant clé de la Génération Augmentée par Récupération (RAG), garantissant que l'IA maintient un personnage utile tout en évitant les hallucinations dans les LLM.
Implémentation avec Ultralytics#
L'exemple suivant montre comment le prompt engineering est appliqué de manière programmatique en utilisant le package ultralytics. Ici, nous utilisons un modèle YOLO-World qui accepte des prompts textuels pour définir dynamiquement les objets à rechercher, contrastant avec les modèles standard comme YOLO26 qui utilisent des listes de classes fixes.
from ultralytics import YOLO
# Load a YOLO-World model capable of interpreting text prompts
model = YOLO("yolov8s-world.pt")
# Apply prompt engineering to define custom classes dynamically
# The model maps these text descriptions to visual features
model.set_classes(["person in safety vest", "forklift", "blue hardhat"])
# Run inference on an image
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Show results - the model only detects objects matching the prompts
results[0].show()Distinguer les concepts apparentés#
Pour déployer efficacement des solutions d'IA via la Plateforme Ultralytics, il est important de distinguer le prompt engineering des techniques d'optimisation similaires :
- Prompt Engineering vs Ajustement de prompt (Prompt Tuning) : Le prompt engineering implique la création manuelle d'entrées en langage naturel. En revanche, le prompt tuning est une méthode de réglage fin efficace en paramètres (PEFT) qui apprend des "prompts souples" (embeddings vectoriels continus) pendant une phase d'entraînement. Ces prompts souples sont des optimisations mathématiques invisibles pour l'utilisateur humain.
- Prompt Engineering vs Réglage fin (Fine-Tuning) : Le réglage fin met à jour de manière permanente les poids d'un modèle en utilisant un jeu de données d'entraînement spécifique pour le spécialiser pour une tâche. Le prompt engineering ne modifie pas le modèle lui-même ; il optimise uniquement l'entrée pendant l'inférence en temps réel.
- Prompt Engineering vs Injection de prompt (Prompt Injection) : Alors que l'ingénierie est constructive, l'injection de prompt est une vulnérabilité de sécurité où des entrées malveillantes manipulent le modèle pour ignorer ses contraintes de sécurité. Garantir la sécurité de l'IA nécessite une défense robuste contre de tels prompts contradictoires.






