Chain-of-Thought Prompting
Explore le prompting Chain-of-Thought (CoT) pour améliorer le raisonnement de l'IA. Découvre comment décomposer les tâches en étapes logiques améliore la génération de code pour Ultralytics YOLO26.
Le prompting par raisonnement en chaîne (CoT) est une technique avancée d’ingénierie des prompts qui permet aux grands modèles de langage (LLM) de résoudre des tâches de raisonnement complexes en les décomposant en étapes logiques intermédiaires. Plutôt que de demander à un modèle de fournir immédiatement une réponse finale, le CoT encourage le système à générer une « chaîne de pensée » qui imite la résolution de problèmes humaine. Ce raisonnement étape par étape améliore considérablement les performances pour les tâches impliquant l’arithmétique, la logique symbolique et le raisonnement de bon sens, transformant ainsi notre manière d’interagir avec les systèmes d’intelligence artificielle (AI).
Le mécanisme du raisonnement#
Les modèles de langage standard ont souvent du mal à résoudre les problèmes à plusieurs étapes, car ils tentent de faire correspondre directement l’entrée à la sortie en un seul passage. Cette approche en « boîte noire » peut entraîner des erreurs, en particulier lorsque le saut logique est trop important. Le prompting par raisonnement en chaîne remédie à cela en insérant des étapes de raisonnement entre la question d’entrée et la sortie finale.
Ce processus fonctionne généralement de deux façons :
- CoT zero-shot : l’utilisateur ajoute au prompt une simple phrase déclencheuse telle que « Réfléchissons étape par étape ». Cela active les capacités de raisonnement latentes du modèle sans nécessiter d’exemples spécifiques.
- CoT few-shot : le prompt contient quelques exemples (exemplaires) de questions associées à leurs solutions étape par étape. Cela exploite l’apprentissage few-shot pour montrer au modèle exactement comment structurer sa logique avant de tenter de résoudre un nouveau problème.
En générant explicitement un raisonnement intermédiaire, le modèle dispose de davantage d’occasions de se corriger et rend transparent le processus qui l’a conduit à une conclusion. Cela est essentiel pour réduire les hallucinations dans les LLM, lorsque les modèles pourraient autrement énoncer avec assurance des faits incorrects.
Applications concrètes#
Bien qu’il ait d’abord été développé pour la logique fondée sur le texte, le prompting par raisonnement en chaîne offre de puissantes applications lorsqu’il est combiné à d’autres domaines de l’IA, tels que la vision par ordinateur et la génération de code.
1. Améliorer la génération de code pour la vision par ordinateur#
Les développeurs utilisent le CoT pour guider les LLM dans l’écriture de scripts logiciels complexes pour des tâches telles que la détection d’objets. Au lieu d’une demande vague comme « écris du code pour trouver des voitures », un prompt CoT peut structurer la demande ainsi : « Premièrement, importe les bibliothèques nécessaires. Deuxièmement, charge le modèle préentraîné. Troisièmement, définis la source de l’image. Enfin, exécute la boucle de prédiction. » Cette approche structurée garantit que le code généré pour des modèles tels que YOLO26 est syntaxiquement correct et logiquement cohérent.
2. Prise de décision autonome#
Dans le domaine des véhicules autonomes, les systèmes doivent traiter des données visuelles et prendre des décisions critiques pour la sécurité. Une approche par raisonnement en chaîne permet au système d’expliciter sa logique : « Je détecte un piéton près du passage piéton. Le piéton fait face à la route. Le feu est vert pour moi, mais le piéton pourrait s’engager. Je vais donc ralentir et me préparer à m’arrêter. » Cela rend les décisions de l’IA interprétables et respecte les principes de l’IA explicable (XAI).
Le raisonnement en chaîne en pratique#
Bien que le CoT soit principalement une technique de langage naturel, il peut être implémenté par programmation afin de garantir des interactions cohérentes avec les modèles de vision. L’exemple Python suivant montre comment un développeur pourrait structurer un prompt pour guider un LLM (simulé ici) dans la génération de code d’inférence valide pour la plateforme Ultralytics.
# Example of structuring a Chain-of-Thought prompt for an LLM
# This prompt guides the model to write a valid YOLO26 inference script
cot_prompt = """
Task: Write a Python script to detect objects using YOLO26.
Chain of Thought:
1. Import the YOLO class from the 'ultralytics' library.
2. Load the 'yolo26n.pt' model weights (the latest nano model).
3. Load a sample image using a URL or local path.
4. Run the predict() function and save the results.
Based on these steps, generate the Python code below:
"""
# In a real application, you would send 'cot_prompt' to an LLM API
print(f"Structured Prompt for LLM:\n{cot_prompt}")Distinction entre concepts connexes#
Il est important de distinguer le prompting par raisonnement en chaîne des termes similaires dans le domaine de l’apprentissage automatique (ML) :
- Enchaînement de prompts : cela consiste à relier plusieurs appels distincts au modèle, où la sortie d’une étape devient l’entrée de la suivante. Le CoT s’effectue au sein d’un seul prompt pour susciter un raisonnement interne, tandis que l’enchaînement de prompts orchestre un workflow à travers plusieurs interactions.
- Génération augmentée par récupération (RAG) : le RAG se concentre sur la récupération de données externes (telles que des documents ou des bases de données) afin d’ancrer les connaissances du modèle. Le CoT se concentre sur le processus de raisonnement lui-même. Ces approches sont souvent combinées : le RAG sert à obtenir les faits, et le CoT à raisonner à leur sujet.
- Ajustement de prompts : il s’agit d’une méthode d’ajustement fin efficace en matière de paramètres qui optimise des prompts souples continus (vecteurs) pendant l’entraînement. Le CoT est une stratégie discrète en langage naturel appliquée lors de l’inférence en temps réel, sans modifier les poids du modèle.
Perspectives d’avenir#
À mesure que les modèles de fondation continuent d’évoluer, le prompting par raisonnement en chaîne devient une bonne pratique standard pour exploiter pleinement leur potentiel. Des recherches menées par des groupes tels que Google DeepMind suggèrent qu’à mesure que les modèles augmentent en taille, leur capacité à effectuer un raisonnement CoT s’améliore considérablement. Cette évolution ouvre la voie à des agents plus fiables et autonomes, capables de gérer des workflows complexes dans des secteurs allant de la santé à la fabrication intelligente.









