Chain-of-Thought Prompting
Esplora il prompting Chain-of-Thought (CoT) per migliorare il ragionamento dell'AI. Scopri come suddividere le attività in passaggi logici migliori la generazione di codice per Ultralytics YOLO26.
Il prompting con catena di pensiero (CoT) è una tecnica avanzata di ingegneria dei prompt che consente ai modelli linguistici di grandi dimensioni (LLMs) di risolvere attività di ragionamento complesse scomponendole in passaggi logici intermedi. Invece di chiedere a un modello di fornire immediatamente una risposta finale, il CoT incoraggia il sistema a generare una "catena di pensiero" che imita la risoluzione dei problemi umana. Questo ragionamento passo-passo migliora significativamente le prestazioni nelle attività che coinvolgono aritmetica, logica simbolica e ragionamento basato sul senso comune, trasformando il modo in cui interagiamo con i sistemi di intelligenza artificiale (AI).
Il meccanismo del ragionamento#
I modelli linguistici standard spesso hanno difficoltà con i problemi a più passaggi perché tentano di mappare direttamente l'input sull'output in un unico passaggio. Questo approccio "scatola nera" può portare a errori, in particolare quando il salto logico è troppo ampio. Il prompting con catena di pensiero risolve il problema inserendo passaggi di ragionamento tra la domanda in input e l'output finale.
Questo processo funziona generalmente in due modi:
- CoT zero-shot: l'utente aggiunge al prompt una semplice frase di attivazione come "Pensiamo passo dopo passo". In questo modo si attivano le capacità di ragionamento latenti del modello senza richiedere esempi specifici.
- CoT few-shot: il prompt include alcuni esempi (esemplari) di domande associate alle relative soluzioni passo-passo. Questo sfrutta il few-shot learning per mostrare al modello esattamente come strutturare la propria logica prima di affrontare un nuovo problema.
Generando esplicitamente un ragionamento intermedio, il modello ha più opportunità di correggersi e offre trasparenza sul modo in cui è giunto a una conclusione. Questo è fondamentale per ridurre le allucinazioni negli LLM, in cui i modelli potrebbero altrimenti affermare con sicurezza fatti errati.
Applicazioni nel mondo reale#
Sebbene sia stato inizialmente sviluppato per la logica basata sul testo, il prompting con catena di pensiero ha applicazioni significative se combinato con altri ambiti dell'AI, come la computer vision e la generazione di codice.
1. Migliorare la generazione di codice per la computer vision#
Gli sviluppatori usano il CoT per guidare gli LLM nella scrittura di script software complessi per attività come il rilevamento degli oggetti. Invece di una richiesta vaga come "scrivi il codice per trovare le auto", un prompt CoT potrebbe strutturare la richiesta in questo modo: "Per prima cosa, importa le librerie necessarie. Secondo, carica il modello preaddestrato. Terzo, definisci la sorgente dell'immagine. Infine, esegui il ciclo di predizione." Questo approccio strutturato garantisce che il codice generato per modelli come YOLO26 sia sintatticamente corretto e logicamente coerente.
2. Processo decisionale autonomo#
Nel campo dei veicoli autonomi, i sistemi devono elaborare dati visivi e prendere decisioni fondamentali per la sicurezza. Un approccio Chain-of-Thought consente al sistema di articolare la propria logica: "Rilevo un pedone vicino alle strisce pedonali. Il pedone è rivolto verso la strada. Il semaforo è verde per me, ma il pedone potrebbe attraversare. Pertanto, rallenterò e mi preparerò a fermarmi." Questo rende interpretabili le decisioni dell'AI ed è in linea con i principi dell'AI spiegabile (XAI).
Chain-of-Thought in azione#
Sebbene il CoT sia principalmente una tecnica di linguaggio naturale, può essere implementato a livello programmatico per garantire interazioni coerenti con i modelli di visione. Il seguente esempio in Python mostra come uno sviluppatore potrebbe strutturare un prompt per guidare un LLM (qui simulato) nella generazione di codice di inferenza valido per la piattaforma Ultralytics.
# Example of structuring a Chain-of-Thought prompt for an LLM
# This prompt guides the model to write a valid YOLO26 inference script
cot_prompt = """
Task: Write a Python script to detect objects using YOLO26.
Chain of Thought:
1. Import the YOLO class from the 'ultralytics' library.
2. Load the 'yolo26n.pt' model weights (the latest nano model).
3. Load a sample image using a URL or local path.
4. Run the predict() function and save the results.
Based on these steps, generate the Python code below:
"""
# In a real application, you would send 'cot_prompt' to an LLM API
print(f"Structured Prompt for LLM:\n{cot_prompt}")Distinzione tra concetti correlati#
È importante distinguere il prompting con catena di pensiero da termini simili nel panorama dell'apprendimento automatico (ML):
- Prompt chaining: consiste nel collegare più chiamate separate al modello, in cui l'output di un passaggio diventa l'input del successivo. Il CoT avviene all'interno di un singolo prompt per sollecitare il ragionamento interno, mentre il prompt chaining orchestra un flusso di lavoro attraverso più interazioni.
- Generazione aumentata dal recupero (RAG): RAG si concentra sul recupero di dati esterni (come documenti o database) per ancorare la conoscenza del modello. Il CoT si concentra invece sul processo di ragionamento in sé. Spesso vengono combinati: si usa RAG per ottenere i fatti e il CoT per ragionarci sopra.
- Prompt tuning: è un metodo di fine-tuning efficiente in termini di parametri che ottimizza prompt soft continui (vettori) durante l'addestramento. Il CoT è una strategia discreta in linguaggio naturale applicata durante l'inferenza in tempo reale senza modificare i pesi del modello.
Prospettive future#
Con la continua evoluzione dei modelli di base, il prompting con catena di pensiero sta diventando una best practice standard per sfruttarne appieno il potenziale. Le ricerche di gruppi come Google DeepMind suggeriscono che, all'aumentare delle dimensioni dei modelli, la loro capacità di eseguire ragionamenti CoT migliora notevolmente. Questa evoluzione sta aprendo la strada ad agenti più affidabili e autonomi, capaci di gestire flussi di lavoro complessi in settori che spaziano dalla sanità alla produzione intelligente.









