Prompt Engineering
Padroneggia il prompt engineering per l’IA e la computer vision. Impara a ottimizzare gli input per gli LLM e i modelli multimodali come Ultralytics YOLO26 per ottenere risultati superiori.
L'ingegneria dei prompt è il processo strategico di progettazione, perfezionamento e ottimizzazione del testo di input per guidare i modelli di Intelligenza artificiale (AI) verso la produzione di risultati accurati, pertinenti e di alta qualità. Inizialmente affermatasi con la diffusione dei modelli linguistici di grandi dimensioni (LLMs) come GPT-4, questa disciplina si è evoluta fino a diventare una competenza fondamentale per interagire con i sistemi di IA generativa in diverse modalità, tra cui testo, immagini e video. Anziché modificare i pesi del modello sottostanti tramite il riaddestramento, l'ingegneria dei prompt sfrutta le conoscenze già presenti nel modello formulando l'attività in modo che il sistema possa comprenderla al meglio, colmando il divario tra l'intento umano e l'esecuzione da parte della macchina.
Meccanismi alla base di prompt efficaci#
Alla base, l'ingegneria dei prompt si fonda sulla comprensione di come i modelli fondazionali elaborano il contesto e le istruzioni. Un prompt ben strutturato riduce l'ambiguità fornendo vincoli espliciti, formati di output desiderati (come JSON o Markdown) e informazioni di contesto pertinenti. Gli esperti utilizzano tecniche avanzate come il few-shot learning, in cui l'utente fornisce nel prompt alcuni esempi di coppie input-output per dimostrare lo schema desiderato.
Un'altra strategia efficace è il chain-of-thought prompting, che incoraggia il modello a scomporre le attività di ragionamento complesse in passaggi intermedi. Ciò migliora significativamente le prestazioni nelle query basate soprattutto sulla logica. Inoltre, ottimizzare l'uso della finestra di contesto—il limite alla quantità di testo che un modello può elaborare contemporaneamente—è fondamentale per mantenere la coerenza nelle interazioni prolungate. Risorse esterne, come la guida di OpenAI sulla progettazione dei prompt, sottolineano l'importanza del perfezionamento iterativo per gestire efficacemente i casi limite.
Rilevanza nella visione artificiale#
Sebbene sia spesso associata al testo, l'ingegneria dei prompt è sempre più importante nella visione artificiale (CV). I moderni modelli multimodali e i rilevatori a vocabolario aperto, come YOLO-World, consentono agli utenti di definire gli obiettivi di rilevamento usando l'elaborazione del linguaggio naturale (NLP) anziché ID numerici delle classi predefiniti.
In questo contesto, il "prompt" è una descrizione testuale dell'oggetto (ad esempio, "persona che indossa un casco rosso"). Questa capacità, nota come zero-shot learning, consente ai sistemi di rilevare oggetti sui quali non sono stati addestrati esplicitamente, sfruttando le associazioni apprese tra caratteristiche visive ed embedding semantici. Negli ambienti di produzione ad alta velocità in cui le classi sono fisse, gli sviluppatori potrebbero infine passare da modelli basati su prompt a modelli efficienti e riaddestrati come YOLO26, ma l'ingegneria dei prompt rimane fondamentale per la prototipazione rapida e la flessibilità.
Applicazioni nel mondo reale#
L'ingegneria dei prompt genera valore in diversi settori, consentendo un'automazione flessibile e intelligente:
- Analisi visiva dinamica: nell'IA nel commercio al dettaglio, i responsabili dei negozi utilizzano modelli di visione basati su prompt per cercare articoli specifici senza interventi tecnici. È possibile chiedere a un sistema di monitorare gli "scaffali vuoti" un giorno e i "prodotti fuori posto" quello successivo. Questa flessibilità consente alle aziende di adattare immediatamente i propri sistemi di rilevamento degli oggetti alle tendenze stagionali.
- Creazione automatizzata di contenuti: i team di marketing si affidano a prompt dettagliati per guidare i generatori da testo a immagine come Stable Diffusion o Midjourney. Progettando prompt che specificano illuminazione, stile artistico e composizione, i designer possono generare rapidamente risorse visive.
- Recupero intelligente delle conoscenze: nell'assistenza clienti, gli ingegneri progettano "prompt di sistema" che istruiscono i chatbot a rispondere alle domande utilizzando esclusivamente dati aziendali verificati. Questo è un componente fondamentale della generazione aumentata dal recupero (RAG), che garantisce il mantenimento di una personalità utile da parte dell'IA evitando le allucinazioni negli LLM.
Implementazione con Ultralytics#
L'esempio seguente dimostra come applicare programmaticamente l'ingegneria dei prompt utilizzando il pacchetto ultralytics. Qui utilizziamo un modello YOLO-World che accetta prompt testuali per definire dinamicamente quali oggetti cercare, a differenza dei modelli standard come YOLO26, che utilizzano elenchi di classi fissi.
from ultralytics import YOLO
# Load a YOLO-World model capable of interpreting text prompts
model = YOLO("yolov8s-world.pt")
# Apply prompt engineering to define custom classes dynamically
# The model maps these text descriptions to visual features
model.set_classes(["person in safety vest", "forklift", "blue hardhat"])
# Run inference on an image
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Show results - the model only detects objects matching the prompts
results[0].show()Distinzione tra concetti correlati#
Per implementare efficacemente soluzioni di IA tramite la piattaforma Ultralytics, è importante distinguere l'ingegneria dei prompt da tecniche di ottimizzazione simili:
- Ingegneria dei prompt vs. Prompt Tuning: l'ingegneria dei prompt consiste nel creare manualmente input in linguaggio naturale. Al contrario, il prompt tuning è un metodo di fine-tuning efficiente in termini di parametri (PEFT) che apprende i "soft prompt" (embedding vettoriali continui) durante una fase di addestramento. Questi soft prompt sono ottimizzazioni matematiche invisibili all'utente.
- Ingegneria dei prompt vs. Fine-Tuning: il fine-tuning aggiorna permanentemente i pesi di un modello utilizzando uno specifico dataset di addestramento per specializzarlo in un'attività. L'ingegneria dei prompt non modifica il modello in sé; ottimizza soltanto l'input durante l'inferenza in tempo reale.
- Ingegneria dei prompt vs. Prompt Injection: mentre l'ingegneria dei prompt è costruttiva, la prompt injection è una vulnerabilità di sicurezza in cui input malevoli manipolano il modello inducendolo a ignorare i propri vincoli di sicurezza. Garantire la sicurezza dell'IA richiede una solida difesa contro prompt avversari di questo tipo.









