Data Poisoning
Scopri l’avvelenamento dei dati e il suo impatto sull’IA. Approfondisci come proteggere i modelli Ultralytics YOLO26 e i dati di addestramento con Ultralytics Platform.
L'avvelenamento dei dati è una minaccia alla sicurezza informatica in cui soggetti malintenzionati manipolano intenzionalmente i dati di addestramento utilizzati per sviluppare modelli di apprendimento automatico (ML). Corrompendo il dataset prima dell'addestramento di un modello, gli aggressori possono introdurre backdoor nascoste, causare distorsioni o ridurre le prestazioni complessive del modello. A differenza di altri exploit di sicurezza che prendono di mira il codice di un sistema, gli attacchi di avvelenamento dei dati prendono di mira il processo di apprendimento stesso, diventando estremamente difficili da rilevare una volta che il modello è stato distribuito in ambienti di produzione. Secondo la panoramica di IBM sull'intelligence delle minacce, questi attacchi comportano gravi rischi per l'integrità e l'affidabilità dei sistemi di intelligenza artificiale.
I meccanismi dell'avvelenamento dell'AI#
Poiché le organizzazioni si affidano sempre più al deep learning (DL) e ai modelli linguistici di grandi dimensioni (LLM), spesso raccolgono enormi quantità di dati non verificati da Internet. Questa pratica crea opportunità per l'iniezione di dati, in cui gli avversari inseriscono punti dati falsificati o dannosi nei repository pubblici. I recenti studi sull'avvelenamento dell'AI del 2025 rivelano una realtà allarmante: anche per i modelli più grandi, con miliardi di parametri, basta che un aggressore manipoli un numero minimo di campioni, pressoché costante, per compromettere il sistema.
L'avvelenamento degli LLM si verifica quando specifiche frasi di attivazione vengono inserite nei testi utilizzati dal modello durante l'addestramento. Una volta distribuito, il modello può funzionare normalmente finché un utente non inserisce la frase di attivazione, inducendo il sistema ad aggirare i protocolli di sicurezza o a generare contenuti tossici. La ricerca di Anthropic del 2025 sull'avvelenamento degli LLM dimostra che bastano 250 documenti avvelenati per creare una backdoor in un modello con 13 miliardi di parametri.
Applicazioni ed esempi nel mondo reale#
L'avvelenamento dei dati non riguarda solo la generazione di testo, ma ha un forte impatto anche sui modelli di visione artificiale (CV). Ecco due esempi concreti di come questa minaccia si manifesta nelle applicazioni reali:
- Compromettere i modelli di arte generativa: strumenti come il progetto Nightshade consentono agli artisti digitali di modificare discretamente i pixel delle proprie opere prima di caricarle online. Quando un modello di AI generativa raccoglie queste immagini per l'addestramento, i pixel alterati agiscono da veleno e inducono il modello a interpretare completamente male i prompt, per esempio generando un'immagine di un gatto quando viene richiesto un'automobile.
- Compromettere i veicoli autonomi: nei sistemi di rilevamento degli oggetti usati per le automobili a guida autonoma, un aggressore potrebbe modificare discretamente le immagini dei segnali di stop in un dataset di addestramento open source. Applicando specifici disturbi visivi, i dati di addestramento avvelenati insegnano al modello a interpretare i segnali di stop come segnali di limite di velocità, con rischi catastrofici per la sicurezza.
Differenze rispetto agli attacchi avversari#
Sebbene siano strettamente correlati, è importante distinguere l'avvelenamento dei dati dagli attacchi avversari. Gli attacchi avversari avvengono durante l'inferenza: l'aggressore manipola i dati di input, per esempio applicando un adesivo a un segnale di stop reale, per ingannare un modello già addestrato. L'avvelenamento dei dati, invece, avviene durante l'addestramento e altera radicalmente la logica interna del modello fin dalle fondamenta. Per contrastare entrambi servono solidi protocolli di sicurezza dell'AI.
Ridurre i rischi nello sviluppo dei modelli#
Per difendersi da queste minacce servono un monitoraggio dei modelli rigoroso e l'uso di dati di convalida integri e affidabili per verificare l'integrità del modello. Valutare un modello su un dataset verificato può aiutare i team a individuare cali imprevisti delle prestazioni che potrebbero indicare una manomissione. Le best practice descritte dalla ricerca di OpenAI sulla sicurezza e dal progetto di sicurezza OWASP GenAI sottolineano l'importanza di una rigorosa provenienza dei dati e dell'uso di dataset selezionati anziché della raccolta indiscriminata di dati dal web.
Durante la creazione e il collaudo dei modelli, i team dovrebbero utilizzare framework consolidati come PyTorch o TensorFlow, insieme a procedure di convalida complete. Puoi convalidare facilmente il tuo modello Ultralytics YOLO26 su un dataset pulito e affidabile per verificare che la sua accuratezza non sia stata compromessa.
from ultralytics import YOLO
# Load a custom-trained Ultralytics YOLO26 model
model = YOLO("yolo26n.pt")
# Validate the model on a trusted dataset to detect performance drops
# Sudden decreases in precision/recall may indicate data poisoning
metrics = model.val(data="clean_validation_data.yaml")
print(f"mAP50-95: {metrics.box.map}") # Review core metricsPer i progetti di visione artificiale su larga scala è essenziale monitorare queste metriche su più cicli di addestramento. Gli sviluppatori possono consultare le informazioni sulla valutazione dei modelli per comprendere le prestazioni di riferimento e usare la Ultralytics Platform per annotare, addestrare e gestire i dati in modo sicuro, senza affidarsi a fonti esterne non verificate. Combinare una selezione sicura dei dati con tecniche controllate di aumento dei dati aiuta a mantenere i modelli accurati e resilienti alle manipolazioni esterne.









