Una guida per un approfondimento sul rilevamento oggetti nel 2025
Scopri il rilevamento degli oggetti, la sua importanza nell'AI e come modelli come YOLO11 stiano trasformando settori come le auto a guida autonoma, la sanità e la sicurezza.

Molte industrie stanno integrando rapidamente soluzioni di intelligenza artificiale (AI) nelle loro attività. Tra le tante tecnologie AI disponibili oggi, la computer vision è una delle più popolari. La Computer vision è una branca dell'AI che aiuta i computer a vedere e comprendere i contenuti di immagini e video, proprio come fanno gli umani. Rende possibile alle macchine riconoscere oggetti, identificare pattern e comprendere ciò che stanno osservando.
Il valore di mercato globale della computer vision è stimato in crescita a 175,72 miliardi di dollari entro il 2032. La computer vision comprende varie attività che consentono ai sistemi di vision AI di analizzare e interpretare dati visivi. Una delle attività più utilizzate ed essenziali della computer vision è l'object detection.
L'Object detection si concentra sulla localizzazione e classificazione degli oggetti nei dati visivi. Ad esempio, se mostri a un computer l'immagine di una mucca, questo può rilevare la mucca e tracciarvi attorno un bounding box. Questa capacità è utile in applicazioni del mondo reale come il monitoraggio degli animali, le auto a guida autonoma e la sorveglianza.
Quindi, come si può eseguire l'object detection? Un modo è tramite i modelli di computer vision. Ad esempio, Ultralytics YOLO11 è un modello di computer vision che supporta attività di computer vision come l'object detection.
In questa guida, esploreremo il rilevamento oggetti e il suo funzionamento. Discuteremo anche alcune applicazioni reali del rilevamento oggetti e di Ultralytics YOLO11.

La Fig 1. mostra l'utilizzo del supporto di YOLO11 per l'object detection nel monitoraggio del bestiame.
Cos'è il rilevamento di oggetti?#
Il rilevamento oggetti è un'attività di computer vision che identifica e localizza oggetti in immagini o video. Risponde a due domande chiave: 'Quali oggetti sono presenti nell'immagine?' e 'Dove sono situati?'
Puoi considerare il rilevamento oggetti come un processo che coinvolge due passaggi fondamentali. Il primo, la classificazione oggetti, consente al sistema di riconoscere ed etichettare gli oggetti, come identificare un gatto, un'auto o una persona in base a schemi appresi. Il secondo, la localizzazione, determina la posizione dell'oggetto disegnando una BBox attorno ad esso, indicando dove appare nell'immagine. Insieme, questi passaggi consentono alle macchine di rilevare e comprendere gli oggetti in una scena.
L'aspetto che rende l'object detection unica è la sua capacità di riconoscere gli oggetti e individuarne la posizione con precisione. Altre attività di computer vision si concentrano su obiettivi differenti.
Ad esempio, la classificazione immagini assegna un'etichetta a un'intera immagine. Allo stesso tempo, la segmentazione immagini fornisce una comprensione a livello di pixel di diversi elementi. D'altra parte, il rilevamento oggetti combina il riconoscimento con la localizzazione. Questo lo rende particolarmente utile per compiti come il conteggio di più oggetti in tempo reale.

La Fig 2. confronta le attività di computer vision.
Riconoscimento oggetti vs. rilevamento oggetti#
Mentre esplori i vari termini della computer vision, potresti pensare che riconoscimento oggetti e rilevamento oggetti siano intercambiabili, ma servono a scopi diversi. Un ottimo modo per comprendere la differenza è osservare il rilevamento volti e il riconoscimento facciale.
Il rilevamento volti è un tipo di rilevamento oggetti. Identifica la presenza di un volto in un'immagine e ne segna la posizione usando una BBox. Risponde alla domanda: “Dov'è il volto nell'immagine?”. Questa tecnologia è comunemente usata nelle fotocamere degli smartphone che mettono a fuoco automaticamente i volti o nelle telecamere di sicurezza che rilevano la presenza di una persona.
Il Face recognition, d'altra parte, è una forma di riconoscimento degli oggetti. Non si limita a rilevare un volto; identifica di chi sia il volto analizzando caratteristiche uniche e confrontandole con un database. Risponde alla domanda: "Chi è questa persona?" Questa è la tecnologia alla base dello sblocco del telefono con Face ID o dei sistemi di sicurezza aeroportuale che verificano le identità.
In poche parole, il rilevamento oggetti trova e localizza gli oggetti, mentre il riconoscimento oggetti li classifica e li identifica.

Fig 3. Rilevamento oggetti vs riconoscimento oggetti. Immagine dell'autore.
Molti modelli di object detection, come Ultralytics YOLO11, sono progettati per supportare il rilevamento dei volti ma non il riconoscimento facciale. YOLO11 è in grado di identificare in modo efficiente la presenza di un volto in un'immagine e di tracciarvi attorno un bbox, risultando utile per applicazioni come sistemi di sorveglianza, monitoraggio di folle e tag automatici delle foto. Tuttavia, non può determinare a chi appartenga quel volto. YOLO11 può essere integrato con modelli addestrati specificamente per il riconoscimento facciale, come Facenet o DeepFace, per consentire sia il rilevamento che l'identificazione in un unico sistema.
Comprendere come funziona il rilevamento degli oggetti#
Prima di discutere come funziona il rilevamento oggetti, osserviamo più da vicino come un computer analizza un'immagine. Invece di vedere un'immagine come facciamo noi, un computer la scompone in una griglia di minuscoli quadrati chiamati pixel. Ogni pixel contiene informazioni su colore e luminosità che i computer possono elaborare per interpretare i dati visivi.
Per dare un senso a questi pixel, gli algoritmi li raggruppano in aree significative in base alla forma, al colore e alla loro vicinanza reciproca. I modelli di object detection, come Ultralytics YOLO11, sono in grado di riconoscere pattern o caratteristiche all'interno di questi gruppi di pixel.
Ad esempio, un'auto a guida autonoma non vede un pedone come facciamo noi: rileva forme e pattern che corrispondono alle caratteristiche di un pedone. Questi modelli si affidano a un training estensivo con dataset di immagini etichettati, consentendo loro di apprendere le caratteristiche distintive di oggetti come auto, segnali stradali e persone.
Un tipico modello di rilevamento oggetti ha tre componenti chiave: backbone, neck e head. Il backbone estrae caratteristiche importanti da un'immagine. Il neck elabora e rifinisce queste caratteristiche, mentre l'head è responsabile della previsione delle posizioni degli oggetti e della loro classificazione.
Perfezionamento dei rilevamenti e presentazione dei risultati#
Una volta effettuati i rilevamenti iniziali, vengono applicate tecniche di post-elaborazione per migliorare l'accuracy e filtrare le predizioni ridondanti. Ad esempio, i bounding box sovrapposti vengono rimossi, assicurando che vengano conservati solo i rilevamenti più rilevanti. Inoltre, a ogni oggetto rilevato vengono assegnati punteggi di confidenza (valori numerici che rappresentano la certezza del modello che un oggetto rilevato appartenga a una determinata classe) per indicare la certezza del modello nelle sue predizioni.
Infine, l'output viene presentato con BBox disegnate attorno agli oggetti rilevati, insieme alle etichette di classe previste e ai punteggi di confidenza. Questi risultati possono quindi essere utilizzati per applicazioni reali.
Modelli di rilevamento oggetti popolari#
Oggi esistono molti modelli di computer vision disponibili e alcuni dei più popolari sono i modelli Ultralytics YOLO. Sono noti per la loro velocità, precisione e versatilità. Nel corso degli anni, questi modelli sono diventati più veloci, precisi e capaci di gestire una gamma più ampia di attività. Il rilascio di Ultralytics YOLOv5 ha reso il deployment più semplice con framework come PyTorch, consentendo a un numero maggiore di persone di utilizzare la vision AI avanzata senza bisogno di competenze tecniche approfondite.
Basandosi su queste fondamenta, Ultralytics YOLOv8 ha introdotto nuove funzionalità come l'istanza di segmentazione, la stima della posa e la classificazione delle immagini. Ora YOLO11 spinge le cose ancora più avanti con prestazioni migliori in molteplici attività. Con il 22% in meno di parametri rispetto a YOLOv8m, YOLO11m ottiene una precisione media media (mAP) superiore sul dataset COCO. In parole semplici, YOLO11 può riconoscere gli oggetti con maggiore precisione utilizzando meno risorse, risultando più veloce e affidabile.
Che tu sia un esperto di intelligenza artificiale o che tu stia appena iniziando, Ultralytics YOLO11 offre una soluzione potente ma facile da usare per le applicazioni di computer vision.
Addestramento personalizzato di un modello per il rilevamento oggetti#
Addestrare modelli di vision AI comporta aiutare i computer a riconoscere e comprendere immagini e video. Tuttavia, l'addestramento può essere un processo che richiede tempo. Invece di partire da zero, il transfer learning accelera le cose utilizzando modelli pre-addestrati che riconoscono già schemi comuni.
Ad esempio, Ultralytics YOLO11 è già stato addestrato sul dataset COCO, che contiene un set diversificato di oggetti di uso quotidiano. Questo modello pre-addestrato può essere ulteriormente personalizzato per rilevare oggetti specifici che potrebbero non essere inclusi nel dataset originale.
Per custom-train Ultralytics YOLO11, ti serve un dataset etichettato che contenga immagini degli oggetti che vuoi rilevare. Ad esempio, se vuoi creare un modello per identificare diversi tipi di frutta in un negozio di alimentari, crederai un dataset con immagini etichettate di mele, banane, arance, ecc. Una volta preparato il dataset, YOLO11 può essere addestrato, regolando parametri come batch size, learning rate ed epochs per ottimizzare le prestazioni.
Con questo approccio, le aziende possono addestrare Ultralytics YOLO11 a rilevare qualsiasi cosa, dai componenti difettosi nella produzione alle specie selvatiche nei progetti di conservazione, adattando il modello alle loro esatte esigenze.
Applicazioni del rilevamento oggetti#
Successivamente, diamo uno sguardo ad alcuni casi d'uso reali del rilevamento oggetti e a come sta trasformando vari settori.
Rilevamento di pericoli per la guida autonoma#
Le auto a guida autonoma utilizzano attività di computer vision come l'object detection per navigare in sicurezza ed evitare ostacoli. Questa tecnologia le aiuta a riconoscere pedoni, altri veicoli, buche e pericoli stradali, consentendo loro di comprendere meglio l'ambiente circostante. Possono prendere decisioni rapide e muoversi in sicurezza nel traffico analizzando costantemente il proprio ambiente.

Fig 4. Un esempio di utilizzo dell'object detection per rilevare le buche con Ultralytics YOLO11.
Analisi di immagini mediche nel settore sanitario#
Le tecniche di medical imaging come raggi X, risonanze magnetiche, TAC ed ecografie creano immagini altamente dettagliate del corpo umano per aiutare a diagnosticare e curare le malattie. Queste scansioni producono grandi quantità di dati che i medici, come radiologi e patologi, devono analizzare attentamente per rilevare le malattie. Tuttavia, esaminare ogni immagine in dettaglio può richiedere molto tempo e gli esperti umani possono talvolta perdere dettagli a causa della stanchezza o di vincoli di tempo.
I modelli di object detection come Ultralytics YOLO11 possono essere d'aiuto identificando automaticamente le caratteristiche chiave nelle scansioni mediche, come organi, tumori o anomalie, con un'elevata precisione. I modelli addestrati su misura possono evidenziare le aree di interesse con bounding box, aiutando i medici a concentrarsi più rapidamente sui potenziali problemi. Ciò riduce il carico di lavoro, migliora l'efficienza e fornisce approfondimenti rapidi.

Fig 5. Analisi di immagini mediche tramite Ultralytics YOLO11.
Aumentare la sicurezza con il rilevamento di persone e anomalie#
Object tracking è un'attività di computer vision supportata da Ultralytics YOLO11, che consente il monitoraggio in tempo reale e miglioramenti della sicurezza. Si basa sull'object detection identificando gli oggetti e tracciandone continuamente il movimento tra i fotogrammi. Questa tecnologia è ampiamente utilizzata nei sistemi di sorveglianza per migliorare la sicurezza in vari ambienti.
Ad esempio, nelle scuole e negli asili nido, l'object tracking può aiutare a monitorare i bambini e impedire loro di allontanarsi. Nelle applicazioni di sicurezza, svolge un ruolo chiave nel rilevare intrusi in aree riservate, monitorare folle per individuare sovraffollamenti o comportamenti sospetti e inviare avvisi in tempo reale quando viene rilevata attività non autorizzata. Tenendo traccia degli oggetti mentre si muovono, i sistemi di tracciamento basati su Ultralytics YOLO11 migliorano la sicurezza, automatizzano il monitoraggio e consentono risposte più rapide a potenziali minacce.
Pro e contro del rilevamento oggetti#
Ecco alcuni dei principali benefici che il rilevamento oggetti può portare a vari settori:
- Automazione: Il rilevamento oggetti può aiutare a ridurre la necessità di supervisione umana in attività come il monitoraggio dei filmati CCTV.
- Funziona con altri modelli AI: Può essere integrato con sistemi di riconoscimento facciale, riconoscimento delle azioni e tracciamento per migliorare accuratezza e funzionalità.
- Elaborazione in tempo reale: Molti modelli di object detection, come Ultralytics YOLO11, sono veloci ed efficienti, il che li rende ideali per applicazioni in tempo reale che richiedono risultati istantanei.
Sebbene questi benefici evidenzino come il rilevamento oggetti influenzi diversi casi d'uso, è anche importante considerare le sfide coinvolte nella sua implementazione. Ecco alcune delle sfide principali:
-
Data privacy: L'uso di dati visivi, soprattutto in aree sensibili come la sorveglianza o la sanità, può sollevare problemi di privacy e sicurezza.
-
Occlusione: L'occlusione nel rilevamento oggetti si verifica quando gli oggetti sono parzialmente bloccati o nascosti alla vista, rendendo difficile per il modello rilevarli e classificarli accuratamente.
-
Costo computazionale: I modelli ad alte prestazioni richiedono spesso potenti GPU per l'elaborazione, rendendo costoso il deployment in tempo reale.
Punti chiave#
L'object detection è uno strumento rivoluzionario nella computer vision che aiuta le macchine a rilevare e localizzare oggetti in immagini e video. Viene utilizzato in settori che vanno dalle auto a guida autonoma alla sanità, rendendo le attività più semplici, sicure ed efficienti. Con i modelli più recenti come Ultralytics YOLO11, le aziende possono facilmente creare modelli di object detection personalizzati per realizzare applicazioni di computer vision specializzate.
Sebbene esistano alcune sfide, come le preoccupazioni per la privacy e gli oggetti nascosti alla vista, il rilevamento oggetti è una tecnologia affidabile. La sua capacità di automatizzare le attività, elaborare dati visivi in tempo reale e integrarsi con altri strumenti di vision AI lo rende una parte essenziale delle innovazioni all'avanguardia.
Per saperne di più, visita il nostro repository GitHub e interagisci con la nostra community. Esplora le innovazioni in settori come AI in self-driving cars e computer vision in agriculture nelle nostre pagine delle soluzioni. Scopri le nostre opzioni di licensing YOLO e dai vita ai tuoi progetti di vision AI. 🚀






