YOLO Vision 2026:
Ultralytics YOLO

Ultralytics YOLO26 ora supporta la stima monoculare della profondità

Scopri come la nuova attività di stima della profondità di Ultralytics YOLO26 prevede la profondità per pixel su scala metrica da una singola immagine RGB, senza bisogno di un rig stereo o del LiDAR.

NUNuvola Ladi6 min read
Ultralytics YOLO26 ora supporta la stima monoculare della profondità

Finora, aggiungere la profondità a una pipeline YOLO significava assemblarla autonomamente. Il modello consolidato consisteva nell'eseguire YOLO per il rilevamento e abbinarlo a un modello di profondità separato proveniente da un altro progetto, come MiDaS o Depth Anything. Questo comportava una seconda dipendenza, un secondo framework e due set di formati di input e output da armonizzare.

La stima della profondità monoculare è ora un'attività nativa di Ultralytics YOLO26. Una singola immagine RGB produce un valore di distanza per ogni pixel, utilizzando lo stesso pacchetto, flusso di lavoro e percorso di esportazione del rilevamento, della segmentazione e della stima della posa.

Che cos'è la stima della profondità?#

La stima della profondità predice una mappa di profondità per pixel a partire da una singola immagine RGB, senza utilizzare una seconda fotocamera o un sensore aggiuntivo. Ogni pixel di output contiene un valore di profondità in metri, che rappresenta la distanza stimata dalla fotocamera a quel punto della superficie.

L'output è una mappa float densa con forma (H, W), allineata all'input, in cui ogni pixel contiene una distanza assoluta in metri: una distanza dalla fotocamera, non un ordinamento relativo di ciò che è più vicino o più lontano.

La profondità è un'attività autonoma con il proprio checkpoint e il suo output è esclusivamente la mappa di profondità; non restituisce BBox o maschere di segmentazione. Combinare il rilevamento con la profondità richiede quindi l'esecuzione di due modelli e di due passaggi forward. La differenza rispetto alla pratica precedente è che ora entrambi risiedono in un unico pacchetto, condividendo una sola installazione, un'unica interfaccia di addestramento e predizione, un unico percorso di esportazione e una sola versione da monitorare, invece di richiedere un secondo framework da mantenere accanto al primo.

È questo output per pixel a rendere la profondità utile per il rilevamento degli ostacoli e dello spazio libero, il controllo delle distanze di sicurezza, la disposizione della scena e la comprensione di ciò che si trova davanti a cosa.

Frame 1077243491 Fig. 1. Stima della profondità con Ultralytics YOLO26 per il monitoraggio della sicurezza e della conformità.

Ultralytics YOLO26 include cinque modelli di profondità preaddestrati, da yolo26n-depth a yolo26x-depth, addestrati su un'ampia combinazione di più dataset comprendente circa 2,19 milioni di immagini di ambienti interni ed esterni. Sul dataset NYU Depth V2, la loro accuratezza δ1 varia da 0,882 del modello nano a 0,933 del modello extra-large, consentendoti di scegliere il compromesso tra velocità e accuratezza più adatto al tuo obiettivo di distribuzione.

Profondità illimitata per progettazione#

La maggior parte dei modelli di profondità limita le proprie predizioni a un intervallo fisso, ad esempio 0–10 metri, che funziona bene per le scene interne ma presenta problemi all'esterno. Ultralytics predice invece la profondità su una scala logaritmica aperta, senza un limite massimo rigido.

La differenza emerge nei test. Un modello con intervallo limitato raggiunge quasi subito un plateau quando viene addestrato su dati misti di ambienti interni ed esterni e crolla sui dataset a lungo raggio come KITTI, in cui gli oggetti possono trovarsi a 80 metri di distanza. L'approccio di Ultralytics YOLO26 non presenta questo limite, quindi continua a migliorare con più dati e mantiene buone prestazioni da pochi centimetri a diverse centinaia di metri. Su KITTI, δ1 raggiunge 0,942 a una distanza di 80 m. Questo significa che una sola famiglia di modelli gestisce altrettanto bene una scena su un tavolo e una scena autostradale.

Confronto tra la profondità di Ultralytics YOLO26 e Depth Anything V2#

Se oggi esegui Depth Anything insieme a YOLO, la differenza riguarda la velocità e il costo computazionale che ne deriva. La profondità di Ultralytics YOLO26 è fino a 20,3× più veloce di Depth Anything V2 Base e 7,7× più veloce di Depth Anything V2 Small, con un modello molto più piccolo: meno di 10M di parametri nella versione nano, contro circa 24M del checkpoint più piccolo di DA V2.

Screenshot 2026-07-29 at 15.02.18 Fig. 2. Benchmark di velocità della profondità di Ultralytics YOLO26 rispetto a Depth Anything V2.

È questo il motivo alla base del design. I modelli di Depth Anything V2 sono molto più grandi; Ultralytics YOLO26-Depth è progettato per offrire prestazioni elevate nella stima della profondità con dimensioni e velocità che richiedono meno risorse computazionali per frame e consentono la distribuzione su hardware non supportato da quei modelli. I dati di accuratezza per modello su NYU Depth V2 e KITTI sono pubblicati nella documentazione, così puoi confrontarli con il requisito effettivo del tuo caso.

Dove può essere eseguito#

È questa differenza di dimensioni a determinare dove la profondità può essere effettivamente utilizzata. La maggior parte dei team che valutano la profondità non ha carenza di idee, ma di risorse computazionali. Droni a basso consumo, robot quadrupedi, dispositivi indossabili, dashcam, hardware per videoconferenze e PC industriali raggiungono tutti un limite di potenza e costo prima di raggiungere un limite di accuratezza.

La profondità è disponibile in cinque modelli preaddestrati, così puoi scegliere la dimensione adatta all'obiettivo invece di quella che vince un benchmark. Poiché la profondità è un'attività nativa di Ultralytics YOLO26, utilizza lo stesso percorso di esportazione del rilevamento, della segmentazione e della posa nei seguenti formati: ONNX, TensorRT, CoreML, NCNN, LiteRT.

Inizia a usare la profondità di Ultralytics YOLO26#

Il pacchetto Python di Ultralytics offre un'unica interfaccia unificata per addestrare, validare ed eseguire l'inferenza su tutte le attività di YOLO26, inclusa la profondità. Eseguire un modello di profondità preaddestrato richiede un solo comando:

from ultralytics import YOLO

from ultralytics import YOLO

# Load a model
model = YOLO("yolo26n-depth.pt")  # load an official model
model = YOLO("path/to/best.pt")  # load a custom model

# Predict with the model
results = model("https://ultralytics.com/images/bus.jpg")  # predict on an image

# Access the results
for result in results:
    depth_map = result.depth.data.cpu().numpy()  # torch.Tensor → NumPy float32, shape (H, W), meters

Oppure dalla CLI:

yolo depth predict model=yolo26n-depth.pt source='https://ultralytics.com/images/bus.jpg'  # predict with official model
yolo depth predict model=path/to/best.pt source='https://ultralytics.com/images/bus.jpg'   # predict with custom model

La distanza assoluta dipende dalla fotocamera e dalla scena. Se la forma della mappa di profondità è corretta ma la scala non lo è, model.calibrate() adatta solo due variabili nella testa di profondità del modello, una scala e un offset, su circa 100 frame annotati, in pochi secondi, senza addestramento e senza modificare il resto della rete.

Fine-tuning sui tuoi dati#

Per adattare un modello di profondità preaddestrato alla tua fotocamera o al tuo dominio, parti dai pesi preaddestrati, usa AdamW e riduci notevolmente il learning rate rispetto al valore predefinito dell'addestramento da zero, così il fine-tuning perfeziona il modello invece di sovrascriverlo:

from ultralytics import YOLO

from ultralytics import YOLO
model = YOLO("yolo26s-depth.pt")  # start from pretrained weights
model.train(
    data="path/to/your_dataset.yaml",
    epochs=20,
    imgsz=640,
    optimizer="AdamW",
    lr0=1e-4,  # ~100x below the from-scratch default
    warmup_bias_lr=1e-4,  # keep warmup gentle too
)

Poiché la testa logaritmica predefinita è illimitata, funziona immediatamente sia con dataset a corto raggio sia con dataset a lungo raggio, senza richiedere il tuning di max_depth. Se per la tua fotocamera specifica è errata solo la scala assoluta, model.calibrate() adatta una correzione leggera in forma chiusa su un piccolo split annotato, in pochi secondi e senza modificare i pesi della rete.

I dataset associano ogni immagine RGB a un file di profondità .npy in una struttura di cartelle corrispondente, e Ultralytics include configurazioni integrate per NYU Depth V2, KITTI, Hypersim, SUN RGB-D e ARKitScenes, così la maggior parte dei team può iniziare immediatamente la validazione rispetto a un benchmark standard.

Principali casi d'uso della stima della profondità#

Poiché questa nuova funzionalità può utilizzare una singola fotocamera comune, la stima della profondità monoculare apre numerose opportunità per prodotti e settori che altrimenti non potrebbero giustificare il costo, il consumo energetico o l'overhead di calibrazione di una configurazione stereo o LiDAR. Esaminiamo quindi alcuni dei principali settori e casi d'uso che possono trarre vantaggio da questa funzionalità:

  • Robotica e navigazione autonoma. I robot mobili e i droni possono stimare la distanza dagli ostacoli e lo spazio libero da una singola fotocamera integrata, supportando la pianificazione del percorso in tempo reale senza hardware dedicato per la profondità.
  • Monitoraggio industriale e logistico. Controllo delle distanze di sicurezza, rilevamento dello spazio libero e informazioni sul contesto di scaffali o corridoi da una singola fotocamera fissa, ovunque aggiungere un secondo sensore non sia pratico.
  • Monitoraggio della sicurezza e della conformità. Zone di sicurezza per carrelli elevatori e magazzini, rilevamento di incidenti ferroviari, rilevamento di persone cadute e di oggetti lasciati indietro tramite sistemi CCTV esistenti: informazioni sulla distanza aggiunte a flussi video già installati, insieme ai sensori esistenti certificati per la sicurezza e non in loro sostituzione.
  • Ispezione di infrastrutture e asset. Analisi delle distanze di sicurezza dalle linee elettriche aeree, ispezione di asset e corrosione basata su droni e rilievi aerei, dove la stessa famiglia di modelli deve gestire sia i dettagli ravvicinati sia le scene a lungo raggio.
  • Sistemi di assistenza alla guida e percezione automotive. Un output di profondità a lungo raggio e illimitato significa che la stessa famiglia di modelli che gestisce una scena interna ravvicinata si generalizza anche a scene di guida a oltre 80 m.
  • AR e contenuti spaziali. Posizionare oggetti virtuali in modo realistico in una scena reale o applicare effetti sensibili alla profondità inizia dalla conoscenza della distanza effettiva di ogni pixel dalla fotocamera.

Portare la stima della profondità in ogni distribuzione di Ultralytics YOLO26#

Con la stima della profondità ora disponibile come attività nativa di Ultralytics YOLO26, i team possono sfruttare la distanza per pixel da qualsiasi fotocamera RGB in diversi settori, utilizzando lo stesso flusso di lavoro di train, val, predict ed export che già conoscono dal rilevamento, dalla segmentazione e dalla posa, con una dipendenza di terze parti in meno da mantenere.

Quindi, mentre definisci la tua distribuzione con la profondità di Ultralytics YOLO26, esaminiamo alcuni punti chiave da tenere a mente:

  • Ultralytics YOLO Depth è progettato per fotocamere RGB. Funziona qualsiasi fotocamera standard, incluse webcam, telefoni, fotocamere industriali o droni. Tuttavia, altre modalità, come nuvole di punti LiDAR, radar, sonar, bande termiche e multispettrali o dati mesh e IFC, non rientrano nel formato di input del modello.
  • Distanza metrica per le decisioni di percezione. L'output è una distanza reale in metri, quindi è adatto alla navigazione, al controllo delle distanze di sicurezza e al monitoraggio. Tuttavia, per qualsiasi applicazione che richieda una tolleranza certificata, le apparecchiature di metrologia dedicate restano lo strumento appropriato.
  • Inferenza per immagine. La profondità viene eseguita indipendentemente su ogni frame, in modo coerente con tutte le altre attività di Ultralytics YOLO26, e può quindi essere inserita in una pipeline esistente per frame senza modifiche. L'analisi di una sequenza rimane a livello del tuo application layer.
  • Ultralytics YOLO26-Depth offre le prestazioni migliori su superfici testurizzate e opache. Vetro, specchi, acqua stagnante, metallo lucidato e cielo aperto sono intrinsecamente ambigui per qualsiasi metodo basato su una singola fotocamera, quindi è opportuno validare il modello su scene rappresentative del tuo ambiente.

Ti interessa l'AI per la visione? Esplora le nostre opzioni di licenza per portare la computer vision nei tuoi progetti. Visita il nostro repository GitHub per scoprire l'intera gamma di attività e integrazioni di Ultralytics e dai un'occhiata a Ultralytics Platform per iniziare a creare i tuoi flussi di lavoro end-to-end di vision AI.

Explore solutions

Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più
Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più
Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più

Costruiamo insieme il futuro dell'AI!

Inizia il tuo percorso verso il futuro del machine learning