Geometric Deep Learning (GDL)
Esplora il geometric deep learning per elaborare dati non euclidei. Scopri come combinare GDL con Ultralytics YOLO26 per mesh 3D, grafi e IA spaziale avanzata.
L'apprendimento profondo geometrico (GDL) è un termine ombrello ampio per indicare tecniche avanzate di apprendimento automatico progettate specificamente per elaborare dati non euclidei. A differenza dei formati standard, come le immagini 2D o le sequenze di testo, che si trovano su griglie piatte e prevedibili, i dati non euclidei includono strutture complesse come varietà e mesh 3D, oltre a intricate reti relazionali. Stabilendo framework matematici che rispettano la geometria intrinseca di queste strutture, l'apprendimento profondo geometrico consente ai sistemi di intelligenza artificiale di analizzare con precisione configurazioni molecolari, mappe topologiche complesse e sistemi interconnessi dinamici.
Come funziona l'apprendimento profondo geometrico#
I principi alla base dell'apprendimento profondo geometrico si fondano sullo sfruttamento della simmetria, dell'invarianza e dell'equivarianza presenti nei set di dati complessi. Una domanda comune tra i professionisti è se una semplice matrice delle distanze sia sufficiente per l'apprendimento profondo geometrico. La risposta è no: sebbene le matrici delle distanze catturino le distanze a coppie, non possiedono la ricchezza topologica necessaria per un vero ragionamento geometrico. Il GDL si basa invece in larga misura su architetture di propagazione dei messaggi e sull'aggregazione dei vicinati.
È utile distinguere l'apprendimento profondo geometrico dalle reti neurali a grafo (GNNs). Mentre il GDL è il campo teorico generale che comprende tutto l'apprendimento profondo non euclideo, le GNNs sono un tipo specifico di architettura neurale che opera esclusivamente su dati sotto forma di grafo. Framework come PyTorch Geometric e TensorFlow GNN sono ampiamente utilizzati per implementare questi principi di apprendimento profondo, consentendo ai nodi di aggiornare le proprie rappresentazioni in base alle loro connessioni strutturali.
Apprendimento geometrico e apprendimento profondo tradizionale#
I modelli di apprendimento profondo tradizionali, come le reti neurali convoluzionali (CNNs), sono altamente ottimizzati per dati euclidei, come le griglie di pixel nelle attività di visione artificiale. Analogamente, le reti neurali ricorrenti (RNNs) sono progettate per elaborare sequenze lineari. Tuttavia, queste reti tradizionali incontrano difficoltà quando i dati non hanno una struttura fissa e regolare.
L'apprendimento geometrico supera questa limitazione operando direttamente su forme irregolari e mappe relazionali. Quando si analizza un social network o si esplora un ambiente 3D, le convoluzioni standard non funzionano perché il "vicinato" di un punto dati non è più un quadrato fisso di pixel. I modelli geometrici adattano dinamicamente i propri campi recettivi, apprendendo le connessioni topologiche che definiscono la vera forma dei dati.
Applicazioni reali dei grafi e dei modelli geometrici#
Poiché i grafi geometrici definiscono esplicitamente i nodi e le loro relazioni strutturali, i modelli geometrici hanno permesso importanti progressi in diversi ambiti scientifici e commerciali:
- Scoperta di farmaci: il GDL è fondamentale per prevedere le interazioni molecolari. AlphaFold di Google DeepMind utilizza notoriamente tecniche di ragionamento spaziale per risolvere complessi problemi di ripiegamento delle proteine, modellando gli amminoacidi come grafi connessi.
- Analisi dei social network: le piattaforme utilizzano il GDL per analizzare le interazioni degli utenti, abilitando sistemi avanzati di raccomandazione e il rilevamento delle frodi tramite la mappatura delle topologie dell'analisi dei social network.
- Visione artificiale 3D: il GDL viene spesso applicato all'elaborazione di nuvole di punti LiDAR e mesh 3D per i veicoli autonomi e la realtà aumentata.
Integrazione del GDL con la visione artificiale#
Collegare la visione artificiale 2D tradizionale ai modelli geometrici crea sistemi altamente robusti, capaci di eseguire ragionamenti spaziali avanzati e rilevamento di oggetti 3D. Utilizzando un potente rilevatore 2D come Ultralytics YOLO26, gli sviluppatori possono individuare rapidamente gli oggetti in una scena. Le coordinate di questi oggetti rilevati possono quindi fungere da nodi fondamentali per un grafo geometrico, consentendo a una GNN a valle di dedurre relazioni complesse tra gli elementi visivi (ad esempio, generando un "grafo della scena").
Il seguente frammento di codice Python mostra come estrarre le coordinate del rilevamento degli oggetti utilizzando il pacchetto ultralytics per avviare una struttura di base di un grafo geometrico:
import torch
from ultralytics import YOLO
# Load the Ultralytics YOLO26 model for high-speed object detection
model = YOLO("yolo26n.pt")
# Perform inference to detect objects
results = model("path/to/image.jpg")
# Extract the center coordinates (x, y) of bounding boxes to act as graph nodes
nodes = results[0].boxes.xywh[:, :2].cpu()
node_tensor = torch.tensor(nodes.numpy(), dtype=torch.float)
print(f"Extracted {node_tensor.size(0)} nodes for Geometric Deep Learning mapping.")Per i team che sviluppano sistemi ibridi su larga scala, combinando il rilevamento degli oggetti euclideo con la mappatura non euclidea, è fondamentale gestire annotazioni di dati complesse. La Ultralytics Platform offre un ambiente end-to-end per annotare, addestrare e distribuire in modo sicuro e fluido questi modelli di visione fondamentali, a supporto di pipeline spaziali avanzate.









