Geometric Deep Learning (GDL)
Explora el aprendizaje profundo geométrico para procesar datos no euclídeos. Aprende a combinar GDL con Ultralytics YOLO26 para trabajar con mallas 3D, grafos e IA espacial avanzada.
El aprendizaje profundo geométrico (GDL) es un término general amplio para referirse a técnicas avanzadas de aprendizaje automático diseñadas específicamente para procesar datos no euclídeos. A diferencia de los formatos estándar, como las imágenes 2D o las secuencias de texto, que se sitúan sobre cuadrículas planas y predecibles, los datos no euclídeos incluyen estructuras complejas, como variedades y mallas 3D, así como intrincadas redes relacionales. Al establecer marcos matemáticos que respetan la geometría intrínseca de estas estructuras, el aprendizaje profundo geométrico permite a los sistemas de IA analizar con precisión formaciones moleculares, mapas topológicos complejos y sistemas dinámicos interconectados.
Cómo funciona el aprendizaje profundo geométrico#
Los principios subyacentes del aprendizaje profundo geométrico se basan en aprovechar la simetría, la invariancia y la equivariancia presentes en conjuntos de datos complejos. Una pregunta habitual entre los profesionales es si una simple matriz de distancias es suficiente para el aprendizaje profundo geométrico. La respuesta es no; aunque las matrices de distancias capturan las distancias por pares, carecen de la sutileza topológica necesaria para un razonamiento geométrico auténtico. En su lugar, el GDL depende en gran medida de las arquitecturas de propagación de mensajes y de la agregación de vecindarios.
Es útil diferenciar el aprendizaje profundo geométrico de las redes neuronales de grafos (GNNs). Mientras que el GDL es el campo teórico general que engloba todo el aprendizaje profundo no euclídeo, las GNNs son un tipo específico de arquitectura neuronal que opera exclusivamente con datos de grafos. Frameworks como PyTorch Geometric y TensorFlow GNN se utilizan ampliamente para implementar estos principios de aprendizaje profundo, lo que permite a los nodos actualizar sus representaciones en función de sus conexiones estructurales.
Aprendizaje geométrico frente al aprendizaje profundo tradicional#
Los modelos de aprendizaje profundo tradicionales, como las redes neuronales convolucionales (CNNs), están muy optimizados para datos euclídeos, como las cuadrículas de píxeles de las tareas de visión artificial. Del mismo modo, las redes neuronales recurrentes (RNNs) están diseñadas para procesar secuencias lineales. Sin embargo, estas redes tradicionales tienen dificultades cuando los datos carecen de una estructura fija y regular.
El aprendizaje geométrico supera esta limitación al operar directamente sobre formas irregulares y mapas relacionales. Al analizar una red social o desplazarse por un entorno 3D, las convoluciones estándar fallan porque el «vecindario» de un punto de datos ya no es un cuadrado fijo de píxeles. Los modelos geométricos adaptan dinámicamente sus campos receptivos y aprenden las conexiones topológicas que definen la verdadera forma de los datos.
Aplicaciones reales de los grafos y modelos geométricos#
Dado que los grafos geométricos definen explícitamente los nodos y sus relaciones estructurales, los modelos geométricos han permitido avances revolucionarios en diversos ámbitos científicos y comerciales:
- Descubrimiento de fármacos: el GDL desempeña un papel fundamental en la predicción de interacciones moleculares. AlphaFold de Google DeepMind utiliza técnicas de razonamiento espacial para resolver problemas complejos de plegamiento de proteínas mediante el modelado de los aminoácidos como grafos conectados.
- Análisis de redes sociales: las plataformas utilizan GDL para analizar las interacciones de los usuarios, lo que permite crear sistemas avanzados de recomendación y detectar fraudes mediante el mapeo de las topologías del análisis de redes sociales.
- Visión artificial 3D: el GDL se aplica con frecuencia al procesamiento de nubes de puntos LiDAR y mallas 3D para vehículos autónomos y realidad aumentada.
Integración del GDL con la visión artificial#
La combinación de la visión artificial 2D tradicional con modelos geométricos crea sistemas muy robustos, capaces de realizar razonamiento espacial avanzado y detección de objetos 3D. Al utilizar un potente detector 2D como Ultralytics YOLO26, los desarrolladores pueden localizar rápidamente los objetos de una escena. Las coordenadas de estos objetos detectados pueden servir posteriormente como nodos fundamentales de un grafo geométrico, lo que permite a una GNN posterior inferir relaciones complejas entre los elementos visuales (por ejemplo, generar un «grafo de escena»).
El siguiente fragmento de Python muestra cómo puedes extraer las coordenadas de detección de objetos mediante el paquete ultralytics para iniciar una estructura de grafo geométrico básica:
import torch
from ultralytics import YOLO
# Load the Ultralytics YOLO26 model for high-speed object detection
model = YOLO("yolo26n.pt")
# Perform inference to detect objects
results = model("path/to/image.jpg")
# Extract the center coordinates (x, y) of bounding boxes to act as graph nodes
nodes = results[0].boxes.xywh[:, :2].cpu()
node_tensor = torch.tensor(nodes.numpy(), dtype=torch.float)
print(f"Extracted {node_tensor.size(0)} nodes for Geometric Deep Learning mapping.")Para los equipos que desarrollan sistemas híbridos a gran escala que combinan la detección de objetos euclídea con el mapeo no euclídeo, es fundamental gestionar una anotación de datos compleja. La Ultralytics Platform proporciona un entorno integral para anotar, entrenar y desplegar de forma segura y fluida estos modelos de visión fundamentales, con el fin de respaldar canalizaciones espaciales avanzadas.









