Spatial Intelligence
Découvre comment l’intelligence spatiale permet à l’IA de percevoir et de parcourir le monde en 3D. Apprends à créer des systèmes sensibles à l’espace avec Ultralytics YOLO26 et l’Ultralytics Platform.
L'intelligence spatiale désigne la capacité d'un système d'intelligence artificielle à percevoir, comprendre et parcourir le monde physique en trois dimensions. Contrairement à la vision par ordinateur traditionnelle, qui analyse souvent les images 2D comme des instantanés statiques, l'intelligence spatiale implique de raisonner sur la profondeur, la géométrie, le mouvement et les relations entre les objets dans un environnement dynamique. Elle permet aux machines non seulement de « voir » les pixels, mais aussi de comprendre le contexte physique d'une scène, afin d'interagir plus efficacement avec le monde réel. Cette capacité fait le lien entre les données visuelles numériques et l'action physique, et constitue un pilier des agents d'IA avancés et des systèmes robotiques.
Les composants clés de l'intelligence spatiale#
Pour parvenir à une compréhension de l'espace semblable à celle de l'être humain, un système d'IA s'appuie sur plusieurs technologies et concepts interconnectés.
- Perception de la profondeur et reconstruction 3D : Les systèmes doivent convertir les entrées 2D des caméras en représentations 3D. Des techniques comme l'estimation de profondeur monoculaire permettent aux modèles de prédire la distance à partir d'une seule image, tandis que la détection d'objets 3D aide à identifier le volume et l'orientation des éléments présents dans cet espace.
- SLAM (localisation et cartographie simultanées) : Cette technologie permet à un appareil, comme un robot ou un drone, de cartographier un environnement inconnu tout en suivant sa propre position dans celui-ci. Les approches modernes associent souvent le SLAM visuel à l'apprentissage profond afin d'améliorer la robustesse dans des conditions d'éclairage changeantes.
- Raisonnement géométrique : Au-delà de la détection, le système doit comprendre les contraintes physiques : savoir qu'une tasse repose sur une table ou qu'une porte doit être ouverte pour passer. Cela implique souvent l'estimation de pose pour suivre l'orientation des objets ou des articulations humaines en temps réel.
- IA incarnée : Ce concept relie la perception à l'action. Un agent incarné ne se contente pas d'observer ; il utilise les données spatiales pour planifier ses mouvements, éviter les obstacles et manipuler des objets, comme le fait l'IA en robotique dans un atelier de fabrication.
Applications concrètes#
L'intelligence spatiale transforme les secteurs d'activité en permettant aux machines de fonctionner de manière autonome dans des environnements complexes.
- Robotique autonome et logistique : Dans les entrepôts, les robots utilisent l'intelligence spatiale pour se déplacer dans des allées encombrées, identifier des colis spécifiques à l'aide de la détection d'objets et les placer précisément sur des convoyeurs. Ils doivent calculer la relation spatiale entre leur pince et la boîte afin d'assurer une prise sûre sans endommager l'objet.
- Réalité augmentée (AR) et réalité mixte : Des appareils comme les lunettes intelligentes utilisent l'informatique spatiale pour ancrer du contenu numérique dans le monde physique. Par exemple, une application de maintenance en AR peut superposer des instructions de réparation directement sur une pièce précise d'un moteur. Cela nécessite un suivi précis des objets pour que les éléments graphiques restent alignés lorsque l'utilisateur bouge la tête.
Intelligence spatiale et vision par ordinateur#
Bien qu'elles soient étroitement liées, il est utile de distinguer l'intelligence spatiale de la vision par ordinateur. La vision par ordinateur est le domaine plus large qui consiste à extraire des informations pertinentes d'images numériques, de vidéos et d'autres entrées visuelles. Elle comprend des tâches comme la classification ou la détection 2D de base. L'intelligence spatiale est un sous-ensemble spécialisé, ou une évolution, de la vision par ordinateur qui ajoute spécifiquement la dimension de l'espace et de la physique. Elle passe de « Quel est cet objet ? » (vision) à « Où se trouve cet objet, comment est-il orienté et comment puis-je interagir avec lui ? » (intelligence spatiale).
Mettre en œuvre la perception spatiale avec Ultralytics#
Les développeurs peuvent établir les fondations de systèmes d'intelligence spatiale à l'aide de l'Ultralytics Platform. En entraînant des modèles comme Ultralytics YOLO26 sur des tâches telles que la détection de boîtes englobantes orientées (OBB) ou l'estimation de pose, les ingénieurs peuvent fournir les données géométriques nécessaires aux applications robotiques ou de réalité augmentée en aval.
Voici un exemple simple d'extraction de points clés spatiaux à l'aide d'un modèle d'estimation de pose, une étape essentielle pour comprendre les mouvements humains dans un espace 3D :
from ultralytics import YOLO
# Load a pre-trained YOLO26 pose estimation model
model = YOLO("yolo26n-pose.pt")
# Run inference on an image to detect human keypoints
results = model("path/to/image.jpg")
# Access the keypoints (x, y coordinates and confidence)
for result in results:
# keypoints.xy returns a tensor of shape (N, 17, 2)
keypoints = result.keypoints.xy
print(f"Detected keypoints for {len(keypoints)} persons.")Les avancées récentes dans les Transformers de vision (ViT) et les modèles de fondation accélèrent encore ce domaine, en permettant aux systèmes de généraliser leur compréhension spatiale à différents environnements sans réentraînement extensif. Alors que les recherches menées par des groupes comme le HAI de Stanford et Google DeepMind se poursuivent, on peut s'attendre à ce que l'intelligence spatiale devienne une fonctionnalité standard de la prochaine génération d'appareils intelligents.









