Neural Radiance Fields (NeRF)
Explore comment les champs de radiance neuronaux (NeRF) synthétisent des scènes 3D à partir d’images 2D. Apprends à améliorer l’entraînement de NeRF avec Ultralytics YOLO26 pour une segmentation précise.
Les champs de radiance neuronale (NeRF) représentent une avancée révolutionnaire en vision par ordinateur (CV) et en IA générative, conçue pour synthétiser des scènes 3D photoréalistes à partir d’un ensemble clairsemé d’images 2D. Contrairement aux approches traditionnelles de modélisation 3D qui reposent sur des structures géométriques explicites telles que des polygones, des maillages ou des nuages de points, un NeRF utilise un réseau neuronal (NN) pour apprendre une représentation « implicite » d’une scène. En mappant les coordonnées spatiales et les directions d’observation sur des valeurs de couleur et de densité, les NeRF peuvent restituer de nouveaux points de vue avec une fidélité exceptionnelle, en capturant précisément des effets visuels complexes tels que les réflexions, la transparence et les variations d’éclairage, souvent difficiles à reproduire avec la photogrammétrie standard.
Fonctionnement des champs de radiance neuronale#
À la base, un NeRF modélise une scène comme une fonction volumétrique continue. Cette fonction est généralement paramétrée par un réseau d’apprentissage profond (DL) entièrement connecté. Le processus commence par le parcours de rayons, durant lequel des rayons sont projetés depuis une caméra virtuelle à travers chaque pixel du plan image souhaité jusque dans l’espace 3D.
Pour les points échantillonnés le long de chaque rayon, le réseau reçoit une entrée 5D — composée de la position spatiale 3D ($x, y, z$) et de la direction d’observation 2D ($\theta, \phi$) — et produit la couleur émise ainsi que la densité volumique (opacité) à cet emplacement. À l’aide de techniques fondées sur le rendu volumique, ces valeurs échantillonnées sont accumulées afin de calculer la couleur finale du pixel. Le réseau est entraîné en minimisant la différence entre les pixels rendus et les pixels réels des données d’entraînement originales, optimisant ainsi les poids du modèle pour mémoriser les propriétés visuelles de la scène.
Applications concrètes#
La technologie NeRF est rapidement passée de la recherche universitaire aux outils pratiques, transformant divers secteurs en réduisant l’écart entre la photographie statique et les environnements 3D interactifs.
- E-commerce immersif : les distributeurs exploitent les NeRF pour créer des démonstrations interactives de produits. En traitant quelques photos d’un article, les solutions d’IA dans le commerce de détail peuvent générer une représentation 3D que les clients peuvent examiner sous n’importe quel angle, offrant une expérience plus riche que les images statiques.
- Production virtuelle et VFX : l’industrie cinématographique utilise les NeRF pour capturer des lieux réels et les restituer sous forme d’arrière-plans photoréalistes pour la production virtuelle. Les cinéastes peuvent ainsi placer les acteurs dans des environnements numériques qui réagissent de manière réaliste aux mouvements de caméra, ce qui réduit le besoin de coûteux tournages sur site.
- Simulation robotique : l’entraînement des véhicules autonomes et des drones nécessite d’énormes quantités de données. Les NeRF peuvent reconstruire des environnements réels complexes à partir de données de capteurs, en créant des environnements de simulation haute fidélité où les algorithmes de robotique peuvent être testés de manière sûre et approfondie.
Distinction avec les concepts associés#
Il est utile de distinguer les NeRF des autres technologies 3D et de vision afin de comprendre leur utilité spécifique.
- NeRF et photogrammétrie : la photogrammétrie reconstruit explicitement la géométrie des surfaces (maillages) en mettant en correspondance les caractéristiques entre les images. Bien qu’elle soit efficace pour les surfaces simples, elle rencontre souvent des difficultés avec les effets « non lambertiens », comme les surfaces brillantes, les structures fines (telles que les cheveux) ou la transparence. Les NeRF excellent dans ces domaines, car ils modélisent directement le volume et le transport de la lumière.
- NeRF et détection d’objets 3D : tandis que les NeRF génèrent des données visuelles, la détection d’objets 3D se concentre sur la compréhension du contenu de la scène. Les modèles de détection identifient et localisent les objets à l’aide de boîtes englobantes, tandis que les NeRF s’intéressent au rendu de l’apparence de la scène.
- NeRF et estimation de profondeur : l’estimation de profondeur prédit la distance entre les pixels et la caméra, ce qui produit une carte de profondeur. Les NeRF apprennent implicitement la géométrie pour restituer des images, mais leur sortie principale est le point de vue synthétisé plutôt qu’une carte de profondeur explicite.
Intégration des NeRF dans les pipelines de vision#
L’entraînement d’un NeRF de haute qualité nécessite souvent des données propres. Le bruit d’arrière-plan ou les objets en mouvement peuvent provoquer des artefacts de « rémanence » dans le rendu final. Pour limiter ce problème, les développeurs utilisent souvent des modèles de segmentation d’instances afin de masquer automatiquement le sujet d’intérêt avant d’entraîner le NeRF.
La plateforme Ultralytics et l’API Python permettent d’intégrer facilement la segmentation dans ce workflow de prétraitement. L’exemple suivant montre comment utiliser YOLO26 pour générer des masques pour un ensemble d’images et les préparer à une reconstruction 3D.
from ultralytics import YOLO
# Load the YOLO26 segmentation model
model = YOLO("yolo26n-seg.pt")
# Run inference to detect and segment objects
# Saving results creates masks useful for NeRF preprocessing
results = model("scene_image.jpg", save=True)
# Access the binary masks for the detected objects
masks = results[0].masks.data
print(f"Generated {len(masks)} masks for NeRF training.")En combinant la précision de la segmentation avec la puissance générative des NeRF, les ingénieurs peuvent créer des pipelines robustes pour la génération de données synthétiques, permettant de produire un nombre illimité d’échantillons d’entraînement pour d’autres tâches en aval.









