Que sont les données synthétiques en vision par ordinateur ? Vue d’ensemble
Découvre comment les données synthétiques destinées à l’entraînement des modèles d’IA sont utilisées dans les applications de vision par ordinateur de secteurs variés comme la santé et la robotique.

Les données ont toujours été un facteur déterminant dans des domaines comme l’analytique et l’intelligence artificielle (AI). En fait, la manière dont nous collectons, générons et utilisons les données façonne l’avenir des systèmes intelligents. Par exemple, les voitures autonomes dépendent de millions d’images annotées et de mesures provenant de capteurs, des panneaux de signalisation aux mouvements des piétons, pour apprendre à circuler en toute sécurité.
L’un des types de données les plus essentiels à ces progrès, notamment dans des domaines comme les véhicules autonomes et la sécurité, est constitué de données visuelles telles que les images et les vidéos.
En particulier, le domaine de l’AI qui permet aux machines d’interpréter ces informations visuelles s’appelle la vision par ordinateur. Elle aide les systèmes à comprendre et à analyser les entrées visuelles comme le font les humains, en prenant en charge des tâches telles que la reconnaissance faciale, la détection des panneaux de signalisation et l’analyse d’images médicales.
Cependant, rassembler des jeux de données visuelles à grande échelle et de haute qualité à partir du monde réel peut prendre beaucoup de temps, coûter cher et soulever souvent des problèmes de confidentialité. C’est pourquoi les chercheurs étudient activement le recours aux données synthétiques.
Les données synthétiques désignent des éléments visuels générés artificiellement qui imitent étroitement des images et des vidéos du monde réel. Elles sont créées à l’aide de techniques comme la modélisation 3D, les simulations informatiques et les méthodes d’AI générative telles que les réseaux antagonistes génératifs (GANs), qui apprennent les tendances présentes dans les données réelles pour produire de nouveaux exemples réalistes.
Les données synthétiques devraient bientôt jouer un rôle essentiel dans le développement de l’AI : Gartner prévoit qu’en 2030, elles deviendront plus importantes que les données du monde réel. Dans cet article, nous allons examiner ce que sont les données synthétiques dans le contexte de la vision par ordinateur, comment elles sont générées et dans quels scénarios réels elles sont utilisées. C’est parti !
Que sont les données synthétiques en vision par ordinateur ?#
Supposons que tu veuilles entraîner un modèle d’AI de vision à détecter des objets dans des environnements et des conditions variés. S’appuyer uniquement sur des données du monde réel peut être difficile et parfois sembler limitant.
Les données synthétiques peuvent quant à elles servir à créer le jeu de données approprié, contenant des objets dans différentes conditions créées artificiellement. À l’aide d’outils comme la modélisation 3D et les simulations, les développeurs peuvent générer des images en contrôlant précisément des facteurs comme l’éclairage, les angles et le placement des objets. Cela offre à son tour davantage de flexibilité pour l’entraînement des modèles que les données du monde réel.
Les données synthétiques sont particulièrement utiles lorsque la collecte de données du monde réel est difficile, voire impossible. Par exemple, entraîner un modèle à reconnaître des personnes dans un large éventail de positions, comme en train de courir, de s’accroupir ou de s’allonger, nécessiterait de prendre des milliers de photos dans de nombreux contextes, sous différents angles et avec diverses conditions d’éclairage.
À l’inverse, avec les données synthétiques, les développeurs peuvent facilement générer ces variations avec des annotations précises, ce qui permet de gagner du temps et de réduire les efforts tout en améliorant les performances du modèle.

Fig. 1. Jeu de données synthétiques présentant différentes positions humaines et variations d’éclairage (source).
Données synthétiques et données réelles dans l’AI#
Examinons maintenant de plus près les différences entre les données synthétiques et les données réelles. Les deux présentent des avantages et des inconvénients lorsqu’il s’agit d’entraîner des modèles d’AI.
Par exemple, les données synthétiques sont utiles lorsque les données réelles sont difficiles à collecter, mais elles peuvent ne pas restituer tous les détails présents dans la vie réelle. Parallèlement, les données réelles sont plus authentiques, mais elles peuvent être difficiles à obtenir, longues à annoter et ne pas couvrir toutes les situations.
En combinant données synthétiques et données réelles, les développeurs peuvent tirer le meilleur parti des deux approches. Cet équilibre aide les modèles d’AI à apprendre plus précisément, à mieux se généraliser à différents scénarios et à réduire les biais.

Fig. 2. Données synthétiques et données réelles dans l’AI. Image de l’auteur.
Génération de données pour les modèles de vision par ordinateur#
De la création de mondes virtuels avec des outils 3D à la génération d’images à l’aide de l’AI générative, voici quelques méthodes courantes utilisées pour créer des données d’entraînement synthétiques destinées aux modèles de vision par ordinateur :
- Modélisation 3D : les développeurs utilisent des logiciels 3D pour créer des objets et des scènes numériques. Cela permet de contrôler entièrement des éléments comme l’éclairage, les angles de caméra et le placement des objets, et s’avère utile pour générer des images réalistes de personnes, de véhicules et d’environnements.
- Simulations : elles recréent des situations du monde réel, comme la circulation ou des environnements industriels, à l’aide de moteurs fondés sur la physique. Les simulations sont utiles pour générer en toute sécurité des données d’entraînement dans des domaines comme la robotique et les voitures autonomes.
- Réseaux antagonistes génératifs : les GANs sont un type de modèle d’apprentissage profond composé de deux réseaux : l’un crée les images et l’autre les évalue. Ensemble, ils génèrent des images très réalistes, comme des visages humains ou des scènes de rue, en apprenant à partir d’exemples réels.
- Génération procédurale : cette technique utilise des règles prédéfinies ou des modèles mathématiques pour générer automatiquement des structures visuelles complexes comme des terrains, des bâtiments ou des textures. Elle est souvent utilisée dans les jeux vidéo et les plateformes de simulation, et peut produire des jeux de données diversifiés à grande échelle avec une intervention humaine minimale.
- Randomisation de domaine : elle peut modifier aléatoirement des éléments comme l’éclairage, les couleurs et la forme des objets dans des scènes synthétiques. L’objectif de cette technique est d’aider les modèles à se concentrer sur ce qui compte vraiment, afin de les rendre plus adaptables aux environnements du monde réel.

Fig. 3. Exemples de données : (a) fondées sur un modèle 3D, (b) scènes synthétiques multi-objets et (c) images d’un jeu de données réel (source).
Entraînement de modèles d’AI de vision avec des données synthétiques#
Maintenant que nous avons abordé certaines des différentes méthodes utilisées pour créer des données synthétiques, voyons comment elles sont utilisées pour entraîner des modèles d’AI.
Une fois générées, les données synthétiques peuvent généralement être intégrées directement au pipeline d’entraînement, de la même manière que les données du monde réel. Elles comprennent généralement les annotations nécessaires, comme les étiquettes d’objets, les boîtes englobantes ou les masques de segmentation, ce qui signifie qu’elles peuvent être utilisées pour des tâches d’apprentissage supervisé, dans lesquelles les modèles apprennent à partir de paires entrée-sortie annotées, sans nécessiter d’annotation manuelle.
Pendant l’entraînement, le modèle traite les images synthétiques pour apprendre à détecter des caractéristiques, à reconnaître des tendances et à classer des objets. Ces données peuvent servir à créer une première version du modèle à partir de zéro ou à enrichir un jeu de données existant, contribuant ainsi à améliorer les performances du modèle.
Dans de nombreux workflows, les données synthétiques sont également utilisées pour le préentraînement, afin de donner aux modèles une compréhension générale et fondamentale avant leur ajustement avec des exemples du monde réel. De même, elles servent à augmenter les jeux de données en introduisant des variations contrôlées, comme différentes conditions d’éclairage, différents angles ou des classes d’objets rares, afin d’améliorer la généralisation et de réduire le surapprentissage.
En combinant données synthétiques et données réelles, les équipes peuvent entraîner des modèles plus robustes et performants dans un large éventail de conditions, tout en réduisant leur dépendance aux efforts de collecte manuelle de données, coûteux et chronophages.
Applications concrètes des données synthétiques en vision par ordinateur#
À mesure que les données synthétiques deviennent plus pratiques et accessibles, nous commençons à les voir adoptées dans divers cas d’utilisation réels de l’AI de vision. Explorons certaines des applications les plus importantes de la vision par ordinateur dans lesquelles elles sont utilisées.
Utiliser des données synthétiques pour la détection d’objets dans les véhicules autonomes#
Apprendre aux voitures autonomes à circuler en toute sécurité nécessite d’entraîner les modèles sur un large éventail de scénarios, notamment des situations rares ou dangereuses. Cependant, la collecte de données du monde réel pour ces cas limites peut être difficile et parfois dangereuse. Les données synthétiques peuvent aider à créer des scènes dans lesquelles les modèles apprennent à détecter des objets dans des situations complexes. Elles peuvent également imiter différentes configurations de capteurs, ce qui est utile, car toutes les voitures autonomes n’utilisent pas le même matériel.
La plateforme DRIVE Sim de NVIDIA en est un excellent exemple. Elle crée des données synthétiques de haute qualité à l’aide de modèles 3D photoréalistes, d’environnements virtuels et de simulations de capteurs. Elle peut également générer des images correspondant à plusieurs angles de conduite à partir d’une seule image. Utiliser ainsi des données synthétiques contribue à réduire le besoin de tests coûteux dans le monde réel, tout en fournissant au modèle la diversité dont il a besoin pour apprendre efficacement.

Fig. 4. Création de plusieurs vues de conduite à partir d’une image (source).
Réduire les biais de l’AI en imagerie médicale grâce aux données synthétiques#
Les modèles de vision par ordinateur comme Ultralytics YOLO11, qui prennent en charge des tâches telles que la détection d’objets et la segmentation d’instances, peuvent être entraînés sur mesure pour des applications d’imagerie médicale. Cependant, les données d’entraînement du monde réel contiennent souvent des biais, car elles ne représentent pas suffisamment les patients de tous les groupes démographiques.
Par exemple, le cancer de la peau est moins souvent diagnostiqué chez les personnes à la peau foncée, ce qui entraîne un volume de données limité pour ces populations. Ce déséquilibre peut contribuer à des erreurs de diagnostic et à des inégalités en matière de santé, notamment dans des domaines comme l’histopathologie, les radiographies thoraciques et la dermatologie.
Les images synthétiques peuvent contribuer à réduire cet écart en matière de données. En générant des exemples supplémentaires et diversifiés, comme différentes anomalies tissulaires, un large éventail d’affections pulmonaires et des carnations présentant différents types de lésions, les données synthétiques peuvent aider à améliorer les performances des modèles pour les groupes sous-représentés.
Les chercheurs travaillent actuellement à la création et à la validation de jeux de données synthétiques pour soutenir ces objectifs. Ils étudient également comment les données synthétiques peuvent être utilisées pour tester des outils médicaux et des stratégies de traitement sans s’appuyer sur de véritables dossiers de patients, ce qui contribue à accélérer la recherche tout en protégeant la confidentialité des patients. Grâce à ces travaux, les données synthétiques ouvrent la voie à des systèmes d’AI médicale plus inclusifs, précis et éthiques.
Faire progresser l’AI agricole grâce aux données synthétiques pour l’agriculture de précision#
La création de systèmes d’AI de vision pour les applications agricoles dépend de l’accès à de grandes quantités de données annotées. Cependant, photographier et annoter des cultures, des maladies et des conditions de terrain est lent, coûteux et souvent limité par des facteurs comme la météo, les saisons de croissance ou la difficulté d’accès à certaines zones.
Ces difficultés compliquent l’entraînement de modèles de vision par ordinateur capables de gérer des tâches comme la détection des maladies des plantes, la surveillance des cultures ou la prévision des rendements. C’est là que les données synthétiques peuvent aider : elles imitent différents environnements agricoles pour générer des exemples d’entraînement utiles.

Fig. 5. Utilisation d’images synthétiques pour améliorer la détection des maladies (source).
Points clés à retenir#
L’utilisation de données synthétiques représente une avancée importante pour l’entraînement des modèles d’AI, notamment pour les systèmes de vision par ordinateur dans les domaines où les données du monde réel sont limitées ou difficiles à obtenir. Plutôt que de s’appuyer uniquement sur des photos ou des vidéos réelles, qui peuvent être coûteuses, chronophages ou soulever des problèmes de confidentialité, les données synthétiques permettent de générer à la demande des images réalistes et annotées.
Elles facilitent l’entraînement des modèles d’AI de vision pour des tâches comme la conduite autonome, la détection des maladies ou la surveillance des cultures. À mesure que l’AI continue d’évoluer, les données synthétiques devraient jouer un rôle encore plus important pour accélérer l’innovation et améliorer l’accessibilité dans tous les secteurs.
En savoir plus sur l’AI grâce à notre dépôt GitHub et rejoins notre communauté grandissante. Découvre l’impact d’applications comme l’AI dans les véhicules autonomes et la vision par ordinateur dans l’agriculture. Explore nos options de licence et donne vie à tes projets d’AI de vision.









