Synthetic Data
Découvre comment les données synthétiques alimentent l’IA et le machine learning. Apprends à générer des jeux de données de haute qualité pour Ultralytics YOLO26 afin d’améliorer dès aujourd’hui la précision des modèles.
Les données synthétiques sont des informations générées artificiellement qui reproduisent les propriétés statistiques, les schémas et les caractéristiques structurelles des données du monde réel. Dans les domaines en évolution rapide de l’intelligence artificielle (AI) et de l’apprentissage automatique (ML), ces données constituent une ressource essentielle lorsque la collecte de données authentiques est coûteuse, chronophage ou limitée par les réglementations relatives à la confidentialité. Contrairement aux données organiques recueillies à partir d’événements du monde réel, les données synthétiques sont créées algorithmiquement à l’aide de techniques telles que les simulations informatiques et les modèles génératifs avancés. D’ici 2030, les analystes du secteur de Gartner prévoient que les données synthétiques supplanteront les données réelles dans les modèles d’AI, transformant fondamentalement la manière dont les systèmes intelligents sont conçus et déployés.
Le rôle des données synthétiques dans le développement de l’AI#
Le principal moteur de l’utilisation des jeux de données synthétiques est de surmonter les limites inhérentes à la collecte et à l’annotation des données traditionnelles. L’entraînement de modèles robustes de vision par ordinateur (CV) nécessite souvent d’énormes jeux de données contenant des scénarios variés. Lorsque les données du monde réel sont rares — par exemple pour le diagnostic de maladies rares ou les accidents de la circulation dangereux dans des situations limites — les données synthétiques comblent le manque.
La génération de ces données permet aux développeurs de créer à la demande des [données d’entraînement](https://ultralytics-translation-0.invalid parfaitement annotées. Cela inclut des boîtes englobantes précises pour la détection d’objets ou des masques au pixel près pour la segmentation sémantique, ce qui élimine les erreurs humaines souvent présentes dans les processus d’annotation manuelle. De plus, cette approche permet de traiter les biais dans l’AI en donnant aux ingénieurs la possibilité d’équilibrer délibérément les jeux de données avec des groupes ou des conditions environnementales sous-représentés, afin de garantir des performances plus équitables des modèles.
Applications concrètes#
Les données synthétiques révolutionnent les secteurs où la confidentialité des données, la sécurité et l’évolutivité sont essentielles.
- Simulations de conduite autonome : Tester des véhicules autonomes uniquement dans le monde physique est risqué et limité géographiquement. Les entreprises utilisent des simulateurs photoréalistes, tels que NVIDIA Omniverse, pour entraîner leurs systèmes de perception. Ces simulateurs génèrent des milliards de kilomètres virtuels, exposant l’AI à des conditions météorologiques dangereuses, au comportement imprévisible des piétons et à des configurations urbaines complexes, difficiles à capturer de manière cohérente dans le monde réel.
- Santé et imagerie médicale : Les lois sur la confidentialité des patients, telles que la HIPAA et le GDPR, encadrent strictement le partage des dossiers médicaux. Les données synthétiques permettent de créer des jeux de données réalistes d’analyse d’images médicales — comme des radiographies ou des IRM — qui conservent les marqueurs des pathologies sans contenir d’informations permettant d’identifier personnellement les patients. Les chercheurs peuvent ainsi entraîner en collaboration des modèles de détection des tumeurs sans compromettre la confidentialité des patients.
Générer des données synthétiques pour l’AI appliquée à la vision#
La création de données synthétiques de haute qualité repose souvent sur deux approches principales : les moteurs de simulation et l’AI générative. Les moteurs de simulation, comme le Unity Engine, utilisent des graphismes 3D pour rendre des scènes avec un éclairage et des textures fondés sur la physique. Les modèles génératifs, tels que les réseaux antagonistes génératifs (GANs) et les modèles de diffusion, apprennent quant à eux la distribution des données réelles afin de synthétiser de nouveaux exemples photoréalistes.
Une fois qu’un jeu de données synthétiques est généré, il peut être utilisé pour entraîner des modèles hautement performants. L’exemple Python suivant montre comment charger un modèle — potentiellement entraîné sur des données synthétiques — à l’aide du package ultralytics afin d’effectuer une inférence sur une image.
from ultralytics import YOLO
# Load the YOLO26 model (latest stable generation for superior accuracy)
model = YOLO("yolo26n.pt")
# Run inference on a source image (this could be a synthetic validation image)
results = model("https://ultralytics.com/images/bus.jpg")
# Display the detection results to verify model performance
results[0].show()Données synthétiques et augmentation des données#
Il est utile de distinguer les données synthétiques de l’augmentation des données, car les deux techniques visent à étendre les jeux de données, mais fonctionnent différemment.
- L’augmentation des données consiste à appliquer des transformations — comme le retournement, la rotation, le recadrage ou l’ajustement des couleurs — à des images réelles existantes afin de créer de légères variations. Elle repose sur la source de données d’origine.
- Les données synthétiques consistent à créer entièrement de nouvelles instances de données à partir de zéro à l’aide d’algorithmes ou de simulations. Elles ne nécessitent pas obligatoirement une image d’origine pour chaque résultat, ce qui permet de générer des scénarios qui n’ont jamais été capturés par une caméra.
Les flux de travail modernes sur la plateforme Ultralytics combinent souvent les deux approches : utiliser des données synthétiques pour combler les lacunes du jeu de données et appliquer l’augmentation des données pendant l’entraînement afin de maximiser la robustesse de modèles comme YOLO26.









