Synthetic Data
Descubre cómo los datos sintéticos impulsan la IA y el aprendizaje automático. Aprende a generar conjuntos de datos de alta calidad para Ultralytics YOLO26 y mejorar hoy mismo la precisión del modelo.
Los datos sintéticos son información generada artificialmente que imita las propiedades estadísticas, los patrones y las características estructurales de los datos del mundo real. En los campos en rápida evolución de la inteligencia artificial (AI) y el aprendizaje automático (ML), estos datos son un recurso fundamental cuando recopilar datos auténticos resulta caro, requiere mucho tiempo o está restringido por las normativas de privacidad. A diferencia de los datos orgánicos obtenidos de acontecimientos del mundo real, los datos sintéticos se crean algorítmicamente mediante técnicas como las simulaciones informáticas y los modelos generativos avanzados. Los analistas del sector de Gartner predicen que, para 2030, los datos sintéticos superarán a los datos reales en los modelos de AI, transformando radicalmente la forma en que se crean y despliegan los sistemas inteligentes.
El papel de los datos sintéticos en el desarrollo de AI#
El principal motivo para utilizar conjuntos de datos sintéticos es superar las limitaciones inherentes a la recopilación y anotación de datos tradicionales. Entrenar modelos sólidos de visión artificial (CV) suele requerir conjuntos de datos masivos que contengan escenarios diversos. Cuando los datos del mundo real son escasos —como en el diagnóstico de enfermedades poco frecuentes o en accidentes de tráfico peligrosos y extremos—, los datos sintéticos cubren esa carencia.
Generar estos datos permite a los desarrolladores crear datos de entrenamiento perfectamente etiquetados bajo demanda. Esto incluye BBox precisas para la detección de objetos o máscaras píxel a píxel para la segmentación semántica, lo que elimina los errores humanos habituales en los procesos de etiquetado manual. Además, aborda el sesgo en AI al permitir que los ingenieros equilibren deliberadamente los conjuntos de datos con grupos o condiciones ambientales infrarrepresentados, garantizando un rendimiento más justo de los modelos.
Aplicaciones en el mundo real#
Los datos sintéticos están revolucionando los sectores en los que la privacidad de los datos, la seguridad y la escalabilidad son primordiales.
- Simulaciones de conducción autónoma: Probar vehículos autónomos únicamente en el mundo físico es arriesgado y está limitado geográficamente. Las empresas utilizan simuladores fotorrealistas, como NVIDIA Omniverse, para entrenar sus sistemas de percepción. Estos simuladores generan miles de millones de kilómetros virtuales y exponen la AI a condiciones meteorológicas peligrosas, comportamientos impredecibles de los peatones y complejas configuraciones urbanas que son difíciles de capturar de forma sistemática en el mundo real.
- Asistencia sanitaria e imagen médica: Las leyes de privacidad de los pacientes, como HIPAA y GDPR, regulan estrictamente el intercambio de historiales médicos. Los datos sintéticos permiten crear conjuntos de datos realistas de análisis de imágenes médicas, como radiografías o exploraciones de MRI, que conservan los indicadores de las patologías sin contener información personal identificable. Esto permite a los investigadores entrenar modelos de detección de tumores de forma colaborativa sin poner en peligro la confidencialidad de los pacientes.
Generación de datos sintéticos para AI de visión#
La creación de datos sintéticos de alta calidad suele implicar dos enfoques principales: motores de simulación e AI generativa. Los motores de simulación, como Unity Engine, utilizan gráficos 3D para renderizar escenas con iluminación y texturas basadas en la física. Como alternativa, los modelos generativos, como las redes generativas antagónicas (GANs) y los modelos de difusión, aprenden la distribución de los datos reales para sintetizar ejemplos nuevos y fotorrealistas.
Una vez generado un conjunto de datos sintéticos, puede utilizarse para entrenar modelos de alto rendimiento. El siguiente ejemplo de Python muestra cómo cargar un modelo —posiblemente entrenado con datos sintéticos— mediante el paquete ultralytics para realizar inferencias sobre una imagen.
from ultralytics import YOLO
# Load the YOLO26 model (latest stable generation for superior accuracy)
model = YOLO("yolo26n.pt")
# Run inference on a source image (this could be a synthetic validation image)
results = model("https://ultralytics.com/images/bus.jpg")
# Display the detection results to verify model performance
results[0].show()Datos sintéticos frente a aumento de datos#
Es útil distinguir los datos sintéticos del aumento de datos, ya que ambas técnicas pretenden ampliar los conjuntos de datos, pero funcionan de forma diferente.
- El aumento de datos consiste en aplicar transformaciones —como volteo, rotación, recorte o ajuste del color— a imágenes reales existentes para crear variaciones sutiles. Depende de la fuente de datos original.
- Los datos sintéticos consisten en crear instancias de datos nuevas desde cero mediante algoritmos o simulaciones. No requieren estrictamente una imagen original para cada resultado, lo que permite generar escenarios que nunca se hayan capturado con una cámara.
Los flujos de trabajo modernos en la Ultralytics Platform suelen combinar ambos enfoques: utilizan datos sintéticos para cubrir carencias del conjunto de datos y aplican aumento de datos durante el entrenamiento para maximizar la robustez de modelos como YOLO26.









