Synthetic Data
합성 데이터가 어떻게 AI와 머신러닝을 구동하는지 알아보세요. 모델 정확도를 높이기 위해 Ultralytics YOLO26을 위한 고품질 데이터셋을 생성하는 방법을 지금 배우세요.
합성 데이터(Synthetic data)는 실제 데이터의 통계적 속성, 패턴, 구조적 특성을 모방하여 인공적으로 생성된 정보입니다. 급격히 발전하는 인공지능(AI) 및 머신러닝(ML) 분야에서 이 데이터는 실제 데이터를 수집하는 비용이 많이 들거나, 시간이 오래 걸리거나, 개인정보 보호 규제로 인해 제한될 때 중요한 리소스 역할을 합니다. 실제 이벤트에서 수집되는 유기적 데이터와 달리, 합성 데이터는 컴퓨터 시뮬레이션 및 고급 생성 모델과 같은 기술을 사용하여 알고리즘적으로 생성됩니다. 가트너(Gartner)의 예측에 따르면, 2030년까지 합성 데이터가 AI 모델에서 실제 데이터를 능가하며 지능형 시스템이 구축 및 배포되는 방식을 근본적으로 바꿀 것입니다.
AI 개발에서 합성 데이터의 역할#
합성 데이터셋을 활용하는 주된 이유는 전통적인 데이터 수집 및 어노테이션의 한계를 극복하기 위함입니다. 강력한 컴퓨터 비전(CV) 모델을 학습하려면 다양한 시나리오를 포함하는 대규모 데이터셋이 필요한 경우가 많습니다. 희귀 질환 진단이나 위험한 코너케이스 교통사고와 같이 실제 데이터가 부족한 경우, 합성 데이터가 그 공백을 메워줍니다.
이 데이터를 생성하면 개발자는 필요에 따라 완벽하게 라벨링된 학습 데이터를 만들 수 있습니다. 여기에는 객체 감지를 위한 정밀한 바운딩 박스나 의미론적 분할을 위한 픽셀 단위의 완벽한 마스크가 포함되며, 수동 라벨링 과정에서 흔히 발생하는 인적 오류를 없애줍니다. 또한 AI의 편향 문제를 해결하여 엔지니어가 데이터셋을 과소 대표 그룹이나 환경 조건과 의도적으로 균형 있게 맞출 수 있도록 지원함으로써 더 공정한 모델 성능을 보장합니다.
실제 애플리케이션 사례#
합성 데이터는 데이터 프라이버시, 안전성 및 확장성이 매우 중요한 산업 분야를 혁신하고 있습니다.
- 자율주행 시뮬레이션: 물리적 세계에서만 자율주행차를 테스트하는 것은 위험하며 지리적 한계가 있습니다. 기업들은 NVIDIA Omniverse와 같은 포토리얼리스틱 시뮬레이터를 사용하여 인지 시스템을 학습합니다. 이러한 시뮬레이터는 수십억 마일의 가상 주행 거리를 생성하여, 실제 세계에서 지속적으로 포착하기 어려운 위험한 날씨, 불규칙한 보행자 행동, 복잡한 도시 레이아웃에 AI를 노출시킵니다.
- 의료 및 의료 영상: HIPAA 및 GDPR과 같은 환자 개인정보 보호법은 의료 기록 공유를 엄격하게 규제합니다. 합성 데이터를 사용하면 개인 식별 정보를 포함하지 않으면서도 병리적 특징을 유지하는 X-선 또는 MRI 스캔과 같은 사실적인 의료 영상 분석 데이터셋을 만들 수 있습니다. 이를 통해 연구자들은 환자의 기밀성을 침해하지 않고 공동으로 종양 탐지 모델을 학습할 수 있습니다.
비전 AI를 위한 합성 데이터 생성#
고품질 합성 데이터를 생성하는 과정은 주로 시뮬레이션 엔진과 생성형 AI라는 두 가지 접근 방식을 포함합니다. Unity Engine과 같은 시뮬레이션 엔진은 3D 그래픽을 사용하여 물리 기반 조명과 텍스처로 장면을 렌더링합니다. 또는 생성적 적대 신경망(GAN) 및 확산 모델(Diffusion models) 같은 생성 모델이 실제 데이터의 분포를 학습하여 새롭고 사실적인 예시를 합성합니다.
합성 데이터셋이 생성되면 이를 사용하여 고성능 모델을 학습할 수 있습니다. 다음 Python 예제는 ultralytics 패키지를 사용하여 (잠재적으로 합성 데이터로 학습된) 모델을 로드하고 이미지에 대해 추론을 수행하는 방법을 보여줍니다.
from ultralytics import YOLO
# Load the YOLO26 model (latest stable generation for superior accuracy)
model = YOLO("yolo26n.pt")
# Run inference on a source image (this could be a synthetic validation image)
results = model("https://ultralytics.com/images/bus.jpg")
# Display the detection results to verify model performance
results[0].show()합성 데이터 vs. 데이터 증강#
두 기법 모두 데이터셋 확장을 목표로 하지만 작동 방식이 다르므로, 합성 데이터를 데이터 증강(Data augmentation)과 구분하는 것이 유용합니다.
- 데이터 증강은 기존의 실제 이미지에 뒤집기, 회전, 자르기 또는 색상 조정과 같은 변환을 적용하여 약간의 변형을 만드는 것을 포함합니다. 이는 원래의 데이터 소스에 의존합니다.
- 합성 데이터는 알고리즘이나 시뮬레이션을 사용하여 처음부터 완전히 새로운 데이터 인스턴스를 만드는 것을 포함합니다. 모든 결과물에 대해 원본 이미지가 반드시 필요한 것은 아니며, 카메라로 포착된 적 없는 시나리오를 생성할 수 있습니다.
Ultralytics Platform의 최신 워크플로는 두 가지 접근 방식을 결합하는 경우가 많습니다. 즉, 합성 데이터를 사용하여 데이터셋의 공백을 메우고, 학습 중에 데이터 증강을 적용하여 YOLO26 같은 모델의 견고성을 극대화합니다.






