Synthetic Data
Khám phá cách dữ liệu tổng hợp hỗ trợ AI và machine learning. Tìm hiểu cách tạo dataset chất lượng cao cho Ultralytics YOLO26 để cải thiện độ chính xác của model ngay hôm nay.
Dữ liệu tổng hợp là thông tin được tạo ra một cách nhân tạo, mô phỏng các thuộc tính thống kê, mẫu hình và đặc điểm cấu trúc của dữ liệu trong thế giới thực. Trong các lĩnh vực trí tuệ nhân tạo (AI) và machine learning (ML) đang phát triển nhanh chóng, dữ liệu này là một tài nguyên thiết yếu khi việc thu thập dữ liệu xác thực tốn kém, mất nhiều thời gian hoặc bị hạn chế bởi các quy định về quyền riêng tư. Khác với dữ liệu tự nhiên được thu thập từ các sự kiện trong thế giới thực, dữ liệu tổng hợp được tạo ra bằng thuật toán thông qua các kỹ thuật như mô phỏng máy tính và các model generative tiên tiến. Gartner dự đoán rằng đến năm 2030, dữ liệu tổng hợp sẽ vượt qua dữ liệu thực trong các model AI, làm thay đổi căn bản cách các hệ thống thông minh được xây dựng và triển khai.
Vai trò của dữ liệu tổng hợp trong phát triển AI#
Động lực chính cho việc sử dụng các dataset tổng hợp là khắc phục những hạn chế vốn có trong việc thu thập và gắn nhãn dữ liệu truyền thống. Việc huấn luyện các model computer vision (CV) mạnh mẽ thường đòi hỏi các dataset khổng lồ chứa nhiều tình huống đa dạng. Khi dữ liệu trong thế giới thực khan hiếm—chẳng hạn như trong chẩn đoán bệnh hiếm gặp hoặc các vụ tai nạn giao thông nguy hiểm thuộc những trường hợp biên—dữ liệu tổng hợp sẽ thu hẹp khoảng cách này.
Việc tạo ra dữ liệu này cho phép developer tạo dữ liệu huấn luyện được gắn nhãn hoàn hảo theo nhu cầu. Dữ liệu này bao gồm các bounding box chính xác cho phát hiện đối tượng hoặc các mask chính xác đến từng pixel cho phân đoạn ngữ nghĩa, loại bỏ lỗi do con người thường xuất hiện trong quy trình gắn nhãn thủ công. Hơn nữa, dữ liệu tổng hợp còn giải quyết vấn đề thiên lệch trong AI bằng cách cho phép engineer chủ động cân bằng dataset với các nhóm hoặc điều kiện môi trường chưa được đại diện đầy đủ, từ đó đảm bảo hiệu năng model công bằng hơn.
Các ứng dụng trong thực tế#
Dữ liệu tổng hợp đang tạo ra cuộc cách mạng trong những ngành mà quyền riêng tư dữ liệu, an toàn và khả năng mở rộng là các yếu tố tối quan trọng.
- Mô phỏng lái xe tự hành: Việc chỉ kiểm thử xe tự hành trong thế giới vật lý tiềm ẩn rủi ro và bị giới hạn về địa lý. Các công ty sử dụng những trình mô phỏng có độ chân thực cao, chẳng hạn như NVIDIA Omniverse, để huấn luyện các hệ thống nhận thức của họ. Những trình mô phỏng này tạo ra hàng tỷ dặm di chuyển ảo, cho AI tiếp xúc với thời tiết nguy hiểm, hành vi thất thường của người đi bộ và bố cục đô thị phức tạp—những yếu tố khó được ghi lại một cách nhất quán trong thế giới thực.
- Chăm sóc sức khỏe và hình ảnh y khoa: Các luật về quyền riêng tư của bệnh nhân như HIPAA và GDPR quản lý nghiêm ngặt việc chia sẻ hồ sơ y tế. Dữ liệu tổng hợp cho phép tạo các dataset phân tích hình ảnh y khoa chân thực—chẳng hạn như ảnh X-quang hoặc ảnh MRI—vẫn giữ lại các dấu hiệu bệnh lý nhưng không chứa bất kỳ thông tin nhận dạng cá nhân nào. Điều này cho phép các nhà nghiên cứu cùng huấn luyện model phát hiện khối u mà không làm tổn hại đến tính bảo mật của bệnh nhân.
Tạo dữ liệu tổng hợp cho AI thị giác#
Việc tạo dữ liệu tổng hợp chất lượng cao thường bao gồm hai phương pháp chính: engine mô phỏng và AI generative. Các engine mô phỏng, chẳng hạn như Unity Engine, sử dụng đồ họa 3D để dựng các cảnh với ánh sáng và texture dựa trên vật lý. Ngoài ra, các model generative như Mạng đối nghịch tạo sinh (GANs) và model diffusion học phân phối của dữ liệu thực để tổng hợp các ví dụ mới có độ chân thực cao.
Sau khi dataset tổng hợp được tạo, nó có thể được sử dụng để huấn luyện các model hiệu năng cao. Ví dụ Python sau đây minh họa cách tải một model—có thể đã được huấn luyện trên dữ liệu tổng hợp—bằng package ultralytics để thực hiện inference trên một hình ảnh.
from ultralytics import YOLO
# Load the YOLO26 model (latest stable generation for superior accuracy)
model = YOLO("yolo26n.pt")
# Run inference on a source image (this could be a synthetic validation image)
results = model("https://ultralytics.com/images/bus.jpg")
# Display the detection results to verify model performance
results[0].show()Dữ liệu tổng hợp và tăng cường dữ liệu#
Việc phân biệt dữ liệu tổng hợp với tăng cường dữ liệu là rất hữu ích, vì cả hai kỹ thuật đều nhằm mở rộng dataset nhưng hoạt động theo những cách khác nhau.
- Tăng cường dữ liệu bao gồm việc áp dụng các phép biến đổi—chẳng hạn như lật, xoay, cắt hoặc điều chỉnh màu—cho các hình ảnh thực trong dataset hiện có để tạo ra những biến thể nhỏ. Phương pháp này phụ thuộc vào nguồn dữ liệu ban đầu.
- Dữ liệu tổng hợp bao gồm việc tạo ra các instance dữ liệu hoàn toàn mới từ đầu bằng thuật toán hoặc mô phỏng. Phương pháp này không bắt buộc phải có một hình ảnh gốc cho mỗi đầu ra, nhờ đó cho phép tạo ra những tình huống chưa từng được camera ghi lại.
Các workflow hiện đại trên Ultralytics Platform thường kết hợp cả hai phương pháp: sử dụng dữ liệu tổng hợp để lấp đầy các khoảng trống trong dataset và áp dụng tăng cường dữ liệu trong quá trình huấn luyện nhằm tối đa hóa độ mạnh của các model như YOLO26.









