Dữ liệu tổng hợp trong thị giác máy tính là gì? Tổng quan
Khám phá cách dữ liệu tổng hợp để huấn luyện model AI được sử dụng trong các ứng dụng thị giác máy tính thuộc nhiều ngành như chăm sóc sức khỏe và robotics.

Dữ liệu luôn là yếu tố thúc đẩy các lĩnh vực như phân tích dữ liệu và trí tuệ nhân tạo (AI). Trên thực tế, cách chúng ta thu thập, tạo và sử dụng dữ liệu đang định hình tương lai của các hệ thống thông minh. Ví dụ, xe tự lái phụ thuộc vào hàng triệu hình ảnh được gán nhãn và dữ liệu cảm biến, từ biển báo giao thông đến chuyển động của người đi bộ, để học cách di chuyển an toàn trên đường.
Một trong những loại dữ liệu quan trọng nhất thúc đẩy tiến bộ này, đặc biệt trong các lĩnh vực như phương tiện tự hành và an ninh, là dữ liệu hình ảnh như ảnh và video.
Cụ thể, lĩnh vực AI giúp máy móc diễn giải thông tin hình ảnh này được gọi là thị giác máy tính. Công nghệ này giúp các hệ thống hiểu và phân tích dữ liệu đầu vào hình ảnh tương tự như con người, hỗ trợ các tác vụ như nhận dạng khuôn mặt, phát hiện biển báo giao thông và phân tích hình ảnh y tế.
Tuy nhiên, việc thu thập các dataset hình ảnh quy mô lớn, chất lượng cao từ thế giới thực có thể tốn nhiều thời gian, chi phí và thường làm phát sinh các mối lo ngại về quyền riêng tư. Vì vậy, các nhà nghiên cứu đang tích cực tìm hiểu khái niệm khai thác dữ liệu tổng hợp.
Dữ liệu tổng hợp là các hình ảnh được tạo nhân tạo, mô phỏng sát ảnh và video trong thế giới thực. Dữ liệu này được tạo bằng các kỹ thuật như mô hình hóa 3D, mô phỏng máy tính và các phương pháp AI tạo sinh như Mạng đối sinh đối nghịch (GANs), trong đó các mô hình học các mẫu từ dữ liệu thực để tạo ra những ví dụ mới chân thực.
Dữ liệu tổng hợp được kỳ vọng sẽ đóng vai trò quan trọng trong phát triển AI trong thời gian tới - Gartner dự đoán rằng đến năm 2030, dữ liệu này sẽ trở nên thiết yếu hơn dữ liệu trong thế giới thực. Trong bài viết này, chúng ta sẽ tìm hiểu dữ liệu tổng hợp là gì trong bối cảnh thị giác máy tính, cách dữ liệu được tạo ra và những nơi dữ liệu đang được ứng dụng trong các tình huống thực tế. Hãy bắt đầu!
Dữ liệu tổng hợp trong thị giác máy tính là gì?#
Giả sử bạn muốn huấn luyện một model AI thị giác để phát hiện các đối tượng trong nhiều môi trường và điều kiện khác nhau. Chỉ dựa vào dữ liệu trong thế giới thực có thể khó khăn và đôi khi tạo cảm giác bị giới hạn.
Trong khi đó, dữ liệu tổng hợp có thể được sử dụng để tạo ra dataset phù hợp, bao gồm các đối tượng trong nhiều điều kiện được tạo nhân tạo. Bằng cách sử dụng các công cụ như mô hình hóa 3D và mô phỏng, các nhà phát triển có thể tạo hình ảnh với quyền kiểm soát chính xác đối với những yếu tố như ánh sáng, góc nhìn và vị trí đối tượng. Nhờ đó, dữ liệu tổng hợp mang lại nhiều linh hoạt hơn cho việc huấn luyện model so với dữ liệu trong thế giới thực.
Dữ liệu tổng hợp đặc biệt hữu ích khi việc thu thập dữ liệu trong thế giới thực khó khăn hoặc không thể thực hiện. Ví dụ, để huấn luyện một model nhận diện người trong nhiều tư thế khác nhau như chạy, ngồi xổm hoặc nằm, cần chụp hàng nghìn bức ảnh trong nhiều bối cảnh, góc nhìn và điều kiện ánh sáng khác nhau.
Ngược lại, với dữ liệu tổng hợp, các nhà phát triển có thể dễ dàng tạo ra những biến thể này cùng nhãn chính xác, tiết kiệm thời gian và công sức đồng thời cải thiện hiệu năng của model.

Hình 1. Dataset tổng hợp với các tư thế con người và biến thể ánh sáng khác nhau (nguồn).
Dữ liệu tổng hợp so với dữ liệu thực trong AI#
Tiếp theo, hãy xem xét kỹ hơn sự khác biệt giữa dữ liệu tổng hợp và dữ liệu thực. Cả hai đều có ưu và nhược điểm khi dùng để huấn luyện các model AI.
Ví dụ, dữ liệu tổng hợp hữu ích khi dữ liệu thực khó thu thập, nhưng có thể không ghi lại được mọi chi tiết nhỏ trong đời thực. Đồng thời, dữ liệu thực chân thực hơn, nhưng có thể khó tìm nguồn, tốn thời gian gán nhãn và không bao quát được mọi tình huống.
Bằng cách kết hợp dữ liệu tổng hợp và dữ liệu thực, các nhà phát triển có thể tận dụng ưu điểm của cả hai. Sự cân bằng này giúp các model AI học chính xác hơn, tổng quát hóa tốt hơn trên nhiều kịch bản khác nhau và giảm độ lệch.

Hình 2. Dữ liệu tổng hợp so với dữ liệu thực trong AI. Hình ảnh do tác giả tạo.
Tổng quan về việc tạo dữ liệu cho các model thị giác máy tính#
Từ việc xây dựng thế giới ảo bằng các công cụ 3D đến tạo hình ảnh bằng AI tạo sinh, dưới đây là một số phương pháp phổ biến được sử dụng để tạo dữ liệu huấn luyện tổng hợp cho các model thị giác máy tính:
- Mô hình hóa 3D: Các nhà phát triển sử dụng phần mềm 3D để tạo các đối tượng và khung cảnh kỹ thuật số. Điều này cho phép kiểm soát hoàn toàn những yếu tố như ánh sáng, góc camera và vị trí đối tượng, đồng thời hữu ích trong việc tạo hình ảnh chân thực về con người, phương tiện và môi trường.
- Mô phỏng: Các phương pháp này tái tạo những tình huống trong thế giới thực như giao thông hoặc môi trường nhà máy bằng các engine dựa trên vật lý. Mô phỏng hữu ích để tạo dữ liệu huấn luyện an toàn trong các lĩnh vực như robot và xe tự lái.
- Mạng đối sinh đối nghịch: GANs là một loại model học sâu gồm hai mạng: một mạng tạo hình ảnh và một mạng đánh giá chúng. Kết hợp với nhau, hai mạng tạo ra những hình ảnh có độ chân thực cao, chẳng hạn như khuôn mặt người hoặc cảnh đường phố, bằng cách học từ các ví dụ thực.
- Tạo sinh theo quy trình: Kỹ thuật này sử dụng các quy tắc được định nghĩa trước hoặc các model toán học để tự động tạo ra những cấu trúc hình ảnh phức tạp như địa hình, tòa nhà hoặc texture. Kỹ thuật này thường được sử dụng trong game và các nền tảng mô phỏng, đồng thời có thể tạo ra các dataset đa dạng, quy mô lớn với rất ít sự can thiệp của con người.
- Ngẫu nhiên hóa miền: Kỹ thuật này có thể thay đổi ngẫu nhiên những yếu tố như ánh sáng, màu sắc và hình dạng đối tượng trong các cảnh tổng hợp. Mục tiêu của kỹ thuật là giúp model tập trung vào những yếu tố thực sự quan trọng, từ đó thích ứng tốt hơn với môi trường trong thế giới thực.

Hình 3. Ví dụ dữ liệu: (a) dựa trên model 3D, (b) các cảnh tổng hợp nhiều đối tượng và (c) hình ảnh từ dataset thực (nguồn).
Huấn luyện model AI thị giác bằng dữ liệu tổng hợp#
Sau khi đã thảo luận về một số phương pháp khác nhau được sử dụng để tạo dữ liệu tổng hợp, hãy cùng tìm hiểu cách dữ liệu này được dùng để huấn luyện các model AI.
Sau khi được tạo, dữ liệu tổng hợp thường có thể được tích hợp trực tiếp vào pipeline huấn luyện theo cách tương tự dữ liệu trong thế giới thực. Dữ liệu này thường bao gồm các annotation cần thiết như nhãn đối tượng, bounding box hoặc mask phân đoạn, nghĩa là có thể được sử dụng cho các tác vụ học có giám sát, trong đó model học từ các cặp input-output đã gán nhãn mà không cần gán nhãn thủ công.
Trong quá trình huấn luyện, model xử lý các hình ảnh tổng hợp để học cách phát hiện đặc trưng, nhận diện mẫu và phân loại đối tượng. Dữ liệu này có thể được sử dụng để xây dựng phiên bản ban đầu của model từ đầu hoặc bổ sung cho một dataset hiện có, qua đó giúp cải thiện hiệu năng của model.
Trong nhiều workflow, dữ liệu tổng hợp cũng được sử dụng để pretraining, giúp model có được hiểu biết nền tảng rộng trước khi được fine-tune bằng các ví dụ trong thế giới thực. Tương tự, dữ liệu này được dùng để tăng cường dataset bằng cách đưa vào các biến thể có kiểm soát như điều kiện ánh sáng, góc nhìn hoặc các lớp đối tượng hiếm, nhằm cải thiện khả năng tổng quát hóa và giảm overfitting.
Bằng cách kết hợp dữ liệu tổng hợp và dữ liệu thực, các team có thể huấn luyện những model mạnh mẽ hơn, hoạt động tốt trong nhiều điều kiện khác nhau, đồng thời giảm sự phụ thuộc vào các nỗ lực thu thập dữ liệu thủ công tốn thời gian và chi phí.
Các ứng dụng thực tế của dữ liệu tổng hợp trong thị giác máy tính#
Khi dữ liệu tổng hợp trở nên thiết thực và dễ tiếp cận hơn, chúng ta bắt đầu thấy dữ liệu này được áp dụng trong nhiều use case AI thị giác thực tế. Hãy cùng khám phá một số ứng dụng trong thị giác máy tính có tác động lớn nhất đang sử dụng dữ liệu tổng hợp.
Sử dụng dữ liệu tổng hợp để phát hiện đối tượng trong phương tiện tự hành#
Để dạy xe tự lái vận hành an toàn, cần huấn luyện model trên nhiều kịch bản khác nhau, bao gồm các tình huống hiếm gặp hoặc nguy hiểm. Tuy nhiên, việc thu thập dữ liệu trong thế giới thực cho những trường hợp đặc biệt này có thể khó khăn và đôi khi không an toàn. Dữ liệu tổng hợp có thể giúp tạo ra các cảnh trong đó model học cách phát hiện đối tượng trong những tình huống khó. Dữ liệu này cũng có thể mô phỏng các cấu hình cảm biến khác nhau, điều hữu ích vì không phải mọi xe tự lái đều sử dụng cùng một phần cứng.
Nền tảng NVIDIA’s DRIVE Sim là một ví dụ điển hình. Nền tảng này tạo dữ liệu tổng hợp chất lượng cao bằng các model 3D ảnh thực, môi trường ảo và mô phỏng cảm biến. Nền tảng cũng có thể tạo hình ảnh từ nhiều góc nhìn lái xe khác nhau chỉ từ một hình ảnh. Việc sử dụng dữ liệu tổng hợp như vậy giúp giảm nhu cầu kiểm thử tốn kém trong thế giới thực, đồng thời vẫn cung cấp cho model sự đa dạng cần thiết để học hiệu quả.

Hình 4. Tạo nhiều góc nhìn lái xe từ một hình ảnh (nguồn).
Giảm độ lệch trong AI hình ảnh y tế bằng dữ liệu tổng hợp#
Các model thị giác máy tính như Ultralytics YOLO11, hỗ trợ các tác vụ như phát hiện đối tượng và phân đoạn instance, có thể được huấn luyện tùy chỉnh cho các ứng dụng hình ảnh y tế. Tuy nhiên, dữ liệu huấn luyện trong thế giới thực thường chứa độ lệch vì có thể không đại diện đầy đủ cho bệnh nhân thuộc mọi nhóm nhân khẩu học.
Ví dụ, ung thư da ít được chẩn đoán hơn ở những người có tông da sẫm màu, dẫn đến dữ liệu hạn chế cho các nhóm dân cư này. Sự mất cân bằng này có thể góp phần gây ra chẩn đoán sai và kết quả chăm sóc sức khỏe không bình đẳng, đặc biệt trong các lĩnh vực như mô bệnh học, X-quang ngực và da liễu.
Hình ảnh tổng hợp có thể góp phần thu hẹp khoảng cách dữ liệu này. Bằng cách tạo thêm các ví dụ đa dạng như những bất thường mô khác nhau, nhiều tình trạng phổi và các tông da với nhiều loại tổn thương khác nhau, dữ liệu tổng hợp có thể giúp cải thiện hiệu năng của model trên các nhóm chưa được đại diện đầy đủ.
Các nhà nghiên cứu hiện đang phát triển và xác thực những dataset tổng hợp để hỗ trợ các mục tiêu này. Họ cũng đang tìm hiểu cách sử dụng dữ liệu tổng hợp để kiểm thử các công cụ y tế và chiến lược điều trị mà không phụ thuộc vào hồ sơ bệnh nhân thực, qua đó đẩy nhanh nghiên cứu đồng thời bảo vệ quyền riêng tư của bệnh nhân. Thông qua những nỗ lực này, dữ liệu tổng hợp đang mở đường cho các hệ thống AI y tế toàn diện, chính xác và có đạo đức hơn.
Thúc đẩy AI nông nghiệp bằng dữ liệu tổng hợp cho canh tác chính xác#
Việc xây dựng các hệ thống Vision AI cho ứng dụng nông nghiệp phụ thuộc vào khả năng tiếp cận lượng lớn dữ liệu được gán nhãn. Tuy nhiên, việc thu thập và gán nhãn hình ảnh về cây trồng, bệnh tật và điều kiện đồng ruộng chậm, tốn kém, đồng thời thường bị hạn chế bởi các yếu tố như thời tiết, mùa vụ hoặc khó tiếp cận một số khu vực.
Những thách thức này khiến việc huấn luyện các model thị giác máy tính thực hiện các tác vụ như phát hiện bệnh cây, giám sát cây trồng hoặc dự đoán năng suất trở nên khó khăn. Đây là lúc dữ liệu tổng hợp có thể hỗ trợ - bằng cách mô phỏng các môi trường canh tác khác nhau để tạo ra những ví dụ huấn luyện hữu ích.

Hình 5. Sử dụng hình ảnh tổng hợp để cải thiện khả năng phát hiện bệnh (nguồn).
Những điểm chính#
Sử dụng dữ liệu tổng hợp là một bước tiến quan trọng trong huấn luyện model AI, đặc biệt đối với các hệ thống thị giác máy tính trong những lĩnh vực có dữ liệu thực hạn chế hoặc khó thu thập. Thay vì chỉ dựa vào ảnh hoặc video thực, vốn có thể tốn kém, mất thời gian hoặc làm phát sinh lo ngại về quyền riêng tư, dữ liệu tổng hợp cho phép chúng ta tạo ra các hình ảnh chân thực, được gán nhãn theo nhu cầu.
Dữ liệu tổng hợp giúp việc huấn luyện các model AI thị giác cho những tác vụ như lái xe tự hành, phát hiện bệnh hoặc giám sát cây trồng trở nên dễ dàng hơn. Khi AI tiếp tục phát triển, dữ liệu tổng hợp sẽ đóng vai trò ngày càng lớn trong việc đẩy nhanh đổi mới và cải thiện khả năng tiếp cận trong nhiều ngành.
Tìm hiểu thêm về AI trên repository GitHub của chúng tôi và tham gia cộng đồng đang phát triển. Khám phá tác động của các ứng dụng như AI trong phương tiện tự hành và thị giác máy tính trong nông nghiệp. Tìm hiểu các lựa chọn cấp phép và biến các dự án AI thị giác của bạn thành hiện thực.









