Data-Centric AI
Khám phá Data-Centric AI để nâng cao hiệu năng model bằng cách ưu tiên chất lượng dữ liệu. Tìm hiểu cách curate dataset cho Ultralytics YOLO26 bằng Ultralytics Platform.
AI lấy dữ liệu làm trọng tâm là một triết lý và phương pháp tiếp cận trong machine learning, tập trung vào việc cải thiện chất lượng dataset được sử dụng để train model, thay vì chủ yếu tập trung vào việc tinh chỉnh kiến trúc model hoặc các hyperparameter. Trong quy trình phát triển lấy model làm trọng tâm truyền thống, các kỹ sư thường giữ nguyên dataset trong khi lặp lại trên thuật toán để đạt được hiệu năng tốt hơn. AI lấy dữ liệu làm trọng tâm đảo ngược mô hình này, cho rằng trong nhiều ứng dụng hiện đại, kiến trúc model đã đủ tiên tiến, và cách hiệu quả nhất để cải thiện hiệu năng là có hệ thống thiết kế chính dữ liệu. Điều này bao gồm việc làm sạch, gán nhãn, tăng cường và tuyển chọn dataset để bảo đảm chúng nhất quán, đa dạng và đại diện cho bài toán thực tế.
Triết lý cốt lõi: Chất lượng dữ liệu quan trọng hơn số lượng#
Sự chuyển dịch sang các phương pháp lấy dữ liệu làm trọng tâm thừa nhận rằng "garbage in, garbage out" là một sự thật nền tảng trong machine learning. Việc chỉ đơn giản bổ sung thêm dữ liệu không phải lúc nào cũng là giải pháp nếu dữ liệu đó chứa nhiễu hoặc bị thiên lệch. Thay vào đó, phương pháp này nhấn mạnh tầm quan trọng của các dataset computer vision chất lượng cao. Bằng cách ưu tiên chất lượng dữ liệu và tính nhất quán, developer thường có thể đạt độ chính xác cao hơn với các dataset nhỏ hơn nhưng được tuyển chọn kỹ lưỡng, thay vì các dataset khổng lồ và lộn xộn.
Triết lý này gắn chặt với active learning, trong đó model giúp xác định những điểm dữ liệu nào có giá trị nhất để gán nhãn tiếp theo. Các công cụ như Ultralytics Platform hỗ trợ việc này bằng cách hợp lý hóa quy trình chú thích dữ liệu và quản lý dữ liệu, cho phép các team cộng tác để cải thiện tình trạng của dataset. Điều này trái ngược với các workflow supervised learning thuần túy, trong đó dataset thường được xem như một artifact tĩnh.
Các kỹ thuật chính trong AI lấy dữ liệu làm trọng tâm#
Việc triển khai chiến lược lấy dữ liệu làm trọng tâm bao gồm một số bước thực tiễn vượt xa việc chỉ thu thập dữ liệu đơn giản.
- Tính nhất quán của nhãn: Bảo đảm tất cả annotator gán nhãn cho các object theo đúng cùng một cách là yếu tố then chốt. Ví dụ, trong object detection, việc xác định nghiêm ngặt có đưa gương chiếu hậu của xe vào bounding box hay không có thể ảnh hưởng đáng kể đến hiệu năng của model.
- Data Augmentation: Áp dụng có hệ thống các phép biến đổi cho dữ liệu hiện có để bao phủ các trường hợp biên. Bạn có thể đọc hướng dẫn toàn diện về data augmentation của chúng tôi để hiểu cách các kỹ thuật như xoay và mosaic augmentation giúp model khái quát hóa tốt hơn.
- Phân tích lỗi: Xác định các class hoặc kịch bản cụ thể mà model gặp lỗi và thu thập dữ liệu có mục tiêu để giải quyết những thiếu sót đó. Việc này thường bao gồm kiểm tra ma trận nhầm lẫn để xác định chính xác các điểm yếu.
- Làm sạch dữ liệu: Xóa các ảnh trùng lặp, sửa những example bị gán nhãn sai và lọc dữ liệu chất lượng thấp có thể gây nhầm lẫn cho neural network.
Các ứng dụng trong thực tế#
Các phương pháp lấy dữ liệu làm trọng tâm đang chuyển đổi những ngành mà độ tin cậy là yếu tố bắt buộc.
-
Chẩn đoán hình ảnh y khoa: Trong các lĩnh vực như phát hiện khối u trên ảnh y khoa, việc thu thập hàng triệu ảnh là bất khả thi. Thay vào đó, các nhà nghiên cứu tập trung tuyển chọn những dataset có độ chính xác cao và được chuyên gia đánh giá. Phương pháp lấy dữ liệu làm trọng tâm bảo đảm từng pixel trong segmentation mask đều chính xác, vì các nhãn mơ hồ có thể dẫn đến những sai sót đe dọa tính mạng.
-
Kiểm soát chất lượng trong sản xuất: Khi triển khai hệ thống kiểm tra trực quan, các lỗi như vết xước hoặc vết lõm hiếm hơn nhiều so với các sản phẩm hoàn hảo. Chiến lược lấy dữ liệu làm trọng tâm bao gồm việc tổng hợp hoặc chủ động thu thập dữ liệu lỗi để cân bằng dataset, bảo đảm model không chỉ dự đoán "pass" cho mọi sản phẩm.
AI lấy dữ liệu làm trọng tâm so với AI lấy model làm trọng tâm#
Điều quan trọng là phải phân biệt AI lấy dữ liệu làm trọng tâm với AI lấy model làm trọng tâm. Trong workflow lấy model làm trọng tâm, dataset được cố định và mục tiêu là cải thiện các metric bằng cách thay đổi kiến trúc model (ví dụ: chuyển từ YOLO11 sang ResNet tùy chỉnh) hoặc tinh chỉnh các parameter như learning rate. Trong workflow lấy dữ liệu làm trọng tâm, kiến trúc model được cố định (ví dụ: tiêu chuẩn hóa theo YOLO26), và mục tiêu là cải thiện các metric bằng cách làm sạch nhãn, bổ sung các example đa dạng hoặc xử lý outlier.
Đoạn code sau minh họa một quy trình kiểm tra đơn giản theo hướng lấy dữ liệu làm trọng tâm: kiểm tra dataset để phát hiện ảnh bị hỏng trước khi train. Điều này bảo đảm training pipeline của bạn không bị lỗi do dữ liệu không hợp lệ.
from ultralytics.data.utils import check_cls_dataset
# Validate a classification dataset structure and integrity
# This helps identify issues with data organization before training begins
try:
# Checks the dataset defined in a YAML or path structure
check_cls_dataset("mnist", split="train")
print("Dataset structure is valid and ready for data-centric curation.")
except Exception as e:
print(f"Data issue found: {e}")Các công cụ cho phát triển lấy dữ liệu làm trọng tâm#
Để thực hành AI lấy dữ liệu làm trọng tâm hiệu quả, developer dựa vào các công cụ mạnh mẽ. Ultralytics Platform đóng vai trò là trung tâm quản lý vòng đời dữ liệu, cung cấp các tính năng auto-annotation giúp đẩy nhanh quy trình gán nhãn mà vẫn duy trì tính nhất quán. Ngoài ra, việc sử dụng các công cụ explorer cho phép người dùng truy vấn dataset theo ngữ nghĩa (ví dụ: "tìm tất cả ảnh xe màu đỏ vào ban đêm") để hiểu rõ phân phối và độ thiên lệch.
Bằng cách tập trung vào dữ liệu, các kỹ sư có thể xây dựng những hệ thống mạnh mẽ, công bằng và thiết thực hơn để triển khai trong các môi trường năng động như xe tự hành hoặc bán lẻ thông minh. Sự chuyển dịch này thừa nhận rằng đối với nhiều bài toán, code đã là một bài toán được giải quyết, nhưng dữ liệu vẫn là biên giới của đổi mới.









