Data Annotation
Tìm hiểu cách data annotation tạo ra ground truth cho machine learning. Khám phá các kỹ thuật object detection và segmentation để hỗ trợ Ultralytics YOLO26.
Chú thích dữ liệu là quy trình quan trọng nhằm bổ sung siêu dữ liệu hoặc thẻ mô tả vào dữ liệu thô—chẳng hạn như hình ảnh, video, văn bản hoặc âm thanh—để các model học máy (ML) có thể hiểu được. Thực tiễn này tạo lập một "ground truth" mà các thuật toán sử dụng để học các mẫu, nhận diện đối tượng và đưa ra dự đoán. Trong ngữ cảnh học có giám sát, các chú thích chất lượng cao đóng vai trò như người thầy, hướng dẫn model về đầu ra được kỳ vọng đối với một đầu vào nhất định. Nếu không có chú thích dữ liệu chính xác, ngay cả các kiến trúc tiên tiến như Ultralytics YOLO26 cũng không thể phát hiện đối tượng hoặc diễn giải các cảnh phức tạp một cách chính xác, vì hiệu suất của model phụ thuộc mật thiết vào chất lượng của dữ liệu huấn luyện.
Vai trò của chú thích trong phát triển AI#
Việc xây dựng các hệ thống AI mạnh mẽ đòi hỏi phải chuyển đổi dữ liệu phi cấu trúc thành các dataset có cấu trúc. Chú thích dữ liệu thu hẹp khoảng cách này bằng cách đánh dấu rõ ràng các đặc trưng cần quan tâm. Ví dụ, trong thị giác máy tính (CV), việc này có thể bao gồm vẽ bounding box quanh ô tô hoặc lần theo đường viền của khối u trong ảnh quét y tế.
Độ phức tạp của tác vụ chú thích thay đổi tùy theo ứng dụng dự kiến:
- Phát hiện đối tượng: Bao gồm việc vẽ các hình chữ nhật 2D quanh đối tượng để dạy model đối tượng đó là gì và nó nằm ở đâu.
- Phân đoạn instance: Yêu cầu các polygon chính xác đến từng pixel quanh đối tượng để phân biệt từng instance và hình dạng chính xác của chúng.
- Ước tính tư thế: Tập trung đánh dấu các keypoint cụ thể, chẳng hạn như các khớp trên cơ thể người, để phân tích chuyển động hoặc tư thế.
- Phân loại hình ảnh: Gán một nhãn phân loại duy nhất cho toàn bộ hình ảnh, chẳng hạn như xác định một bức ảnh là "nắng" hoặc "mưa".
Các ứng dụng trong thực tế#
Chú thích dữ liệu thúc đẩy đổi mới trong nhiều ngành đa dạng bằng cách giúp máy móc nhận thức thế giới một cách chính xác.
-
Phương tiện tự hành: Ô tô tự lái dựa vào các dataset khổng lồ, trong đó mọi người đi bộ, đèn giao thông và vạch kẻ làn đường đều được chú thích. Dữ liệu đã gán nhãn này cho phép các hệ thống nhận thức điều hướng an toàn. Các công ty sử dụng chú thích đám mây điểm LiDAR kết hợp với dữ liệu video để tạo bản đồ 3D của môi trường.
-
Chẩn đoán hình ảnh y khoa: Trong AI chăm sóc sức khỏe, bác sĩ chẩn đoán hình ảnh chú thích ảnh X-quang và ảnh chụp MRI để làm nổi bật các bất thường. Những dataset đã chú thích này dùng để huấn luyện model hỗ trợ chẩn đoán sớm, chẳng hạn như phát hiện khối u với độ nhất quán cao hơn so với chỉ đánh giá thủ công bởi con người.
Chú thích so với gán nhãn và tăng cường dữ liệu#
Mặc dù thường được sử dụng thay thế cho nhau, việc phân biệt chú thích dữ liệu với các khái niệm liên quan trong quy trình vận hành ML (MLOps) là rất hữu ích.
- Chú thích so với Gán nhãn dữ liệu: "Gán nhãn" thường là thuật ngữ rộng hơn, có thể chỉ việc phân loại đơn giản (ví dụ: gắn thẻ một email là spam). "Chú thích" thường hàm ý một quy trình phong phú và chi tiết hơn, chẳng hạn như đánh dấu các vùng không gian cụ thể trong hình ảnh hoặc các đoạn thời gian trong tệp âm thanh.
- Chú thích so với Tăng cường dữ liệu: Chú thích tạo ra ground truth ban đầu. Tăng cường là bước tiếp theo, trong đó dataset được mở rộng nhân tạo bằng cách áp dụng các phép biến đổi—chẳng hạn như xoay, lật hoặc thêm nhiễu—vào các mẫu đã chú thích hiện có. Điều này giúp ngăn overfitting và cải thiện khả năng tổng quát hóa của model.
Công cụ và quy trình#
Chú thích dữ liệu hiện đại hiếm khi là một tác vụ thủ công, đơn lẻ. Quy trình này bao gồm các nền tảng cộng tác và ngày càng có nhiều công cụ được AI hỗ trợ. Ultralytics Platform đơn giản hóa quy trình này bằng cách cung cấp các công cụ tích hợp để quản lý dataset và tự động chú thích. Việc sử dụng một model đã được huấn luyện trước để đề xuất các nhãn ban đầu có thể tăng tốc đáng kể quy trình, một kỹ thuật được gọi là active learning.
Sau khi được chú thích, dữ liệu thường được xuất ở các định dạng tiêu chuẩn như JSON hoặc định dạng YOLO TXT để huấn luyện. Đoạn mã Python sau đây minh họa cách xác minh cấu hình dataset đã chú thích trước khi huấn luyện model YOLO26.
from ultralytics import YOLO
# Load a YOLO26 model (recommended for new projects)
model = YOLO("yolo26n.pt")
# Train the model using a dataset configuration file
# The YAML file defines paths to your annotated training and validation images
results = model.train(data="coco8.yaml", epochs=5, imgsz=640)Chú thích dữ liệu chính xác là nền tảng của AI hiệu suất cao. Bằng cách đầu tư vào các chú thích chất lượng cao, developer đảm bảo model của họ học từ những ví dụ rõ ràng và nhất quán, từ đó đưa ra các dự đoán đáng tin cậy khi triển khai trong thực tế.









