Semi-Supervised Learning
Khám phá cách học bán giám sát kết hợp dữ liệu đã gán nhãn và chưa gán nhãn để nâng cao độ chính xác của model. Học cách triển khai workflow SSL bằng Ultralytics YOLO26.
Học bán giám sát (SSL) là một mô hình chiến lược trong học máy (ML), đóng vai trò cầu nối giữa hai phương pháp huấn luyện truyền thống. Trong khi học có giám sát hoàn toàn dựa vào các dataset được chú thích đầy đủ và học không giám sát cố gắng tìm ra các mẫu trong dữ liệu mà không có bất kỳ nhãn nào, SSL hoạt động bằng cách kết hợp một lượng nhỏ dữ liệu đã gán nhãn với một tập hợp lớn hơn đáng kể gồm dữ liệu chưa gán nhãn. Phương pháp này đặc biệt có giá trị trong các tình huống thị giác máy tính (CV) thực tế, nơi việc thu thập hình ảnh thô—chẳng hạn như video từ camera an ninh hoặc vệ tinh—tương đối ít tốn kém, nhưng quy trình gán nhãn dữ liệu do các chuyên gia thực hiện lại tốn kém, chậm và đòi hỏi nhiều nhân lực. Bằng cách tận dụng hiệu quả cấu trúc ẩn trong các mẫu chưa gán nhãn, SSL có thể cải thiện đáng kể độ chính xác của model và khả năng khái quát hóa mà không cần ngân sách chú thích quá lớn.
Cơ chế cốt lõi của học bán giám sát#
Mục tiêu chính của SSL là truyền bá thông tin có trong tập nhỏ các mẫu đã gán nhãn sang tập lớn hơn gồm các mẫu chưa gán nhãn. Điều này cho phép mạng neural học các ranh giới quyết định đi qua những vùng có mật độ dữ liệu thấp, từ đó tạo ra khả năng phân loại hoặc phát hiện mạnh mẽ hơn.
Hai kỹ thuật phổ biến thúc đẩy hầu hết các quy trình học bán giám sát:
- Gán nhãn giả: Trong phương pháp này, một model trước tiên được huấn luyện trên dữ liệu đã gán nhãn ở quy mô hạn chế. Sau đó, model được sử dụng để chạy inference trên dữ liệu chưa gán nhãn. Các dự đoán vượt qua một ngưỡng độ tin cậy cụ thể sẽ được xem là “nhãn giả” hoặc ground truth. Những dự đoán có độ tin cậy cao này được thêm vào dữ liệu huấn luyện, sau đó model được huấn luyện lại, qua đó cải thiện hiệu năng theo từng vòng lặp.
- Điều chuẩn tính nhất quán: Kỹ thuật này dựa vào tăng cường dữ liệu. Ý tưởng là model phải đưa ra các dự đoán tương tự nhau đối với một hình ảnh và phiên bản được biến đổi nhẹ (đã tăng cường) của chính hình ảnh đó. Bằng cách giảm thiểu sự khác biệt giữa các dự đoán của phiên bản gốc và phiên bản đã tăng cường, model học cách tập trung vào các đặc trưng cốt lõi của đối tượng thay vì nhiễu, từ đó cải thiện khả năng xử lý overfitting.
Triển khai thực tế với YOLO#
Ví dụ Python sau đây minh họa một quy trình gán nhãn giả đơn giản bằng package ultralytics. Trong ví dụ này, chúng ta huấn luyện một model YOLO26 trên một dataset nhỏ, sau đó sử dụng model để tạo nhãn cho một thư mục chứa các hình ảnh chưa gán nhãn.
from ultralytics import YOLO
# Load the latest YOLO26 model
model = YOLO("yolo26n.pt")
# Train initially on a small available labeled dataset
model.train(data="coco8.yaml", epochs=10)
# Run inference on unlabeled data to generate pseudo-labels
# Setting save_txt=True saves the detections as text files for future training
results = model.predict(source="./unlabeled_images", save_txt=True, conf=0.85)Các ứng dụng trong thực tế#
Học bán giám sát đang chuyển đổi các ngành có nguồn dữ liệu dồi dào nhưng thiếu chuyên môn.
- Chẩn đoán hình ảnh: Trong AI y tế, việc thu thập ảnh chụp (X-quang, MRI) là quy trình tiêu chuẩn, nhưng để một bác sĩ X-quang được chứng nhận chuyên môn chú thích từng pixel cho bài toán phát hiện khối u thì chi phí quá cao. SSL cho phép các nhà nghiên cứu huấn luyện những model hiệu năng cao chỉ bằng một phần nhỏ các ca bệnh được chuyên gia chú thích, đồng thời tận dụng hàng nghìn ảnh chụp được lưu trữ để tinh chỉnh khả năng hiểu các cấu trúc sinh học của model.
- Lái xe tự hành: Các công ty xe tự lái thu thập petabyte dữ liệu video mỗi ngày từ các phương tiện trong đội xe. Việc gán nhãn cho từng khung hình để phát hiện đối tượng và phân đoạn ngữ nghĩa là điều bất khả thi. Thông qua SSL, hệ thống có thể học từ phần lớn thời lượng lái xe chưa được gán nhãn để hiểu rõ hơn các môi trường đường sá phức tạp, điều kiện thời tiết và những trường hợp biên hiếm gặp.
Phân biệt các khái niệm liên quan#
Để triển khai hiệu quả các giải pháp AI, điều quan trọng là phải hiểu SSL khác với các chiến lược tương tự như thế nào:
- So với Học chủ động: Mặc dù cả hai đều xử lý dữ liệu chưa gán nhãn, cách tiếp cận việc gán nhãn của chúng khác nhau. SSL tự động gán nhãn dựa trên các dự đoán của model. Ngược lại, học chủ động xác định những điểm dữ liệu “gây困惑” hoặc không chắc chắn nhất và chủ động yêu cầu con người tham gia trong vòng lặp gán nhãn cho chúng, qua đó tối ưu hóa thời gian của con người thay vì loại bỏ hoàn toàn sự tham gia của họ.
- So với Học chuyển giao: Học chuyển giao bao gồm việc lấy một model đã được huấn luyện trước trên một dataset bên ngoài quy mô lớn (chẳng hạn như ImageNet) rồi fine-tune model đó cho tác vụ cụ thể của bạn. Tuy nhiên, SSL tập trung vào việc tận dụng phần chưa gán nhãn trong phân phối dataset cụ thể của bạn ngay trong quá trình huấn luyện.
- So với Học tự giám sát: Mặc dù tên gọi tương tự nhau, học tự giám sát thường đề cập đến các “tác vụ tiền đề” (chẳng hạn như giải trò ghép hình từ các mảnh hình ảnh), trong đó dữ liệu tự tạo ra các tín hiệu giám sát mà không cần nhãn bên ngoài. SSL đặc biệt hàm ý việc sử dụng một tập nhỏ hơn gồm các nhãn đã được xác minh để định hướng quy trình.
Công cụ và triển vọng tương lai#
Khi các model học sâu (DL) ngày càng lớn, hiệu quả sử dụng dữ liệu trở nên tối quan trọng. Các framework hiện đại như PyTorch và TensorFlow cung cấp backend tính toán cho các vòng lặp huấn luyện nâng cao này. Ngoài ra, các công cụ như Ultralytics Platform đang đơn giản hóa vòng đời quản lý dataset. Bằng cách sử dụng các tính năng như tự động gán nhãn, các nhóm có thể triển khai quy trình bán giám sát dễ dàng hơn, nhanh chóng chuyển đổi dữ liệu thô thành trọng số model sẵn sàng cho production. Sự phát triển này trong MLOps đảm bảo rằng rào cản gia nhập đối với việc xây dựng các hệ thống thị giác có độ chính xác cao tiếp tục giảm xuống.









