Self-Supervised Learning
Khám phá cách học tự giám sát loại bỏ nhu cầu gán nhãn thủ công. Tìm hiểu các phương pháp SSL sinh và tương phản để nâng cao Ultralytics YOLO26.
Học tự giám sát (SSL) là một mô hình học máy trong đó hệ thống học cách hiểu dữ liệu bằng cách tự tạo ra các tín hiệu giám sát từ chính dữ liệu đó, thay vì dựa vào các nhãn do con người cung cấp từ bên ngoài. Trong Học có giám sát truyền thống, các model cần một lượng lớn dữ liệu được chú thích thủ công—chẳng hạn như hình ảnh được gắn nhãn "mèo" hoặc "chó"—vốn tốn kém và mất nhiều thời gian để tạo ra. SSL loại bỏ điểm nghẽn này bằng cách tạo ra các "nhiệm vụ bổ trợ", trong đó model phải dự đoán những phần ẩn hoặc bị thiếu của dữ liệu đầu vào, qua đó tự học cấu trúc và các đặc trưng nền tảng cần thiết cho những tác vụ phức tạp như phát hiện đối tượng và phân loại.
Cơ chế cốt lõi của học tự giám sát#
Ý tưởng nền tảng đằng sau SSL là che hoặc ẩn một phần dữ liệu, đồng thời buộc mạng nơ-ron (NN) tái tạo phần đó hoặc dự đoán mối quan hệ giữa các góc nhìn khác nhau của cùng một dữ liệu. Quá trình này tạo ra các biểu diễn phong phú, đa dụng, có thể được tinh chỉnh sau đó cho những ứng dụng hạ nguồn cụ thể.
Có hai phương pháp chính trong SSL:
- Phương pháp sinh: Model học cách tạo ra các pixel hoặc từ để điền vào chỗ trống. Một ví dụ kinh điển trong Xử lý ngôn ngữ tự nhiên (NLP) là dự đoán từ tiếp theo trong một câu. Trong thị giác máy tính, các kỹ thuật như bộ mã hóa tự động che (MAE) sẽ che các mảng ngẫu nhiên của một hình ảnh và yêu cầu model tái tạo những pixel bị thiếu, buộc model phải "hiểu" ngữ cảnh trực quan.
- Học tương phản: Phương pháp này dạy model phân biệt giữa các điểm dữ liệu tương đồng và không tương đồng. Bằng cách áp dụng các kỹ thuật tăng cường dữ liệu—chẳng hạn như cắt ảnh, biến đổi màu hoặc xoay—vào một hình ảnh, model học rằng các phiên bản đã biến đổi này biểu diễn cùng một đối tượng (cặp dương), đồng thời xem những hình ảnh khác là các đối tượng khác nhau (cặp âm). Các framework phổ biến như SimCLR phụ thuộc nhiều vào nguyên lý này.
Các ứng dụng trong thực tế#
Học tự giám sát đã trở thành nền tảng để xây dựng các mô hình nền tảng mạnh mẽ trong nhiều lĩnh vực. Khả năng tận dụng lượng dữ liệu khổng lồ chưa gắn nhãn giúp phương pháp này có khả năng mở rộng cao.
- Ảnh y khoa: Việc thu thập các ảnh quét y khoa được chuyên gia gắn nhãn rất khó khăn và tốn kém. SSL cho phép các model tiền huấn luyện trên hàng nghìn ảnh X-quang hoặc ảnh MRI chưa gắn nhãn để học các đặc trưng giải phẫu tổng quát. Sau đó, model đã tiền huấn luyện có thể được tinh chỉnh bằng một số lượng nhỏ ví dụ đã gắn nhãn để đạt độ chính xác cao trong phát hiện khối u hoặc chẩn đoán bệnh.
- Lái xe tự hành: Xe tự lái tạo ra hàng terabyte dữ liệu video mỗi ngày. SSL cho phép các hệ thống này học động lực học theo thời gian và khả năng hiểu không gian từ cảnh quay video thô mà không cần chú thích từng khung hình. Điều này giúp cải thiện phát hiện làn đường và khả năng tránh chướng ngại vật bằng cách dự đoán các khung hình trong tương lai hoặc chuyển động của đối tượng.
Phân biệt SSL với các thuật ngữ liên quan#
Điều quan trọng là phải phân biệt SSL với Học không giám sát. Mặc dù cả hai phương pháp đều sử dụng dữ liệu chưa gắn nhãn, học không giám sát thường tập trung vào việc tìm các mẫu hoặc nhóm ẩn (phân cụm) mà không có một tác vụ dự đoán cụ thể. Ngược lại, SSL định hình quá trình học như một tác vụ có giám sát, trong đó các nhãn được tự động tạo ra từ chính cấu trúc dữ liệu. Ngoài ra, Học bán giám sát kết hợp một lượng nhỏ dữ liệu đã gắn nhãn với một lượng lớn dữ liệu chưa gắn nhãn, trong khi SSL thuần túy tự tạo toàn bộ nhãn từ tập dữ liệu chưa gắn nhãn trước khi diễn ra bất kỳ quá trình tinh chỉnh nào.
Sử dụng trọng số tiền huấn luyện trong Ultralytics#
Trong hệ sinh thái Ultralytics, các model như YOLO26 hưởng lợi đáng kể từ các chiến lược huấn luyện nâng cao, thường kết hợp những nguyên lý tương tự SSL trong giai đoạn tiền huấn luyện trên các tập dữ liệu quy mô lớn như ImageNet hoặc COCO. Điều này đảm bảo rằng khi người dùng triển khai model cho một tác vụ cụ thể, các bộ trích xuất đặc trưng đã đủ mạnh.
Người dùng có thể tận dụng các biểu diễn tiền huấn luyện mạnh mẽ này để tinh chỉnh model trên các tập dữ liệu tùy chỉnh của riêng mình bằng Ultralytics Platform.
Dưới đây là một ví dụ ngắn gọn về cách tải một model Ultralytics YOLO26 đã tiền huấn luyện và bắt đầu tinh chỉnh model đó trên một tập dữ liệu mới, tận dụng các đặc trưng đã học được trong quá trình huấn luyện quy mô lớn ban đầu:
from ultralytics import YOLO
# Load a pre-trained YOLO26 model (weights learned from large-scale data)
model = YOLO("yolo26n.pt")
# Fine-tune the model on a specific dataset (e.g., COCO8)
# This leverages the robust feature representations learned during pre-training
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)Tương lai của SSL#
Khi các nhà nghiên cứu tại những phòng thí nghiệm lớn như Meta AI và Google DeepMind tiếp tục cải tiến các kỹ thuật này, SSL đang mở rộng giới hạn của những gì có thể thực hiện trong AI tạo sinh và thị giác máy tính. Bằng cách giảm sự phụ thuộc vào dữ liệu đã gắn nhãn, SSL đang dân chủ hóa khả năng tiếp cận AI hiệu năng cao, cho phép các nhóm nhỏ hơn xây dựng những model tinh vi cho các ứng dụng chuyên biệt như bảo tồn động vật hoang dã hoặc kiểm tra công nghiệp.









