Few-Shot Learning
Khám phá Few-Shot Learning (FSL) để train AI với lượng dữ liệu tối thiểu. Tìm hiểu cách Ultralytics YOLO26 tận dụng meta-learning để thích ứng nhanh và đạt độ chính xác cao.
Học tập Few-Shot (FSL) là một phân ngành chuyên biệt của máy học (ML), được thiết kế để huấn luyện model nhận diện và phân loại các khái niệm mới chỉ bằng một số lượng rất nhỏ ví dụ đã gán nhãn. Trong học sâu (DL) truyền thống, để đạt độ chính xác cao thường cần các dataset khổng lồ chứa hàng nghìn hình ảnh cho mỗi danh mục. Tuy nhiên, FSL mô phỏng khả năng nhận thức của con người trong việc khái quát hóa nhanh chóng từ trải nghiệm hạn chế—tương tự như cách một đứa trẻ có thể nhận ra hươu cao cổ sau khi chỉ xem một hoặc hai bức ảnh trong sách. Khả năng này rất cần thiết để triển khai trí tuệ nhân tạo (AI) trong những tình huống mà việc thu thập lượng lớn dữ liệu huấn luyện quá tốn kém, mất thời gian hoặc không khả thi trên thực tế.
Các cơ chế cốt lõi của Học tập Few-Shot#
Mục tiêu chính của FSL là giảm sự phụ thuộc vào việc thu thập dữ liệu quy mô lớn bằng cách tận dụng kiến thức có sẵn. Thay vì học các pattern từ đầu, model sử dụng một “support set” chứa một số ít ví dụ đã gán nhãn để hiểu các class mới. Điều này thường đạt được thông qua các kỹ thuật nâng cao như meta-learning, còn được gọi là “học cách học”. Trong mô hình này, model được huấn luyện trên nhiều task khác nhau để học một phương thức khởi tạo hoặc quy tắc cập nhật tối ưu, cho phép thích ứng với các task mới chỉ với những điều chỉnh tối thiểu.
Một phương pháp phổ biến khác là học dựa trên metric, trong đó model học cách ánh xạ dữ liệu đầu vào vào một không gian vector bằng cách sử dụng embedding. Trong không gian này, các phần tử tương tự được gom cụm gần nhau, còn các phần tử khác biệt được đẩy ra xa. Các thuật toán như Mạng nguyên mẫu tính toán một biểu diễn trung bình, hay prototype, cho mỗi class và phân loại các mẫu truy vấn mới dựa trên khoảng cách đến những prototype này. Phương pháp này thường dựa vào khả năng trích xuất đặc trưng được phát triển trong quá trình pre-training trên các dataset lớn và tổng quát hơn.
Các ứng dụng trong thực tế#
Học tập Few-Shot đang chuyển đổi các ngành mà trước đây tình trạng khan hiếm dữ liệu cản trở việc áp dụng các công nghệ AI.
Chẩn đoán và phân tích hình ảnh y tế#
Trong lĩnh vực phân tích hình ảnh y tế, việc thu thập hàng nghìn ảnh chụp đã gán nhãn cho các bệnh lý hiếm gặp thường không khả thi. FSL cho phép các nhà nghiên cứu huấn luyện các hệ thống thị giác máy tính (CV) để phát hiện các loại khối u hiếm gặp hoặc những bất thường di truyền cụ thể chỉ bằng một số ít ca bệnh được chú thích. Khả năng này mở rộng quyền tiếp cận các công cụ chẩn đoán tiên tiến, một mục tiêu được các tổ chức như Stanford Medicine theo đuổi, giúp xác định những tình trạng mà nếu không sẽ đòi hỏi chuyên môn đặc biệt của con người.
Kiểm soát chất lượng công nghiệp#
AI trong sản xuất hiện đại phụ thuộc nhiều vào hoạt động kiểm tra tự động. Tuy nhiên, các lỗi cụ thể có thể xuất hiện rất hiếm, khiến việc xây dựng một dataset lớn gồm các bộ phận “lỗi” trở nên khó khăn. FSL cho phép các hệ thống phát hiện bất thường học các đặc điểm của một loại lỗi mới chỉ từ vài hình ảnh. Điều này cho phép nhân viên vận hành nhà máy nhanh chóng cập nhật các quy trình đảm bảo chất lượng mà không cần dừng sản xuất để thu thập dữ liệu, từ đó cải thiện đáng kể hiệu suất trong các môi trường sản xuất năng động.
Phân biệt các khái niệm liên quan#
Để hiểu rõ phạm vi ứng dụng riêng của FSL, việc phân biệt FSL với các mô hình học tập ít dữ liệu tương tự là rất hữu ích:
- Học chuyển giao: FSL thường được triển khai như một dạng cụ thể và cực đoan của học chuyển giao. Trong khi học chuyển giao tiêu chuẩn có thể fine-tune một model như YOLO26 trên hàng trăm hình ảnh, FSL nhắm đến các tình huống chỉ có khoảng 5 đến 10 hình ảnh cho mỗi class (được gọi là phân loại “N-way K-shot”).
- Học One-Shot: Đây là một tập con nghiêm ngặt của FSL, trong đó model phải học chính xác từ một ví dụ đã gán nhãn. Phương pháp này thường được sử dụng trong nhận dạng khuôn mặt để xác minh danh tính dựa trên một ảnh được lưu trữ duy nhất.
- Học Zero-Shot: Không giống FSL, vốn yêu cầu ít nhất một support set trực quan nhỏ, Học Zero-Shot không yêu cầu bất kỳ ví dụ trực quan nào của class mục tiêu trong quá trình huấn luyện. Thay vào đó, phương pháp này dựa vào các mô tả ngữ nghĩa hoặc thuộc tính (chẳng hạn như prompt văn bản) để nhận diện các đối tượng chưa từng thấy.
Triển khai thực tế với Ultralytics#
Trên thực tế, một trong những cách hiệu quả nhất để thực hiện Học tập Few-Shot là tận dụng một model pre-trained có độ robust cao. Các model tiên tiến như YOLO26 mới hơn đã học được các biểu diễn đặc trưng phong phú từ những dataset khổng lồ như COCO hoặc ImageNet. Bằng cách fine-tune các model này trên một dataset tùy chỉnh rất nhỏ, chúng có thể thích ứng với các task mới nhanh chóng và đạt độ chính xác ấn tượng.
Ví dụ Python sau đây minh họa cách huấn luyện một model trên dataset nhỏ bằng package ultralytics, qua đó thực hiện việc thích ứng few-shot:
from ultralytics import YOLO
# Load a pre-trained YOLO26 model (incorporates learned features)
model = YOLO("yolo26n.pt")
# Fine-tune on a tiny dataset (e.g., coco8 has only 4 images per batch)
# This leverages the model's prior knowledge for the new task
results = model.train(data="coco8.yaml", epochs=20, imgsz=640)
# The model adapts to detect objects in the small dataset
print("Few-shot adaptation complete.")Thách thức và Triển vọng tương lai#
Mặc dù mạnh mẽ, FSL vẫn phải đối mặt với các thách thức về độ tin cậy. Nếu một vài ví dụ được cung cấp là các outlier hoặc chứa nhiễu, hiệu suất của model có thể suy giảm—một vấn đề được gọi là overfitting. Nghiên cứu về tăng cường dữ liệu và quá trình tạo dữ liệu tổng hợp đóng vai trò quan trọng trong việc giảm thiểu những rủi ro này. Khi foundation model ngày càng lớn và mạnh hơn, đồng thời các công cụ như Ultralytics Platform đơn giản hóa việc huấn luyện và quản lý model, khả năng tạo các giải pháp AI tùy chỉnh với lượng dữ liệu tối thiểu sẽ ngày càng dễ tiếp cận hơn đối với các developer trên toàn thế giới.









