Zero-Shot Learning
Khám phá học zero-shot (ZSL) để phát hiện và phân loại đối tượng mà không cần dữ liệu huấn luyện. Tìm hiểu cách Ultralytics YOLO-World hỗ trợ phát hiện từ vựng mở theo thời gian thực.
Học không mẫu (ZSL) là một mô hình học máy cho phép các model trí tuệ nhân tạo nhận dạng, phân loại hoặc phát hiện những đối tượng mà chúng chưa từng gặp trong giai đoạn huấn luyện. Trong học có giám sát truyền thống, một model cần hàng nghìn ví dụ được gán nhãn cho mỗi danh mục cụ thể mà nó cần nhận diện. ZSL loại bỏ sự phụ thuộc nghiêm ngặt này bằng cách tận dụng thông tin bổ trợ—thường là mô tả bằng văn bản, thuộc tính ngữ nghĩa hoặc embedding—để thu hẹp khoảng cách giữa các lớp đã thấy và chưa thấy. Khả năng này cho phép các hệ thống trí tuệ nhân tạo (AI) trở nên linh hoạt, có khả năng mở rộng và xử lý các môi trường động tốt hơn đáng kể, nơi việc thu thập dữ liệu đầy đủ cho mọi đối tượng có thể xảy ra là không khả thi.
Cách thức hoạt động của học không mẫu#
Cơ chế cốt lõi của ZSL liên quan đến việc chuyển giao kiến thức từ các khái niệm quen thuộc sang những khái niệm xa lạ bằng cách sử dụng một không gian ngữ nghĩa chung. Thay vì học cách nhận dạng một "ngựa vằn" chỉ bằng cách ghi nhớ các mẫu pixel của những sọc đen trắng, model học mối quan hệ giữa các đặc trưng hình ảnh và thuộc tính ngữ nghĩa (ví dụ: "hình dáng giống ngựa," "mẫu sọc," "bốn chân") được suy ra từ xử lý ngôn ngữ tự nhiên (NLP).
Quy trình này thường dựa vào các model đa phương thức để căn chỉnh các biểu diễn hình ảnh và văn bản. Chẳng hạn, các nghiên cứu nền tảng như CLIP của OpenAI cho thấy các model có thể học các khái niệm trực quan từ việc giám sát bằng ngôn ngữ tự nhiên. Khi một model ZSL gặp một đối tượng chưa thấy, model trích xuất các đặc trưng hình ảnh và so sánh chúng với một từ điển các vector ngữ nghĩa. Nếu các đặc trưng hình ảnh phù hợp với mô tả ngữ nghĩa của lớp mới, model có thể phân loại chính xác đối tượng đó, qua đó thực hiện dự đoán "zero-shot". Phương pháp này là nền tảng của các foundation model hiện đại, vốn có khả năng khái quát hóa trên nhiều tác vụ.
Các ứng dụng trong thực tế#
Học không mẫu đang thúc đẩy đổi mới trong nhiều ngành bằng cách cho phép các hệ thống khái quát hóa vượt ra ngoài dữ liệu huấn luyện ban đầu.
-
Phát hiện đối tượng với từ vựng mở: Các kiến trúc hiện đại như YOLO-World sử dụng ZSL để phát hiện đối tượng dựa trên các prompt văn bản do người dùng định nghĩa. Điều này cho phép thực hiện phát hiện đối tượng trong những tình huống không thể xác định trước một danh sách lớp cố định, chẳng hạn như tìm kiếm các mục cụ thể trong kho lưu trữ video khổng lồ. Các nhà nghiên cứu tại Google Research tiếp tục mở rộng giới hạn của những khả năng với từ vựng mở này.
-
Chẩn đoán y khoa: Trong lĩnh vực AI trong chăm sóc sức khỏe, việc thu thập dữ liệu được gán nhãn cho các bệnh hiếm thường khó khăn và tốn kém. Các model ZSL có thể được huấn luyện trên những bệnh phổ biến và mô tả về các triệu chứng hiếm gặp từ tài liệu y khoa trong các cơ sở dữ liệu như PubMed, qua đó cho phép hệ thống đánh dấu các bất thường hiếm tiềm ẩn trong ảnh y khoa mà không cần một dataset khổng lồ gồm các ca dương tính.
-
Bảo tồn động vật hoang dã: Đối với AI trong nông nghiệp và sinh thái học, việc xác định các loài có nguy cơ tuyệt chủng hiếm khi được chụp ảnh là rất quan trọng. ZSL cho phép các nhà bảo tồn phát hiện những loài động vật này bằng cách sử dụng các mô tả dựa trên thuộc tính được xác định trong những cơ sở dữ liệu sinh học như Encyclopedia of Life.
Phát hiện không mẫu với Ultralytics#
Model Ultralytics YOLO-World là một ví dụ điển hình về việc áp dụng học không mẫu. Model cho phép người dùng xác định động các lớp tùy chỉnh trong thời gian chạy mà không cần huấn luyện lại. Điều này đạt được bằng cách kết nối một backbone phát hiện mạnh mẽ với một bộ mã hóa văn bản có khả năng hiểu ngôn ngữ tự nhiên.
Ví dụ Python sau đây minh họa cách sử dụng YOLO-World để phát hiện các đối tượng không được đưa vào một tập huấn luyện tiêu chuẩn một cách rõ ràng, bằng cách sử dụng package ultralytics.
from ultralytics import YOLOWorld
# Load a pre-trained YOLO-World model capable of Zero-Shot Learning
model = YOLOWorld("yolov8s-world.pt")
# Define custom classes via text prompts (e.g., specific accessories)
# The model adjusts to detect these new classes without retraining
model.set_classes(["blue backpack", "red apple", "sunglasses"])
# Run inference on an image to detect the new zero-shot classes
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Display the results
results[0].show()Phân biệt với các khái niệm liên quan#
Để hiểu đầy đủ về ZSL, cần phân biệt phương pháp này với các chiến lược học tương tự được sử dụng trong thị giác máy tính (CV):
- Học vài mẫu (FSL): Trong khi ZSL không yêu cầu bất kỳ ví dụ nào về lớp mục tiêu, FSL cung cấp cho model một tập hỗ trợ rất nhỏ (thường từ 1 đến 5 ví dụ) để thích ứng. ZSL thường được xem là khó hơn vì hoàn toàn dựa vào suy luận ngữ nghĩa thay vì các ví dụ trực quan.
- Học một mẫu: Một nhánh của FSL, trong đó model học từ chính xác một ví dụ được gán nhãn. ZSL khác biệt về bản chất vì hoạt động mà không cần đến dù chỉ một hình ảnh của danh mục mới.
- Học chuyển giao: Thuật ngữ rộng này chỉ việc chuyển giao kiến thức từ tác vụ này sang tác vụ khác. ZSL là một dạng học chuyển giao cụ thể, sử dụng các thuộc tính ngữ nghĩa để chuyển giao kiến thức sang những lớp chưa thấy mà không cần fine-tuning truyền thống trên dữ liệu mới.
Thách thức và Triển vọng tương lai#
Mặc dù ZSL có tiềm năng rất lớn, phương pháp này vẫn đối mặt với những thách thức như vấn đề dịch chuyển miền, trong đó các thuộc tính ngữ nghĩa học được trong quá trình huấn luyện không ánh xạ hoàn toàn chính xác sang diện mạo trực quan của các lớp chưa thấy. Ngoài ra, các model ZSL có thể gặp hiện tượng thiên lệch, khi độ chính xác dự đoán đối với các lớp đã thấy cao hơn đáng kể so với các lớp chưa thấy.
Các nghiên cứu từ những tổ chức như Phòng thí nghiệm AI của Đại học Stanford và IEEE Computer Society tiếp tục giải quyết những hạn chế này. Khi các công cụ thị giác máy tính trở nên mạnh mẽ hơn, ZSL được kỳ vọng sẽ trở thành một tính năng tiêu chuẩn, giảm sự phụ thuộc vào các nỗ lực gán nhãn dữ liệu quy mô lớn. Đối với các đội ngũ muốn quản lý dataset hiệu quả trước khi triển khai các model nâng cao, Ultralytics Platform cung cấp các công cụ toàn diện cho việc chú thích và quản lý dataset.









