Tìm hiểu về few-shot, zero-shot và transfer learning
Khám phá sự khác biệt giữa few-shot learning, zero-shot learning và transfer learning trong computer vision, cũng như cách các paradigm này định hình quá trình train model AI.

Các hệ thống trí tuệ nhân tạo (AI) có thể xử lý những nhiệm vụ phức tạp như nhận diện khuôn mặt, phân loại hình ảnh và lái xe với rất ít sự can thiệp của con người. Chúng thực hiện điều này bằng cách nghiên cứu dữ liệu, nhận diện các mẫu và sử dụng những mẫu đó để đưa ra dự đoán hoặc quyết định. Khi AI phát triển, chúng ta đang chứng kiến những phương thức ngày càng tinh vi hơn, qua đó các model AI có thể học hỏi, thích ứng và thực hiện nhiệm vụ với hiệu suất đáng kinh ngạc.
Ví dụ, thị giác máy tính là một nhánh của AI tập trung vào việc giúp máy móc diễn giải và hiểu thông tin hình ảnh từ thế giới xung quanh. Việc phát triển model thị giác máy tính truyền thống phụ thuộc nhiều vào các dataset lớn được gán nhãn để training. Việc thu thập và gán nhãn dữ liệu như vậy có thể tốn nhiều thời gian và chi phí.
Để giải quyết những thách thức này, các nhà nghiên cứu đã giới thiệu những phương pháp sáng tạo như học few-shot (FSL), học từ một số lượng ví dụ hạn chế; học zero-shot (ZSL), nhận diện các đối tượng chưa từng thấy; và học chuyển giao (TL), áp dụng kiến thức từ các model được pre-trained vào những nhiệm vụ mới.
Trong bài viết này, chúng ta sẽ tìm hiểu cách các mô hình học tập này hoạt động, làm rõ những điểm khác biệt chính và xem xét các ứng dụng trong thực tế. Hãy bắt đầu!
Tổng quan về các mô hình học tập#
Hãy cùng tìm hiểu học few-shot, học zero-shot và học chuyển giao là gì trong bối cảnh thị giác máy tính, cũng như cách chúng hoạt động.
Học few-shot#
Học few-shot là một phương pháp trong đó các hệ thống học cách nhận diện những đối tượng mới chỉ bằng một số lượng nhỏ ví dụ. Ví dụ, nếu bạn cho model xem một vài hình ảnh chim cánh cụt, bồ nông và chim hải âu (nhóm nhỏ này được gọi là "support set"), model sẽ học được hình dạng của những loài chim này.
Sau đó, nếu bạn cho model xem một hình ảnh mới, chẳng hạn hình ảnh chim cánh cụt, model sẽ so sánh hình ảnh mới này với những hình ảnh trong support set và chọn kết quả khớp gần nhất. Khi khó thu thập một lượng lớn dữ liệu, phương pháp này rất hữu ích vì hệ thống vẫn có thể học hỏi và thích ứng chỉ với vài ví dụ.

Hình 1. Tổng quan về cách học few-shot hoạt động.
Học zero-shot#
Học zero-shot là phương pháp giúp máy móc nhận diện những sự vật mà chúng chưa từng thấy trước đây mà không cần các ví dụ về chúng. Phương pháp này sử dụng thông tin ngữ nghĩa, chẳng hạn như mô tả, để hỗ trợ việc tạo ra các mối liên hệ.
Ví dụ, nếu một máy đã học về những loài động vật như mèo, sư tử và ngựa bằng cách hiểu các đặc điểm như “nhỏ và nhiều lông”, “mèo lớn hoang dã” hoặc “mặt dài”, máy có thể sử dụng kiến thức này để nhận diện một loài động vật mới, chẳng hạn hổ. Ngay cả khi chưa từng thấy hổ trước đây, máy vẫn có thể sử dụng mô tả như “một loài động vật giống sư tử với các sọc sẫm màu” để nhận diện chính xác. Điều này giúp máy móc học hỏi và thích ứng dễ dàng hơn mà không cần nhiều ví dụ.

Hình 2. Học zero-shot nhận diện các đối tượng mới bằng mô tả.
Học chuyển giao#
Học chuyển giao là một mô hình học tập trong đó model sử dụng những gì đã học từ một nhiệm vụ để hỗ trợ giải quyết một nhiệm vụ mới tương tự. Kỹ thuật này đặc biệt hữu ích đối với các nhiệm vụ thị giác máy tính như phát hiện đối tượng, phân loại hình ảnh và nhận diện mẫu.
Chẳng hạn, trong thị giác máy tính, một model được pre-trained có thể nhận diện các đối tượng chung như động vật, sau đó được fine-tune thông qua học chuyển giao để nhận diện những đối tượng cụ thể, chẳng hạn các giống chó khác nhau. Bằng cách tái sử dụng kiến thức từ những nhiệm vụ trước đó, học chuyển giao giúp việc training các model thị giác máy tính trên các dataset nhỏ hơn trở nên dễ dàng hơn, qua đó tiết kiệm thời gian và công sức.

Hình 3. Tổng quan về cách học chuyển giao hoạt động.
Có thể bạn đang thắc mắc những model nào hỗ trợ học chuyển giao. Ultralytics YOLO11 là một ví dụ điển hình về model thị giác máy tính có khả năng này. Đây là model phát hiện đối tượng hiện đại, trước tiên được pre-trained trên một dataset lớn và tổng quát. Sau đó, model có thể được fine-tune và custom-train trên một dataset nhỏ hơn, chuyên biệt cho các nhiệm vụ cụ thể.
So sánh các mô hình học tập#
Sau khi đã tìm hiểu về học few-shot, học zero-shot và học chuyển giao, hãy cùng so sánh chúng để xem chúng khác nhau như thế nào.

Hình 4. Những điểm khác biệt chính giữa học few-shot, học zero-shot và học chuyển giao. Hình ảnh do tác giả thực hiện.
Học few-shot hữu ích khi bạn chỉ có một lượng nhỏ dữ liệu được gán nhãn. Phương pháp này cho phép model AI học từ chỉ một vài ví dụ. Ngược lại, học zero-shot không yêu cầu dữ liệu được gán nhãn. Thay vào đó, phương pháp này sử dụng mô tả hoặc ngữ cảnh để hỗ trợ hệ thống xử lý các nhiệm vụ mới. Trong khi đó, học chuyển giao sử dụng một cách tiếp cận khác bằng cách tận dụng kiến thức từ các model được pre-trained, cho phép chúng nhanh chóng thích ứng với những nhiệm vụ mới chỉ với rất ít dữ liệu bổ sung. Mỗi phương pháp đều có những thế mạnh riêng, tùy thuộc vào loại dữ liệu và nhiệm vụ bạn đang xử lý.
Các ứng dụng thực tế của nhiều mô hình học tập#
Những mô hình học tập này đã tạo ra tác động trong nhiều lĩnh vực, giải quyết các vấn đề phức tạp bằng những giải pháp sáng tạo. Hãy cùng xem xét kỹ hơn cách chúng có thể được áp dụng trong thực tế.
Chẩn đoán bệnh hiếm bằng học few-shot#
Học few-shot là một bước đột phá đối với lĩnh vực y tế, đặc biệt trong chẩn đoán hình ảnh y khoa. Phương pháp này có thể hỗ trợ bác sĩ chẩn đoán các bệnh hiếm chỉ bằng một vài ví dụ hoặc thậm chí bằng mô tả, mà không cần lượng dữ liệu lớn. Điều này đặc biệt hữu ích khi dữ liệu bị hạn chế, thường xảy ra vì việc thu thập các dataset lớn cho những bệnh hiếm có thể rất khó khăn.
Ví dụ, SHEPHERD sử dụng học few-shot và các knowledge graph y sinh để chẩn đoán những rối loạn di truyền hiếm gặp. Hệ thống ánh xạ thông tin bệnh nhân, chẳng hạn triệu chứng và kết quả xét nghiệm, lên một mạng lưới các gene và bệnh đã biết. Điều này giúp xác định nguyên nhân di truyền có khả năng xảy ra nhất và tìm các ca bệnh tương tự, ngay cả khi dữ liệu bị hạn chế.

Hình 5. Model SHEPHERD chẩn đoán bệnh hiếm bằng dữ liệu tối thiểu.
Cải thiện khả năng phát hiện bệnh ở cây trồng bằng học zero-shot#
Trong nông nghiệp, việc nhanh chóng xác định bệnh ở cây trồng là rất quan trọng vì chậm trễ trong phát hiện có thể dẫn đến thiệt hại trên diện rộng cho mùa màng, giảm năng suất và tổn thất tài chính đáng kể. Các phương pháp truyền thống thường phụ thuộc vào dataset lớn và kiến thức chuyên môn, vốn không phải lúc nào cũng sẵn có, đặc biệt tại các khu vực hẻo lánh hoặc thiếu thốn nguồn lực. Đây là lúc những tiến bộ trong AI, chẳng hạn học zero-shot, phát huy vai trò.
Giả sử một nông dân đang trồng cà chua và khoai tây, đồng thời nhận thấy các triệu chứng như lá chuyển vàng hoặc xuất hiện đốm nâu. Học zero-shot có thể giúp xác định các bệnh như bệnh mốc sương mà không cần dataset lớn. Bằng cách sử dụng mô tả về các triệu chứng, model có thể phân loại những bệnh mà model chưa từng thấy trước đây. Phương pháp này nhanh, có khả năng mở rộng và cho phép nông dân phát hiện nhiều vấn đề khác nhau ở cây trồng. Phương pháp này giúp họ giám sát sức khỏe cây trồng hiệu quả hơn, hành động kịp thời và giảm thiểu tổn thất.

Hình 6. Sử dụng học zero-shot để xác định bệnh ở cây trồng.
Xe tự hành và học chuyển giao#
Xe tự hành thường cần thích ứng với các môi trường khác nhau để di chuyển an toàn. Học chuyển giao giúp chúng sử dụng kiến thức có sẵn để nhanh chóng điều chỉnh theo các điều kiện mới mà không phải bắt đầu training lại từ đầu. Khi kết hợp với thị giác máy tính, công nghệ giúp xe diễn giải thông tin hình ảnh, những công nghệ này cho phép điều hướng mượt mà hơn trên nhiều địa hình và trong các điều kiện thời tiết khác nhau, giúp việc lái xe tự hành hiệu quả và đáng tin cậy hơn.
Một ví dụ điển hình là hệ thống quản lý bãi đỗ xe sử dụng Ultralytics YOLO11 để giám sát các vị trí đỗ xe. YOLO11, một model phát hiện đối tượng được pre-trained, có thể được fine-tune bằng học chuyển giao để nhận diện các vị trí đỗ xe trống và đang có xe theo thời gian thực. Bằng cách training model trên một dataset nhỏ hơn gồm các hình ảnh bãi đỗ xe, model học cách phát hiện chính xác các vị trí còn trống, vị trí đã kín và thậm chí cả khu vực dành riêng.

Hình 7. Quản lý bãi đỗ xe bằng Ultralytics YOLO11.
Khi được tích hợp với các công nghệ khác, hệ thống này có thể hướng dẫn tài xế đến vị trí còn trống gần nhất, giúp giảm thời gian tìm kiếm và tình trạng ùn tắc giao thông. Học chuyển giao giúp điều này khả thi bằng cách dựa trên các khả năng phát hiện đối tượng sẵn có của Ultralytics YOLO11, cho phép model thích ứng với những nhu cầu cụ thể của việc quản lý bãi đỗ xe mà không cần bắt đầu lại từ đầu. Phương pháp này tiết kiệm thời gian và tài nguyên, đồng thời tạo ra một giải pháp hiệu quả cao, có khả năng mở rộng, giúp cải thiện hoạt động bãi đỗ xe và nâng cao trải nghiệm người dùng tổng thể.
Các xu hướng mới nổi trong mô hình học tập#
Tương lai của các mô hình học tập trong thị giác máy tính đang hướng đến việc phát triển những hệ thống AI thị giác thông minh và bền vững hơn. Đặc biệt, một xu hướng đang phát triển là sử dụng các phương pháp tiếp cận lai, kết hợp học few-shot, học zero-shot và học chuyển giao. Bằng cách kết hợp thế mạnh của những phương pháp này, các model có thể học những nhiệm vụ mới với lượng dữ liệu tối thiểu và áp dụng kiến thức của chúng trong nhiều lĩnh vực khác nhau.
Một ví dụ thú vị là sử dụng các embedding sâu được điều chỉnh để fine-tune các model bằng kiến thức từ những nhiệm vụ trước đó cùng một lượng nhỏ dữ liệu mới, giúp việc xử lý các dataset hạn chế trở nên dễ dàng hơn.
Tương tự, học X-shot được thiết kế để xử lý các nhiệm vụ có lượng dữ liệu khác nhau. Phương pháp này sử dụng supervision yếu, trong đó các model học từ những nhãn hạn chế hoặc nhiễu, cùng các chỉ dẫn rõ ràng để giúp chúng nhanh chóng thích ứng, ngay cả khi có rất ít hoặc không có ví dụ trước đó. Những phương pháp tiếp cận lai này cho thấy việc tích hợp các phương pháp học khác nhau có thể giúp hệ thống AI xử lý thách thức hiệu quả hơn.
Những điểm chính#
Học few-shot, học zero-shot và học chuyển giao đều giải quyết những thách thức cụ thể trong thị giác máy tính, khiến chúng phù hợp với các nhiệm vụ khác nhau. Phương pháp phù hợp phụ thuộc vào ứng dụng cụ thể và lượng dữ liệu hiện có. Ví dụ, học few-shot hoạt động hiệu quả với dữ liệu hạn chế, trong khi học zero-shot phù hợp để xử lý các lớp chưa từng thấy hoặc không quen thuộc.
Trong tương lai, việc kết hợp những phương pháp này để tạo ra các model lai tích hợp thị giác, ngôn ngữ và âm thanh nhiều khả năng sẽ là trọng tâm chính. Những tiến bộ này hướng đến việc làm cho các hệ thống AI trở nên linh hoạt, hiệu quả và có khả năng xử lý các vấn đề phức tạp hơn, mở ra những khả năng mới cho sự đổi mới trong lĩnh vực này.
Tìm hiểu thêm về AI bằng cách tham gia cộng đồng của chúng tôi và xem repository GitHub của chúng tôi. Tìm hiểu cách AI trong xe tự lái và thị giác máy tính trong nông nghiệp đang định hình lại tương lai. Xem các tùy chọn giấy phép YOLO hiện có để bắt đầu!









