Model Ensemble
Khám phá cách model ensemble kết hợp nhiều kiến trúc, chẳng hạn như Ultralytics YOLO26, để tăng độ chính xác và độ robust. Tìm hiểu các kỹ thuật chính và mẹo triển khai.
Tổ hợp model là một phương pháp chiến lược trong machine learning, trong đó các dự đoán từ nhiều model riêng lẻ được kết hợp để tạo ra đầu ra cuối cùng thường chính xác và mạnh mẽ hơn những gì bất kỳ model đơn lẻ nào có thể đạt được. Tương tự như một hội đồng chuyên gia thảo luận để đưa ra quyết định tốt hơn một cá nhân, tổ hợp model khai thác thế mạnh của các kiến trúc đa dạng để giảm thiểu lỗi. Kỹ thuật này được sử dụng rộng rãi để cải thiện hiệu năng trong các tác vụ phức tạp, giảm rủi ro quá khớp và xử lý đánh đổi sai lệch-phương sai vốn có trong việc lập mô hình thống kê.
Cơ chế của việc tạo tổ hợp model#
Nguyên tắc cốt lõi của tổ hợp model là "tính đa dạng". Bằng cách huấn luyện nhiều model—thường được gọi là "bộ học cơ sở" hoặc "bộ học yếu"—trên các tập con khác nhau của dữ liệu huấn luyện hoặc sử dụng các thuật toán khác nhau, tổ hợp này đảm bảo rằng lỗi do một model tạo ra có khả năng được các model khác sửa chữa. Trong bối cảnh deep learning, việc này thường bao gồm chạy song song nhiều mạng nơ-ron trong quá trình suy luận.
Các phương pháp phổ biến để kết hợp những dự đoán này bao gồm:
- Bỏ phiếu: Được sử dụng trong phân loại ảnh, trong đó lớp được đa số model lựa chọn sẽ trở thành dự đoán cuối cùng.
- Lấy trung bình: Thường được sử dụng trong các tác vụ hồi quy, trong đó các đầu ra dạng số được lấy trung bình để làm mượt nhiễu.
- Hợp nhất có trọng số: Trong phát hiện đối tượng, các kỹ thuật như Hợp nhất hộp có trọng số (WBF) sẽ gộp các bounding box từ những detector khác nhau dựa trên điểm độ tin cậy.
Các ứng dụng trong thực tế#
Tổ hợp model đóng vai trò thiết yếu trong các môi trường có yêu cầu an toàn cao, nơi việc tối đa hóa độ chính xác là ưu tiên hàng đầu và tài nguyên tính toán cho phép chạy nhiều model.
-
Chẩn đoán y khoa: Trong phân tích ảnh y khoa, việc bỏ sót một chẩn đoán có thể gây ra hậu quả nghiêm trọng. Các bác sĩ X quang thường sử dụng các tổ hợp kết hợp một Mạng nơ-ron tích chập (CNN) tiêu chuẩn với một Transformer thị giác (ViT). CNN vượt trội trong phân tích kết cấu cục bộ, còn ViT nắm bắt ngữ cảnh toàn cục, cho phép hệ thống phát hiện khối u với độ nhạy cao hơn so với từng kiến trúc riêng lẻ.
-
Xe tự hành: Các hệ thống nhận thức trong phương tiện tự hành phải có khả năng vận hành an toàn khi xảy ra lỗi. Các kỹ sư thường triển khai một tổ hợp các model phát hiện—chẳng hạn, kết hợp tốc độ theo thời gian thực của YOLO26 với độ chính xác dựa trên Transformer của RT-DETR. Điều này đảm bảo người đi bộ hoặc chướng ngại vật vẫn được phát hiện ngay cả khi một model gặp khó khăn trong các điều kiện ánh sáng cụ thể, chẳng hạn như ánh sáng chói hoặc bóng đổ.
Triển khai tổ hợp model với Python#
Mặc dù có thể xây dựng các chiến lược tổ hợp phức tạp bằng những thư viện như Scikit-learn, bạn vẫn có thể tạo một tổ hợp suy luận cơ bản cho computer vision bằng cách chỉ cần tải nhiều model và xử lý cùng một đầu vào. Ví dụ sau minh họa cách tải hai model Ultralytics YOLO riêng biệt để tạo dự đoán trên cùng một ảnh.
from ultralytics import YOLO
# Load two different model variants to create a diverse ensemble
model_a = YOLO("yolo26n.pt") # Nano model (Speed focused)
model_b = YOLO("yolo26s.pt") # Small model (Higher accuracy)
# Perform inference on an image with both models
# In production, results are typically merged programmatically
results_a = model_a("https://ultralytics.com/images/bus.jpg")
results_b = model_b("https://ultralytics.com/images/bus.jpg")
print(f"Model A detected {len(results_a[0].boxes)} objects.")
print(f"Model B detected {len(results_b[0].boxes)} objects.")Tổ hợp model và Mixture of Experts#
Việc phân biệt một tổ hợp model tiêu chuẩn với Mixture of Experts (MoE), một thuật ngữ thường xuất hiện trong nghiên cứu Large Language Model (LLM) hiện đại, là rất hữu ích.
- Tổ hợp model: Thông thường truy vấn mọi model trong tập hợp cho mỗi đầu vào và tổng hợp các kết quả. Cách này tối đa hóa các chỉ số như độ chính xác trung bình (mAP), nhưng làm tăng đáng kể độ trễ suy luận và chi phí tính toán. Đây là một phương pháp brute-force để đạt chất lượng.
- Mixture of Experts: Sử dụng một "mạng định tuyến" để chuyển dữ liệu chỉ đến một vài model con "chuyên gia" cụ thể phù hợp nhất với đầu vào hiện tại. Điều này cho phép mở rộng quy mô mạnh mẽ trong các foundation model mà không phải chịu chi phí tính toán do chạy mọi tham số cho mọi token.
Ưu điểm và các điểm cần cân nhắc#
Ưu điểm chính của việc sử dụng tổ hợp model là hiệu năng được cải thiện. Các tổ hợp thường chiếm ưu thế trên bảng xếp hạng trong những thử thách về data science như các cuộc thi Kaggle, vì chúng có thể mô hình hóa các mẫu phức tạp mà model đơn lẻ bỏ sót. Tuy nhiên, điều này đi kèm với một chi phí: triển khai các tổ hợp đòi hỏi nhiều memory và năng lực tính toán hơn.
Đối với các team muốn quản lý hiệu quả những yêu cầu về tài nguyên này, Ultralytics Platform cung cấp các công cụ để huấn luyện, theo dõi và benchmark những kiến trúc model khác nhau. Bằng cách dễ dàng so sánh các chỉ số hiệu năng, developer có thể quyết định liệu mức tăng độ chính xác từ một tổ hợp có xứng đáng với hạ tầng bổ sung cần thiết để triển khai trong các kịch bản edge AI hay không.









