Feature Maps
Khám phá cách feature map hoạt động như đôi mắt của CNN. Tìm hiểu cách Ultralytics YOLO26 sử dụng các biểu diễn nội tại này để phát hiện pattern và hỗ trợ computer vision.
Bản đồ đặc trưng là đầu ra cơ bản được tạo ra khi một bộ lọc tích chập xử lý ảnh đầu vào hoặc một layer trước đó trong mạng nơ-ron. Trong ngữ cảnh thị giác máy tính (CV), các bản đồ này đóng vai trò là biểu diễn nội tại của dữ liệu, làm nổi bật những mẫu cụ thể như cạnh, texture hoặc các hình dạng hình học phức tạp mà model đã học cách nhận diện. Về cơ bản, bản đồ đặc trưng hoạt động như "đôi mắt" của một Mạng nơ-ron tích chập (CNN), chuyển đổi các giá trị pixel thô thành những abstraction có ý nghĩa, hỗ trợ các tác vụ như phát hiện đối tượng và phân loại.
Cơ chế phía sau bản đồ đặc trưng#
Việc tạo bản đồ đặc trưng được thực hiện thông qua phép toán toán học gọi là tích chập. Trong quá trình này, một ma trận nhỏ chứa các tham số có thể học, được gọi là kernel hoặc filter, trượt qua dữ liệu đầu vào. Tại mỗi vị trí, kernel thực hiện phép nhân theo từng phần tử và phép cộng tổng, tạo ra một giá trị duy nhất trong lưới đầu ra.
- Kích hoạt mẫu: Mỗi filter được huấn luyện để tìm kiếm một đặc trưng cụ thể. Khi filter bắt gặp đặc trưng đó trong dữ liệu đầu vào, giá trị tương ứng trong bản đồ đặc trưng sẽ cao, cho thấy mức kích hoạt mạnh.
- Phân cấp không gian: Trong các kiến trúc deep learning (DL), các bản đồ đặc trưng được sắp xếp theo cấp bậc. Các layer đầu tiên tạo ra những bản đồ phát hiện các chi tiết cấp thấp như đường thẳng và đường cong trong phát hiện cạnh. Các layer sâu hơn kết hợp những bản đồ đơn giản này để hình thành các biểu diễn cấp cao của những đối tượng phức tạp, chẳng hạn như khuôn mặt hoặc phương tiện.
- Thay đổi số chiều: Khi dữ liệu đi qua mạng, các phép toán như layer pooling thường làm giảm kích thước không gian (chiều cao và chiều rộng) của các bản đồ đặc trưng, đồng thời tăng độ sâu (số lượng channel). Quá trình này, thường được gọi là giảm số chiều, giúp model tập trung vào sự hiện diện của các đặc trưng thay vì vị trí pixel chính xác của chúng.
Các ứng dụng trong thực tế#
Bản đồ đặc trưng là phần cốt lõi của các ứng dụng AI hiện đại, cho phép hệ thống diễn giải dữ liệu hình ảnh với khả năng hiểu tương tự con người.
- Chẩn đoán y khoa: Trong phân tích ảnh y khoa, các model sử dụng bản đồ đặc trưng để xử lý ảnh X-quang hoặc ảnh MRI. Các bản đồ ở giai đoạn đầu có thể làm nổi bật đường viền của xương, trong khi các bản đồ ở giai đoạn sâu hơn nhận diện những bất thường như khối u hoặc vết gãy, hỗ trợ bác sĩ trong các tình huống AI trong chăm sóc sức khỏe.
- Điều hướng tự động: Xe tự lái phụ thuộc rất nhiều vào các bản đồ đặc trưng được tạo ra bởi cảm biến hình ảnh. Những bản đồ này cho phép máy tính tích hợp trên xe phân biệt làn đường, người đi bộ và biển báo giao thông theo thời gian thực, điều này rất quan trọng để phương tiện tự hành vận hành an toàn.
Làm việc với bản đồ đặc trưng trong Python#
Mặc dù bản đồ đặc trưng là các cấu trúc nội bộ, việc hiểu rõ kích thước của chúng rất quan trọng khi thiết kế kiến trúc. Ví dụ PyTorch sau đây minh họa cách một layer tích chập đơn lẻ biến đổi ảnh đầu vào thành một bản đồ đặc trưng.
import torch
import torch.nn as nn
# Define a convolution layer: 1 input channel, 1 output filter, 3x3 kernel
conv_layer = nn.Conv2d(in_channels=1, out_channels=1, kernel_size=3, bias=False)
# Create a random dummy image (Batch Size=1, Channels=1, Height=5, Width=5)
input_image = torch.randn(1, 1, 5, 5)
# Pass the image through the layer to generate the feature map
feature_map = conv_layer(input_image)
print(f"Input shape: {input_image.shape}")
# The output shape will be smaller (3x3) due to the kernel size and no padding
print(f"Feature Map shape: {feature_map.shape}")Phân biệt các khái niệm liên quan#
Để tránh nhầm lẫn trong quá trình huấn luyện model, việc phân biệt bản đồ đặc trưng với các thuật ngữ tương tự là rất hữu ích:
- Bản đồ đặc trưng và Filter: Filter (hoặc kernel) là công cụ được sử dụng để quét ảnh; nó chứa trọng số model. Bản đồ đặc trưng là kết quả của quá trình quét đó. Có thể hình dung filter là "ống kính", còn bản đồ đặc trưng là "hình ảnh" được chụp qua ống kính đó.
- Bản đồ đặc trưng và Embedding: Mặc dù cả hai đều biểu diễn dữ liệu, bản đồ đặc trưng thường giữ lại cấu trúc không gian (chiều cao và chiều rộng), phù hợp cho phân đoạn ngữ nghĩa. Ngược lại, embedding thường là các vector 1D được làm phẳng, nắm bắt ý nghĩa ngữ nghĩa nhưng loại bỏ bố cục không gian, và thường được sử dụng trong các tác vụ tìm kiếm tương đồng.
- Bản đồ đặc trưng và Activation: Một hàm activation (chẳng hạn như ReLU) được áp dụng lên các giá trị trong bản đồ đặc trưng để đưa tính phi tuyến vào mô hình. Bản đồ tồn tại cả trước và sau phép toán toán học này.
Mức độ liên quan đến các model Ultralytics#
Trong các kiến trúc nâng cao như YOLO26, bản đồ đặc trưng đóng vai trò then chốt trong "backbone" và "head" của model. Backbone trích xuất các đặc trưng ở nhiều scale khác nhau (feature pyramid), đảm bảo model có thể phát hiện hiệu quả cả đối tượng nhỏ và lớn. Người dùng tận dụng Ultralytics Platform để huấn luyện có thể trực quan hóa hiệu suất của các model này, gián tiếp quan sát hiệu quả của những bản đồ đặc trưng bên dưới thông qua các metric như độ chính xác và recall. Việc tối ưu hóa các bản đồ này đòi hỏi quá trình huấn luyện mở rộng trên các dataset đã được gán nhãn, thường sử dụng những kỹ thuật như trích xuất đặc trưng để chuyển giao kiến thức từ các model đã được pre-train sang những tác vụ mới.









