Convolution
Khám phá các nền tảng của phép convolution trong thị giác máy tính và deep learning. Tìm hiểu cách kernel và feature map thúc đẩy Ultralytics YOLO26 cho các tác vụ thời gian thực.
Tích chập là một phép toán toán học nền tảng, đóng vai trò là khối xây dựng cốt lõi của các hệ thống thị giác máy tính (CV) và học sâu (DL) hiện đại. Trong xử lý ảnh, tích chập bao gồm việc trượt một bộ lọc nhỏ—thường được gọi là kernel—trên ảnh đầu vào để tạo ra một bản đồ các đặc trưng quan trọng. Quy trình này cho phép các model trí tuệ nhân tạo (AI) tự động học và nhận diện các mẫu như cạnh, kết cấu và hình dạng mà không cần sự can thiệp của con người. Khác với machine learning (ML) truyền thống, vốn thường yêu cầu trích xuất đặc trưng thủ công, tích chập cho phép các mạng xây dựng hiểu biết phân cấp về dữ liệu hình ảnh, bắt đầu từ các đường nét đơn giản và tiến tới những đối tượng phức tạp như khuôn mặt hoặc phương tiện.
Cách tích chập hoạt động#
Phép toán này hoạt động bằng cách đưa một bộ lọc qua dữ liệu đầu vào, thực hiện phép nhân theo từng phần tử rồi cộng các kết quả để tạo ra một giá trị duy nhất tại mỗi vị trí. Đầu ra này được gọi là bản đồ đặc trưng.
- Kernel: Đây là một ma trận nhỏ gồm các số (trọng số) dùng để phát hiện các đặc trưng cụ thể. Ví dụ, toán tử Sobel là một loại kernel cụ thể được sử dụng để phát hiện các cạnh dọc hoặc ngang.
- Cửa sổ trượt: Kernel di chuyển trên ảnh theo một kích thước bước xác định, được gọi là "stride". Quy trình lọc không gian này bảo toàn mối quan hệ giữa các pixel, điều rất quan trọng để hiểu hình ảnh.
- Phân cấp lớp: Trong các kiến trúc deep learning như Mạng nơ-ron tích chập (CNNs), các lớp ban đầu nắm bắt các chi tiết cấp thấp, trong khi các lớp sâu hơn kết hợp chúng thành những khái niệm cấp cao.
Tích chập và các khái niệm liên quan#
Để hiểu đầy đủ về tích chập, cần phân biệt nó với các thuật ngữ tương tự thường gặp trong tài liệu về mạng nơ-ron (NN):
- Tương quan chéo và tích chập: Về mặt toán học, tích chập thực sự bao gồm việc lật kernel trước khi áp dụng. Tuy nhiên, hầu hết các framework deep learning, bao gồm thư viện PyTorch, đều triển khai tương quan chéo (trượt mà không lật) nhưng gọi nó là "tích chập" vì các trọng số được học trong quá trình training, khiến sự khác biệt về việc lật không ảnh hưởng đến hiệu năng.
- Tích chập và attention: Trong khi tích chập xử lý thông tin cục bộ (các pixel lân cận), cơ chế attention cho phép model liên hệ đồng thời các phần ở xa nhau trong một ảnh. Các kiến trúc hiện đại như YOLO26 thường sử dụng các lớp tích chập được tối ưu hóa cao để duy trì tốc độ suy luận thời gian thực, vì các lớp attention có thể đòi hỏi nhiều tính toán hơn.
Các ứng dụng trong thực tế#
Hiệu quả của tích chập đã giúp AI cách mạng hóa nhiều ngành công nghiệp bằng cách cung cấp nền tảng cho các hệ thống perception mạnh mẽ:
-
Chẩn đoán y khoa: Trong lĩnh vực AI trong chăm sóc sức khỏe, tích chập hỗ trợ phân tích các ảnh chụp MRI có độ phân giải cao. Bằng cách sử dụng các kernel được thiết kế riêng để làm nổi bật những điểm bất thường, các model có thể phát hiện sớm dấu hiệu của khối u hoặc gãy xương với [độ chính xác](https://ultralytics-translation-2.invalid tương đương với các chuyên gia con người.
-
Điều hướng tự động: Các phương tiện tự lái dựa vào tích chập để phát hiện đối tượng theo thời gian thực. Khi xe di chuyển, các lớp tích chập xử lý luồng video để ngay lập tức nhận diện người đi bộ, vạch làn đường và biển báo giao thông—một thành phần quan trọng của an toàn AI trong ngành ô tô.
Ví dụ Python với Ultralytics#
Bạn có thể kiểm tra các lớp tích chập bên trong những model tiên tiến nhất bằng Python. Ví dụ sau tải model YOLO26 và xác minh rằng lớp ban đầu của model sử dụng một phép toán tích chập tiêu chuẩn, được triển khai thông qua torch.nn.
import torch.nn as nn
from ultralytics import YOLO
# Load the latest YOLO26 model
model = YOLO("yolo26n.pt")
# Access the first layer of the model's backbone
first_layer = model.model.model[0]
# Verify it is a Convolutional layer
if isinstance(first_layer.conv, nn.Conv2d):
print("Success: The first layer is a standard convolution.")
print(f"Kernel size: {first_layer.conv.kernel_size}")Vì sao tích chập quan trọng đối với Edge AI#
Các phép toán tích chập có khả năng tối ưu hóa cao, khiến chúng trở nên lý tưởng cho việc triển khai Edge AI, nơi tài nguyên tính toán bị giới hạn. Vì cùng một kernel được chia sẻ trên toàn bộ ảnh (chia sẻ tham số), model yêu cầu ít bộ nhớ hơn đáng kể so với các kiến trúc fully connected trước đây. Hiệu quả này cho phép các model tiên tiến chạy trên smartphone và thiết bị IoT.
Đối với các đội ngũ muốn tận dụng những phép toán này cho các dataset tùy chỉnh, Ultralytics Platform cung cấp một môi trường liền mạch để gán nhãn ảnh và training các model dựa trên tích chập mà không cần quản lý hạ tầng phức tạp. Bằng cách sử dụng transfer learning, bạn có thể fine-tune các trọng số tích chập đã được pre-trained để nhận diện các đối tượng mới với dữ liệu training tối thiểu.









