Convolutional Neural Network (CNN)
Khám phá cách Convolutional Neural Networks (CNN) hỗ trợ computer vision hiện đại. Tìm hiểu về các lớp, ứng dụng và cách chạy Ultralytics YOLO26 cho AI thời gian thực.
Mạng nơ-ron tích chập (CNN) là một kiến trúc học sâu chuyên biệt được thiết kế để xử lý dữ liệu có cấu trúc topology dạng lưới, đáng chú ý nhất là hình ảnh kỹ thuật số. Lấy cảm hứng từ cấu trúc sinh học của vỏ não thị giác, CNN có khả năng độc đáo trong việc bảo tồn các mối quan hệ không gian trong dữ liệu đầu vào. Không giống như các mạng nơ-ron truyền thống làm phẳng hình ảnh thành một danh sách dài các con số, CNN phân tích các vùng nhỏ chồng chéo của hình ảnh để tự động học các bậc phân cấp của đặc trưng—từ các cạnh và kết cấu đơn giản đến các hình dạng và đối tượng phức tạp. Khả năng này khiến chúng trở thành công nghệ nền tảng đằng sau các hệ thống thị giác máy tính (CV) hiện đại.
Cách thức hoạt động của mạng thần kinh tích chập#
Sức mạnh của một CNN nằm ở khả năng rút gọn một ảnh phức tạp thành một dạng dễ xử lý hơn mà không làm mất đi các đặc trưng quan trọng để có được dự đoán tốt. Điều này đạt được thông qua một quy trình gồm các lớp riêng biệt chuyển đổi khối dữ liệu đầu vào thành một lớp hoặc giá trị đầu ra:
- Lớp Tích chập: Đây là khối xây dựng cốt lõi. Nó sử dụng một tập hợp các bộ lọc có thể học được (hoặc kernel) trượt qua hình ảnh đầu vào giống như một chiếc đèn pin. Tại mỗi vị trí, bộ lọc thực hiện một phép toán gọi là tích chập, tạo ra một bản đồ đặc trưng làm nổi bật các mẫu cụ thể như đường ngang hoặc dải màu.
- Hàm Kích hoạt: Sau khi tích chập, một hàm phi tuyến tính được áp dụng cho đầu ra. Lựa chọn phổ biến nhất là ReLU (Đơn vị tuyến tính chỉnh lưu), giúp chuyển các giá trị pixel âm thành không. Điều này giới thiệu tính phi tuyến tính, cho phép mạng học các mẫu phức tạp vượt ra ngoài các mối quan hệ tuyến tính đơn giản.
- Lớp Gộp (Pooling Layer): Còn được gọi là lấy mẫu xuống, lớp này làm giảm số chiều của các bản đồ đặc trưng. Các kỹ thuật như gộp tối đa (max pooling) chỉ giữ lại các đặc trưng quan trọng nhất (các giá trị cao nhất) trong một vùng, giúp giảm tải tính toán và ngăn ngừa hiện tượng quá khớp (overfitting).
- Lớp Kết nối Đầy đủ (Fully Connected Layer): Ở giai đoạn cuối, các đặc trưng đã xử lý được làm phẳng và đưa vào một mạng nơ-ron (NN) tiêu chuẩn. Lớp này sử dụng các đặc trưng cấp cao được xác định bởi các lớp trước để thực hiện phân loại hoặc dự đoán cuối cùng, chẳng hạn như "mèo" hoặc "chó."
Các ứng dụng trong thực tế#
CNN đã chuyển đổi các ngành công nghiệp bằng cách tự động hóa các tác vụ thị giác với độ chính xác vượt trội con người.
- Chẩn đoán Y khoa: Trong lĩnh vực chăm sóc sức khỏe, CNN hỗ trợ các bác sĩ X-quang bằng cách xác định các bất thường trong ảnh chụp y tế nhanh hơn mắt người. Ví dụ, các mô hình học sâu phân tích chụp MRI và CT để phát hiện các dấu hiệu sớm của khối u hoặc vết gãy xương. Nghiên cứu liên quan đến AI trong chẩn đoán hình ảnh y tế nêu bật cách các công cụ này cải thiện độ nhất quán và tốc độ chẩn đoán.
- Autonomous Systems: Self-driving cars rely heavily on CNNs to perceive their surroundings. Models like YOLO26 utilize efficient CNN backbones to perform real-time object detection, identifying pedestrians, traffic signs, and other vehicles to make split-second driving decisions.
CNN so với Vision Transformers (ViT)#
Mặc dù CNN từ lâu đã là tiêu chuẩn cho các tác vụ thị giác, một kiến trúc mới hơn gọi là Transformer Thị giác (ViT) đã xuất hiện.
- CNN xử lý hình ảnh sử dụng các đặc trưng cục bộ và có hiệu suất cao trên các tập dữ liệu nhỏ hơn nhờ "thiên vị quy nạp" của chúng (giả định rằng các pixel lân cận có liên quan). Chúng nổi trội trong các kịch bản yêu cầu suy luận thời gian thực trên các thiết bị biên.
- ViT chia hình ảnh thành các bản vá (patches) và xử lý chúng bằng cơ chế tự chú ý (self-attention) toàn cục. Điều này cho phép chúng nắm bắt các phụ thuộc tầm xa trên toàn bộ hình ảnh nhưng thường đòi hỏi các tập dữ liệu lớn và nhiều sức mạnh tính toán hơn để huấn luyện hiệu quả.
Ví dụ về triển khai#
Các thư viện hiện đại giúp việc sử dụng các mô hình dựa trên CNN trở nên đơn giản. Gói ultralytics cung cấp quyền truy cập vào các mô hình tiên tiến như YOLO26, có các kiến trúc CNN được tối ưu hóa cao để suy luận nhanh chóng.
Ví dụ sau đây minh họa cách tải một mô hình CNN đã được huấn luyện trước và thực hiện dự đoán:
from ultralytics import YOLO
# Load a YOLO26 model, which uses an advanced CNN architecture
model = YOLO("yolo26n.pt")
# Run inference on an image to identify objects
results = model("https://ultralytics.com/images/bus.jpg")
# Display the prediction results
results[0].show()Công cụ dành cho phát triển#
Việc phát triển CNN được hỗ trợ bởi một hệ sinh thái mạnh mẽ các công cụ mã nguồn mở. Các kỹ sư thường sử dụng các framework như PyTorch hoặc TensorFlow để xây dựng các kiến trúc tùy chỉnh. Các thư viện này cung cấp các thao tác tensor cấp thấp cần thiết cho tích chập và lan truyền ngược (backpropagation).
Đối với các nhóm muốn đơn giản hóa vòng đời của các dự án thị giác máy tính—từ thu thập dữ liệu đến triển khai—Ultralytics Platform cung cấp một giải pháp toàn diện. Nó đơn giản hóa các quy trình phức tạp, cho phép các nhà phát triển tập trung vào việc áp dụng CNN để giải quyết các vấn đề kinh doanh thay vì quản lý cơ sở hạ tầng. Ngoài ra, các mô hình có thể được xuất sang các định dạng như ONNX hoặc TensorRT để triển khai hiệu suất cao trên các thiết bị biên.






