Receptive Field
Khám phá cách receptive field xác định những gì neural network nhìn thấy. Tìm hiểu cách Ultralytics YOLO26 tối ưu hóa ngữ cảnh không gian để phát hiện hiệu quả các object ở mọi kích thước.
Trong lĩnh vực thị giác máy tính (CV) và deep learning, trường tiếp nhận là vùng cụ thể của ảnh đầu vào mà một neuron nhất định trong mạng nơ-ron (NN) “nhìn thấy” hoặc phân tích. Về mặt khái niệm, nó hoạt động tương tự trường nhìn của mắt người hoặc ống kính camera. Trường tiếp nhận xác định lượng ngữ cảnh không gian mà một model có thể nhận biết tại bất kỳ layer nào. Khi dữ liệu truyền qua Mạng nơ-ron tích chập (CNN), trường tiếp nhận thường mở rộng, cho phép hệ thống chuyển từ việc nhận diện các chi tiết cục bộ, nhỏ—chẳng hạn như cạnh hoặc góc—sang việc hiểu các cấu trúc phức tạp, mang tính toàn cục như toàn bộ vật thể hoặc cảnh.
Cơ chế của trường tiếp nhận#
Kích thước và độ sâu của trường tiếp nhận được quyết định bởi kiến trúc của mạng. Ở các layer ban đầu, neuron thường có trường tiếp nhận nhỏ, tập trung vào một cụm pixel nhỏ để nắm bắt các kết cấu chi tiết. Khi mạng trở nên sâu hơn, các phép toán như layer pooling và phép tích chập có stride sẽ thực hiện downsample các feature map một cách hiệu quả. Quá trình này cho phép các neuron ở những layer tiếp theo tổng hợp thông tin từ một phần lớn hơn nhiều của đầu vào ban đầu.
Các kiến trúc hiện đại, bao gồm Ultralytics YOLO26 hiện đại nhất, được thiết kế để cân bằng các trường tiếp nhận này một cách cẩn trọng. Nếu trường tiếp nhận quá hẹp, model có thể không nhận diện được các vật thể lớn vì không thể nhận biết toàn bộ hình dạng. Ngược lại, nếu trường tiếp nhận quá rộng mà không duy trì độ phân giải, model có thể bỏ sót các vật thể nhỏ. Để giải quyết vấn đề này, các kỹ sư thường sử dụng phép tích chập giãn (còn gọi là phép tích chập atrous) để mở rộng trường tiếp nhận mà không làm giảm độ phân giải không gian, một kỹ thuật thiết yếu cho các tác vụ có độ chính xác cao như phân đoạn ngữ nghĩa.
Các ứng dụng trong thực tế#
Tối ưu hóa trường tiếp nhận đóng vai trò quan trọng đối với sự thành công của nhiều giải pháp AI.
- Lái xe tự hành: Trong AI cho ngành ô tô, các hệ thống perception phải đồng thời theo dõi những chi tiết rất nhỏ và các chướng ngại vật lớn. Một phương tiện cần trường tiếp nhận nhỏ để nhận diện đèn giao thông ở xa, đồng thời cần trường tiếp nhận lớn để hiểu quỹ đạo của một chiếc xe tải ở gần hoặc độ cong của làn đường. Khả năng perception đa tỉ lệ này giúp cải thiện an toàn AI và việc ra quyết định.
- Chẩn đoán y khoa: Khi ứng dụng AI trong chăm sóc sức khỏe, các bác sĩ chẩn đoán hình ảnh dựa vào model để phát hiện những điểm bất thường trong ảnh quét. Để nhận diện khối u não, mạng cần một trường tiếp nhận lớn để hiểu tính đối xứng và cấu trúc tổng thể của não. Tuy nhiên, để phát hiện các vi vôi hóa trong ảnh chụp X-quang tuyến vú, model dựa vào các layer đầu với trường tiếp nhận nhỏ, nhạy với những thay đổi tinh tế của kết cấu.
Phân biệt các khái niệm liên quan#
Để hiểu đầy đủ về thiết kế mạng, việc phân biệt trường tiếp nhận với các thuật ngữ tương tự sẽ rất hữu ích:
- Trường tiếp nhận và Kernel: Kích thước kernel (hoặc filter) xác định các chiều của cửa sổ trượt (ví dụ: 3x3) cho một phép tích chập đơn lẻ. Trường tiếp nhận là một thuộc tính phát sinh, biểu thị tổng vùng đầu vào tích lũy có ảnh hưởng đến một neuron. Một chuỗi gồm nhiều kernel 3x3 sẽ tạo ra trường tiếp nhận lớn hơn 3x3 rất nhiều.
- Trường tiếp nhận và Feature Map: Feature map là volume đầu ra do một layer tạo ra, chứa các biểu diễn đã học. Trường tiếp nhận mô tả mối quan hệ giữa một điểm đơn lẻ trên feature map đó và ảnh đầu vào ban đầu.
- Trường tiếp nhận và Context Window: Mặc dù cả hai thuật ngữ đều đề cập đến phạm vi dữ liệu được nhận biết, “context window” thường được sử dụng trong Xử lý ngôn ngữ tự nhiên (NLP) hoặc phân tích video để biểu thị một khoảng thời gian hoặc chuỗi (ví dụ: giới hạn token). Trường tiếp nhận chỉ đề cập đến vùng không gian trong dữ liệu dạng lưới (hình ảnh).
Ứng dụng thực tế trong code#
Các model hiện đại nhất như YOLO26 mới hơn sử dụng Mạng kim tự tháp đặc trưng (FPN) để duy trì trường tiếp nhận hiệu quả cho các vật thể có mọi kích thước. Ví dụ sau đây cho thấy cách load một model và thực hiện object detection, đồng thời tự động tận dụng các tối ưu hóa kiến trúc nội bộ này. Người dùng muốn train model của riêng mình với các kiến trúc được tối ưu hóa có thể sử dụng Ultralytics Platform để quản lý dataset và train trên cloud một cách liền mạch.
from ultralytics import YOLO
# Load the latest YOLO26 model with optimized multi-scale receptive fields
model = YOLO("yolo26n.pt")
# Run inference; the model aggregates features from various receptive field sizes
results = model("https://ultralytics.com/images/bus.jpg")
# Display the results, detecting both large (bus) and small (person) objects
results[0].show()








