YOLO Vision 2026:
Hướng dẫn

EfficientNet là gì? Tổng quan nhanh

Tìm hiểu kiến trúc EfficientNet và cơ chế compound scaling! Khám phá EfficientNet B0-B7 để đạt hiệu quả hàng đầu trong phân loại và phân đoạn ảnh.

ABAbirami Vina6 min read
Tổng quan về kiến trúc EfficientNet

Vào năm 2019, các nhà nghiên cứu tại Google AI đã giới thiệu EfficientNet, một model thị giác máy tính tiên tiến được xây dựng để nhận diện các đối tượng và mẫu trong hình ảnh. Model này chủ yếu được thiết kế cho việc phân loại hình ảnh, bao gồm việc gán một hình ảnh vào một trong các danh mục được xác định trước. Tuy nhiên, ngày nay, EfficientNet còn đóng vai trò là backbone cho các tác vụ phức tạp hơn như phát hiện đối tượng, phân đoạn và transfer learning.

Trước EfficientNet, các model machine learning và AI thị giác thường cố gắng cải thiện độ chính xác bằng cách thêm nhiều layer hơn hoặc tăng kích thước của các layer đó. Layer là các bước trong một model neural network (một loại model deep learning lấy cảm hứng từ bộ não con người) dùng để xử lý dữ liệu nhằm học các mẫu và cải thiện độ chính xác.

Những thay đổi này tạo ra sự đánh đổi, khiến các model AI truyền thống lớn hơn và chậm hơn, trong khi phần độ chính xác tăng thêm thường rất nhỏ so với mức gia tăng đáng kể về năng lực tính toán cần thiết.

EfficientNet sử dụng một cách tiếp cận khác. Model đồng thời tăng độ sâu (số lượng layer), độ rộng (số lượng unit trong mỗi layer) và độ phân giải hình ảnh (mức độ chi tiết của hình ảnh đầu vào) theo cách cân bằng. Phương pháp này, được gọi là compound scaling, tận dụng đáng tin cậy toàn bộ năng lực xử lý hiện có. Kết quả là một model nhỏ hơn và nhanh hơn, có thể đạt hiệu năng tốt hơn các model cũ như ResNet hoặc DenseNet.

Ngày nay, các model thị giác máy tính mới hơn như Ultralytics YOLO11 mang lại độ chính xác, tốc độ và hiệu quả cao hơn. Dù vậy, EfficientNet vẫn là một cột mốc quan trọng, có ảnh hưởng đến thiết kế của nhiều kiến trúc tiên tiến.

Trong bài viết này, chúng ta sẽ tìm hiểu EfficientNet trong năm phút, bao quát cách model hoạt động, những điểm độc đáo và lý do model này vẫn quan trọng trong thị giác máy tính. Hãy bắt đầu!

EfficientNet là gì?#

Trước khi EfficientNet được thiết kế, hầu hết các model nhận dạng hình ảnh cải thiện độ chính xác bằng cách điều chỉnh các layer hoặc tăng kích thước hình ảnh đầu vào để thu nhận nhiều chi tiết hơn. Dù các chiến lược này cải thiện kết quả, chúng cũng khiến model nặng hơn và đòi hỏi nhiều tài nguyên hơn. Điều này có nghĩa là chúng cần nhiều memory hơn và phần cứng tốt hơn.

Thay vì thay đổi từng layer riêng lẻ, EfficientNet mở rộng độ sâu, độ rộng và độ phân giải hình ảnh cùng lúc bằng một phương pháp gọi là compound scaling. Cách tiếp cận này cho phép model phát triển hiệu quả mà không làm quá tải bất kỳ khía cạnh riêng lẻ nào.

Kiến trúc EfficientNet xử lý hình ảnh thông qua một chuỗi block, mỗi block được xây dựng từ các module nhỏ hơn. Số lượng module trong mỗi block phụ thuộc vào kích thước model.

Các block cấu thành EfficientNet

Hình 1. Các block cấu thành EfficientNet. (Nguồn)

Các phiên bản nhỏ hơn sử dụng ít module hơn, trong khi các phiên bản lớn hơn lặp lại module thường xuyên hơn. Thiết kế linh hoạt này cho phép EfficientNet đạt độ chính xác và hiệu quả cao trên nhiều ứng dụng, từ thiết bị di động đến các hệ thống quy mô lớn.

Compound scaling hoạt động như thế nào#

Phương pháp compound scaling mở rộng độ sâu, độ rộng và độ phân giải hình ảnh của model nhưng vẫn duy trì sự cân bằng giữa chúng. Nhờ đó, năng lực tính toán có thể được sử dụng hiệu quả. Chuỗi này bắt đầu với một model cơ sở nhỏ hơn có tên EfficientNet-B0, đóng vai trò nền tảng cho tất cả các phiên bản khác.

Từ B0, các model được mở rộng thành những biến thể lớn hơn có tên EfficientNet-B1 đến EfficientNet-B7. Ở mỗi bước, network có thêm layer, tăng số lượng channel (các unit được sử dụng để xử lý) và xử lý hình ảnh đầu vào có độ phân giải cao hơn. Mức tăng trưởng ở mỗi bước được xác định bởi một tham số gọi là compound coefficient, đảm bảo độ sâu, độ rộng và độ phân giải tăng theo các tỷ lệ cố định thay vì độc lập với nhau.

Compound scaling tăng độ rộng, độ sâu và độ phân giải hình ảnh của model

Hình 2. Compound scaling tăng độ rộng, độ sâu và độ phân giải hình ảnh của model. (Nguồn)

Kiến trúc EfficientNet#

Tiếp theo, hãy cùng xem xét kiến trúc của EfficientNet.

EfficientNet được xây dựng dựa trên MobileNetV2, một model thị giác máy tính nhẹ được tối ưu hóa cho các thiết bị di động và thiết bị nhúng. Thành phần cốt lõi là block Mobile Inverted Bottleneck Convolution (MBConv), một layer đặc biệt xử lý dữ liệu hình ảnh như phép tích chập tiêu chuẩn nhưng với ít phép tính hơn. Block này giúp model vừa nhanh vừa sử dụng memory hiệu quả hơn.

Bên trong mỗi block MBConv là một module squeeze-and-excitation (SE). Module này điều chỉnh cường độ của các channel khác nhau trong network. Nó tăng cường các channel thiết yếu và giảm cường độ của các channel khác. Module giúp network tập trung vào những đặc trưng quan trọng nhất trong hình ảnh, đồng thời bỏ qua phần còn lại. Model EfficientNet cũng sử dụng hàm kích hoạt Swish (một hàm toán học giúp network học các mẫu), nhờ đó nhận diện các mẫu trong hình ảnh tốt hơn các phương pháp cũ.

Ngoài ra, model còn sử dụng DropConnect, trong đó một số kết nối bên trong network được tắt ngẫu nhiên trong quá trình training. Phương pháp regularization ngẫu nhiên này (một kỹ thuật ngẫu nhiên hóa nhằm ngăn model ghi nhớ dữ liệu training thay vì khái quát hóa) làm giảm overfitting bằng cách buộc network học các biểu diễn đặc trưng mạnh mẽ hơn (các mẫu mạnh hơn và có tính tổng quát hơn trong dữ liệu), giúp chuyển giao tốt hơn sang dữ liệu chưa từng thấy.

Kiến trúc của EfficientNet-B0

Hình 3. Kiến trúc của EfficientNet-B0 (Nguồn)

Tổng quan ngắn về các biến thể model của EfficientNet#

Giờ đây, khi đã hiểu rõ hơn về cách các model EfficientNet hoạt động, hãy cùng thảo luận về những biến thể model khác nhau.

Các model EfficientNet mở rộng từ B0 đến B7, bắt đầu với B0 là model cơ sở cân bằng giữa tốc độ và độ chính xác. Mỗi phiên bản đều tăng độ sâu, độ rộng và độ phân giải hình ảnh, qua đó cải thiện độ chính xác. Tuy nhiên, chúng cũng đòi hỏi nhiều năng lực tính toán hơn, từ B1 và B2 cho đến B6 và B7 có hiệu năng cao.

Trong khi các model EfficientNet-B3 và EfficientNet-B4 tạo được sự cân bằng cho những hình ảnh lớn hơn, B5 thường được chọn cho các dataset phức tạp yêu cầu độ chính xác cao. Vượt xa các model này, model mới nhất EfficientNet V2 có thể cải thiện tốc độ training, xử lý dataset nhỏ tốt hơn và được tối ưu hóa cho phần cứng hiện đại.

Các ứng dụng của EfficientNet#

EfficientNet có thể tạo ra kết quả chính xác trong khi sử dụng ít memory và năng lực xử lý hơn nhiều model khác. Điều này khiến model hữu ích trong nhiều lĩnh vực, từ nghiên cứu khoa học đến các sản phẩm được sử dụng hằng ngày.

Phân tích hình ảnh y tế#

Hình ảnh y tế, chẳng hạn như ảnh chụp CT phổi, thường chứa những chi tiết nhỏ nhưng có ý nghĩa quan trọng đối với việc chẩn đoán chính xác. Các model AI có thể hỗ trợ phân tích những hình ảnh này để phát hiện các mẫu mà con người khó nhận ra. Một biến thể của EfficientNet cho mục đích này là MONAI (Mạng mở y tế cho AI) EfficientNet, được thiết kế chuyên biệt cho phân tích hình ảnh y tế.

Dựa trên kiến trúc của EfficientNet, các nhà nghiên cứu cũng đã phát triển Lung-EffNet, một model phân loại ảnh chụp CT phổi để phát hiện khối u. Model có thể phân loại khối u là lành tính, ác tính hoặc bình thường, đạt độ chính xác được báo cáo trên 99% trong các điều kiện thử nghiệm.

Phân loại hình ảnh khối u bằng Lung-EffNet

Hình 4. Phân loại hình ảnh khối u bằng Lung-EffNet. (Nguồn)

Phát hiện đối tượng theo thời gian thực#

Phát hiện đối tượng là quá trình tìm các đối tượng trong hình ảnh và xác định vị trí của chúng. Đây là một thành phần quan trọng trong các ứng dụng như hệ thống an ninh, xe tự lái và drone.

EfficientNet trở nên quan trọng trong lĩnh vực này vì cung cấp một cách rất hiệu quả để trích xuất đặc trưng từ hình ảnh. Phương pháp mở rộng độ sâu, độ rộng và độ phân giải cho thấy các model có thể đạt độ chính xác cao mà không quá nặng hoặc chậm. Vì vậy, nhiều hệ thống phát hiện, chẳng hạn như EfficientDet, sử dụng EfficientNet làm backbone.

Các model mới hơn, chẳng hạn như Ultralytics YOLO11, cũng hướng đến mục tiêu kết hợp tốc độ với độ chính xác. Xu hướng phát triển các model hiệu quả này chịu ảnh hưởng mạnh mẽ từ những ý tưởng trong các kiến trúc như EfficientNet.

Ưu và nhược điểm của EfficientNet#

Dưới đây là một số lợi ích khi sử dụng EfficientNet trong các dự án thị giác máy tính:

  • Độ chính xác cao với ít parameter hơn: EfficientNet có thể mang lại độ chính xác tương đương hoặc tốt hơn các model cũ như ResNet hoặc DenseNet. Tuy nhiên, model sử dụng ít parameter hơn, nhờ đó training nhanh hơn và dễ triển khai hơn.
  • Họ model có khả năng mở rộng: Với các phiên bản từ B0 đến B7, bạn có thể chọn phiên bản phù hợp với phần cứng và yêu cầu về độ chính xác mà không cần thay đổi network cơ sở.
  • Phù hợp cho transfer learning: EfficientNet có thể mang lại hiệu năng model đáng tin cậy cho transfer learning, một quá trình training lại model đã được pre-train cho một tác vụ tùy chỉnh. Model có thể làm backbone cho nhiều tác vụ thị giác máy tính. Model cũng cho thấy kết quả mạnh mẽ khi được fine-tune. Ví dụ, model đạt độ chính xác tiên tiến trên CIFAR-100, một dataset phân loại hình ảnh được sử dụng rộng rãi, với số lượng parameter ít hơn đáng kể so với các model trước đây.

Mặc dù có nhiều lợi ích khi sử dụng EfficientNet, dưới đây là một số hạn chế của EfficientNet cần lưu ý:

  • Yêu cầu nhiều memory hơn: Các phiên bản như EfficientNet-B6 và EfficientNet-B7 yêu cầu rất nhiều memory GPU.
  • Cấu hình scaling được tinh chỉnh cho ImageNet: Các thiết lập scaling được thiết kế cho dataset ImageNet, vì vậy hiệu năng có thể giảm trên những dataset rất khác nếu không fine-tune. Điều này đặc biệt đúng với các dataset nhỏ, vì kiến trúc và scaling của EfficientNet được thiết kế cho một dataset lớn và đa dạng như ImageNet, cung cấp đủ dữ liệu để phù hợp với độ sâu và độ rộng của model.
  • Chậm hơn trên một số phần cứng: EfficientNet sử dụng các layer gọi là MBConv, được thiết kế để đạt hiệu quả trên phần cứng hiện đại. Trên các GPU hoặc CPU cũ hơn, những layer này có thể chạy chậm hơn.

Những điểm chính#

EfficientNet đã thay đổi cách các model thị giác máy tính phát triển bằng cách duy trì sự cân bằng giữa độ sâu, độ rộng và độ phân giải hình ảnh. Đây vẫn là một model quan trọng và cũng có ảnh hưởng đến các kiến trúc mới hơn. Đặc biệt, model giữ một vị trí đáng kể trong lịch sử thị giác máy tính.

Tham gia cộng đồngrepository GitHub của chúng tôi để khám phá thêm về AI. Hãy xem các trang giải pháp của chúng tôi để đọc về AI trong chăm sóc sức khỏethị giác máy tính trong ngành ô tô. Khám phá các tùy chọn cấp phép của chúng tôi và bắt đầu xây dựng với thị giác máy tính ngay hôm nay!

Explore solutions

Thị giác máy tính cho hình ảnh trên không

Thị giác máy tính cho hình ảnh trên không

Biến đổi hình ảnh từ máyδ bay không người lái và ảnh chụp trên không thành thông tin chi tiết thời gian thực cho nông nghiệp, nuôi trồng thủy sản, giám sát môi trường, bảo tồn và phân tích không gian địa lý với Ultralytics YOLO.
Tìm hiểu thêm
Thị giác máy tính trong hàng không vũ trụ

Thị giác máy tính trong hàng không vũ trụ

Mang thị giác AI đến với hoạt động giám sát trên không bằng các model Ultralytics YOLO. Cung cấp sức mạnh cho máy bay không người lái, quy trình hàng không vũ trụ, bảo tồn môi trường & ngành công nghiệp địa không gian với các giải pháp thị giác máy tính.
Tìm hiểu thêm

Bảo vệ mọi địa điểm bằng các model Ultralytics YOLO. Thị giác AI cung cấp sức mạnh cho việc giám sát chu vi, phát hiện mối đe dọa, nhận diện biển số xe và an toàn nơi làm việc.
Tìm hiểu thêm
Thị giác máy tính trong robotics

Thị giác máy tính trong robotics

Nâng cao năng lực cho máy móc thông minh hơn với các model Ultralytics YOLO. Vision AI trong robotics hỗ trợ điều hướng tự động, nhận thức, theo dõi đối tượng và điều khiển theo thời gian thực.
Tìm hiểu thêm
Thị giác máy tính trong logistics

Thị giác máy tính trong logistics

Tinh gọn logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra kiện hàng, phân loại, theo dõi phương tiện và giám sát an toàn kho theo thời gian thực.
Tìm hiểu thêm
Thị giác máy tính trong bán lẻ

Thị giác máy tính trong bán lẻ

Định hình lại ngành bán lẻ với các model Ultralytics YOLO. Vision AI hỗ trợ tracking hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và cung cấp insight khách hàng thông minh hơn.
Tìm hiểu thêm
Computer vision trong healthcare

Computer vision trong healthcare

Xây dựng các giải pháp healthcare với các model Ultralytics YOLO. Vision AI trong healthcare thúc đẩy chẩn đoán hình ảnh nhanh hơn, chẩn đoán thông minh hơn và giám sát bệnh nhân.
Tìm hiểu thêm
Computer vision trong sản xuất

Computer vision trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Computer vision trong ngành ô tô

Computer vision trong ngành ô tô

Ứng dụng computer vision trong ngành ô tô với các model Ultralytics YOLO. Vision AI nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện để tạo nên những tuyến đường thông minh hơn.
Tìm hiểu thêm
Computer vision trong nông nghiệp

Computer vision trong nông nghiệp

Đưa vision AI vào nông nghiệp thông minh với các model Ultralytics YOLO. Thúc đẩy giám sát cây trồng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Thị giác máy tính cho hình ảnh trên không

Thị giác máy tính cho hình ảnh trên không

Biến đổi hình ảnh từ máyδ bay không người lái và ảnh chụp trên không thành thông tin chi tiết thời gian thực cho nông nghiệp, nuôi trồng thủy sản, giám sát môi trường, bảo tồn và phân tích không gian địa lý với Ultralytics YOLO.
Tìm hiểu thêm
Thị giác máy tính trong hàng không vũ trụ

Thị giác máy tính trong hàng không vũ trụ

Mang thị giác AI đến với hoạt động giám sát trên không bằng các model Ultralytics YOLO. Cung cấp sức mạnh cho máy bay không người lái, quy trình hàng không vũ trụ, bảo tồn môi trường & ngành công nghiệp địa không gian với các giải pháp thị giác máy tính.
Tìm hiểu thêm

Bảo vệ mọi địa điểm bằng các model Ultralytics YOLO. Thị giác AI cung cấp sức mạnh cho việc giám sát chu vi, phát hiện mối đe dọa, nhận diện biển số xe và an toàn nơi làm việc.
Tìm hiểu thêm
Thị giác máy tính trong robotics

Thị giác máy tính trong robotics

Nâng cao năng lực cho máy móc thông minh hơn với các model Ultralytics YOLO. Vision AI trong robotics hỗ trợ điều hướng tự động, nhận thức, theo dõi đối tượng và điều khiển theo thời gian thực.
Tìm hiểu thêm
Thị giác máy tính trong logistics

Thị giác máy tính trong logistics

Tinh gọn logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra kiện hàng, phân loại, theo dõi phương tiện và giám sát an toàn kho theo thời gian thực.
Tìm hiểu thêm
Thị giác máy tính trong bán lẻ

Thị giác máy tính trong bán lẻ

Định hình lại ngành bán lẻ với các model Ultralytics YOLO. Vision AI hỗ trợ tracking hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và cung cấp insight khách hàng thông minh hơn.
Tìm hiểu thêm
Computer vision trong healthcare

Computer vision trong healthcare

Xây dựng các giải pháp healthcare với các model Ultralytics YOLO. Vision AI trong healthcare thúc đẩy chẩn đoán hình ảnh nhanh hơn, chẩn đoán thông minh hơn và giám sát bệnh nhân.
Tìm hiểu thêm
Computer vision trong sản xuất

Computer vision trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Computer vision trong ngành ô tô

Computer vision trong ngành ô tô

Ứng dụng computer vision trong ngành ô tô với các model Ultralytics YOLO. Vision AI nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện để tạo nên những tuyến đường thông minh hơn.
Tìm hiểu thêm
Computer vision trong nông nghiệp

Computer vision trong nông nghiệp

Đưa vision AI vào nông nghiệp thông minh với các model Ultralytics YOLO. Thúc đẩy giám sát cây trồng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Thị giác máy tính cho hình ảnh trên không

Thị giác máy tính cho hình ảnh trên không

Biến đổi hình ảnh từ máyδ bay không người lái và ảnh chụp trên không thành thông tin chi tiết thời gian thực cho nông nghiệp, nuôi trồng thủy sản, giám sát môi trường, bảo tồn và phân tích không gian địa lý với Ultralytics YOLO.
Tìm hiểu thêm
Thị giác máy tính trong hàng không vũ trụ

Thị giác máy tính trong hàng không vũ trụ

Mang thị giác AI đến với hoạt động giám sát trên không bằng các model Ultralytics YOLO. Cung cấp sức mạnh cho máy bay không người lái, quy trình hàng không vũ trụ, bảo tồn môi trường & ngành công nghiệp địa không gian với các giải pháp thị giác máy tính.
Tìm hiểu thêm

Bảo vệ mọi địa điểm bằng các model Ultralytics YOLO. Thị giác AI cung cấp sức mạnh cho việc giám sát chu vi, phát hiện mối đe dọa, nhận diện biển số xe và an toàn nơi làm việc.
Tìm hiểu thêm
Thị giác máy tính trong robotics

Thị giác máy tính trong robotics

Nâng cao năng lực cho máy móc thông minh hơn với các model Ultralytics YOLO. Vision AI trong robotics hỗ trợ điều hướng tự động, nhận thức, theo dõi đối tượng và điều khiển theo thời gian thực.
Tìm hiểu thêm
Thị giác máy tính trong logistics

Thị giác máy tính trong logistics

Tinh gọn logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra kiện hàng, phân loại, theo dõi phương tiện và giám sát an toàn kho theo thời gian thực.
Tìm hiểu thêm
Thị giác máy tính trong bán lẻ

Thị giác máy tính trong bán lẻ

Định hình lại ngành bán lẻ với các model Ultralytics YOLO. Vision AI hỗ trợ tracking hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và cung cấp insight khách hàng thông minh hơn.
Tìm hiểu thêm
Computer vision trong healthcare

Computer vision trong healthcare

Xây dựng các giải pháp healthcare với các model Ultralytics YOLO. Vision AI trong healthcare thúc đẩy chẩn đoán hình ảnh nhanh hơn, chẩn đoán thông minh hơn và giám sát bệnh nhân.
Tìm hiểu thêm
Computer vision trong sản xuất

Computer vision trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Computer vision trong ngành ô tô

Computer vision trong ngành ô tô

Ứng dụng computer vision trong ngành ô tô với các model Ultralytics YOLO. Vision AI nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện để tạo nên những tuyến đường thông minh hơn.
Tìm hiểu thêm
Computer vision trong nông nghiệp

Computer vision trong nông nghiệp

Đưa vision AI vào nông nghiệp thông minh với các model Ultralytics YOLO. Thúc đẩy giám sát cây trồng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm

Hãy cùng xây dựng tương lai của AI!

Bắt đầu hành trình của bạn với tương lai của machine learning