YOLO Vision 2026:
Quay lại Bảng thuật ngữ Ultralytics

Vision Mamba

Khám phá Vision Mamba, một giải pháp thay thế có độ phức tạp tuyến tính cho các Transformer. Tìm hiểu cách các State Space Models (SSM) nâng cao hiệu suất cho thị giác máy tính độ phân giải cao.

Vision Mamba đại diện cho một bước chuyển biến đáng kể trong các kiến trúc học sâu (deep learning) cho thị giác máy tính, dịch chuyển khỏi sự thống trị của các cơ chế dựa trên sự chú ý (attention-based mechanisms) có trong Transformer. Đây là một sự thích ứng của kiến trúc Mamba—vốn được thiết kế ban đầu để mô hình hóa chuỗi hiệu quả trong xử lý ngôn ngữ tự nhiên—được tinh chỉnh đặc biệt cho các tác vụ thị giác. Bằng cách tận dụng Mô hình Không gian Trạng thái (State Space Models - SSMs), Vision Mamba cung cấp một giải pháp thay thế có độ phức tạp tuyến tính cho độ phức tạp bậc hai của các lớp tự chú ý (self-attention) truyền thống. Điều này cho phép nó xử lý các hình ảnh độ phân giải cao hiệu quả hơn, làm cho nó đặc biệt có giá trị đối với các ứng dụng có giới hạn về tài nguyên tính toán hoặc nơi các phụ thuộc tầm xa trong dữ liệu thị giác phải được nắm bắt mà không cần đến dung lượng bộ nhớ lớn đặc trưng của Vision Transformers (ViT).

Vision Mamba hoạt động như thế nào#

Trọng tâm của Vision Mamba là khái niệm quét dữ liệu chọn lọc. Các Convolutional Neural Networks (CNNs) truyền thống xử lý hình ảnh bằng các cửa sổ trượt cục bộ, rất xuất sắc trong việc phát hiện kết cấu và cạnh nhưng gặp khó khăn với ngữ cảnh tổng thể. Ngược lại, Transformer sử dụng sự chú ý toàn cục để liên kết mọi điểm ảnh (hoặc bản vá) với mọi điểm ảnh khác, cung cấp ngữ cảnh tuyệt vời nhưng trở nên đắt đỏ về mặt tính toán khi độ phân giải hình ảnh tăng lên. Vision Mamba thu hẹp khoảng cách này bằng cách làm phẳng hình ảnh thành các chuỗi và xử lý chúng bằng cách sử dụng các không gian trạng thái chọn lọc. Điều này cho phép mô hình nén thông tin thị giác thành một trạng thái có kích thước cố định, giữ lại các chi tiết có liên quan qua khoảng cách dài trong chuỗi hình ảnh trong khi loại bỏ nhiễu không liên quan.

Kiến trúc này thường bao gồm cơ chế quét hai chiều. Vì hình ảnh là các cấu trúc 2D chứ không có tính tuần tự bẩm sinh như văn bản, Vision Mamba quét các bản vá hình ảnh theo cả hướng tiến và lùi (và đôi khi là các đường dẫn khác nhau) để đảm bảo rằng các mối quan hệ không gian được hiểu bất kể thứ tự quét. Cách tiếp cận này cho phép mô hình đạt được receptive fields toàn cục tương tự như Transformer nhưng với tốc độ suy luận nhanh hơn và mức sử dụng bộ nhớ thấp hơn, thường cạnh tranh với các kết quả tốt nhất trên các benchmark như ImageNet.

Các ứng dụng trong thực tế#

Hiệu suất của Vision Mamba làm cho nó cực kỳ phù hợp với các môi trường hạn chế tài nguyên và các tác vụ có độ phân giải cao.

  • Phân tích Hình ảnh Y tế: Trong các lĩnh vực như X quang, việc phân tích các bản chụp MRI hoặc CT độ phân giải cao đòi hỏi phải phát hiện các bất thường tinh tế có thể cách xa nhau về mặt không gian trong một hình ảnh lớn. Vision Mamba có thể xử lý các tệp medical image analysis lớn này một cách hiệu quả mà không gặp phải các nút thắt cổ chai về bộ nhớ thường làm phiền các Transformer tiêu chuẩn, hỗ trợ các bác sĩ xác định khối u hoặc vết gãy với độ chính xác cao.
  • Điều hướng Tự động trên Thiết bị Biên: Xe tự lái và máy bay không người lái dựa vào edge computing để xử lý các luồng video trong thời gian thực. Việc mở rộng quy mô tuyến tính của Vision Mamba cho phép các hệ thống này xử lý đầu vào video tốc độ khung hình cao cho object detectionsemantic segmentation hiệu quả hơn so với các mô hình Transformer nặng, đảm bảo thời gian phản ứng nhanh hơn cho các quyết định quan trọng về an toàn.

Vision Mamba so với Vision Transformers (ViT)#

Mặc dù cả hai kiến trúc đều nhằm mục đích nắm bắt bối cảnh toàn cục, chúng khác biệt cơ bản trong cách vận hành.

  • Vision Transformer (ViT): Dựa vào attention mechanism, tính toán mối quan hệ giữa mọi cặp bản vá hình ảnh. Điều này dẫn đến độ phức tạp bậc hai ($O(N^2)$), nghĩa là việc gấp đôi kích thước hình ảnh sẽ làm tăng gấp bốn lần chi phí tính toán.
  • Vision Mamba: Tận dụng Mô hình Không gian Trạng thái (SSMs) để xử lý các token thị giác một cách tuyến tính ($O(N)$). Nó duy trì một trạng thái chạy cập nhật khi nhìn thấy các bản vá mới, cho phép nó mở rộng quy mô tốt hơn nhiều với độ phân giải cao hơn trong khi vẫn duy trì accuracy tương đương.

Ví dụ: Quy trình làm việc suy luận hiệu quả#

Mặc dù Vision Mamba là một kiến trúc cụ thể, các nguyên tắc hiệu quả của nó phù hợp với các mục tiêu của các mô hình thời gian thực hiện đại như Ultralytics YOLO26. Người dùng đang tìm kiếm các tác vụ thị giác được tối ưu hóa có thể tận dụng Ultralytics Platform để huấn luyện và triển khai. Dưới đây là một ví dụ sử dụng gói ultralytics để chạy suy luận, chứng minh tính dễ sử dụng của các mô hình thị giác được tối ưu hóa cao.

from ultralytics import YOLO

# Load a pre-trained YOLO26 model (optimized for speed and accuracy)
model = YOLO("yolo26n.pt")  # 'n' for nano, emphasizing efficiency

# Run inference on an image
results = model.predict("path/to/image.jpg")

# Display the results
results[0].show()

Những lợi ích chính và triển vọng tương lai#

Sự ra đời của các kiến trúc dựa trên Mamba vào thị giác máy tính báo hiệu sự chuyển dịch hướng tới AI nhận thức phần cứng hơn. Bằng cách giảm chi phí tính toán liên quan đến global attention, các nhà nghiên cứu đang mở ra cánh cửa cho việc triển khai các AI agents tiên tiến trên các thiết bị nhỏ hơn.

Nghiên cứu gần đây, chẳng hạn như VMamba paper và các phát triển trong efficient deep learning, làm nổi bật tiềm năng của các mô hình này trong việc thay thế các xương sống truyền thống trong các tác vụ từ video understanding đến 3D object detection. Khi cộng đồng tiếp tục tinh chỉnh các chiến lược quét và tích hợp với convolutional layers, Vision Mamba sẵn sàng trở thành một thành phần tiêu chuẩn trong hộp công cụ deep learning bên cạnh CNN và Transformer.

Explore solutions

Real-time AI that works with your team

AI trong ngành Robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong Logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong chăm sóc sức khỏe

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

AI trong Ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

AI trong Nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong Logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong chăm sóc sức khỏe

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

AI trong Ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

AI trong Nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong Logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong chăm sóc sức khỏe

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

AI trong Ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

AI trong Nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm

Hãy cùng nhau xây dựng tương lai của AI!

Bắt đầu hành trình của bạn với tương lai của machine learning