Visual SLAM (Simultaneous Localization and Mapping)
Khám phá cách Visual SLAM hỗ trợ lập bản đồ tự động. Tìm hiểu cách nâng cao độ chính xác bằng Ultralytics YOLO26 và triển khai giải pháp qua Ultralytics Platform.
Visual SLAM (Định vị và lập bản đồ đồng thời) là một kỹ thuật thị giác máy tính cốt lõi cho phép một tác nhân, chẳng hạn như robot hoặc thiết bị di động, đồng thời lập bản đồ môi trường chưa biết và xác định vị trí của chính nó trong không gian đó chỉ bằng dữ liệu từ camera. Không giống các hệ thống SLAM truyền thống dựa vào cảm biến laser đắt tiền, Visual SLAM sử dụng camera monocular, stereo hoặc RGB-D tiêu chuẩn. Bằng cách trích xuất và theo dõi các đặc trưng hình ảnh qua những khung hình liên tiếp, hệ thống tính toán quỹ đạo camera đồng thời xây dựng dần đám mây điểm 3D hoặc bản đồ dày đặc về môi trường xung quanh. Công nghệ này là nền tảng để hỗ trợ điều hướng tự động và nhận thức không gian cho máy móc.
Visual SLAM hoạt động như thế nào#
Một pipeline Visual SLAM điển hình gồm hai thành phần chính: front-end và back-end. Front-end xử lý dữ liệu cảm biến, thực hiện trích xuất đặc trưng hình ảnh (nhận diện các góc hoặc cạnh riêng biệt) và ghép các đặc trưng này giữa những khung hình để ước tính chuyển động của camera theo thời gian. Back-end tiếp nhận dữ liệu odometry này và áp dụng các thuật toán tối ưu hóa như điều chỉnh bó để hiệu chỉnh độ trôi, đồng thời tinh chỉnh cả bản đồ môi trường lẫn pose ước tính của camera.
Những đột phá gần đây trong năm 2024 và 2025 đã chuyển dịch mô hình từ các đặc trưng thủ công truyền thống—như những đặc trưng được sử dụng trong các framework lâu đời như ORB-SLAM3—sang các phương pháp deep learning. Các hệ thống hiện đại hiện sử dụng mạng neural cho optical flow dày đặc và ghép đặc trưng, nhờ đó có khả năng chống chịu cao trước nhòe chuyển động và môi trường ít kết cấu. Ngoài ra, các kỹ thuật kết xuất mới kết hợp 3D Gaussian Splatting và Neural Radiance Fields (NeRFs) cho phép lập bản đồ dày đặc, chân thực như ảnh theo thời gian thực, ghi lại các chi tiết hình học phức tạp tốt hơn nhiều so với đám mây điểm tiêu chuẩn.
Visual SLAM so với LiDAR SLAM và theo dõi đối tượng#
Hiểu rõ khác biệt giữa công nghệ lập bản đồ và theo dõi là điều thiết yếu để triển khai giải pháp phù hợp:
- Visual SLAM so với LiDAR SLAM: Visual SLAM dựa vào cảm biến camera giá rẻ để nhận biết kết cấu hình ảnh phong phú, trong khi LiDAR SLAM sử dụng tia laser để đo chính xác khoảng cách vật lý. LiDAR có độ chính xác cao nhưng đắt tiền và tiêu thụ nhiều điện năng, còn Visual SLAM có chi phí hợp lý và cung cấp thông tin màu sắc nhưng có thể gặp khó khăn trong điều kiện thiếu sáng.
- Visual SLAM so với theo dõi đối tượng: Theo dõi đối tượng tách riêng và bám theo chuyển động của các thực thể cụ thể qua các khung hình video. Ngược lại, Visual SLAM theo dõi chuyển động của camera so với môi trường tĩnh để xây dựng bản đồ. Tuy nhiên, hai khái niệm này kết hợp trong Semantic SLAM, nơi các model phát hiện đối tượng nhận diện vật thể động để chủ động loại chúng khỏi bản đồ tĩnh.
Ứng dụng thực tế#
Visual SLAM được tích hợp sâu vào các tác nhân AI hiện đại và hệ thống điện toán không gian.
- Robot và drone tự hành: Robot giao hàng và drone sử dụng Visual SLAM để điều hướng trong môi trường không có GPS, chẳng hạn như nhà kho hoặc các hẻm phố đô thị dày đặc. Bằng cách xây dựng bản đồ theo thời gian thực, chúng có thể tự lập kế hoạch đường đi và tránh chướng ngại vật.
- Thực tế tăng cường (AR) và thực tế ảo (VR): Kính thông minh thương mại phụ thuộc nhiều vào Visual SLAM để hiểu hình học của căn phòng. Điều này cho phép các hệ thống AR neo chính xác vật thể kỹ thuật số, chẳng hạn như màn hình ảo, lên các bề mặt vật lý để chúng giữ ổn định khi người dùng di chuyển.
- Hệ thống hỗ trợ điều hướng: Những tiến bộ gần đây trong Semantic SLAM ứng dụng deep learning đang được sử dụng để tạo thiết bị hỗ trợ điều hướng đeo được cho người khiếm thị, giúp định tuyến an toàn theo thời gian thực quanh các chướng ngại vật vật lý di động.
Tích hợp Semantic SLAM và Ultralytics YOLO26#
Một trong những thách thức lớn nhất của Visual SLAM là xử lý môi trường động, nơi các vật thể chuyển động làm sai lệch bản đồ. Semantic SLAM giải quyết vấn đề này bằng cách kết hợp pipeline SLAM truyền thống với các model thị giác tốc độ cao. Bằng cách sử dụng Ultralytics YOLO26 để phân đoạn instance hoặc phát hiện, hệ thống có thể gán nhãn ngữ nghĩa cho cảnh và lọc bỏ các vật thể đang chuyển động, cải thiện đáng kể độ chính xác định vị.
Khối mã bên dưới minh họa cách sử dụng Ultralytics YOLO26 để xác định tọa độ của các vật thể động (như người và ô tô), nhờ đó bộ máy ghép đặc trưng của SLAM có thể chủ động bỏ qua chúng:
from ultralytics import YOLO
# Load Ultralytics YOLO26 to detect dynamic objects in the scene
model = YOLO("yolo26n.pt")
results = model("robot_camera_view.jpg")
# Extract bounding boxes of dynamic objects to exclude them from SLAM maps
for box in results[0].boxes:
if int(box.cls) in [0, 2]: # Example: Class 0 is person, Class 2 is car
print(f"Ignore dynamic feature region at coordinates: {box.xyxy[0]}")Bằng cách tận dụng phần cứng edge AI hiện đại như NVIDIA Jetson và tích hợp model thông qua Ultralytics Platform, nhà phát triển có thể huấn luyện và triển khai trực tiếp các thuật toán thị giác gọn nhẹ cùng với pipeline SLAM. Để tìm hiểu thêm về kiến trúc lập bản đồ tự hành, hãy tham khảo các tài liệu gần đây trên IEEE Xplore hoặc arXiv, đồng thời tìm hiểu cách tối ưu pipeline thị giác liên tục trong tài liệu Ultralytics.









