Spatial Intelligence
Khám phá cách spatial intelligence giúp AI nhận thức và điều hướng thế giới 3D. Học cách xây dựng các hệ thống có nhận thức không gian với Ultralytics YOLO26 và Ultralytics Platform.
Trí tuệ không gian đề cập đến khả năng của một hệ thống trí tuệ nhân tạo trong việc nhận thức, hiểu và điều hướng thế giới vật lý theo ba chiều. Khác với thị giác máy tính truyền thống, vốn thường phân tích hình ảnh 2D như những ảnh chụp tĩnh, trí tuệ không gian bao gồm việc suy luận về chiều sâu, hình học, chuyển động và mối quan hệ giữa các vật thể trong một môi trường động. Khả năng này giúp máy móc không chỉ “nhìn thấy” các pixel mà còn hiểu được bối cảnh vật lý của một cảnh, cho phép chúng tương tác với thế giới thực hiệu quả hơn. Đây là cầu nối giữa dữ liệu hình ảnh kỹ thuật số và hành động vật lý, đồng thời là nền tảng cho các AI agent tiên tiến và hệ thống robot.
Các thành phần cốt lõi của trí tuệ không gian#
Để đạt được khả năng hiểu không gian tương tự con người, một hệ thống AI dựa trên một số công nghệ và khái niệm có mối liên hệ với nhau.
- Nhận thức chiều sâu và tái tạo 3D: Hệ thống phải chuyển đổi đầu vào 2D từ camera thành các biểu diễn 3D. Các kỹ thuật như ước tính chiều sâu đơn ảnh cho phép model dự đoán khoảng cách từ một hình ảnh duy nhất, trong khi phát hiện vật thể 3D giúp xác định thể tích và hướng của các vật thể trong không gian đó.
- Định vị và lập bản đồ đồng thời (SLAM): Công nghệ này cho phép một thiết bị, chẳng hạn như robot hoặc drone, lập bản đồ một môi trường chưa biết đồng thời theo dõi vị trí của chính nó trong môi trường đó. Các phương pháp hiện đại thường tích hợp SLAM thị giác với deep learning để cải thiện độ ổn định trong các điều kiện ánh sáng thay đổi.
- Suy luận hình học: Ngoài việc phát hiện, hệ thống phải hiểu các ràng buộc vật lý—biết rằng một chiếc cốc nằm trên bàn hoặc một cánh cửa phải được mở để đi qua. Điều này thường bao gồm ước tính tư thế để theo dõi hướng của vật thể hoặc các khớp trên cơ thể người theo thời gian thực.
- AI hiện thân: Khái niệm này liên kết nhận thức với hành động. Một agent hiện thân không chỉ quan sát; nó sử dụng dữ liệu không gian để lập kế hoạch di chuyển, tránh chướng ngại vật và thao tác với vật thể, tương tự cách AI trong lĩnh vực robot hoạt động tại xưởng sản xuất.
Các ứng dụng trong thực tế#
Trí tuệ không gian đang chuyển đổi nhiều ngành bằng cách cho phép máy móc vận hành tự động trong các môi trường phức tạp.
- Robot tự hành và logistics: Trong kho hàng, robot sử dụng trí tuệ không gian để điều hướng các lối đi đông đúc, xác định những kiện hàng cụ thể bằng phát hiện vật thể và đặt chúng chính xác lên băng chuyền. Chúng phải tính toán mối quan hệ không gian giữa bộ kẹp và thùng hàng để bảo đảm giữ chắc mà không làm hỏng vật phẩm.
- Thực tế tăng cường (AR) và thực tế hỗn hợp: Các thiết bị như kính thông minh sử dụng điện toán không gian để neo nội dung kỹ thuật số vào thế giới vật lý. Ví dụ, một ứng dụng bảo trì AR có thể phủ trực tiếp hướng dẫn sửa chữa lên một bộ phận cụ thể của động cơ. Điều này đòi hỏi theo dõi vật thể chính xác để bảo đảm đồ họa luôn thẳng hàng khi người dùng di chuyển đầu.
Trí tuệ không gian và thị giác máy tính#
Mặc dù có mối liên hệ chặt chẽ, việc phân biệt trí tuệ không gian và thị giác máy tính là rất hữu ích. Thị giác máy tính là lĩnh vực rộng hơn, tập trung vào việc trích xuất thông tin có ý nghĩa từ hình ảnh kỹ thuật số, video và các đầu vào hình ảnh khác. Lĩnh vực này bao gồm các tác vụ như phân loại hoặc phát hiện 2D cơ bản. Trí tuệ không gian là một tập con chuyên biệt hoặc một bước phát triển của thị giác máy tính, bổ sung cụ thể chiều không gian và vật lý. Nó chuyển từ câu hỏi “Vật thể này là gì?” (Thị giác) sang “Vật thể này ở đâu, đang có hướng như thế nào và tôi có thể tương tác với nó ra sao?” (Trí tuệ không gian).
Triển khai nhận thức không gian với Ultralytics#
Các developer có thể xây dựng nền tảng cho hệ thống trí tuệ không gian bằng Ultralytics Platform. Bằng cách training các model như Ultralytics YOLO26 trên các tác vụ như phát hiện Hộp giới hạn định hướng (OBB) hoặc ước tính tư thế, các kỹ sư có thể cung cấp dữ liệu hình học cần thiết cho các ứng dụng robot hoặc AR ở lớp downstream.
Dưới đây là một ví dụ đơn giản về cách trích xuất các keypoint không gian bằng model ước tính tư thế, một bước quan trọng trong việc hiểu chuyển động của con người trong không gian 3D:
from ultralytics import YOLO
# Load a pre-trained YOLO26 pose estimation model
model = YOLO("yolo26n-pose.pt")
# Run inference on an image to detect human keypoints
results = model("path/to/image.jpg")
# Access the keypoints (x, y coordinates and confidence)
for result in results:
# keypoints.xy returns a tensor of shape (N, 17, 2)
keypoints = result.keypoints.xy
print(f"Detected keypoints for {len(keypoints)} persons.")Những tiến bộ gần đây trong Vision Transformer (ViT) và foundation model đang tiếp tục đẩy nhanh lĩnh vực này, cho phép các hệ thống khái quát hóa khả năng hiểu không gian giữa nhiều môi trường khác nhau mà không cần training lại quy mô lớn. Khi nghiên cứu từ các nhóm như HAI của Stanford và Google DeepMind tiếp tục phát triển, chúng ta có thể kỳ vọng trí tuệ không gian sẽ trở thành một tính năng tiêu chuẩn trong thế hệ thiết bị thông minh tiếp theo.









