Visual Reasoning
Khám phá khả năng suy luận trực quan trong AI và tìm hiểu cách các model suy luận logic không gian. Tìm hiểu cách xây dựng các pipeline suy luận nâng cao bằng Ultralytics YOLO26.
Suy luận thị giác trong trí tuệ nhân tạo đề cập đến khả năng của một model trong việc phân tích, diễn giải và đưa ra các suy luận logic từ dữ liệu thị giác và không gian. Trong khi các hệ thống thị giác máy tính (CV) tiêu chuẩn rất hiệu quả trong việc xác định những đối tượng nào hiện diện trong một cảnh, suy luận thị giác tiến thêm một bước để hiểu cách thức và lý do các đối tượng đó tương tác với nhau. Lấy cảm hứng từ năng lực nhận thức thị giác của con người và được đánh giá bằng các bài kiểm tra tâm lý học nhận thức tiêu chuẩn, khả năng này cho phép các model AI thực hiện phân tích hình ảnh phức tạp, suy luận các mối quan hệ không gian và giải quyết các bài toán nhiều bước chỉ dựa trên ngữ cảnh thị giác. Đây là một thành phần quan trọng giúp thu hẹp khoảng cách giữa nhận thức thô và trí tuệ có thể hành động trong các hệ thống AI đa phương thức.
Các khái niệm cốt lõi và mô hình "Think With Images"#
Trong lịch sử, các model machine learning chuyển đổi dữ liệu hình ảnh thành văn bản trước khi áp dụng suy luận logic. Tuy nhiên, những phát triển gần đây trong năm 2024 và 2025 đã phổ biến một mô hình trong đó các model vốn có khả năng suy nghĩ bằng hình ảnh. Bằng cách khai thác suy luận thị giác tiềm ẩn, các model thị giác-ngôn ngữ (VLMs) tiên tiến có thể tạo ra các biểu diễn thị giác trung gian—tương tự cách con người có thể hình dung một bản đồ tinh thần như được định nghĩa trong các tham số không gian của NIH Toolbox—trước khi đi đến kết luận.
Phương pháp này thường sử dụng một cơ chế được gọi là Trực quan hóa đa phương thức của tư duy (MVoT). Thay vì chỉ dựa vào chuỗi suy nghĩ dạng văn bản, các hệ thống có thể khám phá suy luận trực quan hóa không gian để xác minh các thay đổi hình học, đánh giá hiện tượng che khuất và theo dõi các chuyển động liên tục trong không gian 3D.
Suy luận thị giác và các khả năng liên quan#
Việc phân biệt suy luận thị giác với các thuật ngữ AI có nhiều điểm giao thoa khác là rất hữu ích:
- Các model suy luận: Đây là một danh mục rộng hơn, bao gồm các model được thiết kế cho suy luận logic nhiều bước, thường trong văn bản, toán học hoặc lập trình. Suy luận thị giác áp dụng các nguyên tắc suy diễn này cụ thể cho dữ liệu thị giác và không gian.
- Hỏi đáp bằng hình ảnh (VQA): VQA là một ứng dụng hoặc tác vụ cụ thể, trong đó AI cung cấp câu trả lời bằng ngôn ngữ tự nhiên cho prompt của người dùng về một hình ảnh. Suy luận thị giác là khả năng nhận thức nền tảng hỗ trợ VQA, cho phép model suy ra câu trả lời chính xác dựa trên ngữ cảnh không gian.
Các ứng dụng trong thực tế#
Khả năng diễn giải linh hoạt các ngữ cảnh không gian đang mở ra những quy trình agentic mang tính đột phá trong các lĩnh vực vật lý và kỹ thuật số.
- AI trong robot học và trí tuệ hiện thân: Các agent tự động và cánh tay robot cần trí tuệ không gian tinh vi để điều hướng trong những môi trường phức tạp. Bằng cách sử dụng suy luận thị giác, robot có thể suy ra rằng một vật dễ vỡ đang được xếp bên dưới một chiếc hộp nặng, rồi lập kế hoạch logic cho một chuỗi chuyển động để lấy vật đó mà không gây hư hỏng, dựa nhiều vào việc đánh giá các ràng buộc vật lý động.
- AI trong chẩn đoán y tế: Trong lĩnh vực chẩn đoán hình ảnh y khoa, các chuyên gia sử dụng hệ thống suy luận thị giác để vượt ra ngoài phát hiện bất thường cơ bản. Các model có thể đánh giá ảnh chụp MRI 3D để suy luận về mặt cấu trúc quỹ đạo phát triển của khối u so với các cơ quan xung quanh, cung cấp ngữ cảnh hình học quan trọng cho việc lập kế hoạch phẫu thuật.
Triển khai nhận thức cho các pipeline suy luận#
Để xây dựng các hệ thống suy luận hiệu quả, các developer dựa vào những model nhận thức tốc độ cao để trích xuất ngữ cảnh cấu trúc từ thế giới vật lý. Ultralytics YOLO26 đóng vai trò là một lớp nền tảng mạnh mẽ, nhanh chóng chuyển đổi pixel thành tọa độ hộp giới hạn có cấu trúc và các lớp đối tượng. Dữ liệu có cấu trúc này sau đó được đưa vào các engine suy luận thị giác chuyên biệt được xây dựng bằng các framework như PyTorch hoặc TensorFlow để đánh giá logic không gian.
Nếu bạn đang so sánh YOLO26 và YOLO11 cho tác vụ này, kiến trúc end-to-end gốc của YOLO26 giảm thiểu độ trễ inference, khiến model này trở nên lý tưởng cho các pipeline logic thời gian thực.
Đoạn mã Python sau đây minh họa cách sử dụng Ultralytics YOLO26 để trích xuất tọa độ không gian, cung cấp các đầu vào nhận thức thiết yếu cần thiết cho suy luận không gian ở các bước tiếp theo:
from ultralytics import YOLO
# Load the Ultralytics YOLO26 model to act as the perception layer
model = YOLO("yolo26n.pt")
# Run inference to detect objects in a scene
results = model("https://ultralytics.com/images/bus.jpg")
# Extract structured spatial data for the visual reasoning engine
for result in results:
for box in result.boxes:
cls_name = model.names[int(box.cls)]
# xyxy provides exact spatial coordinates (left, top, right, bottom)
coords = box.xyxy[0].tolist()
print(f"Object: {cls_name}, Spatial Coordinates: {coords}")Việc mở rộng quy mô các ứng dụng đa phương thức phức tạp này đòi hỏi hạ tầng mạnh mẽ. Ultralytics Platform cung cấp một môi trường hợp nhất để chú thích liền mạch các dataset trí tuệ không gian, train model trên cloud và triển khai các hệ thống nhận thức edge đáng tin cậy. Khi lĩnh vực này tiến tới các framework agentic tiên tiến hơn cho các tác vụ không gian và được hỗ trợ bởi nghiên cứu thị giác tiên tiến, việc kết hợp phát hiện đối tượng có độ chính xác cao với suy luận logic đại diện cho biên giới tiếp theo của trí tuệ nhân tạo.









