World Models
Khám phá cách world model giúp AI dự đoán trạng thái tương lai bằng động lực học môi trường. Tìm hiểu cách Ultralytics YOLO26 cung cấp năng lực nhận thức cho AI dự đoán.
“Mô hình thế giới” là biểu diễn nội bộ của một hệ thống AI về cách môi trường vận hành, cho phép hệ thống dự đoán trạng thái hoặc kết quả trong tương lai dựa trên quan sát hiện tại và các hành động tiềm năng. Không giống các model truyền thống ánh xạ trực tiếp đầu vào sang đầu ra (chẳng hạn phân loại hình ảnh), mô hình thế giới học các động lực, quy luật vật lý và mối quan hệ nhân quả nền tảng của một hệ thống. Khái niệm này có vai trò cốt yếu trong việc thúc đẩy Trí tuệ nhân tạo tổng quát (AGI), vì nó mang lại cho máy móc một dạng suy luận “lẽ thường”, giúp máy mô phỏng tình huống trong nội bộ trước khi hành động trong thế giới thực.
Cơ chế đằng sau mô hình thế giới#
Về cốt lõi, mô hình thế giới hoạt động tương tự trực giác của con người. Khi ném một quả bóng, bạn không tính các phương trình lực cản của gió; não bộ mô phỏng quỹ đạo dựa trên kinh nghiệm trước đó. Tương tự, trong machine learning (ML), các model này nén dữ liệu cảm giác đa chiều (như khung hình video) thành trạng thái tiềm ẩn nhỏ gọn. Trạng thái đã nén này cho phép tác tử “mơ” hoặc hình dung các tương lai tiềm năng một cách hiệu quả.
Các nghiên cứu hàng đầu, chẳng hạn công trình về Mô hình thế giới hồi quy của Ha và Schmidhuber, cho thấy tác tử có thể học chính sách hoàn toàn bên trong một môi trường mô phỏng như trong mơ. Gần đây hơn, những tiến bộ về AI tạo sinh như Sora của OpenAI thể hiện hình thức mô hình hóa thế giới bằng hình ảnh, trong đó hệ thống hiểu quy luật vật lý, ánh sáng và tính bền vững của đối tượng để tạo ra video liên tục, nhất quán.
Ứng dụng trong robot và mô phỏng#
Mô hình thế giới đặc biệt tạo ra chuyển biến lớn trong các lĩnh vực đòi hỏi ra quyết định phức tạp.
- Xe tự hành: Xe tự lái sử dụng mô hình thế giới để dự đoán hành vi của những người lái xe và người đi bộ khác. Bằng cách mô phỏng hàng nghìn tình huống giao thông tiềm năng mỗi giây, xe có thể chọn lộ trình an toàn nhất. Điều này gắn chặt với thị giác máy tính trong các giải pháp ô tô, nơi khả năng nhận thức chính xác là nền tảng cho việc dự đoán.
- Robot: Trong robot sản xuất, cánh tay robot được huấn luyện bằng mô hình thế giới có thể thích ứng với đối tượng mới hoặc chướng ngại vật bất ngờ mà không cần huấn luyện lại. Robot hiểu quy luật vật lý của thao tác gắp và chuyển động, qua đó cải thiện các giải pháp sản xuất thông minh.
Mô hình thế giới và học tăng cường tiêu chuẩn#
Việc phân biệt world model với các phương pháp tiêu chuẩn là rất hữu ích:
- World model so với học tăng cường (RL): RL truyền thống thường là "không dùng model", nghĩa là agent chỉ học thông qua thử và sai trong môi trường. Phương pháp world model là "dựa trên model", trong đó agent xây dựng một trình mô phỏng để học, nhờ đó giảm đáng kể mức độ tương tác thực tế cần thiết.
- World model so với mô hình ngôn ngữ lớn (LLMs): Trong khi LLM dự đoán token văn bản tiếp theo, world model thường dự đoán khung hình trực quan hoặc trạng thái tiếp theo. Tuy nhiên, ranh giới đang dần mờ đi với sự phát triển của học đa phương thức, trong đó model tích hợp văn bản, thị giác và vật lý.
Các khái niệm triển khai thực tế#
Mặc dù việc xây dựng một world model hoàn chỉnh khá phức tạp, khái niệm nền tảng dựa trên việc dự đoán các trạng thái tương lai. Với các tác vụ thị giác máy tính, những model phát hiện tốc độ cao như Ultralytics YOLO26 đóng vai trò như "đôi mắt" cảm biến, cung cấp thông tin quan sát cho logic ra quyết định.
Đoạn mã Python sau minh họa cách bạn có thể dùng model YOLO để trích xuất trạng thái hiện tại (vị trí các đối tượng), làm đầu vào cho bước dự đoán của world model.
from ultralytics import YOLO
# Load the Ultralytics YOLO26 model to act as the perception layer
model = YOLO("yolo26n.pt")
# Perform inference to get the current state of the environment
results = model("https://ultralytics.com/images/bus.jpg")
# Extract bounding boxes (xyxy) representing object states
for result in results:
boxes = result.boxes.xyxy.cpu().numpy()
print(f"Observed State (Object Positions): {boxes}")
# A World Model would take these 'boxes' to predict the NEXT frame's stateTương lai của AI dự đoán#
World model đang phát triển theo hướng AI vật lý, nơi trí tuệ số tương tác liền mạch với thế giới vật lý. Những đổi mới như JEPA (Kiến trúc dự đoán nhúng kết hợp) của Yann LeCun đề xuất học các biểu diễn trừu tượng thay vì dự đoán từng pixel, giúp model hiệu quả hơn đáng kể.
Khi các kiến trúc này hoàn thiện, chúng tôi kỳ vọng chúng sẽ được tích hợp vào Ultralytics Platform, cho phép developer không chỉ phát hiện đối tượng mà còn dự báo quỹ đạo và tương tác của chúng trong môi trường biến động. Sự chuyển dịch từ phát hiện tĩnh sang dự đoán động này đánh dấu bước tiến lớn tiếp theo của thị giác máy tính (CV).









