Novel View Synthesis (NVS)
Khám phá novel view synthesis để tạo các góc nhìn 3D từ hình ảnh 2D. Tìm hiểu cách cải thiện Ultralytics YOLO26 model bằng dữ liệu tổng hợp để có AI robust.
Quá trình tạo ra các góc nhìn mới, chưa từng thấy của một cảnh 3D từ một tập hợp hạn chế các hình ảnh 2D là một tác vụ nâng cao trong thị giác máy tính (CV). Kỹ thuật này phụ thuộc nhiều vào deep learning (DL) để suy luận chính xác về hình học, ánh sáng, kết cấu và hiện tượng che khuất bên dưới. Bằng cách dự đoán cách các đối tượng và môi trường sẽ xuất hiện từ những góc chưa được ghi lại, công nghệ này thu hẹp khoảng cách giữa hình ảnh 2D và biểu diễn cảnh 3D sống động.
Quá trình phát triển và những tiến bộ gần đây#
Trước đây, việc tạo các góc nhìn mới phụ thuộc vào stereo đa góc nhìn cổ điển và các kỹ thuật quang trắc truyền thống, vốn thường gặp khó khăn với ánh sáng phức tạp và các bề mặt phản chiếu. Ngày nay, lĩnh vực này bị chi phối bởi kết xuất neural. Điều quan trọng là phân biệt khái niệm rộng này với các phương thức triển khai kiến trúc cụ thể như Trường bức xạ neural (NeRF) và Gaussian Splatting. Mặc dù các thuật ngữ đó đề cập đến những phương pháp toán học và cấu trúc cụ thể để kết xuất cảnh, mục tiêu chung mà cả hai cùng giải quyết là tạo ra các góc nhìn mới.
Những đột phá gần đây trong năm 2024 và 2025 đã tích hợp trực tiếp các model diffusion sinh vào pipeline tổng hợp. Các kiến trúc mới này cho phép khả năng học zero-shot, giúp model tạo ra các chi tiết còn thiếu có tính thuyết phục trực tiếp trong không gian pixel mà không cần tái dựng mesh 3D tường minh. Điều này làm giảm chi phí tính toán vốn thường gắn với kết xuất đồ họa máy tính và đẩy nhanh quá trình tạo ra các đầu ra chân thực như ảnh.
Các ứng dụng trong thực tế#
Khả năng tổng hợp các góc chưa từng thấy có những tác động sâu rộng đến nhiều ngành:
- Truyền thông sống động: Trong điện toán không gian hiện đại, công nghệ này đóng vai trò nền tảng trong việc tạo ra môi trường thực tế ảo có thể khám phá và ứng dụng thực tế tăng cường tương tác chỉ từ một vài bức ảnh chụp ngẫu nhiên bằng smartphone.
- Thương mại điện tử: Các nhà bán lẻ có thể tạo ra những màn trình diễn sản phẩm 3D toàn diện từ một tập hợp thưa các hình ảnh 2D, cho phép khách hàng kiểm tra sản phẩm bằng kỹ thuật số từ mọi góc độ.
- Mô phỏng và đào tạo: Đối với xe tự hành và robotics, việc thu thập các trường hợp biên trong thế giới thực vừa nguy hiểm vừa tốn kém. Bằng cách tổng hợp các góc nhìn mới của dữ liệu đường phố hoặc nhà kho hiện có, các kỹ sư có thể tạo ra vô số biến thể của một cảnh. Đây là một hình thức tăng cường dữ liệu mạnh mẽ, giúp cải thiện độ bền vững của các model điều hướng trí tuệ nhân tạo (AI) ở các bước xử lý tiếp theo.
Tích hợp với quy trình làm việc của Ultralytics#
Sau khi các góc nhìn mới được tổng hợp, chúng thường cần được phân tích cấu trúc. Với Ultralytics Platform, các developer có thể quản lý liền mạch việc thu thập và gán nhãn dữ liệu cho các dataset được tạo nhân tạo này.
Bằng cách huấn luyện các model tiên tiến như Ultralytics YOLO26 trên những góc nhìn đa dạng này, bạn có thể cải thiện đáng kể độ chính xác của các tác vụ phát hiện đối tượng, phân đoạn hình ảnh và ước lượng pose. Vì model học cách nhận diện đối tượng từ những góc chưa từng được ghi lại trước đó, việc triển khai model thu được sẽ có khả năng chống chịu tốt hơn đáng kể trong các tình huống thực tế.
Để nhanh chóng phân tích một góc nhìn đã được tổng hợp, bạn có thể truyền trực tiếp hình ảnh đã kết xuất vào một model được huấn luyện trước:
import cv2
from ultralytics import YOLO
# Load the highly recommended Ultralytics YOLO26 model
model = YOLO("yolo26n.pt")
# Load a synthesized novel view using the OpenCV library
synthesized_view = cv2.imread("novel_view_render.jpg")
# Perform real-time object detection on the newly generated perspective
results = model(synthesized_view)
# Display the detection results
results[0].show()Cho dù bạn đang kết xuất môi trường bằng thư viện PyTorch3D hay tăng tốc suy luận trên phần cứng như các bộ xử lý tensor (TPUs), việc tổng hợp và sau đó phân tích các góc nhìn mới vẫn đi đầu trong nghiên cứu AI, liên tục nhận được sự hỗ trợ từ các preprint học thuật gần đây và các cụm machine learning trên nền tảng cloud quy mô lớn.









