Large Vision Models (LVM)
Khám phá Mô hình thị giác quy mô lớn (LVM) và tác động của chúng đến AI. Tìm hiểu cách Ultralytics YOLO26 và Ultralytics Platform hỗ trợ phát hiện và phân tích đối tượng nâng cao.
Mô hình thị giác quy mô lớn (LVM) đánh dấu bước tiến lớn trong lĩnh vực trí tuệ nhân tạo, tập trung chuyên sâu vào việc hiểu, tạo và xử lý dữ liệu thị giác ở quy mô rất lớn. Khác với các hệ thống thị giác máy tính truyền thống được huấn luyện trên tập dữ liệu hẹp cho những tác vụ cụ thể đã xác định trước, LVM đóng vai trò là model nền tảng tổng quát, được huấn luyện trên bộ sưu tập ảnh và video khổng lồ. Quá trình tiền huấn luyện mở rộng này giúp chúng phát triển khả năng hiểu sâu và toàn diện về hình học thị giác, texture và các quan hệ không gian phức tạp mà không phụ thuộc vào nhãn do con người chú thích.
Cách hoạt động của mô hình thị giác quy mô lớn#
Các mô hình thị giác quy mô lớn hiện đại thường tận dụng Transformer thị giác (ViT) hoặc kiến trúc tích chập được mở rộng quy mô mạnh để xử lý đầu vào thị giác. Bằng cách sử dụng các kỹ thuật học tự giám sát, chẳng hạn như mô hình hóa ảnh bị che, chúng học bằng cách dự đoán những phần còn thiếu của ảnh hoặc khung hình. Các tổ chức học thuật như Trung tâm Nghiên cứu Model Nền tảng Stanford đã chứng minh rằng việc nhanh chóng tăng số lượng tham số của các model này tạo ra những năng lực mới nổi có thể sử dụng ngay. Nhờ đó, chúng có thể thích ứng với các tác vụ hạ nguồn như phát hiện đối tượng tốc độ cao và phân đoạn ảnh chi tiết chỉ với lượng tinh chỉnh tối thiểu.
Ứng dụng thực tế#
LVM đang chuyển đổi nhiều ngành bằng cách xử lý các phân tích thị giác phức tạp vốn trước đây cần đến những thuật toán được huấn luyện riêng và chuyên biệt cao.
- Phân tích ảnh y khoa tự động: Trong môi trường lâm sàng, các kiến trúc thị giác quy mô lớn xử lý ảnh X-quang, MRI và CT độ phân giải cao để xác định những bất thường khó nhận thấy, hỗ trợ bác sĩ chẩn đoán hình ảnh phát hiện bệnh sớm và giảm đáng kể sai sót chẩn đoán.
- Phát hiện lỗi trong sản xuất: Các dây chuyền sản xuất tại nhà máy sử dụng model thị giác tổng quát để kiểm tra sản phẩm theo thời gian thực, dễ dàng nhận diện những lỗi phức tạp chưa từng gặp trên dây chuyền lắp ráp và cải thiện kiểm soát chất lượng mà không cần hàng nghìn ví dụ cho từng loại lỗi cụ thể.
Phân biệt các khái niệm liên quan#
Để hiểu đầy đủ bức tranh toàn cảnh về AI, cần phân biệt LVM với các model nền tảng phổ biến khác:
- LVM và Model ngôn ngữ thị giác (VLM): Trong khi LVM chỉ xử lý phương thức thị giác (pixel), VLM kết hợp cả văn bản lẫn hình ảnh, cho phép người dùng đặt câu hỏi bằng ngôn ngữ tự nhiên về một bức ảnh hoặc nhận mô tả bằng văn bản về video.
- LVM và Mô hình ngôn ngữ lớn (LLM): LLM chỉ được huấn luyện trên dữ liệu văn bản để hiểu và tạo ngôn ngữ tự nhiên. LVM thực hiện quy mô hóa và khả năng hiểu tương tự nhưng chỉ dành cho dữ liệu thị giác.
Làm việc với các model thị giác#
Trong khi các LVM khổng lồ thường cần cụm máy chủ chạy PyTorch hoặc TensorFlow, những model thị giác nền tảng được tối ưu hóa cao như Ultralytics YOLO26 mang trí tuệ thị giác tiên tiến, mạnh mẽ trực tiếp đến môi trường biên cục bộ. Ví dụ sau minh họa cách thực hiện suy luận thị giác mạnh mẽ bằng model đã được tiền huấn luyện:
from ultralytics import YOLO
# Tải model Ultralytics YOLO26 tiên tiến đã được tiền huấn luyện
model = YOLO("yolo26x.pt")
# Thực hiện suy luận trên ảnh để trích xuất đặc trưng thị giác và bounding box
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Hiển thị các quan hệ thị giác được dự đoán
results[0].show()Tương lai của trí tuệ thị giác#
Quá trình chuyển đổi từ nghiên cứu học thuật được công bố trên arXiv và thư viện số IEEE Xplore sang ứng dụng thực tiễn trong doanh nghiệp đang tăng tốc nhanh chóng. Những đổi mới từ các nhóm nghiên cứu như Google DeepMind đang tích cực mở rộng LVM sang lĩnh vực thời gian, cho phép model hiểu các chuỗi video phức tạp tương tự nội dung do Sora của OpenAI tạo ra.
Đối với nhà phát triển và tổ chức muốn xây dựng giải pháp AI thị giác tùy chỉnh, Nền tảng Ultralytics cung cấp các công cụ liền mạch để chú thích tập dữ liệu theo nhóm, huấn luyện trên cloud và triển khai model tinh gọn, giúp mọi người dễ dàng tiếp cận các năng lực thị giác tiên tiến. Ngoài ra, các công cụ phân đoạn zero-shot như Segment Anything 2 (SAM 2) của Meta cho thấy các phương pháp thị giác nền tảng quy mô lớn—thường được trình bày chi tiết trong Thư viện số ACM—đang chuẩn hóa khả năng hiểu phức tạp ở cấp pixel trong toàn ngành AI.









