YOLO Vision 2026:
Quay lại Bảng thuật ngữ Ultralytics

Vision Language Model (VLM)

Khám phá Vision Language Models (VLM) với Ultralytics. Tìm hiểu cách chúng kết nối thị giác máy tính và LLM cho VQA và phát hiện từ vựng mở sử dụng Ultralytics YOLO26.

Vision Language Model (VLM) là một loại trí tuệ nhân tạo có khả năng xử lý và diễn giải đồng thời cả thông tin trực quan (hình ảnh hoặc video) và thông tin văn bản. Khác với các mô hình computer vision truyền thống vốn chỉ tập trung vào dữ liệu điểm ảnh, hoặc các Large Language Models (LLMs) chỉ hiểu văn bản, VLM thu hẹp khoảng cách giữa hai phương thức này. Bằng cách huấn luyện trên các tập dữ liệu lớn chứa các cặp hình ảnh-văn bản, các mô hình này học cách liên kết các đặc trưng trực quan với các khái niệm ngôn ngữ, cho phép chúng mô tả hình ảnh, trả lời câu hỏi về các cảnh quan trực quan, và thậm chí thực thi các lệnh dựa trên những gì chúng "nhìn thấy."

Cách thức hoạt động của Vision Language Models#

Về cơ bản, VLM thường bao gồm hai thành phần chính: một bộ mã hóa thị giác (vision encoder) và một bộ mã hóa văn bản (text encoder). Bộ mã hóa thị giác xử lý hình ảnh để trích xuất feature maps và các biểu diễn trực quan, trong khi bộ mã hóa văn bản xử lý đầu vào ngôn ngữ. Các luồng dữ liệu riêng biệt này sau đó được hợp nhất bằng các cơ chế như cross-attention để căn chỉnh thông tin trực quan và văn bản trong một không gian nhúng chung.

Những tiến bộ gần đây trong năm 2024 và 2025 đã chuyển dịch sang các kiến trúc hợp nhất hơn, nơi một mạng xương sống Transformer đơn lẻ xử lý cả hai phương thức. Chẳng hạn, các mô hình như Google PaliGemma 2 chứng minh rằng việc tích hợp hiệu quả các luồng này có thể nâng cao hiệu suất trong các tác vụ suy luận phức tạp. Sự căn chỉnh này cho phép mô hình hiểu ngữ cảnh, chẳng hạn như nhận diện rằng từ "apple" ám chỉ một loại quả trong hình ảnh siêu thị nhưng lại là một công ty công nghệ trong một logo.

Các ứng dụng trong thực tế#

Khả năng hiểu thế giới thông qua cả thị giác và ngôn ngữ mở ra nhiều ứng dụng đa dạng trong các ngành công nghiệp khác nhau:

  • Visual Question Answering (VQA): VLM được sử dụng nhiều trong healthcare diagnostics để hỗ trợ các bác sĩ chẩn đoán hình ảnh. Một bác sĩ có thể hỏi hệ thống, "Có vết nứt nào trên phim X-quang này không?", và mô hình sẽ phân tích hình ảnh y tế để đưa ra đánh giá sơ bộ, giúp giảm thiểu sai sót chẩn đoán.
  • Smart E-Commerce Search: Trong các retail environments, VLM cho phép người dùng tìm kiếm sản phẩm bằng các mô tả ngôn ngữ tự nhiên kết hợp với hình ảnh. Một người mua sắm có thể tải lên bức ảnh trang phục của một người nổi tiếng và hỏi, "Hãy tìm cho tôi một chiếc váy có họa tiết này nhưng màu xanh lam", và hệ thống sử dụng semantic search để truy xuất các kết quả khớp chính xác.
  • Automated Captioning and Accessibility: VLM tự động tạo alt text mang tính mô tả cho các hình ảnh trên web, giúp nội dung kỹ thuật số dễ tiếp cận hơn đối với người dùng bị khiếm thị dựa vào trình đọc màn hình.

Phân biệt VLM với các khái niệm liên quan#

Việc phân biệt VLM với các danh mục AI khác sẽ giúp ích trong việc hiểu rõ vai trò cụ thể của chúng:

  • VLM vs. LLM: Một Large Language Model (như các phiên bản chỉ có văn bản của GPT-4) chỉ xử lý dữ liệu văn bản. Mặc dù có thể tạo ra các câu chuyện sáng tạo hoặc mã nguồn, nó không thể "nhìn thấy" một hình ảnh. VLM thực chất mang lại đôi mắt cho LLM.
  • VLM vs. Object Detection: Các mô hình object detection truyền thống, chẳng hạn như các phiên bản YOLO đời đầu, xác định các đối tượng nằm ở đâu và thuộc lớp nào (ví dụ: "Car: 99%"). VLM tiến xa hơn bằng cách thấu hiểu các mối quan hệ và thuộc tính, chẳng hạn như "một chiếc xe thể thao màu đỏ đậu bên cạnh một trụ cứu hỏa."
  • VLM vs. Multimodal AI: Multimodal AI là một thuật ngữ bao hàm rộng hơn. Mặc dù tất cả VLM đều là đa phương thức (kết hợp thị giác và ngôn ngữ), không phải mọi mô hình đa phương thức đều là VLM; một số có thể kết hợp âm thanh và văn bản (như chuyển giọng nói thành văn bản) hoặc dữ liệu video và cảm biến mà không có thành phần ngôn ngữ.

Phát hiện từ vựng mở (Open-Vocabulary Detection) với YOLO#

Các VLM hiện đại cho phép phát hiện theo "từ vựng mở" (open-vocabulary), nơi bạn có thể phát hiện các đối tượng sử dụng các câu lệnh văn bản tự do thay vì các lớp được định nghĩa trước. Đây là một tính năng cốt lõi của các mô hình như Ultralytics YOLO-World, cho phép định nghĩa lớp động mà không cần huấn luyện lại.

Ví dụ sau đây minh họa cách sử dụng gói ultralytics để phát hiện các đối tượng cụ thể được mô tả bằng văn bản:

from ultralytics import YOLOWorld

# Load a model capable of vision-language understanding
model = YOLOWorld("yolov8s-world.pt")

# Define custom classes using natural language text prompts
model.set_classes(["person wearing sunglasses", "red backpack"])

# Run inference to find these text-defined objects in an image
results = model.predict("https://ultralytics.com/images/bus.jpg")

# Display the detection results
results[0].show()

Thách thức và các hướng phát triển trong tương lai#

Dù rất mạnh mẽ, Vision Language Models vẫn đối mặt với những thách thức đáng kể. Một vấn đề lớn là hallucination, trong đó mô hình tự tin mô tả các đối tượng hoặc văn bản vốn không hề có trong hình ảnh. Các nhà nghiên cứu đang tích cực phát triển các kỹ thuật như Reinforcement Learning from Human Feedback (RLHF) để cải thiện độ bám sát thực tế và độ chính xác.

Một thách thức khác là chi phí tính toán. Việc huấn luyện các mô hình khổng lồ này đòi hỏi nguồn GPU resources đáng kể. Tuy nhiên, sự ra mắt của các kiến trúc hiệu quả như Ultralytics YOLO26 đang giúp mang lại các khả năng thị giác tiên tiến cho các thiết bị biên. Khi tiến bước về phía trước, chúng tôi kỳ vọng sẽ thấy VLM đóng vai trò quan trọng trong các robotic agents, cho phép robot điều hướng và thao tác với các đối tượng dựa trên các hướng dẫn bằng lời nói phức tạp.

Đối với những ai quan tâm đến nền tảng lý thuyết, CLIP paper by OpenAI gốc cung cấp cái nhìn sâu sắc tuyệt vời về việc huấn luyện trước ngôn ngữ-hình ảnh tương phản. Ngoài ra, việc theo dõi các CVPR conference papers là rất cần thiết để nắm bắt sự tiến hóa nhanh chóng của các kiến trúc này. Để thử nghiệm huấn luyện các mô hình thị giác của riêng bạn, bạn có thể tận dụng Ultralytics Platform để quản lý tập dữ liệu và triển khai mô hình một cách tối ưu.

Explore solutions

Real-time AI that works with your team

AI trong ngành Robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong Logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong chăm sóc sức khỏe

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

AI trong Ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

AI trong Nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong Logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong chăm sóc sức khỏe

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

AI trong Ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

AI trong Nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong Logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong chăm sóc sức khỏe

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

AI trong Ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

AI trong Nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm

Hãy cùng nhau xây dựng tương lai của AI!

Bắt đầu hành trình của bạn với tương lai của machine learning