Multi-Modal Model
Khám phá cách multi-modal model tích hợp text, hình ảnh và audio. Tìm hiểu về các kiến trúc như Ultralytics YOLO26 và triển khai vision AI trên Ultralytics Platform.
Mô hình đa phương thức là một loại hệ thống trí tuệ nhân tạo (AI) tiên tiến, có khả năng xử lý, diễn giải và tích hợp đồng thời thông tin từ nhiều loại dữ liệu khác nhau, hay còn gọi là "phương thức". Trong khi các hệ thống đơn phương thức truyền thống chuyên về một lĩnh vực duy nhất—chẳng hạn như Xử lý Ngôn ngữ Tự nhiên (NLP) cho văn bản hoặc Thị giác Máy tính (CV) cho hình ảnh—các mô hình đa phương thức hướng đến việc mô phỏng nhận thức của con người bằng cách tổng hợp đồng thời các tín hiệu thị giác, thính giác và ngôn ngữ. Sự hội tụ này cho phép model phát triển hiểu biết toàn diện về thế giới, giúp model suy luận các mối tương quan phức tạp giữa một cảnh trực quan và phần mô tả bằng lời nói. Những khả năng này được xem là các bước nền tảng hướng tới Trí tuệ Nhân tạo Tổng quát (AGI).
Cơ chế cốt lõi và kiến trúc#
Hiệu quả của một mô hình đa phương thức phụ thuộc vào khả năng ánh xạ các loại dữ liệu đa dạng vào một không gian ngữ nghĩa dùng chung. Quy trình này thường bắt đầu bằng việc tạo ra embeddings, là các biểu diễn số nắm bắt ý nghĩa cốt lõi của dữ liệu đầu vào. Bằng cách huấn luyện trên các tập dữ liệu khổng lồ gồm những ví dụ đi theo cặp, chẳng hạn như video kèm phụ đề, model học cách căn chỉnh biểu diễn vector của hình ảnh "con mèo" với embedding văn bản của từ "cat".
Một số khái niệm kiến trúc then chốt giúp hiện thực hóa quá trình tích hợp này:
- Kiến trúc Transformer: Nhiều hệ thống đa phương thức sử dụng transformer, vốn áp dụng các cơ chế attention để linh hoạt xác định mức độ quan trọng của các phần khác nhau trong dữ liệu đầu vào. Điều này cho phép model tập trung vào những vùng hình ảnh cụ thể tương ứng với các từ liên quan trong một prompt văn bản, một khái niệm được trình bày chi tiết trong bài nghiên cứu kinh điển "Attention Is All You Need".
- Hợp nhất dữ liệu: Đây là chiến lược kết hợp thông tin từ nhiều nguồn khác nhau. Hợp nhất cảm biến có thể diễn ra ở giai đoạn đầu bằng cách hợp nhất dữ liệu thô hoặc ở giai đoạn cuối bằng cách kết hợp các quyết định của những sub-model riêng biệt. Các framework hiện đại như PyTorch cung cấp sự linh hoạt cần thiết để xây dựng các pipeline phức tạp này.
- Học tương phản: Các kỹ thuật được những model như CLIP của OpenAI sử dụng sẽ huấn luyện hệ thống giảm khoảng cách giữa các cặp văn bản-hình ảnh tương ứng trong không gian vector, đồng thời tăng khoảng cách giữa các cặp không tương ứng.
Các ứng dụng trong thực tế#
Các mô hình đa phương thức đã mở ra những khả năng mà trước đây các hệ thống đơn phương thức không thể đạt được.
- Trả lời câu hỏi trực quan (VQA): Các hệ thống này cho phép người dùng đặt câu hỏi bằng ngôn ngữ tự nhiên về một hình ảnh. Chẳng hạn, một người khiếm thị có thể tải lên ảnh chụp tủ đựng thức ăn và hỏi: "Có một lon súp trên kệ trên cùng không?" Model sử dụng phát hiện đối tượng để xác định các vật thể và NLP để hiểu truy vấn, từ đó đưa ra phản hồi hữu ích.
- Phương tiện tự hành: Ô tô tự lái hoạt động như các agent đa phương thức theo thời gian thực. Chúng kết hợp dữ liệu hình ảnh từ camera, thông tin độ sâu từ LiDAR và dữ liệu vận tốc từ radar. Tính dự phòng này đảm bảo rằng nếu một cảm biến bị thời tiết cản trở, các cảm biến khác vẫn có thể duy trì an toàn giao thông.
- Phát hiện với từ vựng mở: Các model như Ultralytics YOLO-World cho phép người dùng phát hiện đối tượng bằng các prompt văn bản tùy ý thay vì một danh sách class cố định. Điều này thu hẹp khoảng cách giữa các lệnh ngôn ngữ và khả năng nhận dạng hình ảnh.
Ví dụ: Phát hiện với từ vựng mở#
Ví dụ sau minh họa cách sử dụng thư viện ultralytics để thực hiện phát hiện với từ vựng mở, trong đó model diễn giải các prompt văn bản để xác định đối tượng trong một hình ảnh:
from ultralytics import YOLOWorld
# Load a pre-trained YOLO-World model capable of vision-language understanding
model = YOLOWorld("yolov8s-world.pt")
# Define custom classes using natural language text prompts
model.set_classes(["person wearing a hat", "blue backpack"])
# Run inference: The model aligns text prompts with visual features
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Visualize the detection results
results[0].show()Phân biệt với các thuật ngữ liên quan#
Việc phân biệt "Mô hình đa phương thức" với các khái niệm liên quan trong bảng thuật ngữ AI là rất hữu ích:
- Học đa phương thức: Đây là quy trình và các kỹ thuật machine learning (ML) được sử dụng để huấn luyện những hệ thống này. Mô hình đa phương thức là artifact hoặc sản phẩm phần mềm tạo ra từ quy trình học đó.
- Mô hình ngôn ngữ lớn (LLMs): LLM truyền thống chỉ xử lý văn bản. Mặc dù nhiều LLM đang phát triển thành Mô hình Thị giác-Ngôn ngữ (VLMs), một LLM tiêu chuẩn vẫn là mô hình đơn phương thức.
- Foundation Model: Đây là một danh mục rộng hơn, mô tả các model quy mô lớn có thể thích ứng với nhiều tác vụ downstream. Mặc dù mô hình đa phương thức thường là một foundation model, không phải tất cả foundation model đều xử lý nhiều phương thức.
Tương lai của AI đa phương thức#
Lĩnh vực này đang nhanh chóng tiến tới các hệ thống có thể xử lý liên tục các luồng âm thanh, video và văn bản theo thời gian thực. Nghiên cứu từ các tổ chức như Google DeepMind tiếp tục mở rộng giới hạn của khả năng nhận thức máy. Tại Ultralytics, chúng tôi hỗ trợ hệ sinh thái này bằng các vision backbone hiệu năng cao như YOLO26. Được phát hành vào năm 2026, YOLO26 mang lại tốc độ và độ chính xác vượt trội cho các tác vụ như phân đoạn instance, đóng vai trò là một thành phần thị giác hiệu quả trong các pipeline đa phương thức lớn hơn. Các developer có thể quản lý dữ liệu, quá trình huấn luyện và triển khai những workflow phức tạp này bằng Ultralytics Platform hợp nhất.









