YOLO Vision 2026:
Quay lại Bảng thuật ngữ Ultralytics

Multi-Modal Learning

Khám phá multi-modal learning trong AI. Tìm hiểu cách nó tích hợp văn bản, hình ảnh và âm thanh cho các model mạnh mẽ như Ultralytics YOLO26 và YOLO-World. Tìm hiểu thêm ngay hôm nay!

Học đa phương thức là một phương pháp tiên tiến trong artificial intelligence (AI) nhằm huấn luyện các thuật toán xử lý, hiểu và tương quan thông tin từ nhiều loại dữ liệu riêng biệt, hay còn gọi là các "modalities" (đặc tính/dạng dữ liệu). Không giống như các hệ thống truyền thống chuyên xử lý một loại đầu vào duy nhất—chẳng hạn như văn bản để dịch thuật hoặc điểm ảnh để image recognition—học đa phương thức mô phỏng nhận thức của con người bằng cách tích hợp các đầu vào cảm giác đa dạng như dữ liệu thị giác, âm thanh lời nói, mô tả văn bản và số liệu từ cảm biến. Phương pháp toàn diện này cho phép các mô hình machine learning (ML) phát triển sự hiểu biết sâu sắc hơn, có nhận thức về ngữ cảnh về thế giới, dẫn đến các dự đoán mạnh mẽ và linh hoạt hơn.

Cách thức hoạt động của học máy đa phương thức#

Thách thức cốt lõi trong học máy đa phương thức là chuyển đổi các loại dữ liệu khác nhau thành một không gian toán học chung, nơi chúng có thể được so sánh và kết hợp. Quá trình này thường bao gồm ba giai đoạn chính: mã hóa (encoding), căn chỉnh (alignment) và hợp nhất (fusion).

  1. Feature Extraction: Các mạng neural chuyên biệt xử lý từng modality một cách độc lập. Ví dụ, convolutional neural networks (CNNs) hoặc Vision Transformers (ViTs) có thể trích xuất các đặc trưng từ hình ảnh, trong khi Recurrent Neural Networks (RNNs) hoặc Transformer xử lý văn bản.

  2. Embeddings Alignment: Mô hình học cách ánh xạ các đặc trưng đa dạng này thành các vector không gian chiều cao chung. Trong không gian chung này, vector của từ "cat" (mèo) và vector của hình ảnh một con mèo được đặt gần nhau. Các kỹ thuật như contrastive learning, được phổ biến qua các bài báo nghiên cứu như OpenAI's CLIP, đóng vai trò thiết yếu ở đây.

  3. Data Fusion: Cuối cùng, thông tin được hợp nhất để thực hiện một tác vụ. Quá trình hợp nhất có thể diễn ra sớm (kết hợp dữ liệu thô), muộn (kết hợp các dự đoán cuối cùng), hoặc thông qua các phương pháp lai trung gian sử dụng attention mechanism để đánh giá tầm quan trọng của từng modality một cách động.

Các ứng dụng trong thực tế#

Học máy đa phương thức là động lực đằng sau nhiều bước đột phá AI ấn tượng nhất hiện nay, giúp thu hẹp khoảng cách giữa các kho dữ liệu riêng biệt để giải quyết các vấn đề phức tạp.

  • Visual Question Answering (VQA): Trong ứng dụng này, hệ thống phải phân tích một hình ảnh và trả lời một câu hỏi bằng ngôn ngữ tự nhiên về hình ảnh đó, chẳng hạn như "Đèn giao thông có màu gì?". Điều này đòi hỏi mô hình phải hiểu ngữ nghĩa của văn bản và định vị không gian các yếu tố thị giác tương ứng bằng cách sử dụng computer vision.
  • Autonomous Vehicles: Xe tự hành phụ thuộc rất nhiều vào việc hợp nhất cảm biến, kết hợp dữ liệu từ đám mây điểm LiDAR, nguồn cấp dữ liệu video từ camera và radar để điều hướng an toàn. Đầu vào đa phương thức này đảm bảo rằng nếu một cảm biến bị lỗi (ví dụ: camera bị chói nắng), các cảm biến khác vẫn có thể duy trì road safety.
  • Healthcare Diagnostics: AI trong chăm sóc sức khỏe ứng dụng học đa phương thức bằng cách phân tích medical image analysis (như chụp MRI hoặc X-quang) bên cạnh lịch sử bệnh nhân dạng văn bản phi cấu trúc và dữ liệu di truyền. Góc nhìn toàn diện này hỗ trợ các bác sĩ đưa ra chẩn đoán chính xác hơn, một chủ đề thường được thảo luận trong Nature Digital Medicine journals.
  • Generative AI: Các công cụ tạo ra hình ảnh từ các câu lệnh văn bản, chẳng hạn như Stable Diffusion, phụ thuộc hoàn toàn vào khả năng của mô hình trong việc hiểu mối quan hệ giữa các mô tả ngôn ngữ và kết cấu thị giác.

Phát hiện đối tượng đa phương thức với Ultralytics#

Trong khi các bộ dò tìm đối tượng tiêu chuẩn dựa vào các lớp được định nghĩa trước, các phương pháp đa phương thức như YOLO-World cho phép người dùng phát hiện đối tượng bằng cách sử dụng các câu lệnh văn bản từ vựng mở. Điều này chứng minh sức mạnh của việc liên kết các khái niệm văn bản với các đặc trưng thị giác trong hệ sinh thái Ultralytics.

Đoạn mã Python sau đây cho thấy cách sử dụng mô hình YOLO-World đã được huấn luyện trước để phát hiện đối tượng dựa trên đầu vào văn bản tùy chỉnh.

from ultralytics import YOLOWorld

# Load a pretrained YOLO-World model (Multi-Modal: Text + Vision)
model = YOLOWorld("yolov8s-world.pt")

# Define custom text prompts (modalities) for the model to identify
model.set_classes(["person", "bus", "traffic light"])

# Run inference: The model aligns the text prompts with visual features
results = model.predict("https://ultralytics.com/images/bus.jpg")

# Show the results
results[0].show()

Phân biệt các thuật ngữ chính#

Để điều hướng bối cảnh AI hiện đại, việc phân biệt 'Học máy đa phương thức' với các khái niệm liên quan sẽ rất hữu ích:

  • Multi-Modal Model: "Multi-Modal Learning" đề cập đến phương pháp luận và lĩnh vực nghiên cứu. Một "Multi-Modal Model" (như GPT-4 hoặc Gemini của Google) là thực thể hoặc sản phẩm phần mềm cụ thể kết quả từ quá trình huấn luyện đó.
  • Unimodal AI: Computer Vision truyền thống thường là đơn phương thức, tập trung độc quyền vào dữ liệu thị giác. Trong khi một mô hình như Ultralytics YOLO26 là một công cụ CV tiên tiến để phát hiện đối tượng, nó thường chỉ hoạt động trên các đầu vào thị giác trừ khi là một phần của một pipeline đa phương thức lớn hơn.
  • Large Language Models (LLMs): Các LLM truyền thống là đơn phương thức, chỉ được huấn luyện trên văn bản. Tuy nhiên, ngành công nghiệp đang chuyển dịch sang các "Large Multimodal Models" (LMMs) có khả năng xử lý nguyên bản hình ảnh và văn bản, một xu hướng được hỗ trợ bởi các framework như PyTorchTensorFlow.

Triển vọng tương lai#

Quỹ đạo của học đa phương thức hướng tới các hệ thống sở hữu các đặc điểm Artificial General Intelligence (AGI). Bằng cách gắn kết thành công ngôn ngữ vào thực tế vật lý và thị giác, các mô hình này đang chuyển dịch vượt ra ngoài sự tương quan thống kê để hướng tới khả năng suy luận thực sự. Nghiên cứu từ các tổ chức như MIT CSAILStanford Center for Research on Foundation Models tiếp tục đẩy xa ranh giới về cách máy móc nhận thức và tương tác với các môi trường đa giác quan phức tạp.

Tại Ultralytics, chúng tôi đang tích hợp các tiến bộ này vào Ultralytics Platform của mình, cho phép người dùng quản lý dữ liệu, huấn luyện các mô hình và triển khai các giải pháp tận dụng toàn bộ phổ các modality có sẵn, từ tốc độ của YOLO26 đến tính linh hoạt của việc phát hiện từ vựng mở.

Explore solutions

Real-time AI that works with your team

AI trong ngành Robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong Logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong chăm sóc sức khỏe

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

AI trong Ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

AI trong Nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong Logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong chăm sóc sức khỏe

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

AI trong Ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

AI trong Nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong Logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong chăm sóc sức khỏe

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

AI trong Ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

AI trong Nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm

Hãy cùng nhau xây dựng tương lai của AI!

Bắt đầu hành trình của bạn với tương lai của machine learning