YOLO Vision 2026:
Quay lại bảng thuật ngữ Ultralytics

Multi-Modal Learning

Khám phá multi-modal learning trong AI. Tìm hiểu cách phương pháp này tích hợp text, vision và audio để tạo ra các model robust như Ultralytics YOLO26 và YOLO-World. Khám phá thêm ngay hôm nay!

Học đa phương thức là một phương pháp sophisticated trong trí tuệ nhân tạo (AI), huấn luyện các thuật toán xử lý, hiểu và liên kết thông tin từ nhiều loại dữ liệu riêng biệt, hay còn gọi là “modalities”. Khác với các hệ thống truyền thống chỉ chuyên về một loại đầu vào—chẳng hạn như văn bản để dịch hoặc pixel cho nhận dạng hình ảnh—học đa phương thức mô phỏng nhận thức của con người bằng cách tích hợp nhiều đầu vào cảm giác đa dạng như dữ liệu hình ảnh, âm thanh lời nói, mô tả bằng văn bản và dữ liệu đọc từ cảm biến. Phương pháp toàn diện này cho phép các model machine learning (ML) phát triển khả năng hiểu thế giới sâu sắc hơn và nhận biết ngữ cảnh, từ đó tạo ra các dự đoán mạnh mẽ và linh hoạt hơn.

Cách hoạt động của học đa phương thức#

Thách thức cốt lõi trong học đa phương thức là chuyển đổi các loại dữ liệu khác nhau thành một không gian toán học chung, nơi chúng có thể được so sánh và kết hợp. Quy trình này thường gồm ba giai đoạn chính: mã hóa, căn chỉnh và hợp nhất.

  1. Trích xuất đặc trưng: Các mạng nơ-ron chuyên biệt xử lý từng modality một cách độc lập. Chẳng hạn, mạng nơ-ron tích chập (CNNs) hoặc Vision Transformers (ViTs) có thể trích xuất đặc trưng từ hình ảnh, trong khi mạng nơ-ron hồi quy (RNNs) hoặc Transformers xử lý văn bản.

  2. Căn chỉnh embedding: Model học cách ánh xạ các đặc trưng đa dạng này vào những vector nhiều chiều dùng chung. Trong không gian chung này, vector của từ “cat” và vector của một hình ảnh con mèo được đưa lại gần nhau. Các kỹ thuật như học tương phản, được phổ biến qua những nghiên cứu như CLIP của OpenAI, đóng vai trò thiết yếu ở đây.

  3. Hợp nhất dữ liệu: Cuối cùng, thông tin được hợp nhất để thực hiện một tác vụ. Việc hợp nhất có thể diễn ra ở giai đoạn sớm (kết hợp dữ liệu thô), giai đoạn muộn (kết hợp các dự đoán cuối cùng) hoặc thông qua các phương pháp lai trung gian sử dụng cơ chế attention để tự động cân nhắc tầm quan trọng của từng modality.

Các ứng dụng trong thực tế#

Học đa phương thức là động lực đằng sau nhiều đột phá AI ấn tượng nhất hiện nay, thu hẹp khoảng cách giữa các kho dữ liệu riêng biệt để giải quyết những bài toán phức tạp.

  • Trả lời câu hỏi bằng hình ảnh (VQA): Trong ứng dụng này, một hệ thống phải phân tích hình ảnh và trả lời câu hỏi bằng ngôn ngữ tự nhiên về hình ảnh đó, chẳng hạn như “Đèn giao thông có màu gì?”. Điều này đòi hỏi model phải hiểu ngữ nghĩa của văn bản và xác định vị trí các yếu tố hình ảnh tương ứng trong không gian bằng thị giác máy tính.
  • Phương tiện tự hành: Xe tự lái phụ thuộc nhiều vào việc hợp nhất dữ liệu cảm biến, kết hợp dữ liệu từ các point cloud LiDAR, luồng video camera và radar để di chuyển an toàn. Đầu vào đa phương thức này đảm bảo rằng nếu một cảm biến gặp sự cố (ví dụ: camera bị lóa do ánh nắng), các cảm biến khác vẫn có thể duy trì an toàn giao thông.
  • Chẩn đoán y tế: AI trong lĩnh vực chăm sóc sức khỏe sử dụng học đa phương thức bằng cách phân tích hình ảnh y tế (chẳng hạn như MRI hoặc X-quang) cùng với bệnh sử dạng văn bản phi cấu trúc và dữ liệu di truyền của bệnh nhân. Góc nhìn toàn diện này hỗ trợ bác sĩ đưa ra chẩn đoán chính xác hơn, một chủ đề thường được thảo luận trong các tạp chí Nature Digital Medicine.
  • AI tạo sinh: Các công cụ tạo hình ảnh từ prompt văn bản, chẳng hạn như Stable Diffusion, hoàn toàn phụ thuộc vào khả năng của model trong việc hiểu mối quan hệ giữa các mô tả ngôn ngữ và kết cấu hình ảnh.

Phát hiện đối tượng đa phương thức với Ultralytics#

Trong khi các model phát hiện đối tượng tiêu chuẩn dựa vào các lớp được định nghĩa trước, những phương pháp đa phương thức như YOLO-World cho phép người dùng phát hiện đối tượng bằng các prompt văn bản với vocabulary mở. Điều này cho thấy sức mạnh của việc liên kết các khái niệm văn bản với đặc trưng hình ảnh trong hệ sinh thái Ultralytics.

Đoạn mã Python sau đây minh họa cách sử dụng model YOLO-World đã được pre-trained để phát hiện đối tượng dựa trên các đầu vào văn bản tùy chỉnh.

from ultralytics import YOLOWorld

# Load a pretrained YOLO-World model (Multi-Modal: Text + Vision)
model = YOLOWorld("yolov8s-world.pt")

# Define custom text prompts (modalities) for the model to identify
model.set_classes(["person", "bus", "traffic light"])

# Run inference: The model aligns the text prompts with visual features
results = model.predict("https://ultralytics.com/images/bus.jpg")

# Show the results
results[0].show()

Phân biệt các thuật ngữ chính#

Để định hướng trong bối cảnh AI hiện đại, việc phân biệt “Học đa phương thức” với các khái niệm liên quan là rất hữu ích:

  • Model đa phương thức: “Học đa phương thức” đề cập đến phương pháp luận và lĩnh vực nghiên cứu. “Model đa phương thức” (chẳng hạn như GPT-4 hoặc Gemini của Google) là sản phẩm hoặc sản phẩm phần mềm cụ thể tạo ra từ quá trình huấn luyện đó.
  • AI đơn phương thức: Thị giác máy tính truyền thống nhìn chung là đơn phương thức, chỉ tập trung vào dữ liệu hình ảnh. Mặc dù một model như Ultralytics YOLO26 là công cụ CV tiên tiến để phát hiện đối tượng, model này thường chỉ xử lý đầu vào hình ảnh, trừ khi là một phần của pipeline đa phương thức lớn hơn.
  • Các mô hình ngôn ngữ lớn (LLMs): Các LLM truyền thống là đơn phương thức, chỉ được huấn luyện trên văn bản. Tuy nhiên, ngành đang chuyển sang “Các mô hình đa phương thức lớn (LMMs)” có thể xử lý nguyên bản hình ảnh và văn bản, với xu hướng này được hỗ trợ bởi các framework như PyTorchTensorFlow.

Triển vọng tương lai#

Quỹ đạo phát triển của học đa phương thức hướng tới các hệ thống sở hữu những đặc điểm của trí tuệ nhân tạo tổng quát (AGI). Bằng cách neo ngôn ngữ thành công vào thực tế hình ảnh và vật lý, các model này đang vượt ra ngoài mối tương quan thống kê để tiến tới khả năng suy luận thực sự. Nghiên cứu từ các tổ chức như MIT CSAILTrung tâm Nghiên cứu về Foundation Model của Stanford tiếp tục mở rộng giới hạn về cách máy móc nhận thức và tương tác với các môi trường phức tạp có nhiều loại cảm giác.

Tại Ultralytics, chúng tôi đang tích hợp những tiến bộ này vào Ultralytics Platform, cho phép người dùng quản lý dữ liệu, huấn luyện model và triển khai các giải pháp tận dụng toàn bộ các modality hiện có, từ tốc độ của YOLO26 đến tính linh hoạt của việc phát hiện với vocabulary mở.

Explore solutions

Real-time AI that works with your team

Thị giác máy tính trong robotics

Nâng cao năng lực cho máy móc thông minh hơn với các model Ultralytics YOLO. Vision AI trong robotics hỗ trợ điều hướng tự động, nhận thức, theo dõi đối tượng và điều khiển theo thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

Thị giác máy tính trong logistics

Tinh gọn logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra kiện hàng, phân loại, theo dõi phương tiện và giám sát an toàn kho theo thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

Thị giác máy tính trong bán lẻ

Định hình lại ngành bán lẻ với các model Ultralytics YOLO. Vision AI hỗ trợ tracking hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và cung cấp insight khách hàng thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong healthcare

Xây dựng các giải pháp healthcare với các model Ultralytics YOLO. Vision AI trong healthcare thúc đẩy chẩn đoán hình ảnh nhanh hơn, chẩn đoán thông minh hơn và giám sát bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

Computer vision trong ngành ô tô

Ứng dụng computer vision trong ngành ô tô với các model Ultralytics YOLO. Vision AI nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện để tạo nên những tuyến đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

Computer vision trong nông nghiệp

Đưa vision AI vào nông nghiệp thông minh với các model Ultralytics YOLO. Thúc đẩy giám sát cây trồng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

Thị giác máy tính trong robotics

Nâng cao năng lực cho máy móc thông minh hơn với các model Ultralytics YOLO. Vision AI trong robotics hỗ trợ điều hướng tự động, nhận thức, theo dõi đối tượng và điều khiển theo thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

Thị giác máy tính trong logistics

Tinh gọn logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra kiện hàng, phân loại, theo dõi phương tiện và giám sát an toàn kho theo thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

Thị giác máy tính trong bán lẻ

Định hình lại ngành bán lẻ với các model Ultralytics YOLO. Vision AI hỗ trợ tracking hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và cung cấp insight khách hàng thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong healthcare

Xây dựng các giải pháp healthcare với các model Ultralytics YOLO. Vision AI trong healthcare thúc đẩy chẩn đoán hình ảnh nhanh hơn, chẩn đoán thông minh hơn và giám sát bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

Computer vision trong ngành ô tô

Ứng dụng computer vision trong ngành ô tô với các model Ultralytics YOLO. Vision AI nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện để tạo nên những tuyến đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

Computer vision trong nông nghiệp

Đưa vision AI vào nông nghiệp thông minh với các model Ultralytics YOLO. Thúc đẩy giám sát cây trồng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

Thị giác máy tính trong robotics

Nâng cao năng lực cho máy móc thông minh hơn với các model Ultralytics YOLO. Vision AI trong robotics hỗ trợ điều hướng tự động, nhận thức, theo dõi đối tượng và điều khiển theo thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

Thị giác máy tính trong logistics

Tinh gọn logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra kiện hàng, phân loại, theo dõi phương tiện và giám sát an toàn kho theo thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

Thị giác máy tính trong bán lẻ

Định hình lại ngành bán lẻ với các model Ultralytics YOLO. Vision AI hỗ trợ tracking hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và cung cấp insight khách hàng thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong healthcare

Xây dựng các giải pháp healthcare với các model Ultralytics YOLO. Vision AI trong healthcare thúc đẩy chẩn đoán hình ảnh nhanh hơn, chẩn đoán thông minh hơn và giám sát bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

Computer vision trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

Computer vision trong ngành ô tô

Ứng dụng computer vision trong ngành ô tô với các model Ultralytics YOLO. Vision AI nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện để tạo nên những tuyến đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

Computer vision trong nông nghiệp

Đưa vision AI vào nông nghiệp thông minh với các model Ultralytics YOLO. Thúc đẩy giám sát cây trồng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm

Hãy cùng xây dựng tương lai của AI!

Bắt đầu hành trình của bạn với tương lai của machine learning