YOLO Vision 2026:
Ultralytics用語集に戻る

Multi-Modal Learning

AI におけるマルチモーダル学習を探ります。Ultralytics YOLO26 や YOLO-World のような堅牢なモデルのために、テキスト、ビジョン、オーディオをどのように統合するかを学びましょう。今すぐ詳細を確認してください!

マルチモーダル学習は、人工知能 (AI) における洗練されたアプローチであり、複数の異なる種類のデータ(「モダリティ」)からの情報を処理、理解、および相関させるようにアルゴリズムを訓練します。翻訳用のテキストや画像認識用のピクセルといった単一の入力タイプを専門とする従来のシステムとは異なり、マルチモーダル学習は、視覚データ、音声、テキスト記述、センサー読み取り値などの多様な感覚入力を統合することで人間の認知を模倣します。この総体的なアプローチにより、機械学習 (ML) モデルは世界に対するより深くコンテキストを認識した理解を深めることができ、より堅牢で汎用性の高い予測につながります。

マルチモーダル学習の仕組み#

マルチモーダル学習における中心的な課題は、異なるデータタイプを比較および結合可能な共通の数学的空間に変換することです。このプロセスは一般的に、エンコーディング、アライメント、フュージョンの3つの主要な段階で構成されます。

  1. 特徴抽出: 特殊なニューラルネットワークが各モダリティを独立して処理します。たとえば、畳み込みニューラルネットワーク (CNN)Vision Transformers (ViTs) が画像から特徴を抽出し、一方で Recurrent Neural Networks (RNNs) や Transformer がテキストを処理します。

  2. 埋め込み合わせ: モデルは、これらの多様な特徴を共有の高次元ベクトルにマッピングすることを学習します。この共有空間において、「猫」という単語のベクトルと猫の画像のベクトルは互いに近づけられます。OpenAI's CLIP などの論文によって普及した対照学習などの手法が、ここで不可欠となります。

  3. データ融合: 最後に、タスクを実行するために情報がマージされます。融合は、早期(生データの結合)、後期(最終予測の結合)、または注意機構を使用して各モダリティの重要性を動的に重み付けする中間的なハイブリッド手法を介して発生する可能性があります。

実社会での応用#

マルチモーダル学習は、現代の多くの素晴らしいAIのブレイクスルーを支えるエンジンであり、異なるデータサイロ間のギャップを埋めて複雑な問題を解決しています。

  • ビジュアル質問応答 (VQA): このアプリケーションでは、システムは画像を分析し、「信号機は何色ですか?」などのそれに関する自然言語の質問に答える必要があります。これには、モデルがテキストの意味論を理解し、コンピュータビジョンを使用して対応する視覚要素を空間的に特定することが求められます。
  • 自動運転車: 自動運転車は、LiDARの点群データ、カメラの映像フィード、レーダーからのデータを組み合わせて安全にナビゲートするセンサーフュージョンに大きく依存しています。このマルチモーダル入力により、1つのセンサーが故障した場合(例:太陽の眩しさに目が眩んだカメラ)でも、他のセンサーが道路の安全性を維持できるようになります。
  • ヘルスケア診断: ヘルスケアにおけるAIは、医療画像解析(MRIやX線など)を非構造化テキストの患者履歴や遺伝子データと一緒に分析することで、マルチモーダル学習を活用します。この包括的な視点は、医師がより正確な診断を下すのを支援し、これはNature Digital Medicine journalsでも頻繁に議論されているトピックです。
  • 生成AI: Stable Diffusion などのテキストプロンプトから画像を生成するツールは、言語記述と視覚的テクスチャの関係を理解するモデルの能力に完全に依存しています。

Ultralyticsを用いたマルチモーダル物体検出#

標準的な物体検出器は事前定義されたクラスに依存しますが、YOLO-World のようなマルチモーダルアプローチでは、ユーザーがオープンボキャブラリのテキストプロンプトを使用して物体を検出できます。これは、Ultralyticsエコシステム内でテキスト概念と視覚的特徴をリンクさせる力の証明となります。

以下のPythonコードスニペットは、事前学習済みのYOLO-Worldモデルを使用して、カスタムテキスト入力に基づいて物体を検出する方法を示しています。

from ultralytics import YOLOWorld

# Load a pretrained YOLO-World model (Multi-Modal: Text + Vision)
model = YOLOWorld("yolov8s-world.pt")

# Define custom text prompts (modalities) for the model to identify
model.set_classes(["person", "bus", "traffic light"])

# Run inference: The model aligns the text prompts with visual features
results = model.predict("https://ultralytics.com/images/bus.jpg")

# Show the results
results[0].show()

主要な用語の区別#

現代のAIの状況を理解するためには、「マルチモーダル学習」と関連する概念を区別することが有益です。

  • マルチモーダルモデル: 「マルチモーダル学習」は、方法論および研究分野を指します。「マルチモーダルモデル」(GPT-4 やGoogleのGeminiなど)は、その訓練プロセスの結果として得られる特定の成果物またはソフトウェア製品です。
  • ユニモーダルAI: 従来のコンピュータビジョンは一般にユニモーダルであり、視覚データのみに焦点を当てています。Ultralytics YOLO26 のようなモデルは物体を検出するための最先端のCVツールですが、大規模なマルチモーダルパイプラインの一部でない限り、通常は視覚的入力のみで動作します。
  • 大規模言語モデル (LLMs): 従来のLLMsはユニモーダルであり、テキストのみで訓練されています。しかし、業界は画像とテキストをネイティブに処理できる「大規模マルチモーダルモデル」(LMMs) へとシフトしており、このトレンドは PyTorchTensorFlow などのフレームワークによってサポートされています。

今後の展望#

マルチモーダル学習の軌跡は、汎用人工知能 (AGI) の特性を備えたシステムへと向かっています。言語を視覚的および物理的な現実にうまく根付かせることにより、これらのモデルは統計的な相関関係を超えて真の推論へと移行しています。MIT CSAILStanford Center for Research on Foundation Models などの機関からの研究は、機械が複雑でマルチ感覚的な環境をどのように知覚し、相互作用するかという境界を押し広げ続けています。

Ultralyticsでは、これらの進歩を Ultralytics Platform に統合しており、ユーザーはデータの管理、モデルの訓練、および YOLO26 の速度からオープンボキャブラリ検出の多様性に至るまで、利用可能なすべてのモダリティの全スペクトルを活用するソリューションのデプロイを行うことができます。

Explore solutions

Real-time AI that works with your team

ロボティクスにおけるAI

Ultralytics YOLOモデルで、よりスマートなマシンを実現しましょう。ロボティクスにおけるビジョンAIは、自律航行、認識、物体追跡、リアルタイム制御を推進します。
詳細はこちら
Real-time AI that works with your team

物流におけるAI

Ultralytics YOLOモデルで物流を効率化しましょう。ビジョンAIにより、荷物の検査、仕分け、車両追跡、リアルタイムの倉庫安全モニタリングが可能になります。
詳細はこちら
Real-time AI that works with your team

小売業界におけるAI

Ultralytics YOLOモデルで小売を再定義しましょう。ビジョンAIは、在庫追跡、棚のモニタリング、キュー管理、そしてより賢明な顧客インサイトを促進します。
詳細はこちら
Real-time AI that works with your team

ヘルスケアにおけるAI

Ultralytics YOLOモデルを使用してヘルスケアソリューションを構築しましょう。ヘルスケア分野におけるビジョンAIは、より高速な医療画像診断、よりスマートな診断、患者モニタリングを推進します。
詳細はこちら
Real-time AI that works with your team

製造におけるAI

Ultralytics YOLOモデルで製造を最適化しましょう。ビジョンAIは、品質管理、欠陥検出、PPEコンプライアンス、組立ラインの自動化を促進します。
詳細はこちら
Real-time AI that works with your operation

自動車におけるAI

Ultralytics YOLOモデルを使用して、自動車分野にコンピュータビジョンを適用しましょう。ビジョンAIは、道路の安全性、運転支援、車両の自動化を向上させ、よりスマートな道路を実現します。
詳細はこちら
Real-time AI tailored to your operation

農業におけるAI

Ultralytics YOLOモデルを使用して、スマート農業にビジョンAIを導入しましょう。作物モニタリング、家畜のトラッキング、精密農業を強化し、より高くスマートな収穫を実現します。
詳細はこちら
Real-time AI that works with your team

ロボティクスにおけるAI

Ultralytics YOLOモデルで、よりスマートなマシンを実現しましょう。ロボティクスにおけるビジョンAIは、自律航行、認識、物体追跡、リアルタイム制御を推進します。
詳細はこちら
Real-time AI that works with your team

物流におけるAI

Ultralytics YOLOモデルで物流を効率化しましょう。ビジョンAIにより、荷物の検査、仕分け、車両追跡、リアルタイムの倉庫安全モニタリングが可能になります。
詳細はこちら
Real-time AI that works with your team

小売業界におけるAI

Ultralytics YOLOモデルで小売を再定義しましょう。ビジョンAIは、在庫追跡、棚のモニタリング、キュー管理、そしてより賢明な顧客インサイトを促進します。
詳細はこちら
Real-time AI that works with your team

ヘルスケアにおけるAI

Ultralytics YOLOモデルを使用してヘルスケアソリューションを構築しましょう。ヘルスケア分野におけるビジョンAIは、より高速な医療画像診断、よりスマートな診断、患者モニタリングを推進します。
詳細はこちら
Real-time AI that works with your team

製造におけるAI

Ultralytics YOLOモデルで製造を最適化しましょう。ビジョンAIは、品質管理、欠陥検出、PPEコンプライアンス、組立ラインの自動化を促進します。
詳細はこちら
Real-time AI that works with your operation

自動車におけるAI

Ultralytics YOLOモデルを使用して、自動車分野にコンピュータビジョンを適用しましょう。ビジョンAIは、道路の安全性、運転支援、車両の自動化を向上させ、よりスマートな道路を実現します。
詳細はこちら
Real-time AI tailored to your operation

農業におけるAI

Ultralytics YOLOモデルを使用して、スマート農業にビジョンAIを導入しましょう。作物モニタリング、家畜のトラッキング、精密農業を強化し、より高くスマートな収穫を実現します。
詳細はこちら
Real-time AI that works with your team

ロボティクスにおけるAI

Ultralytics YOLOモデルで、よりスマートなマシンを実現しましょう。ロボティクスにおけるビジョンAIは、自律航行、認識、物体追跡、リアルタイム制御を推進します。
詳細はこちら
Real-time AI that works with your team

物流におけるAI

Ultralytics YOLOモデルで物流を効率化しましょう。ビジョンAIにより、荷物の検査、仕分け、車両追跡、リアルタイムの倉庫安全モニタリングが可能になります。
詳細はこちら
Real-time AI that works with your team

小売業界におけるAI

Ultralytics YOLOモデルで小売を再定義しましょう。ビジョンAIは、在庫追跡、棚のモニタリング、キュー管理、そしてより賢明な顧客インサイトを促進します。
詳細はこちら
Real-time AI that works with your team

ヘルスケアにおけるAI

Ultralytics YOLOモデルを使用してヘルスケアソリューションを構築しましょう。ヘルスケア分野におけるビジョンAIは、より高速な医療画像診断、よりスマートな診断、患者モニタリングを推進します。
詳細はこちら
Real-time AI that works with your team

製造におけるAI

Ultralytics YOLOモデルで製造を最適化しましょう。ビジョンAIは、品質管理、欠陥検出、PPEコンプライアンス、組立ラインの自動化を促進します。
詳細はこちら
Real-time AI that works with your operation

自動車におけるAI

Ultralytics YOLOモデルを使用して、自動車分野にコンピュータビジョンを適用しましょう。ビジョンAIは、道路の安全性、運転支援、車両の自動化を向上させ、よりスマートな道路を実現します。
詳細はこちら
Real-time AI tailored to your operation

農業におけるAI

Ultralytics YOLOモデルを使用して、スマート農業にビジョンAIを導入しましょう。作物モニタリング、家畜のトラッキング、精密農業を強化し、より高くスマートな収穫を実現します。
詳細はこちら

AIの未来を共に築き上げましょう!

機械学習の未来とともに旅を始めましょう