Multi-Modal Learning
AIにおけるマルチモーダル学習を確認します。テキスト、画像、音声を統合して、Ultralytics YOLO26やYOLO-Worldのような堅牢なモデルを実現する方法を学びます。詳しくはこちらをご覧ください。
マルチモーダル学習は、人工知能(AI)における高度なアプローチであり、複数の異なる種類のデータ、つまり「モダリティ」から情報を処理、理解、関連付けるようにアルゴリズムを学習させます。翻訳におけるテキストや画像認識におけるピクセルなど、単一の入力タイプに特化する従来のシステムとは異なり、マルチモーダル学習は、視覚データ、音声、テキストによる説明、センサーの測定値など、多様な感覚入力を統合することで人間の認知を模倣します。この包括的なアプローチにより、機械学習(ML)モデルは、世界をより深く、コンテキストを考慮して理解できるようになり、より堅牢で多用途な予測につながります。
マルチモーダル学習の仕組み#
マルチモーダル学習における中心的な課題は、異なるデータタイプを、比較および統合できる共通の数学的空間へ変換することです。このプロセスは一般に、エンコーディング、アライメント、フュージョンという3つの主要な段階で構成されます。
-
特徴抽出: 特化したニューラルネットワークが各モダリティを個別に処理します。たとえば、畳み込みニューラルネットワーク(CNNs)やビジョンTransformer(ViTs)は画像から特徴を抽出し、リカレントニューラルネットワーク(RNNs)やTransformerはテキストを処理します。
-
埋め込みのアライメント: モデルは、これらの多様な特徴を共通の高次元ベクトルへマッピングする方法を学習します。この共通空間では、「猫」という単語のベクトルと猫の画像のベクトルが近づけられます。OpenAIのCLIPなどの論文によって広く知られるようになったコントラスト学習のような手法が、ここで重要な役割を果たします。
-
データフュージョン: 最後に、情報を統合してタスクを実行します。フュージョンは、初期段階(生データの統合)、後段(最終予測の統合)、またはアテンションメカニズムを使用して各モダリティの重要度を動的に重み付けする中間的なハイブリッド手法によって実行できます。
実世界での利用例#
マルチモーダル学習は、今日の最も印象的なAIの進歩の多くを支える原動力であり、異なるデータサイロの間の隔たりを埋めて複雑な問題を解決します。
- 画像質問応答(VQA): このアプリケーションでは、システムが画像を分析し、「信号機は何色ですか?」のような画像に関する自然言語の質問に回答する必要があります。これには、モデルがテキストの意味を理解し、コンピュータビジョンを使用して対応する視覚要素の空間的位置を特定することが求められます。
- 自動運転車: 自動運転車はセンサーフュージョンに大きく依存しており、LiDARの点群、カメラ映像、レーダーからのデータを組み合わせて安全に走行します。このマルチモーダル入力により、1つのセンサーが故障した場合(たとえば、カメラが太陽光のまぶしさで視界を失った場合)でも、他のセンサーが道路の安全を維持できます。
- 医療診断: 医療分野のAIは、医用画像解析(MRIやX線など)を、構造化されていない患者の病歴テキストや遺伝データと併せて分析することで、マルチモーダル学習を活用します。この包括的な視点は、医師がより正確な診断を下すのに役立ちます。このテーマは、Nature Digital Medicineの各誌でも頻繁に取り上げられています。
- 生成AI: Stable Diffusionなど、テキストプロンプトから画像を生成するツールは、言語による説明と視覚的なテクスチャの関係をモデルが理解する能力に全面的に依存しています。
Ultralyticsによるマルチモーダル物体検出#
標準的な物体検出器があらかじめ定義されたクラスに依存するのに対し、YOLO-Worldのようなマルチモーダルアプローチでは、オープンボキャブラリーのテキストプロンプトを使用して物体を検出できます。これは、Ultralyticsエコシステム内でテキストの概念と視覚的特徴を結び付けることの威力を示しています。
次のPythonコードスニペットは、事前学習済みのYOLO-Worldモデルを使用して、カスタムテキスト入力に基づいて物体を検出する方法を示しています。
from ultralytics import YOLOWorld
# Load a pretrained YOLO-World model (Multi-Modal: Text + Vision)
model = YOLOWorld("yolov8s-world.pt")
# Define custom text prompts (modalities) for the model to identify
model.set_classes(["person", "bus", "traffic light"])
# Run inference: The model aligns the text prompts with visual features
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Show the results
results[0].show()主要用語の違い#
現代のAIの全体像を把握するには、「マルチモーダル学習」と関連概念を区別すると役立ちます。
- マルチモーダルモデル: 「マルチモーダル学習」は、方法論および研究分野を指します。一方、「マルチモーダルモデル」(GPT-4やGoogleのGeminiなど)は、その学習プロセスによって生み出される具体的な成果物またはソフトウェア製品です。
- ユニモーダルAI: 従来のコンピュータビジョンは一般にユニモーダルであり、視覚データだけに焦点を当てます。Ultralytics YOLO26のようなモデルは物体検出用の最先端CVツールですが、通常は、より大規模なマルチモーダルパイプラインの一部でない限り、視覚入力だけで動作します。
- 大規模言語モデル(LLMs): 従来のLLMはユニモーダルで、テキストのみで学習されます。しかし業界は、画像とテキストをネイティブに処理できる「大規模マルチモーダルモデル(LMMs)」へと移行しつつあり、この傾向はPyTorchやTensorFlowなどのフレームワークに支えられています。
今後の展望#
マルチモーダル学習の進展は、汎用人工知能(AGI)の特性を備えたシステムへと向かっています。言語を視覚的および物理的な現実にうまく結び付けることで、これらのモデルは統計的な相関を超え、真の推論へと移行しつつあります。MIT CSAILやStanford Center for Research on Foundation Modelsなどの機関による研究は、機械が複雑で多感覚的な環境を認識し、そこに働きかける方法の限界を引き続き押し広げています。
Ultralyticsでは、これらの進歩をUltralytics Platformに統合し、ユーザーがデータを管理し、モデルを学習させ、利用可能なモダリティの全領域を活用するソリューションをデプロイできるようにしています。そこには、YOLO26の高速性からオープンボキャブラリー検出の汎用性までが含まれます。









