Ultralytics YOLO27:
Ultralytics用語集に戻る

Multi-Modal Learning

AIにおけるマルチモーダル学習を確認します。テキスト、画像、音声を統合して、Ultralytics YOLO26やYOLO-Worldのような堅牢なモデルを実現する方法を学びます。詳しくはこちらをご覧ください。

マルチモーダル学習は、人工知能(AI)における高度なアプローチであり、複数の異なる種類のデータ、つまり「モダリティ」から情報を処理、理解、関連付けるようにアルゴリズムを学習させます。翻訳におけるテキストや画像認識におけるピクセルなど、単一の入力タイプに特化する従来のシステムとは異なり、マルチモーダル学習は、視覚データ、音声、テキストによる説明、センサーの測定値など、多様な感覚入力を統合することで人間の認知を模倣します。この包括的なアプローチにより、機械学習(ML)モデルは、世界をより深く、コンテキストを考慮して理解できるようになり、より堅牢で多用途な予測につながります。

マルチモーダル学習の仕組み#

マルチモーダル学習における中心的な課題は、異なるデータタイプを、比較および統合できる共通の数学的空間へ変換することです。このプロセスは一般に、エンコーディング、アライメント、フュージョンという3つの主要な段階で構成されます。

  1. 特徴抽出: 特化したニューラルネットワークが各モダリティを個別に処理します。たとえば、畳み込みニューラルネットワーク(CNNs)ビジョンTransformer(ViTs)は画像から特徴を抽出し、リカレントニューラルネットワーク(RNNs)やTransformerはテキストを処理します。

  2. 埋め込みのアライメント: モデルは、これらの多様な特徴を共通の高次元ベクトルへマッピングする方法を学習します。この共通空間では、「猫」という単語のベクトルと猫の画像のベクトルが近づけられます。OpenAIのCLIPなどの論文によって広く知られるようになったコントラスト学習のような手法が、ここで重要な役割を果たします。

  3. データフュージョン: 最後に、情報を統合してタスクを実行します。フュージョンは、初期段階(生データの統合)、後段(最終予測の統合)、またはアテンションメカニズムを使用して各モダリティの重要度を動的に重み付けする中間的なハイブリッド手法によって実行できます。

実世界での利用例#

マルチモーダル学習は、今日の最も印象的なAIの進歩の多くを支える原動力であり、異なるデータサイロの間の隔たりを埋めて複雑な問題を解決します。

  • 画像質問応答(VQA): このアプリケーションでは、システムが画像を分析し、「信号機は何色ですか?」のような画像に関する自然言語の質問に回答する必要があります。これには、モデルがテキストの意味を理解し、コンピュータビジョンを使用して対応する視覚要素の空間的位置を特定することが求められます。
  • 自動運転車: 自動運転車はセンサーフュージョンに大きく依存しており、LiDARの点群、カメラ映像、レーダーからのデータを組み合わせて安全に走行します。このマルチモーダル入力により、1つのセンサーが故障した場合(たとえば、カメラが太陽光のまぶしさで視界を失った場合)でも、他のセンサーが道路の安全を維持できます。
  • 医療診断: 医療分野のAIは、医用画像解析(MRIやX線など)を、構造化されていない患者の病歴テキストや遺伝データと併せて分析することで、マルチモーダル学習を活用します。この包括的な視点は、医師がより正確な診断を下すのに役立ちます。このテーマは、Nature Digital Medicineの各誌でも頻繁に取り上げられています。
  • 生成AI: Stable Diffusionなど、テキストプロンプトから画像を生成するツールは、言語による説明と視覚的なテクスチャの関係をモデルが理解する能力に全面的に依存しています。

Ultralyticsによるマルチモーダル物体検出#

標準的な物体検出器があらかじめ定義されたクラスに依存するのに対し、YOLO-Worldのようなマルチモーダルアプローチでは、オープンボキャブラリーのテキストプロンプトを使用して物体を検出できます。これは、Ultralyticsエコシステム内でテキストの概念と視覚的特徴を結び付けることの威力を示しています。

次のPythonコードスニペットは、事前学習済みのYOLO-Worldモデルを使用して、カスタムテキスト入力に基づいて物体を検出する方法を示しています。

from ultralytics import YOLOWorld

# Load a pretrained YOLO-World model (Multi-Modal: Text + Vision)
model = YOLOWorld("yolov8s-world.pt")

# Define custom text prompts (modalities) for the model to identify
model.set_classes(["person", "bus", "traffic light"])

# Run inference: The model aligns the text prompts with visual features
results = model.predict("https://ultralytics.com/images/bus.jpg")

# Show the results
results[0].show()

主要用語の違い#

現代のAIの全体像を把握するには、「マルチモーダル学習」と関連概念を区別すると役立ちます。

  • マルチモーダルモデル: 「マルチモーダル学習」は、方法論および研究分野を指します。一方、「マルチモーダルモデル」(GPT-4やGoogleのGeminiなど)は、その学習プロセスによって生み出される具体的な成果物またはソフトウェア製品です。
  • ユニモーダルAI: 従来のコンピュータビジョンは一般にユニモーダルであり、視覚データだけに焦点を当てます。Ultralytics YOLO26のようなモデルは物体検出用の最先端CVツールですが、通常は、より大規模なマルチモーダルパイプラインの一部でない限り、視覚入力だけで動作します。
  • 大規模言語モデル(LLMs): 従来のLLMはユニモーダルで、テキストのみで学習されます。しかし業界は、画像とテキストをネイティブに処理できる「大規模マルチモーダルモデル(LMMs)」へと移行しつつあり、この傾向はPyTorchTensorFlowなどのフレームワークに支えられています。

今後の展望#

マルチモーダル学習の進展は、汎用人工知能(AGI)の特性を備えたシステムへと向かっています。言語を視覚的および物理的な現実にうまく結び付けることで、これらのモデルは統計的な相関を超え、真の推論へと移行しつつあります。MIT CSAILStanford Center for Research on Foundation Modelsなどの機関による研究は、機械が複雑で多感覚的な環境を認識し、そこに働きかける方法の限界を引き続き押し広げています。

Ultralyticsでは、これらの進歩をUltralytics Platformに統合し、ユーザーがデータを管理し、モデルを学習させ、利用可能なモダリティの全領域を活用するソリューションをデプロイできるようにしています。そこには、YOLO26の高速性からオープンボキャブラリー検出の汎用性までが含まれます。

Explore solutions

航空画像向けコンピュータービジョン

航空画像向けコンピュータービジョン

Ultralytics YOLOを使用して、ドローンや航空画像から農業、水産業、環境モニタリング、保全、地理空間分析向けのリアルタイムなインサイトを生成します。
詳細を見る
航空宇宙におけるコンピュータビジョン

航空宇宙におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、ビジョンAIを空中モニタリングに導入します。コンピュータビジョンソリューションで、ドローン、航空宇宙ワークフロー、環境保護、および地理空間産業を強力にサポートします。
詳細を見る

Ultralytics YOLOモデルであらゆるサイトを保護します。ビジョンAIは、境界モニタリング、脅威検出、ナンバープレート認識、職場安全をサポートします。
詳細を見る
ロボティクスのコンピュータービジョン

ロボティクスのコンピュータービジョン

Ultralytics YOLOモデルで、よりスマートなマシンを実現します。ロボティクスのVision AIにより、自律ナビゲーション、認識、物体追跡、リアルタイム制御を実現します。
詳細を見る
物流のコンピュータービジョン

物流のコンピュータービジョン

Ultralytics YOLOモデルで物流を効率化します。Vision AIにより、荷物検査、仕分け、車両追跡、倉庫の安全性に関するリアルタイム監視を実現します。
詳細を見る
小売のコンピュータービジョン

小売のコンピュータービジョン

Ultralytics YOLOモデルで小売を再構築します。Vision AIにより、在庫追跡、棚監視、待ち行列管理、より高度な顧客インサイトを実現します。
詳細を見る
ヘルスケア向けコンピュータービジョン

ヘルスケア向けコンピュータービジョン

Ultralytics YOLOモデルでヘルスケアソリューションを構築しましょう。ヘルスケア向けVision AIは、医用画像処理の高速化、より高度な診断、患者モニタリングを実現します。
詳細を見る
製造業向けコンピュータービジョン

製造業向けコンピュータービジョン

Ultralytics YOLOモデルで製造業を最適化しましょう。Vision AIは、品質管理、欠陥検出、PPE遵守、組立ラインの自動化を推進します。
詳細を見る
自動車分野のコンピュータビジョン

自動車分野のコンピュータビジョン

Ultralytics YOLOモデルで自動車分野にコンピュータビジョンを適用します。ビジョンAIにより、道路の安全性、運転支援、車両自動化を向上させ、よりスマートな道路を実現します。
詳細を見る
農業分野のコンピュータビジョン

農業分野のコンピュータビジョン

Ultralytics YOLOモデルでスマート農業にビジョンAIを導入します。作物のモニタリング、家畜の追跡、精密農業を支援し、より高くスマートな収穫量を実現します。
詳細を見る
航空画像向けコンピュータービジョン

航空画像向けコンピュータービジョン

Ultralytics YOLOを使用して、ドローンや航空画像から農業、水産業、環境モニタリング、保全、地理空間分析向けのリアルタイムなインサイトを生成します。
詳細を見る
航空宇宙におけるコンピュータビジョン

航空宇宙におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、ビジョンAIを空中モニタリングに導入します。コンピュータビジョンソリューションで、ドローン、航空宇宙ワークフロー、環境保護、および地理空間産業を強力にサポートします。
詳細を見る

Ultralytics YOLOモデルであらゆるサイトを保護します。ビジョンAIは、境界モニタリング、脅威検出、ナンバープレート認識、職場安全をサポートします。
詳細を見る
ロボティクスのコンピュータービジョン

ロボティクスのコンピュータービジョン

Ultralytics YOLOモデルで、よりスマートなマシンを実現します。ロボティクスのVision AIにより、自律ナビゲーション、認識、物体追跡、リアルタイム制御を実現します。
詳細を見る
物流のコンピュータービジョン

物流のコンピュータービジョン

Ultralytics YOLOモデルで物流を効率化します。Vision AIにより、荷物検査、仕分け、車両追跡、倉庫の安全性に関するリアルタイム監視を実現します。
詳細を見る
小売のコンピュータービジョン

小売のコンピュータービジョン

Ultralytics YOLOモデルで小売を再構築します。Vision AIにより、在庫追跡、棚監視、待ち行列管理、より高度な顧客インサイトを実現します。
詳細を見る
ヘルスケア向けコンピュータービジョン

ヘルスケア向けコンピュータービジョン

Ultralytics YOLOモデルでヘルスケアソリューションを構築しましょう。ヘルスケア向けVision AIは、医用画像処理の高速化、より高度な診断、患者モニタリングを実現します。
詳細を見る
製造業向けコンピュータービジョン

製造業向けコンピュータービジョン

Ultralytics YOLOモデルで製造業を最適化しましょう。Vision AIは、品質管理、欠陥検出、PPE遵守、組立ラインの自動化を推進します。
詳細を見る
自動車分野のコンピュータビジョン

自動車分野のコンピュータビジョン

Ultralytics YOLOモデルで自動車分野にコンピュータビジョンを適用します。ビジョンAIにより、道路の安全性、運転支援、車両自動化を向上させ、よりスマートな道路を実現します。
詳細を見る
農業分野のコンピュータビジョン

農業分野のコンピュータビジョン

Ultralytics YOLOモデルでスマート農業にビジョンAIを導入します。作物のモニタリング、家畜の追跡、精密農業を支援し、より高くスマートな収穫量を実現します。
詳細を見る
航空画像向けコンピュータービジョン

航空画像向けコンピュータービジョン

Ultralytics YOLOを使用して、ドローンや航空画像から農業、水産業、環境モニタリング、保全、地理空間分析向けのリアルタイムなインサイトを生成します。
詳細を見る
航空宇宙におけるコンピュータビジョン

航空宇宙におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、ビジョンAIを空中モニタリングに導入します。コンピュータビジョンソリューションで、ドローン、航空宇宙ワークフロー、環境保護、および地理空間産業を強力にサポートします。
詳細を見る

Ultralytics YOLOモデルであらゆるサイトを保護します。ビジョンAIは、境界モニタリング、脅威検出、ナンバープレート認識、職場安全をサポートします。
詳細を見る
ロボティクスのコンピュータービジョン

ロボティクスのコンピュータービジョン

Ultralytics YOLOモデルで、よりスマートなマシンを実現します。ロボティクスのVision AIにより、自律ナビゲーション、認識、物体追跡、リアルタイム制御を実現します。
詳細を見る
物流のコンピュータービジョン

物流のコンピュータービジョン

Ultralytics YOLOモデルで物流を効率化します。Vision AIにより、荷物検査、仕分け、車両追跡、倉庫の安全性に関するリアルタイム監視を実現します。
詳細を見る
小売のコンピュータービジョン

小売のコンピュータービジョン

Ultralytics YOLOモデルで小売を再構築します。Vision AIにより、在庫追跡、棚監視、待ち行列管理、より高度な顧客インサイトを実現します。
詳細を見る
ヘルスケア向けコンピュータービジョン

ヘルスケア向けコンピュータービジョン

Ultralytics YOLOモデルでヘルスケアソリューションを構築しましょう。ヘルスケア向けVision AIは、医用画像処理の高速化、より高度な診断、患者モニタリングを実現します。
詳細を見る
製造業向けコンピュータービジョン

製造業向けコンピュータービジョン

Ultralytics YOLOモデルで製造業を最適化しましょう。Vision AIは、品質管理、欠陥検出、PPE遵守、組立ラインの自動化を推進します。
詳細を見る
自動車分野のコンピュータビジョン

自動車分野のコンピュータビジョン

Ultralytics YOLOモデルで自動車分野にコンピュータビジョンを適用します。ビジョンAIにより、道路の安全性、運転支援、車両自動化を向上させ、よりスマートな道路を実現します。
詳細を見る
農業分野のコンピュータビジョン

農業分野のコンピュータビジョン

Ultralytics YOLOモデルでスマート農業にビジョンAIを導入します。作物のモニタリング、家畜の追跡、精密農業を支援し、より高くスマートな収穫量を実現します。
詳細を見る

AIの未来を一緒に築きましょう!

機械学習の未来への歩みを始めましょう