Ultralytics YOLO27:
Ultralytics用語集に戻る

Multi-Modal Model

マルチモーダルモデルがテキスト、画像、音声を統合する方法を確認します。Ultralytics YOLO26のようなアーキテクチャについて学び、Ultralytics PlatformにビジョンAIをデプロイします。

マルチモーダルモデルとは、複数の異なるデータタイプ、すなわち「モダリティ」からの情報を同時に処理、解釈、統合できる高度な人工知能 (AI)システムです。従来の単一モーダルシステムは、テキストを扱う自然言語処理 (NLP)や画像を扱うコンピュータービジョン (CV)など、単一の領域に特化していました。一方、マルチモーダルモデルは、視覚、聴覚、言語の手がかりを組み合わせることで、人間の知覚を模倣することを目指しています。この融合により、モデルは世界を包括的に理解し、視覚的なシーンと音声による説明の間にある複雑な相関関係を導き出せるようになります。これらの能力は、汎用人工知能 (AGI)の実現に向けた基盤となる重要なステップと考えられています。

主要なメカニズムとアーキテクチャ#

マルチモーダルモデルの有効性は、多様なデータタイプを共有されたセマンティック空間にマッピングする能力に依存します。このプロセスは通常、入力データの本質的な意味を捉えた数値表現である埋め込みの作成から始まります。字幕付き動画など、ペアになったサンプルで構成される大規模なデータセットを使って学習することで、モデルは「猫」の画像のベクトル表現と、「cat」という単語のテキスト埋め込みを対応付ける方法を学習します。

この統合を可能にする主要なアーキテクチャ概念には、次のようなものがあります。

  • Transformerアーキテクチャ: 多くのマルチモーダルシステムは、アテンションメカニズムを使用して異なる入力部分の重要度を動的に重み付けするTransformerを採用しています。これにより、モデルはテキストプロンプト内の関連する単語に対応する特定の画像領域に注目できます。この概念は、画期的な研究論文「Attention Is All You Need」で詳しく説明されています。
  • データフュージョン: これは、異なるソースからの情報を組み合わせる戦略を指します。センサーフュージョンは、未加工データをマージする早期段階で行うことも、個別のサブモデルによる判断を組み合わせる後期段階で行うこともできます。PyTorchなどの最新のフレームワークは、こうした複雑なパイプラインを構築するために必要な柔軟性を提供します。
  • コントラスト学習: OpenAIのCLIPなどのモデルで使用される手法では、ベクトル空間において一致するテキストと画像のペア間の距離を最小化し、不一致のペア間の距離を最大化するようにシステムを学習させます。

実世界での利用例#

マルチモーダルモデルにより、単一モーダルシステムでは従来実現できなかった機能が可能になりました。

  • 視覚的質問応答 (VQA): これらのシステムでは、ユーザーが画像について自然言語で質問できます。たとえば、視覚障害のあるユーザーが食品庫の写真をアップロードし、「一番上の棚にスープの缶はありますか?」と尋ねることができます。モデルは物体検出を使用してアイテムを特定し、NLPで質問を理解して、役立つ回答を提供します。
  • 自動運転車: 自動運転車は、リアルタイムで動作するマルチモーダルエージェントとして機能します。カメラからの映像、LiDARからの深度情報、レーダーからの速度データを組み合わせます。この冗長性により、1つのセンサーが天候によって遮られた場合でも、他のセンサーが道路の安全性を維持できます。
  • オープンボキャブラリー検出: Ultralytics YOLO-Worldなどのモデルでは、固定されたクラス一覧ではなく、任意のテキストプロンプトを使用して物体を検出できます。これにより、言語による指示と視覚認識の間のギャップを埋めることができます。

例: オープンボキャブラリー検出#

次の例では、ultralyticsライブラリを使用してオープンボキャブラリー検出を実行する方法を示します。この検出では、モデルがテキストプロンプトを解釈して画像内の物体を特定します。

from ultralytics import YOLOWorld

# Load a pre-trained YOLO-World model capable of vision-language understanding
model = YOLOWorld("yolov8s-world.pt")

# Define custom classes using natural language text prompts
model.set_classes(["person wearing a hat", "blue backpack"])

# Run inference: The model aligns text prompts with visual features
results = model.predict("https://ultralytics.com/images/bus.jpg")

# Visualize the detection results
results[0].show()

関連用語との違い#

AI用語集における関連概念と「マルチモーダルモデル」を区別すると理解しやすくなります。

  • マルチモーダル学習: これは、これらのシステムの学習に使用されるプロセス機械学習 (ML)手法を指します。マルチモーダルモデルは、その学習プロセスから生まれる成果物またはソフトウェア製品です。
  • 大規模言語モデル (LLMs): 従来のLLMはテキストのみを処理します。多くのモデルが視覚言語モデル(VLMs)へと進化していますが、標準的なLLMは単一モーダルです。
  • 基盤モデル: これは、さまざまな下流タスクに適応できる大規模モデルを表す、より広いカテゴリーです。マルチモーダルモデルは基盤モデルであることが多い一方、すべての基盤モデルが複数のモダリティを扱えるわけではありません。

マルチモーダルAIの未来#

この分野では、音声、動画、テキストの連続的なストリームをリアルタイムで処理できるシステムに向けて、急速に進歩しています。Google DeepMindなどの組織による研究は、機械知覚の限界を引き続き押し広げています。Ultralyticsでは、YOLO26などの高性能なビジョンバックボーンによって、このエコシステムをサポートしています。2026年にリリースされたYOLO26は、インスタンスセグメンテーションなどのタスクにおいて優れた速度と精度を提供し、より大規模なマルチモーダルパイプラインで効率的な視覚コンポーネントとして機能します。開発者は、統合されたUltralytics Platformを使用して、これらの複雑なワークフローのデータ、学習、デプロイを管理できます。

Explore solutions

航空画像向けコンピュータービジョン

航空画像向けコンピュータービジョン

Ultralytics YOLOを使用して、ドローンや航空画像から農業、水産業、環境モニタリング、保全、地理空間分析向けのリアルタイムなインサイトを生成します。
詳細を見る
航空宇宙におけるコンピュータビジョン

航空宇宙におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、ビジョンAIを空中モニタリングに導入します。コンピュータビジョンソリューションで、ドローン、航空宇宙ワークフロー、環境保護、および地理空間産業を強力にサポートします。
詳細を見る

Ultralytics YOLOモデルであらゆるサイトを保護します。ビジョンAIは、境界モニタリング、脅威検出、ナンバープレート認識、職場安全をサポートします。
詳細を見る
ロボティクスのコンピュータービジョン

ロボティクスのコンピュータービジョン

Ultralytics YOLOモデルで、よりスマートなマシンを実現します。ロボティクスのVision AIにより、自律ナビゲーション、認識、物体追跡、リアルタイム制御を実現します。
詳細を見る
物流のコンピュータービジョン

物流のコンピュータービジョン

Ultralytics YOLOモデルで物流を効率化します。Vision AIにより、荷物検査、仕分け、車両追跡、倉庫の安全性に関するリアルタイム監視を実現します。
詳細を見る
小売のコンピュータービジョン

小売のコンピュータービジョン

Ultralytics YOLOモデルで小売を再構築します。Vision AIにより、在庫追跡、棚監視、待ち行列管理、より高度な顧客インサイトを実現します。
詳細を見る
ヘルスケア向けコンピュータービジョン

ヘルスケア向けコンピュータービジョン

Ultralytics YOLOモデルでヘルスケアソリューションを構築しましょう。ヘルスケア向けVision AIは、医用画像処理の高速化、より高度な診断、患者モニタリングを実現します。
詳細を見る
製造業向けコンピュータービジョン

製造業向けコンピュータービジョン

Ultralytics YOLOモデルで製造業を最適化しましょう。Vision AIは、品質管理、欠陥検出、PPE遵守、組立ラインの自動化を推進します。
詳細を見る
自動車分野のコンピュータビジョン

自動車分野のコンピュータビジョン

Ultralytics YOLOモデルで自動車分野にコンピュータビジョンを適用します。ビジョンAIにより、道路の安全性、運転支援、車両自動化を向上させ、よりスマートな道路を実現します。
詳細を見る
農業分野のコンピュータビジョン

農業分野のコンピュータビジョン

Ultralytics YOLOモデルでスマート農業にビジョンAIを導入します。作物のモニタリング、家畜の追跡、精密農業を支援し、より高くスマートな収穫量を実現します。
詳細を見る
航空画像向けコンピュータービジョン

航空画像向けコンピュータービジョン

Ultralytics YOLOを使用して、ドローンや航空画像から農業、水産業、環境モニタリング、保全、地理空間分析向けのリアルタイムなインサイトを生成します。
詳細を見る
航空宇宙におけるコンピュータビジョン

航空宇宙におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、ビジョンAIを空中モニタリングに導入します。コンピュータビジョンソリューションで、ドローン、航空宇宙ワークフロー、環境保護、および地理空間産業を強力にサポートします。
詳細を見る

Ultralytics YOLOモデルであらゆるサイトを保護します。ビジョンAIは、境界モニタリング、脅威検出、ナンバープレート認識、職場安全をサポートします。
詳細を見る
ロボティクスのコンピュータービジョン

ロボティクスのコンピュータービジョン

Ultralytics YOLOモデルで、よりスマートなマシンを実現します。ロボティクスのVision AIにより、自律ナビゲーション、認識、物体追跡、リアルタイム制御を実現します。
詳細を見る
物流のコンピュータービジョン

物流のコンピュータービジョン

Ultralytics YOLOモデルで物流を効率化します。Vision AIにより、荷物検査、仕分け、車両追跡、倉庫の安全性に関するリアルタイム監視を実現します。
詳細を見る
小売のコンピュータービジョン

小売のコンピュータービジョン

Ultralytics YOLOモデルで小売を再構築します。Vision AIにより、在庫追跡、棚監視、待ち行列管理、より高度な顧客インサイトを実現します。
詳細を見る
ヘルスケア向けコンピュータービジョン

ヘルスケア向けコンピュータービジョン

Ultralytics YOLOモデルでヘルスケアソリューションを構築しましょう。ヘルスケア向けVision AIは、医用画像処理の高速化、より高度な診断、患者モニタリングを実現します。
詳細を見る
製造業向けコンピュータービジョン

製造業向けコンピュータービジョン

Ultralytics YOLOモデルで製造業を最適化しましょう。Vision AIは、品質管理、欠陥検出、PPE遵守、組立ラインの自動化を推進します。
詳細を見る
自動車分野のコンピュータビジョン

自動車分野のコンピュータビジョン

Ultralytics YOLOモデルで自動車分野にコンピュータビジョンを適用します。ビジョンAIにより、道路の安全性、運転支援、車両自動化を向上させ、よりスマートな道路を実現します。
詳細を見る
農業分野のコンピュータビジョン

農業分野のコンピュータビジョン

Ultralytics YOLOモデルでスマート農業にビジョンAIを導入します。作物のモニタリング、家畜の追跡、精密農業を支援し、より高くスマートな収穫量を実現します。
詳細を見る
航空画像向けコンピュータービジョン

航空画像向けコンピュータービジョン

Ultralytics YOLOを使用して、ドローンや航空画像から農業、水産業、環境モニタリング、保全、地理空間分析向けのリアルタイムなインサイトを生成します。
詳細を見る
航空宇宙におけるコンピュータビジョン

航空宇宙におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、ビジョンAIを空中モニタリングに導入します。コンピュータビジョンソリューションで、ドローン、航空宇宙ワークフロー、環境保護、および地理空間産業を強力にサポートします。
詳細を見る

Ultralytics YOLOモデルであらゆるサイトを保護します。ビジョンAIは、境界モニタリング、脅威検出、ナンバープレート認識、職場安全をサポートします。
詳細を見る
ロボティクスのコンピュータービジョン

ロボティクスのコンピュータービジョン

Ultralytics YOLOモデルで、よりスマートなマシンを実現します。ロボティクスのVision AIにより、自律ナビゲーション、認識、物体追跡、リアルタイム制御を実現します。
詳細を見る
物流のコンピュータービジョン

物流のコンピュータービジョン

Ultralytics YOLOモデルで物流を効率化します。Vision AIにより、荷物検査、仕分け、車両追跡、倉庫の安全性に関するリアルタイム監視を実現します。
詳細を見る
小売のコンピュータービジョン

小売のコンピュータービジョン

Ultralytics YOLOモデルで小売を再構築します。Vision AIにより、在庫追跡、棚監視、待ち行列管理、より高度な顧客インサイトを実現します。
詳細を見る
ヘルスケア向けコンピュータービジョン

ヘルスケア向けコンピュータービジョン

Ultralytics YOLOモデルでヘルスケアソリューションを構築しましょう。ヘルスケア向けVision AIは、医用画像処理の高速化、より高度な診断、患者モニタリングを実現します。
詳細を見る
製造業向けコンピュータービジョン

製造業向けコンピュータービジョン

Ultralytics YOLOモデルで製造業を最適化しましょう。Vision AIは、品質管理、欠陥検出、PPE遵守、組立ラインの自動化を推進します。
詳細を見る
自動車分野のコンピュータビジョン

自動車分野のコンピュータビジョン

Ultralytics YOLOモデルで自動車分野にコンピュータビジョンを適用します。ビジョンAIにより、道路の安全性、運転支援、車両自動化を向上させ、よりスマートな道路を実現します。
詳細を見る
農業分野のコンピュータビジョン

農業分野のコンピュータビジョン

Ultralytics YOLOモデルでスマート農業にビジョンAIを導入します。作物のモニタリング、家畜の追跡、精密農業を支援し、より高くスマートな収穫量を実現します。
詳細を見る

AIの未来を一緒に築きましょう!

機械学習の未来への歩みを始めましょう