Multimodal AI
マルチモーダルAIと、テキストとビジョンを統合してコンテキストを考慮した理解を実現する方法を確認します。Ultralytics YOLO26とオープンボキャブラリーモデルの使用方法を学びます。
マルチモーダルAIとは、複数の異なる種類のデータ、つまり「モダリティ」から情報を同時に処理、解釈、統合するよう設計された高度な人工知能(AI)システムを指します。テキストを扱う自然言語処理(NLP)や画像を扱うコンピュータービジョン(CV)のように単一の入力ソースに特化した従来のユニモーダルシステムとは異なり、マルチモーダルAIは多様なデータストリームを統合することで、人間の知覚を模倣します。この統合には、視覚データ(画像、動画)と言語データ(テキスト、音声)、さらにセンサー情報(LiDAR、レーダー、サーマルデータ)を組み合わせることが含まれます。これらの入力を組み合わせることで、モデルは複雑な現実世界の状況をより深く、文脈を踏まえて理解できるようになり、汎用人工知能(AGI)の幅広い能力に近づいていきます。
マルチモーダルシステムの仕組み#
マルチモーダルAIの中核的な強みは、異なるデータタイプを、比較や統合が可能な共有の数学的空間にマッピングできることです。このプロセスは通常、エンコーディング、アラインメント、フュージョンという3つの主要な段階で構成されます。
-
特徴抽出: 専用のニューラルネットワークが各モダリティを個別に処理し、主要なパターンを識別します。たとえば、畳み込みニューラルネットワーク(CNN)が写真から視覚的特徴を抽出する一方で、Transformerが付随するキャプションを処理します。
-
アラインメントと埋め込み: 抽出された特徴は、高次元の数値ベクトルに変換されます。モデルは、意味的に類似した概念(たとえば、猫の画像とテキスト中の「猫」という単語)がベクトル空間内で近くに位置するよう、これらのベクトルを整列させる方法を学習します。これは、コントラスト学習などの手法によって実現されることが多く、OpenAIのCLIPなどのモデルで広く活用されています。
-
データフュージョン: システムは、高度なフュージョン手法を使用して、整列されたデータを統合します。最新のアーキテクチャでは、アテンションメカニズムを使用して、文脈に応じて一方のモダリティの重要度を別のモダリティより動的に高く評価します。これにより、画像が曖昧な場合はモデルがテキストに集中し、その逆も可能になります。
実世界での利用例#
マルチモーダルAIは、単一モダリティのシステムでは従来不可能だった能力を実現し、さまざまな業界のイノベーションを促進しています。
- 視覚質問応答(VQA): このアプリケーションでは、ユーザーがAIに画像を提示し、その画像について自然言語で質問できます。たとえば、視覚障害のあるユーザーが食料庫の写真をアップロードして、「パスタはまだ残っていますか?」と尋ねることができます。モデルは視覚的な内容とテキストによる質問を処理し、具体的な回答を提供します。
- 自動運転車: 自動運転車はマルチモーダル入力に大きく依存しており、カメラ、LiDARの点群、レーダーからのデータを組み合わせて安全に走行します。この冗長性により、1つのセンサーが故障した場合(たとえば、太陽光のまぶしさでカメラが正常に機能しない場合)でも、他のセンサーが自動車技術者協会(SAE)によって定められた安全基準を維持できます。
- 医療診断: 高度な医療AIシステムは、医用画像解析(MRIやX線など)を、構造化されていない患者の病歴テキストや遺伝子データと併せて分析します。この包括的な視点は、医師がより正確な診断を行うのに役立ちます。このテーマはネイチャー・デジタル・メディシンでも頻繁に取り上げられています。
- 生成AI: Stable Diffusionなど、テキストプロンプトから画像を生成するツールは、言語による説明と視覚的なテクスチャの関係をモデルが理解する能力に全面的に依存しています。
Ultralyticsによるオープンボキャブラリー検出#
標準的な物体検出器があらかじめ定義されたカテゴリーのリストに依存するのに対し、YOLO-Worldのようなマルチモーダルアプローチでは、オープンボキャブラリーのテキストプロンプトを使用してオブジェクトを検出できます。これにより、Ultralyticsエコシステム内で言語による指示と視覚認識の間のギャップが埋められます。
次の例では、ultralyticsライブラリを使用してオープンボキャブラリー検出を実行する方法を示します。この検出では、モデルがカスタムテキスト入力に基づいてオブジェクトを検出します。
from ultralytics import YOLOWorld
# Load a pretrained YOLO-World model (Multimodal: Text + Vision)
model = YOLOWorld("yolov8s-world.pt")
# Define custom text prompts (modalities) for the model to identify
model.set_classes(["person wearing a red hat", "blue backpack"])
# Run inference: The model aligns the text prompts with visual features
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Show the results
results[0].show()関連用語との違い#
現代の機械学習の全体像を把握するには、「マルチモーダルAI」と関連する概念を区別すると役立ちます。
- マルチモーダル学習: これは、異なるデータタイプを組み合わせてアルゴリズムをトレーニングする学術分野および方法論を指します。「マルチモーダルAI」は通常、実際のアプリケーションまたはその結果として得られるシステム自体を指します。
- 大規模言語モデル(LLMs): 従来のLLMsはユニモーダルで、テキストデータのみを使ってトレーニングされています。しかし、業界では現在、画像とテキストをネイティブに処理できる「大規模マルチモーダルモデル」(LMMs)へと移行が進んでおり、PyTorchやTensorFlowなどのフレームワークがこの流れを支えています。
- 特殊用途のビジョンモデル: 最先端のUltralytics YOLO26のようなモデルは、視覚タスクに特化した高度なエキスパートです。汎用的なマルチモーダルモデルがシーンを大まかに説明するのに対し、特殊用途のモデルは、高速かつ高精度な物体検出とエッジハードウェア上でのリアルタイム処理に優れています。
今後の展望#
マルチモーダルAIの進展は、より高度な推論能力を備えたシステムへと向かっています。言語を視覚的および物理的な現実に適切に結び付けることで、これらのモデルは統計的な相関を超え、真の理解へと近づいています。Google DeepMindやStanford Center for Research on Foundation Modelsなどの研究機関による研究は、機械が複雑な環境をどのように認識するかの限界を押し広げ続けています。
Ultralyticsでは、これらの進歩をUltralytics Platformに統合し、利用可能なモダリティの全範囲を活用するソリューションのデータ管理、モデルのトレーニング、デプロイをユーザーが行えるようにしています。これにより、YOLO26の速度とマルチモーダル入力の柔軟性を組み合わせることができます。









