Multimodal AI
マルチモーダル AI がコンテキストを認識した理解のためにテキストとビジョンをどのように統合するかを探ります。今すぐ Ultralytics YOLO26 とオープンボキャブラリーモデルを使用する方法を学びましょう。
マルチモーダルAIとは、複数の異なるタイプのデータ(「モダリティ」)からの情報を同時に処理、解釈、統合するように設計された、洗練された人工知能(AI)システムの一種を指します。テキスト用の自然言語処理(NLP)や画像用のコンピュータビジョン(CV)など、単一の入力ソースに特化した従来の単一モダリティシステムとは異なり、マルチモーダルAIは多様なデータストリームを統合することで人間の知覚を模倣します。この統合には、視覚データ(画像、動画)と、言語データ(テキスト、音声)およびセンサー情報(LiDAR、レーダー、サーマル)の組み合わせが含まれます。これら統合された入力を活用することで、これらのモデルは複雑な現実世界のシナリオに対するより深く、文脈を意識した理解を実現し、汎用人工知能(AGI)の幅広い能力に近づいています。
マルチモーダルシステムの仕組み#
マルチモーダルAIの核心的な強みは、異なるデータ型を比較・結合できる共通の数学的空間にマッピングする能力にあります。このプロセスは一般的に、エンコーディング、アライメント、フュージョンの3つの主要な段階で行われます。
-
特徴抽出: 特殊なニューラルネットワークが各モダリティを独立して処理し、主要なパターンを特定します。たとえば、畳み込みニューラルネットワーク(CNN)が写真から視覚的特徴を抽出し、一方でTransformerが付随するキャプションを処理するといった具合です。
-
アライメントと埋め込み: 抽出された特徴は高次元の数値ベクトルに変換されます。モデルは、意味的に似た概念(例:猫の画像とテキストの単語「猫」)がベクトル空間内で互いに近くに位置するように、これらのベクトルをアライメントすることを学習します。これは多くの場合、対照学習のような手法を通じて実現され、これはOpenAIのCLIPなどのモデルで広く知られている手法です。
-
データフュージョン: システムは、高度なフュージョン手法を使用してアライメントされたデータをマージします。現代のアーキテクチャでは、注意機構を使用して、文脈に応じて一方のモダリティの重要性を動的に重み付けし、画像が曖昧な場合にはテキストに焦点を当てる、あるいはその逆を行うことを可能にしています。
実社会での応用#
マルチモーダルAIは、単一モーダルシステムでは不可能だった能力を実現し、さまざまな業界でイノベーションを促進しています。
- ビジュアル質問応答(VQA): このアプリケーションでは、ユーザーがAIに画像を提示し、それについての自然言語の質問をすることができます。たとえば、視覚障がいのあるユーザーがパントリーの写真をアップロードして、「パスタは残っていますか?」と尋ねる場合があります。モデルは視覚コンテンツとテキストクエリを処理して、具体的な回答を提供します。
- 自動運転車: 自動運転車はマルチモーダル入力に大きく依存しており、カメラ、LiDARポイントクラウド、レーダーからのデータを組み合わせて安全に走行します。この冗長性により、1つのセンサーが故障した場合でも(例:太陽の眩しさでカメラが機能しなくなった場合)、他のセンサーが自動車技術者協会(SAE)によって定義された安全基準を維持できるようになります。
- 医療診断: 高度な医療AIシステムは、構造化されていないテキストによる患者の病歴や遺伝子データとともに、医療画像解析(MRIやX線など)を分析します。この包括的な視点により、医師はより正確な診断を下すことができ、これはNature Digital Medicineでも頻繁に議論されているトピックです。
- 生成AI: Stable Diffusion などのテキストプロンプトから画像を生成するツールは、言語記述と視覚的テクスチャの関係を理解するモデルの能力に完全に依存しています。
Ultralyticsによるオープンボキャブラリー検出#
標準的な物体検出器は事前定義されたカテゴリのリストに依存しますが、YOLO-Worldのようなマルチモーダルアプローチでは、ユーザーがオープンボキャブラリーのテキストプロンプトを使用してオブジェクトを検出できます。これにより、Ultralyticsエコシステム内での言語コマンドと視覚認識の間のギャップが埋められます。
次の例は、ultralyticsライブラリを使用してオープンボキャブラリー検出を実行する方法を示しています。ここでは、モデルがカスタムテキスト入力に基づいてオブジェクトを検出します。
from ultralytics import YOLOWorld
# Load a pretrained YOLO-World model (Multimodal: Text + Vision)
model = YOLOWorld("yolov8s-world.pt")
# Define custom text prompts (modalities) for the model to identify
model.set_classes(["person wearing a red hat", "blue backpack"])
# Run inference: The model aligns the text prompts with visual features
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Show the results
results[0].show()関連用語の区別#
現代の機械学習の状況を理解するには、「マルチモーダルAI」を関連概念と区別することが役立ちます。
- マルチモーダル学習: これは、混合データ型でアルゴリズムをトレーニングする学術的な分野と方法論を指します。「マルチモーダルAI」は一般的に、実用的なアプリケーションまたは結果として得られるシステム自体を指します。
- 大規模言語モデル(LLMs): 従来のLLMsは単一モダリティであり、テキストデータのみでトレーニングされています。しかし、業界は、PyTorchやTensorFlowなどのフレームワークによってサポートされるトレンドである、画像とテキストをネイティブに処理できる「大規模マルチモーダルモデル」(LMMs)へと移行しつつあります。
- 特殊なビジョンモデル: 最先端のUltralytics YOLO26のようなモデルは、視覚タスクにおける高度に特化したエキスパートです。一般的なマルチモーダルモデルがシーンを大まかに説明する一方で、特殊なモデルは、エッジハードウェアでの高速で精密な物体検出とリアルタイム処理に優れています。
今後の展望#
マルチモーダルAIの軌跡は、より優れた推論能力を備えたシステムへと向かっています。言語を視覚的および物理的な現実にうまく根付かせることで、これらのモデルは統計的な相関関係を超えて、真の理解へと進んでいます。Google DeepMindやスタンフォード基礎モデル研究センターなどの機関からの研究は、機械が複雑な環境をどのように認識するかの境界を押し広げ続けています。
Ultralyticsでは、これらの進歩をUltralytics Platformに統合し、ユーザーがデータの管理、モデルのトレーニング、および利用可能なすべてのモダリティの全スペクトルを活用するソリューションのデプロイを行えるようにしています。これにより、YOLO26のスピードとマルチモーダル入力を組み合わせた汎用性が実現します。






