Multimodal RAG
テキスト、画像、ビデオを処理するマルチモーダル RAG を探ります。より正確でコンテキストを認識した応答のために、Ultralytics YOLO26 がどのように AI 検索パイプラインを強化するかを学びましょう。
マルチモーダル検索拡張生成(Multimodal RAG)は、テキスト、画像、動画、音声などの多様なデータタイプを処理および推論できるように従来のRAGシステムを拡張した、高度な 人工知能(AI) フレームワークです。標準的な 検索拡張生成(RAG) が関連するテキストドキュメントを検索して 大規模言語モデル(LLM) の精度を向上させるのに対し、Multimodal RAGは混在メディアのナレッジベースからコンテキストを検索することで、モデルが「見て」「聞く」ことを可能にします。このアプローチにより、モデルの生成内容が具体的な視覚的・聴覚的証拠に基づいたものになり、LLMにおけるハルシネーション が大幅に削減され、プライベートデータセットに対する視覚的質問応答などの複雑なタスクが可能になります。マルチモーダル学習 を活用することで、これらのシステムはユーザーのクエリ(テキストなど)と検索されたアセット(図や監視カメラのフレームなど)からの情報を統合し、包括的でコンテキストを認識した応答を生成できます。
マルチモーダルRAGの仕組み#
Multimodal RAGシステムのアーキテクチャは通常、標準的な「検索してから生成する(Retrieve-then-Generate)」パイプラインを模していますが、非テキストデータ向けに適応されています。このプロセスは、ベクターデータベース と共有セマンティック空間に大きく依存しています。
-
インデックス作成: PDF、動画、スライドデッキなどのさまざまなソースからのデータが処理されます。特徴量抽出 モデルは、これらの異なるモダリティを 埋め込み(embeddings) と呼ばれる高次元の数値ベクトルに変換します。たとえば、OpenAIのCLIP のようなモデルは、犬の写真と「dog」という単語が数学的に近くなるように、画像とテキストの埋め込みを調整します。
-
検索: ユーザーが質問を投げかけると(例:「この回路基板の欠陥を見せてください」)、システムはベクターデータベース全体で セマンティック検索 を実行し、クエリの意図に最も一致する関連性の高い画像や動画クリップを見つけます。
-
生成: 取得された視覚的コンテキストが ビジョン言語モデル(VLM) に入力されます。VLMは、ユーザーのテキストプロンプトと取得された画像特徴量の両方を処理して最終的な回答を生成し、データと効果的に「チャット」します。
実社会での応用#
Multimodal RAGは、AIエージェント が視覚データを介して物理世界と対話できるようにすることで、産業を変革しています。
- 産業用メンテナンスと製造: 製造業におけるAI において、技術者は故障した機械部品の写真を使用してシステムにクエリを送信できます。Multimodal RAGシステムは、同様の過去のメンテナンスログ、技術図面、および動画チュートリアルを検索して、修理プロセスをガイドします。これにより、ダウンタイムが短縮され、専門知識が民主化されます。
- 小売およびEコマースの発見: 小売業におけるAI を使用したアプリケーションにより、顧客は気に入った服装の画像をアップロードできます。システムは現在の在庫から視覚的に類似したアイテムを検索し、スタイリングのアドバイスや製品比較を生成することで、高度にパーソナライズされたショッピング体験を生み出します。
関連用語の区別#
マルチモーダルRAGの特定のニッチを理解するために、関連する概念と区別することが役立ちます。
- Multimodal RAGと マルチモーダルモデル の違い: マルチモーダルモデル(GPT-4oやGeminiなど)は応答を作成します。Multimodal RAGは、そのモデルが学習していない外部のプライベートデータ(画像やドキュメントなど)をモデルに供給する アーキテクチャ です。モデルはエンジンであり、RAGは燃料パイプラインです。
- Multimodal RAGと ファインチューニング の違い: ファインチューニングは、モデルの重み を永続的に更新して、新しいタスクやスタイルを学習します。RAGは推論時に一時的な知識を提供します。頻繁な再学習が実用的ではない動的データ(日次在庫など)には、RAGが好まれます。
Ultralyticsによる実装#
開発者は、Ultralytics YOLO を使用してMultimodal RAGパイプラインの検索コンポーネントを構築できます。YOLOは画像内のオブジェクトを検出し分類することで、テキストベースの検索用にインデックス付けできる構造化メタデータを提供するか、VLM用の関連画像領域を切り出すために使用できます。Ultralyticsプラットフォーム は、特定のドメインに不可欠なカスタムオブジェクトを認識するようにこれらの特殊なビジョンモデルのトレーニングを簡素化します。
次の例は、YOLO26 を使用して画像から視覚的コンテキスト(検出されたオブジェクト)を抽出し、RAGワークフローの一部としてLLMに渡す方法を示しています。
from ultralytics import YOLO
# Load the YOLO26 model (smaller, faster, and more accurate)
model = YOLO("yolo26n.pt")
# Run inference on an image to 'retrieve' visual content
results = model("https://ultralytics.com/images/bus.jpg")
# Extract detected class names to form a text context
detected_objects = results[0].boxes.cls.tolist()
object_names = [model.names[int(cls)] for cls in detected_objects]
print(f"Retrieved Context: Image contains {', '.join(object_names)}")
# Output: Retrieved Context: Image contains bus, person, person, person詳細な読み物とリソース#
- LangChainドキュメント: マルチモーダルサポートを含む、検索パイプライン構築のための包括的なガイド。
- LlamaIndexマルチモーダルガイド: LLM向けの複雑なデータタイプのインデックス作成と検索に関する詳細なドキュメント。
- Google Cloud Vertex AI検索: スケーラブルなRAGアプリケーションを構築するためのエンタープライズグレードのベクトル検索機能。
- Ultralyticsソリューション: さまざまな産業にわたってコンピュータビジョンがより広範なAIシステムとどのように統合されるかをご確認ください。






