Vision Language Model (VLM)
UltralyticsでVision Language Model (VLM)を探求しましょう。コンピュータビジョンとLLMを橋渡しし、Ultralytics YOLO26を使用してVQAやオープンボキャブラリー検出を実現する方法を学びます。
ビジョン言語モデル(VLM)は、視覚情報(画像や動画)とテキスト情報の両方を同時に処理および解釈できる人工知能の1つです。ピクセルデータのみに焦点を当てる従来のcomputer visionモデルや、テキストのみを理解するLarge Language Models (LLMs)とは異なり、VLMはこれら2つのモダリティの架け橋となります。画像とテキストのペアを含む膨大なデータセットでトレーニングを行うことで、これらのモデルは視覚的特徴と言語的概念を関連付けることを学習し、画像の説明、視覚的シーンに関する質問への回答、さらには「見えている」ものに基づいたコマンドの実行を可能にします。
Vision Language Modelの仕組み#
その核心において、VLMは通常、ビジョンエンコーダーとテキストエンコーダーという2つの主要なコンポーネントで構成されています。ビジョンエンコーダーは画像を処理してfeature mapsと視覚的表現を抽出し、テキストエンコーダーは言語入力を処理します。その後、これらの異なるデータストリームは、cross-attentionなどのメカニズムを使用して融合され、共有埋め込み空間内で視覚情報とテキスト情報が整列されます。
2024年から2025年にかけての最近の進歩により、単一のTransformerバックボーンが両方のモダリティを処理する、より統合されたアーキテクチャへの移行が進んでいます。たとえば、Google PaliGemma 2のようなモデルは、これらのストリームを効果的に統合することが複雑な推論タスクでのパフォーマンスをどのように向上させることができるかを示しています。このアライメントにより、モデルはコンテキストを理解できるようになります。たとえば、「apple」という単語が食料品店の画像ではフルーツを指し、ロゴではテクノロジー企業を指すことを認識できるようになります。
実社会での応用#
視覚と言語の両方を通じて世界を理解する能力は、さまざまな業界で多様な応用を可能にします。
- ビジュアル質問応答(VQA): VLMは、放射線科医を支援するためにhealthcare diagnosticsで広く使用されています。医師がシステムに「このX線写真に骨折はありますか?」と尋ねると、モデルが医療画像を分析して初期評価を提供し、診断エラーを削減します。
- スマートEコマース検索: retail environmentsにおいて、VLMはユーザーが画像と組み合わせた自然言語の説明を使用して商品を検索できるようにします。購入者がセレブリティの服装の写真をアップロードし、「このパターンと同じで青いドレスを探して」と尋ねると、システムはsemantic searchを使用して正確な一致を取得します。
- 自動キャプションとアクセシビリティ: VLMは、ウェブ上の画像に対して説明的なalt textを自動的に生成し、スクリーンリーダーに依存する視覚障碍のあるユーザーにとってデジタルコンテンツをよりアクセシブルにします。
VLMと関連概念の違い#
VLMの特定の役割を理解するために、他のAIカテゴリーと区別することが役立ちます。
- VLMとLLMの比較: Large Language Model(テキストのみのバージョンのGPT-4など)は、テキストデータのみを処理します。クリエイティブなストーリーやコードを生成することはできますが、画像を見ることはできません。VLMは、LLMに実質的に目を与えます。
- VLMとオブジェクト検出の比較: 初期のエーラであるYOLOバージョンなどの従来のobject detectionモデルは、オブジェクトがどこにあり、どのクラスに属しているかを特定します(例:「Car: 99%」)。VLMはさらに一歩進んで、「消火器の隣に駐車している赤いスポーツカー」のように、関係性や属性を理解します。
- VLMとMultimodal AIの比較: Multimodal AIは、より包括的な上位概念の用語です。すべてのVLMはマルチモーダル(視覚と言語を組み合わせたもの)ですが、すべてのマルチモーダルモデルがVLMであるわけではありません。音声とテキスト(音声認識など)や、言語コンポーネントのない動画とセンサーデータを組み合わせるものもあります。
YOLOを用いたオープンボキャブラリー検出#
現代のVLMは「オープンボキャブラリー」検出を可能にし、事前に定義されたクラスではなく、自由形式のテキストプロンプトを使用してオブジェクトを検出できます。Ultralytics YOLO-Worldのようなモデルの主要な機能であり、再トレーニングなしで動的なクラス定義が可能になります。
次の例は、テキストによって記述された特定のオブジェクトを検出するために ultralytics パッケージを使用する方法を示しています。
from ultralytics import YOLOWorld
# Load a model capable of vision-language understanding
model = YOLOWorld("yolov8s-world.pt")
# Define custom classes using natural language text prompts
model.set_classes(["person wearing sunglasses", "red backpack"])
# Run inference to find these text-defined objects in an image
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Display the detection results
results[0].show()課題と今後の方向性#
強力である一方で、ビジョン言語モデルには重大な課題があります。主な問題の1つはhallucinationであり、モデルが実際には存在しない画像内のオブジェクトやテキストを自信を持って説明してしまいます。研究者たちは、グラウンディングと精度を向上させるために、Reinforcement Learning from Human Feedback (RLHF)などの技術に取り組んでいます。
もう1つの課題は計算コストです。これらの巨大なモデルのトレーニングには、膨大なGPU resourcesが必要です。しかし、Ultralytics YOLO26のような効率的なアーキテクチャの登場により、エッジデバイスへの高度なビジョン機能の導入が進んでいます。今後、VLMはrobotic agentsにおいて極めて重要な役割を果たし、ロボットが複雑な口頭の指示に基づいてナビゲートし、オブジェクトを操作できるようになると期待されています。
理論的基礎に関心のある方のために、オリジナルのCLIP paper by OpenAIは、対照言語画像事前学習に関する優れた洞察を提供しています。さらに、これらのアーキテクチャの急速な進化を追跡するためには、CVPR conference papersを常に把握することが不可欠です。独自のビジョンモデルのトレーニングを実験するには、Ultralytics Platformを利用して、データセット管理とモデルデプロイを効率化できます。






