YOLOEとは?コンピュータービジョンモデルをさらに進化させる
YOLOEを使用して、簡単なプロンプトや写真から物体を検出する方法を解説します。再トレーニングやモデルのファインチューニングなしで、よりスマートかつ高速なコンピュータービジョンを実現できます。

物体検出は、画像や動画内の物体を識別して位置を特定することを目的とした、コンピュータービジョンの重要なタスクです。これは、機械が視覚データを理解して解釈できるようにする人工知能(AI)の分野であるコンピュータービジョンの重要な要素です。例えば、物体検出を使用すると、画像内の車を識別したり、動画フィード内の人物を検出したりできます。
物体検出などのコンピュータービジョンタスクをサポートするモデルシリーズとして、最もよく知られているものの一つがYOLOモデルシリーズです。速度と精度を重視して設計されたYOLOモデルは、時間とともに継続的に改善されてきました。例えば、最新バージョンの一つであるUltralytics YOLO11は、現実世界の状況で優れた性能を発揮し、より複雑な環境でも正確な結果を提供します。
この進歩をさらに推し進める新しいモデル、YOLOEは、YOLOモデルの機能拡張を目指しています。新しい物体を認識するために再トレーニングが必要な従来のモデルとは異なり、YOLOEはシンプルなテキストまたは画像プロンプトに従って、これまで見たことのない物体を検出できます。そのため、変化する環境への適応性が大幅に向上しています。
この記事では、YOLOEの独自性、従来のYOLOモデルとの比較、そして現在から使い始める方法について詳しく説明します。さっそく始めましょう。
YOLOEの概要#
YOLOEは、物体検出をさらに進化させるコンピュータービジョンモデルです。2025年3月に、清華大学の研究者によって発表されました。YOLOEが従来のモデルと異なる点は、オープンボキャブラリー検出を採用していることです。
多くのモデルは固定された物体のリストを認識するようにトレーニングされますが、YOLOEでは、短い説明やサンプル画像を使って、何を探すかを指定できます。例えば、「緑色のバックパック」を探す場合、その説明を入力するか、モデルに写真を見せることで、YOLOEがシーン内の該当物体を特定します。
さらに、プロンプトがなくても、YOLOEは多くの日常的な物体を自律的に検出できます。これまで見たことのない物体を認識するこの機能は、ゼロショット検出と呼ばれます。タスクや対象となる物体が予期せず変化する可能性のある動的な環境で、特に役立ちます。

図1. YOLOEの機能。
YOLOEの主な機能#
YOLOEは、実世界のアプリケーションでの性能を高めるために設計された、幅広い機能をサポートしています。構造化入力と非構造化入力の両方を処理できるため、YOLOEは物体検出とセグメンテーションに新たな可能性をもたらします。
このモデルが提供する主な機能は次のとおりです。
- プロンプトベースの検出: YOLOEは、短いテキストプロンプトやサンプル画像に基づいて物体を検索できます。つまり、タスクが変わるたびにモデルを再トレーニングする必要はなく、探しているものを説明するか、モデルに見せるだけで済みます。
- インスタンスセグメンテーション: YOLOEは、物体の周囲にバウンディングボックスを描画するだけでなく、インスタンスセグメンテーションを使用して正確な形状の輪郭を描画できます。物体が重なっている場合や、物体の正確な境界を把握する必要がある場合に特に役立ちます。
- プロンプト不要の物体認識: YOLOEは、具体的な指示がなくても物体を認識できます。あらかじめ学習した説明のセットを使用して物体を迅速に識別するため、処理をより高速かつ効率的に実行できます。
YOLOEと他のYOLOモデルの比較#
YOLOEについて理解が深まったところで、YOLOファミリーに属する類似モデルをいくつか見ていきましょう。
コンピュータービジョンの進歩に伴い、YOLOモデルも進化してきました。例えば、Ultralytics YOLOv8はセグメンテーションや分類などの新しいタスクをサポートし、その後のバージョンであるUltralytics YOLO11は、より幅広いタスクでの精度と性能の向上に注力しています。
また、YOLO-Worldは2024年1月にリリースされ、ユーザーが検出したい物体を説明できる、テキストプロンプトの利用機能を導入しました。YOLO-Worldはゼロショット検出に適した選択肢でしたが、インスタンスセグメンテーションやビジュアルプロンプトのサポートなどの機能はありませんでした。
YOLOEは、これらの機能を追加することでYOLO-Worldを発展させ、柔軟性と性能を高め、実世界のコンピュータービジョンアプリケーション向けに、より実用性の高いツールを提供します。

図2. YOLO-WorldとYOLOEはどちらもゼロショット検出をサポートします。
Ultralytics PythonパッケージでYOLOEを使用する#
特定の物体を検出する場合でも、画像内のすべてを探索する場合でも、YOLOEは簡単に使い始めることができます。このモデルはUltralytics Pythonパッケージでサポートされているため、プロジェクトに簡単に統合できます。ここでは、その使用方法を順に説明します。
Ultralyticsパッケージのインストール#
最初のステップは、‘pip’などのパッケージマネージャーを使用してUltralytics Pythonパッケージをインストールすることです。ターミナルまたはコマンドプロンプトで**“pip install ultralytics”**コマンドを実行するとインストールできます。
パッケージをインストールすると、モデルの読み込み、予測の実行、さまざまな検出モードの試行に必要なものがすべて揃います。インストール中に問題が発生した場合は、Ultralyticsの公式ドキュメントにあるトラブルシューティングセクションが役立ちます。
YOLOEで予測を実行する方法はいくつかあります。予測の実行とは、トレーニング済みモデルを使用して、画像や動画内の物体を識別し、位置を特定することです。これらの方法を使うと、具体的なニーズに応じてモデルとの対話方法をカスタマイズできます。
これらの方法を一つずつ説明します。
テキストまたは画像プロンプトで特定の物体を検出する#
YOLOEは、短いテキスト説明に基づいて物体を検出できます。例えば、動いている馬を探す場合は、「horse walking」のようなプロンプトを使用できます。
始めるには、まず事前トレーニング済みのYOLOEモデルを読み込み、以下のコードスニペットに示すように、モデルに探させたいものの説明であるプロンプトを設定します。
from ultralytics import YOLOE
model = YOLOE("yoloe-11l-seg.pt")
prompt = ["horse walking"]
model.set_classes(prompt, model.get_text_pe(prompt))モデルとプロンプトを設定したら、画像または動画に対してモデルを実行できます。コード内のファイルパスを、画像または動画ファイルのパスに置き換えてください。
results = model.predict("path/to/your/image.jpg")
results[0].show()これにより、プロンプトに基づいて検出された物体が明確に示された画像が表示されます。探している対象に応じて、プロンプトを変更し、「red suitcase」、「bicycle」、「zebra」など別の物体を検索できます。

図3. テキストプロンプトを使用してYOLOEで特定の物体を検出する例。
同様に、Ultralytics Pythonパッケージでは、画像を使ってYOLOEにプロンプトを与えることもできます。ビジュアルプロンプトモードでは、モデルが画像を使用して別のシーン内から見た目の似たアイテムを探します。説明が難しい物体や、明確なラベルがない物体に特に役立ちます。
このコードの詳細を確認するには、Ultralyticsドキュメントをご覧ください。
YOLOEを使用した一般的な物体検出#
何を検索するか正確に分からない場合や、特定の物体を探していない場合もあります。そのようなときに便利なのが、プロンプト不要モードです。
このオプションでは、説明を入力したり、サンプル画像を提供したりする必要はありません。YOLOEは画像を自律的に分析し、人物、動物、家具、日用品など、認識可能なすべてのものを検出します。
モデルに具体的な指示を与えずにシーンを探索できる便利な方法です。混雑した部屋をスキャンする場合でも、さまざまな活動が映る映像を確認する場合でも、プロンプト不要モードを使えば、画像内に何が存在するかをすばやく把握できます。
次のコードを使用して、プロンプト不要モードでYOLOEを実行できます。まずモデルを読み込み、次に画像を処理して、画像内の物体を自動的に検出します。最後に結果を表示し、検出された物体を強調表示します。
ファイルパスを実際の画像のパスに置き換えてください。
from ultralytics import YOLOE
model = YOLOE("yoloe-11l-seg-pf.pt")
results = model.predict("path/to/image.jpg")
results[0].show()以下の画像は、YOLOEがプロンプト不要モードで検出できるものの例です。

図4. プロンプト不要モードでYOLOEを使用。
YOLOEのリアルタイムアプリケーション#
YOLOEはテキストプロンプトと画像プロンプトの両方に対応できるため、リアルタイムアプリケーション向けの信頼性の高いツールです。タイミングと精度が不可欠な、動きの速い環境で特に有用な柔軟性を備えています。
YOLOEの実世界での使用例をいくつか見ていきましょう。
手荷物処理の改善:リアルタイムの荷物検出#
混雑した空港では、特に手荷物の紛失に対応する場合、特定の荷物を見つけることが困難になることがあります。YOLOEを使用すると、ライブ動画のスキャンを支援し、「red bag」のようなシンプルなプロンプトに基づいてアイテムをすばやく識別できるため、このプロセスを効率化できます。
荷物が紛失または置き違えられた場合、スタッフはプロンプトを簡単に変更して、「black suitcase」のような別のアイテムを検索できます。このように即座に適応できる機能により、空港スタッフは長時間の映像を確認したりモデルを再トレーニングしたりせずに、正しい荷物をすばやく見つけられます。その結果、手荷物処理と紛失した荷物の問題解決を、より迅速かつ効率的に行えます。
YOLOEによる公共空間のモニタリング#
混雑した市場やカフェなど、公共空間の監視映像には、1日の中で変化する人物、物体、活動が混在していることがよくあります。YOLOEは、プロンプト不要モードを使用してこの映像をリアルタイムに分析し、具体的な指示がなくても、バッグ、テーブル、自転車などのアイテムを自動的に検出できます。

図5. YOLOEは混雑した公共空間でさまざまな物体を検出できます。
これは、セキュリティチームが放置されたアイテムを見つけたり、人混みの動きを追跡したりする際に特に役立ちます。YOLOEは複数の物体を一度に検出できるため、イベント中や混雑する時間帯の公共空間を管理しやすくなり、チームが状況を把握して迅速に対応するのに役立ちます。
YOLOEのメリットとデメリット#
コンピュータービジョンアプリケーションでYOLOEを使用する主なメリットは次のとおりです。
- リアルタイム性能: YOLOEは高速かつ効率的な処理に最適化されており、ライブ動画ストリームや混雑した公共空間などの動的な環境でも、リアルタイム検出を実現します。
- スケーラビリティ: YOLOEはスケーラブルで、セキュリティや監視から小売、ヘルスケア、自動運転車まで、幅広いアプリケーションで優れた性能を発揮します。
- 使いやすさ: YOLOEはUltralytics Pythonパッケージでサポートされているため、既存のコンピュータービジョンプロジェクトに簡単に統合できます。
ただし、YOLOEを使用する際には、いくつかの制限に留意する必要があります。考慮すべき要素を以下に示します。
- 十分なトレーニングデータが必要: YOLOEはゼロショット検出をサポートしていますが、未知の物体に対する性能は、トレーニングデータからどれだけ適切に一般化できるかに左右されます。高度に専門化されたタスクで十分な性能を発揮するには、追加データやファインチューニングが必要になる場合があります。
- 入力品質に敏感: モデルの精度は、低品質の画像や動画の影響を受ける可能性があります。ぼやけた入力や照明が不十分な入力では、物体を正確に検出するモデルの能力が低下するため、最適な性能には高品質な入力が重要です。
主なポイント#
YOLOEは、テキストまたは画像プロンプトで検出を誘導できるようにすることで、コンピュータービジョンの柔軟性を高めます。シーンが急速に変化し、再トレーニングができない実世界の状況で優れた性能を発揮します。
手荷物処理から公共空間のモニタリングまで、YOLOEは新しいタスクに容易に適応します。AIがより利用しやすくなる中、YOLOEのようなモデルは、より多くの業界がビジョン技術を実用的かつ効率的な方法で活用するのに役立っています。
コミュニティに参加し、GitHubリポジトリを確認して、AIのイノベーションについて詳しく学びましょう。小売業界におけるAIやヘルスケアにおけるコンピュータービジョンなどの分野における最新の進歩は、ソリューションページでご覧いただけます。ライセンスオプションを確認して、今すぐコンピュータービジョンを始めましょう。









