Hugging FaceのオープンソースツールでCVプロジェクトを推進
Hugging FaceのオープンソースツールがAI開発をどのように進展させているかを探る、YOLO Vision 2024の基調講演を振り返ります。

適切なアルゴリズムの選択は、インパクトのあるコンピュータービジョンソリューションを構築するうえでの一要素にすぎません。AIエンジニアは、大規模なデータセットを扱い、特定のタスク向けにモデルをファインチューニングし、実環境でのパフォーマンスに向けてAIシステムを最適化することがよくあります。AIアプリケーションの導入が加速するにつれて、こうしたプロセスを簡素化するツールの必要性も高まっています。
Ultralyticsが主催する年次ハイブリッドイベント、YOLO Vision 2024(YV24)では、AIの専門家やテクノロジー愛好家が集まり、コンピュータービジョンにおける最新のイノベーションを探りました。このイベントでは、AIアプリケーション開発を高速化する方法など、さまざまなトピックについて議論が交わされました。
イベントの主なハイライトは、モデルのトレーニング、最適化、デプロイを効率化するオープンソースAIプラットフォーム、Hugging Faceに関する基調講演でした。Hugging FaceのMachine Learning EngineerであるPavel Iakubovskii氏は、画像内の物体の検出、画像のさまざまなグループへの分類、特定の例で事前にトレーニングすることなく予測を行うタスク(ゼロショット学習)など、コンピュータービジョンタスクのワークフローを同社のツールがどのように改善するかを紹介しました。
Hugging Face Hubでは、Ultralytics YOLO11など、さまざまなAIおよびコンピュータービジョンモデルをホストし、アクセスを提供しています。この記事では、Pavel氏の講演の主なポイントを振り返り、開発者がHugging Faceのオープンソースツールを使用してAIモデルを迅速に構築・デプロイする方法を見ていきます。

図1. YV24のステージ上に立つPavel氏。
Hugging Face HubがAI開発を高速化#
Pavel氏は講演の冒頭で、さまざまなアプリケーション向けの事前トレーニング済みモデルを提供するオープンソースAIプラットフォームとしてHugging Faceを紹介しました。これらのモデルは、自然言語処理(NLP)、コンピュータービジョン、マルチモーダルAIなど、さまざまなAI分野向けに設計されており、システムがテキスト、画像、音声など異なる種類のデータを処理できるようにします。
Pavel氏は、Hugging Face Hubが現在100万以上のモデルをホストしており、開発者が特定のプロジェクトに適したモデルを簡単に見つけられると述べました。Hugging Faceは、モデルのトレーニング、ファインチューニング、デプロイ向けのツールを提供することで、AI開発の簡素化を目指しています。開発者がさまざまなモデルを試せることで、AIを実環境のアプリケーションに統合するプロセスが簡素化されます。
Hugging Faceは当初NLPで知られていましたが、その後コンピュータービジョンやマルチモーダルAIへと領域を拡大し、開発者がより幅広いAIタスクに取り組めるようになりました。また、開発者がフォーラム、Discord、GitHubを通じて協力し、知見を共有し、サポートを得られる強力なコミュニティも備えています。
コンピュータービジョンアプリケーション向けのHugging Faceモデルを探る#
Pavel氏はさらに詳しく説明し、Hugging Faceのツールによってコンピュータービジョンアプリケーションをより簡単に構築できる方法を紹介しました。開発者は、画像分類、物体検出、ビジョン・言語アプリケーションなどのタスクにこれらのツールを使用できます。
また、これらのコンピュータービジョンタスクの多くはHugging Face Hubで利用できる事前トレーニング済みモデルで処理できるため、ゼロからトレーニングする必要が減り、時間を節約できます。実際、Hugging Faceは画像分類タスク向けに13,000以上の事前トレーニング済みモデルを提供しており、食品分類、ペット分類、感情検出向けのモデルなどが含まれています。
これらのモデルが利用しやすいことを強調し、同氏は「プロジェクト用にモデルをトレーニングする必要すらないかもしれません。コミュニティの誰かがすでにトレーニングしたモデルをHubで見つけられる可能性があります」と述べました。
物体検出向けのHugging Faceモデル#
別の例として、Pavel氏は、画像内の物体を識別して位置を特定するコンピュータービジョンの主要機能である物体検出にHugging Faceがどのように役立つかを詳しく説明しました。ラベル付きデータが限られている場合でも、Hugging Face Hubで利用できる事前トレーニング済みモデルによって、物体検出をより効率的に行えます。
また、Hugging Faceで見つけられる、このタスク向けに構築された複数のモデルについて簡単に紹介しました。
- リアルタイム物体検出モデル:速度が重要な動的環境では、Detection Transformer(DETR)などのモデルがリアルタイム物体検出機能を提供します。DETRはCOCOデータセットでトレーニングされ、マルチスケール特徴を効率的に処理するよう設計されているため、時間制約のあるアプリケーションに適しています。
- ビジョン・言語モデル:これらのモデルは画像処理とテキスト処理を組み合わせ、AIシステムが画像と説明文を照合したり、トレーニングデータを超えた物体を認識したりできるようにします。CLIPとSigLIPなどがその例で、テキストと視覚情報を関連付けて画像検索を改善し、コンテキストを理解することでAIソリューションが新しい物体を識別できるようにします。
- **ゼロショット物体検出モデル:**画像とテキストの関係を理解することで、これまで見たことのない物体を識別できます。OwlVit、GroundingDINO、OmDetなどがその例で、ゼロショット学習を使用して、ラベル付きトレーニングデータなしで新しい物体を検出します。
Hugging Faceモデルの使用方法#
続いてPavel氏は、Hugging Faceモデルを実際に使用することに焦点を移し、開発者がモデルを活用する3つの方法、すなわちモデルの探索、迅速なテスト、さらなるカスタマイズについて説明しました。
開発者はコードを書かずにHugging Face Hubでモデルを直接閲覧でき、インタラクティブなインターフェースを通じてモデルをすぐに簡単にテストできます。Pavel氏は「コードを1行も書かず、コンピューターにモデルをダウンロードしなくても試せます」と付け加えました。一部のモデルはサイズが大きいため、Hub上で実行することでストレージや処理能力の制約を回避できます。

図2. Hugging Faceモデルの使用方法。
さらに、Hugging Face Inference APIを使用すると、開発者はシンプルなAPI呼び出しでAIモデルを実行できます。複雑なセットアップを必要とせず、迅速なテスト、概念実証プロジェクト、ラピッドプロトタイピングに適しています。
より高度なユースケースでは、開発者はHugging Face Transformersフレームワークを使用できます。これは、テキスト、ビジョン、音声タスク向けの事前トレーニング済みモデルを提供し、PyTorchとTensorFlowの両方をサポートするオープンソースツールです。Pavel氏は、わずか2行のコードで、開発者がHugging Face Hubからモデルを取得し、画像プロセッサなどの前処理ツールに接続して、Vision AIアプリケーション向けに画像データを分析できると説明しました。
Hugging FaceでAIワークフローを最適化#
次にPavel氏は、Hugging FaceがAIワークフローを効率化する方法を説明しました。取り上げた主要なトピックの1つは、Transformerにおけるアテンションメカニズムの最適化です。これは、入力データの最も関連性の高い部分にモデルが集中できるようにする、ディープラーニングモデルの中核機能です。これにより、言語処理やコンピュータービジョンに関わるタスクの精度が向上します。ただし、リソースを大量に消費する可能性があります。
アテンションメカニズムを最適化すると、速度を向上させながらメモリ使用量を大幅に削減できます。Pavel氏は「例えば、より効率的なアテンション実装に切り替えることで、最大1.8倍高速なパフォーマンスを実現できる可能性があります」と指摘しました。
Hugging Faceは、Transformersフレームワーク内でより効率的なアテンション実装を標準でサポートしています。開発者は、モデルの読み込み時に別のアテンション実装を指定するだけで、これらの最適化を有効にできます。
OptimumとTorch Compile#
同氏は、モデルが使用する数値の精度を下げることで、パフォーマンスへの影響を抑えながらAIモデルを小型化する手法である量子化についても説明しました。これにより、モデルのメモリ使用量を減らして実行速度を高められるため、スマートフォンや組み込みシステムなど、処理能力に制約のあるデバイスに適したものになります。
効率をさらに高めるため、Pavel氏はモデルの最適化とデプロイ向けに設計されたツール群であるHugging Face Optimumライブラリを紹介しました。わずか数行のコードで量子化技術を適用し、モデルをONNX(オープンニューラルネットワーク交換)などの効率的な形式に変換できるため、クラウドサーバーやエッジデバイスを含むさまざまなハードウェア上でスムーズに実行できます。

図3. Pavel氏はOptimumライブラリとその機能について説明しました。
最後にPavel氏は、AIモデルのデータ処理方法を最適化して、より高速かつ効率的に実行できるようにするPyTorchの機能、Torch Compileの利点について説明しました。Hugging FaceはTransformersおよびOptimumライブラリにTorch Compileを統合しており、開発者はコードを最小限変更するだけで、こうしたパフォーマンス向上を活用できます。
モデルの計算構造を最適化することで、Torch Compileは推論時間を短縮し、精度や品質を損なうことなくフレームレートを毎秒29フレームから150フレームへ向上させられます。
Hugging Faceツールでモデルをデプロイ#
続いてPavel氏は、適切なモデルを選び、開発に最適なアプローチを決定した後、開発者がHugging Faceツールを使用してVision AIモデルを拡張・デプロイする方法について簡単に説明しました。
例えば、開発者はGradioとStreamlitを使用してインタラクティブなAIアプリケーションをデプロイできます。Gradioでは機械学習モデル向けのWebベースインターフェースを作成でき、StreamlitではシンプルなPythonスクリプトでインタラクティブなデータアプリケーションを構築できます。
Pavel氏はまた、Hugging Faceが提供するガイド、トレーニングノートブック、サンプルスクリプトに触れ、「すべてをゼロから書き始める必要はありません」と指摘しました。これらのリソースにより、すべてを一から構築しなくても、開発者はすぐに作業を開始できます。

図4. YV24でHugging Faceの機能について説明するPavel氏。
Hugging Face Hubのメリット#
基調講演の最後に、Pavel氏はHugging Face Hubを使用するメリットをまとめました。同氏は、モデル管理とコラボレーションを簡素化できる点を強調しました。また、初心者と専門家の双方がAIモデルを理解して実装するのに役立つガイド、ノートブック、チュートリアルが利用できることにも注目しました。
同氏は開発者にプラットフォームの柔軟性を活用するよう促し、「Hubにはすでに多くの魅力的なSpacesがあります。似たものを見つけ、共有されているコードをクローンし、数行を変更して、自分のモデルに置き換え、再びプッシュできます」と説明しました。
主なポイント#
YV24での講演中、Pavel氏はHugging FaceがAIモデルのトレーニング、最適化、デプロイをサポートするツールを提供していることを紹介しました。例えば、Transformers、Optimum、Torch Compileなどのイノベーションは、開発者によるモデルパフォーマンスの向上に役立ちます。
AIモデルの効率が高まるにつれて、量子化やエッジデプロイメントの進歩により、リソースに制約のあるデバイス上でもモデルを実行しやすくなっています。こうした改善と、Hugging FaceなどのツールやUltralytics YOLO11などの高度なコンピュータービジョンモデルを組み合わせることが、スケーラブルで高性能なVision AIアプリケーションの構築に重要です。
成長を続けるコミュニティに参加しましょう!GitHubリポジトリでAIについて学び、YOLOライセンスを確認してVision AIプロジェクトを始めましょう。医療におけるコンピュータービジョンや農業におけるコンピュータービジョンなどのイノベーションに関心がありますか?ソリューションページにアクセスして、さらに詳しくご覧ください。









