Model Soups
Model Soups が Ultralytics YOLO モデルのウェイトを平均化することで、精度と堅牢性をどのように向上させるかを発見してください。レイテンシを増やさずにパフォーマンスを高める方法を学びましょう。
Model Soupsとは、同一の事前学習済みベースモデルから異なるハイパーパラメータを用いてファインチューニングされた複数のニューラルネットワークの重みを平均化し、単一のより堅牢なモデルを作成する機械学習手法のことです。このアプローチにより、推論時の計算コストを増加させることなく、全体的な精度と汎化性能を向上させることができます。
モデルのファインチューニングを行う際、実務担当者は通常、最高性能を発揮する構成を見つけるために広範囲なハイパーパラメータチューニングのスイープを実行します。従来は単一の最良モデルのみが選択され、残りは破棄されていました。しかし、モデルスープを作成することで、スイープ内のすべてのモデルが学習した多様な特徴を活用できます。それらのモデルウェイトを直接平均化することで、生成されたネットワークは多くの場合、単一の最良モデルを上回り、それぞれの強みを効果的に組み合わせながらオーバーフィッティングを最小限に抑えます。このプロセスは効率的であり、Ultralytics Platformのような共同作業環境で簡単に管理できます。
実社会での応用#
Model Soupsは、計算リソースが制限されている一方で、高い精度と堅牢性が求められるシナリオにおいて極めて有効です。
- 自動運転車のビジョン: 自動運転車にオブジェクト検出システムを展開する場合、モデルは多様な照明や気象条件に対して汎化する必要があります。さまざまなデータオーグメンテーションや学習率でトレーニングされた複数のモデルを平均化することで、エンジニアは低い推論レイテンシを維持する非常に堅牢なスープを作成します。これにより、自動ナビゲーションに不可欠なリアルタイム処理速度が損なわれないことが保証されます。
- モバイル医療診断: 初期皮膚科スクリーニングのためにスマートフォンで画像分類を実行するなど、エッジAIアプリケーションでは計算能力が非常に制限されます。モデルスープは、臨床的信頼性に必要な精度向上を提供すると同時に、バッテリーを消耗したりクラウド接続を必要としたりすることなく、最終的なフットプリントがモバイルエッジデバイスに簡単に収まるようにします。
関連する概念との違い#
ディープラーニング最適化の領域を把握するためには、モデルスープを類似のテクニックと区別することが重要です。
- モデルアンサンブル: アンサンブルは、複数の独立したモデルの予測(出力)を組み合わせます。これにより精度は向上しますが、推論時にすべてのモデルを実行する必要があり、計算コストが倍増します。モデルスープは推論前にウェイトを平均化するため、計算コストは単一モデルと同等に保たれます。
- モデルマージ: これは、まったく異なるタスクやデータセットでトレーニングされた可能性のあるモデルを組み合わせるためのより広い用語です。モデルスープは、すべてのモデルがまったく同じ事前学習済みベースアーキテクチャに由来し、同じターゲットタスクでファインチューニングされているマージの特定のサブセットです。
実装例#
均一なモデルスープを作成するには、複数のトレーニング済みモデルのPyTorchステート辞書にアクセスし、それらのテンソルを数学的に平均化します。以下は、PyTorchフレームワークによってネイティブにサポートされているUltralytics YOLO26ワークフローを使用してこれを実現する方法の簡潔な例です。
import torch
# Load the PyTorch state dictionaries from two fine-tuned YOLO26 models
model1 = torch.load("yolo26_run1.pt")["model"].state_dict()
model2 = torch.load("yolo26_run2.pt")["model"].state_dict()
# Create a uniform model soup by averaging the model weights
soup_dict = {key: (model1[key] + model2[key]) / 2.0 for key in model1.keys()}
# The resulting soup_dict can now be loaded into a new YOLO26 instanceこのテクニックを活用することで、コンピュータビジョン実務担当者は、現代のエッジファーストAIアーキテクチャに必要なデプロイ速度を犠牲にすることなく、ゼロショット学習機能や一般的な堅牢性などのパフォーマンス指標を簡単に向上させることができます。






