Ultralytics YOLO26がProgLoss、STAL、MuSGDによってよりスマートにトレーニングされる方法
Ultralytics YOLO26がProgressive Loss Balancing、Small-Target-Aware Label Assignment、MuSGDオプティマイザーを使用して、より安定してトレーニングされる方法を学びます。

先週、私たちはUltralytics YOLO26をリリースし、エッジファーストのリアルタイムコンピュータービジョンモデルにおける新たな基準を打ち立てました。以前のUltralytics YOLOモデルと同様に、Ultralytics YOLO11など、YOLO26は、物体検出、インスタンスセグメンテーション、姿勢推定など、ユーザーに馴染みのある主要なコンピュータービジョンタスクをサポートしています。

図1. 画像内の物体のセグメンテーションにUltralytics YOLO26を使用した例です。
しかし、Ultralytics YOLO26は単なる小幅なアップデートではありません。サポートされるタスクは従来と同じように見えるかもしれませんが、この新しいモデルは、コンピュータービジョンモデルの学習方法における革新的な前進を示しています。YOLO26では、推論効率だけでなく、学習の安定性にも重点が置かれています。
Ultralytics YOLO26は、学習ライフサイクル全体を考慮して設計されています。これにより、より速い収束、信頼性の高い学習実行、安定したモデル動作を実現します。こうした改善は、学習の信頼性がモデルを反復開発してデプロイするまでの速度に直接影響する、実際のワークフローで特に重要です。
これを実現するため、Ultralytics YOLO26は、プログレッシブ損失バランシング (ProgLoss)、小ターゲット対応ラベル割り当て (STAL)、MuSGDオプティマイザーなど、いくつかの目的を絞った学習上の革新を導入しています。これらの変更により、学習損失のバランス調整、ラベルの割り当て、時間経過に伴う最適化の挙動が改善されます。
この記事では、これらの各メカニズムの仕組みと、Ultralytics YOLO26によって大規模環境でも学習しやすく、信頼性が高まる理由を詳しく見ていきます。始めましょう。
Ultralytics YOLO26:単に高速に実行するだけでなく、よりスマートに学習できるように設計#
Ultralytics YOLO26は、Non-Maximum Suppressionなどの後処理ステップへの依存をなくすことで、推論パイプライン全体をネイティブに効率化します。多数の重複する予測を生成して後からフィルタリングするのではなく、YOLO26はネットワークから最終的な検出結果を直接出力します。
これによりYOLO26はエンドツーエンドモデルとなり、予測、重複の解決、最終出力のすべてがネットワーク自体の中で学習されます。これによりデプロイが簡素化され、推論効率が向上すると同時に、学習中のモデルの学習方法にも影響を与えます。

図2. YOLO26は最先端のエンドツーエンドNMSフリー推論を実現します(出典)
このようなエンドツーエンドシステムでは、学習と推論が密接に結び付いています。後から予測を修正する外部の後処理ステージがないため、モデルは学習中に明確で確信度の高い判断を下すことを学習する必要があります。
そのため、学習の目標と推論時の挙動の整合性が特に重要になります。モデルの学習方法と推論時の使用方法に不一致があると、学習が不安定になったり、収束が遅くなったりする可能性があります。
Ultralytics YOLO26は、実際の利用方法を最初から考慮して学習プロセスを設計することで、この課題に対応しています。学習システムは推論速度だけに焦点を当てるのではなく、長時間の実行における安定した学習、NanoからExtra Largeまでのモデルサイズ間で一貫した収束、多様なデータセットでの堅牢な性能をサポートするように構築されています。
Ultralytics YOLO26で学習を改善する2つの学習ヘッド#
Ultralytics YOLO26における主要な学習上の革新の1つは、以前のYOLOモデルで使用されていた2ヘッド学習アプローチを基盤としています。物体検出モデルにおいて、ヘッドとは予測を担当するネットワークの部分を指します。
つまり、検出ヘッドは画像内の物体の位置と、その物体が何であるかを予測するように学習します。これはバウンディングボックスの座標を回帰することで行われます。つまり、入力画像内の各物体の位置とサイズを推定するように学習します。
学習中、モデルは損失を最小化することで学習します。損失とは、予測が正解またはグラウンドトゥルースからどの程度離れているかを示す数値です。損失が小さいほどモデルの予測はグラウンドトゥルースに近く、損失が大きいほど誤差が大きいことを示します。損失の計算は、学習中にモデルがパラメーターを更新する方法を決定します。
Ultralytics YOLO26は、学習中に同じ基盤モデルを共有しながら異なる目的を持つ2つの検出ヘッドを使用します。ワンツーワンヘッドは推論時に使用されるヘッドです。各物体を1つの確信度の高い予測に関連付けるように学習するため、YOLO26のエンドツーエンドNMSフリー設計に不可欠です。
一方、ワンツーメニーヘッドは学習中のみ使用されます。同じ物体に複数の予測を関連付けることができ、より密な教師信号を提供します。この豊かな学習信号は、特に初期段階において、学習の安定化と精度向上に役立ちます。
Ultralytics YOLO26では、両方のヘッドがボックス回帰と分類に同じ損失計算を使用します。以前の実装では、学習全体を通じてこれら2つの損失信号のバランスを固定していました。
しかし実際には、各ヘッドの重要性は時間とともに変化します。密な教師信号は初期段階で最も有用であり、学習が進むにつれて推論時の挙動との整合性がより重要になります。Ultralytics YOLO26はこの知見に基づいて設計されており、学習の進行に合わせて学習信号を再調整する仕組みに直接つながっています。
Ultralytics YOLO26はプログレッシブ損失バランシングを使用します#
では、Ultralytics YOLO26は学習中に変化するこうした学習上のニーズにどのように対応するのでしょうか。学習信号の重みを時間の経過に合わせて調整するために、プログレッシブ損失バランシングを使用します。
ProgLossは、学習の進行に合わせて各ヘッドが全体の損失にどの程度寄与するかを動的に変更します。初期段階では、学習を安定させて再現率を向上させるため、ワンツーメニーヘッドにより大きな重みが置かれます。学習が進むと、バランスは徐々にワンツーワンヘッドへ移行し、学習を推論時の挙動により近づけます。
この段階的な移行により、Ultralytics YOLO26は適切な順序で学習できます。プログレッシブ損失バランシングは、競合する目標をすべて一度に最適化するようモデルに強いるのではなく、学習の各段階で最も有用な学習信号を優先します。その結果、より滑らかな収束、不安定な学習実行の減少、最終性能の一貫性向上が実現します。
STALがUltralytics YOLO26による小さな物体からの学習を支援する仕組み#
Ultralytics YOLO26におけるもう1つの興味深い学習改善は、モデルが予測に学習ターゲットを割り当てる方法にあります。このプロセスはラベル割り当てと呼ばれます。ラベル割り当ては、グラウンドトゥルースの物体を候補予測(アンカーと呼ばれることが多い)に対応付けます。
これらの対応付けによって、どの予測が教師信号を受け取り、損失に寄与するかが決まります。Ultralytics YOLO26は、既存のラベル割り当て手法であるタスクアライメント学習 (TAL) を基盤としています。これは、学習中の分類と位置特定の整合性を高めるために設計されています。
TALはほとんどの物体で良好に機能しますが、学習によって重要な制限が明らかになりました。対応付けの過程で、非常に小さな物体が完全に除外される場合がありました。実際、640ピクセルの入力画像で約8ピクセル未満の物体は、アンカーの割り当てをまったく受けられないことがよくありました。このような場合、モデルはそれらの物体に対する教師信号をほとんど、またはまったく受け取れないため、安定して検出できるように学習することが困難になります。
この問題に対処するため、Ultralytics YOLO26は小ターゲット対応ラベル割り当て (STAL) を導入しています。STALは割り当てプロセスを変更し、学習中に小さな物体が無視されないようにします。具体的には、8ピクセル未満の物体に対して最低4つのアンカー割り当てを強制します。これにより、非常に小さな物体であっても確実に学習損失へ寄与することが保証されます。
小さなターゲットに対する教師信号を強化することで、STALは、小さい物体や遠くの物体が多く存在する状況で、学習の安定性と検出性能を向上させます。この改善は、物体が小さい、遠い、または部分的にしか見えず、信頼性の高い検出が重要となる航空画像、ロボティクス、モノのインターネット (IoT) システムなどのエッジファーストYOLO26アプリケーションで特に重要です。
Ultralytics YOLO26はMuSGDオプティマイザーを導入します#
より安定した予測可能な学習を支援するため、Ultralytics YOLO26はMuSGDと呼ばれる新しいオプティマイザーも導入しています。このオプティマイザーは、特にモデルサイズと学習の複雑さが増すにつれて、エンドツーエンド検出モデルの収束と学習の信頼性を向上させるように設計されています。
ニューラルネットワークが学習し、それに応じて重みを変更するために、学習中は誤差(「損失」とも呼ばれます)を計算します。したがって、モデルは損失値を使用して予測の誤りの大きさを測定し、パラメーターをどのように変更すべきかを示す勾配を計算し、その後、誤差を減らすためにパラメーターを更新します。確率的勾配降下法 (SGD)は、これらの更新を実行する広く使用されているオプティマイザーであり、学習を効率的かつスケーラブルにします。

図3. 確率的勾配降下法と勾配降下法の比較(出典)
MuSGDは、このよく知られた基盤を土台に、大規模言語モデルの学習で使用される手法であるMuonに着想を得た最適化の考え方を取り入れています。これらの考え方は、より構造化されたパラメーター更新によって学習挙動の改善を実証した、Moonshot AIのKimi K2など、近年の進展の影響を受けています。
Ultralytics YOLO26はハイブリッド更新戦略を使用します。一部のパラメーターはMuSGDに着想を得た更新とSGDを組み合わせて更新され、その他のパラメーターはSGDのみで更新されます。これによりYOLO26は、SGDの有効性を支えてきた堅牢性と汎化性能を維持しながら、最適化プロセスにさらなる構造を導入できます。
その結果、モデルサイズ全体で最適化がより滑らかになり、収束が速く、学習挙動がより予測しやすくなります。これによりMuSGDは、Ultralytics YOLO26が大規模環境でも学習しやすく、信頼性が高い理由の重要な要素となっています。
Ultralytics YOLO26の学習上の革新が持つ意義#
Ultralytics YOLO26の学習上の革新は、エンドツーエンド、NMSフリー、エッジファースト設計などの主要機能と組み合わさることで、モデルを大規模環境でも学習しやすく、信頼性の高いものにします。これがコンピュータービジョンアプリケーションにとって実際に何を意味するのか、疑問に思われるかもしれません。

図4. YOLO26の主要機能(出典)
実際の利用においては、コンピュータービジョンを実際に動作する場所へ導入することがはるかに容易になります。モデルはより予測可能に学習し、サイズ間でより一貫してスケールし、新しいデータセットにも簡単に適応できます。これにより、特に信頼性と効率が生の性能と同じくらい重要な環境で、実験とデプロイの間の摩擦が軽減されます。
たとえば、ロボティクスや産業用ビジョンのアプリケーションでは、環境、センサー、タスクの変化に応じてモデルを頻繁に再学習する必要があります。Ultralytics YOLO26を使用すれば、不安定な学習実行やモデルサイズ間での一貫性のない挙動を心配することなく、チームはより速く反復できます。
主なポイント#
信頼性の高いコンピュータービジョンシステムは、推論時の性能だけでなく、モデルの学習方法にも大きく依存します。学習信号のバランス調整、小さな物体の処理、最適化の進行方法を改善することで、Ultralytics YOLO26は学習をより安定させ、スケールしやすくします。信頼性の高い学習に重点を置くことで、特にエッジファーストのアプリケーションにおいて、チームは実験から実際のデプロイへよりスムーズに移行できます。
AIについて学びたい方は、GitHubリポジトリにアクセスして詳細をご覧ください。活発なコミュニティに参加し、物流におけるAIや自動車業界におけるビジョンAIなどの分野の革新についてご確認ください。今すぐコンピュータービジョンを始めるには、ライセンスオプションをご覧ください。









