So trainiert Ultralytics YOLO26 mit ProgLoss, STAL und MuSGD intelligenter
Erfahre, wie Ultralytics YOLO26 mithilfe von Progressive Loss Balancing, Small-Target-Aware Label Assignment und dem MuSGD-Optimierer zuverlässiger trainiert wird.

Letzte Woche haben wir Ultralytics YOLO26 veröffentlicht und damit einen neuen Maßstab für echtzeitfähige Computer-Vision-Modelle mit Fokus auf Edge-Geräte gesetzt. Wie frühere Ultralytics YOLO-Modelle, etwa Ultralytics YOLO11, unterstützt YOLO26 die zentralen Computer-Vision-Aufgaben, mit denen du vertraut bist, darunter Objekterkennung, Instanzsegmentierung und Posenschätzung.

Abb. 1. Ein Beispiel für die Verwendung von Ultralytics YOLO26 zur Segmentierung von Objekten in einem Bild.
Ultralytics YOLO26 ist jedoch nicht nur eine schrittweise Weiterentwicklung. Auch wenn die unterstützten Aufgaben vertraut wirken, stellt dieses neue Modell einen innovativen Fortschritt in der Trainingsweise von Computer-Vision-Modellen dar. Bei YOLO26 geht der Fokus über die Inferenzleistung hinaus und umfasst auch ein stabileres Training.
Ultralytics YOLO26 wurde mit Blick auf den gesamten Trainingslebenszyklus entwickelt. Das bedeutet schnellere Konvergenz, zuverlässigere Trainingsläufe und ein konsistentes Modellverhalten. Diese Verbesserungen sind besonders für reale Arbeitsabläufe wichtig, in denen die Zuverlässigkeit des Trainings direkt beeinflusst, wie schnell Modelle weiterentwickelt und bereitgestellt werden können.
Dafür führt Ultralytics YOLO26 mehrere gezielte Innovationen für das Training ein, darunter Progressive Loss Balancing (ProgLoss), Small-Target-Aware Label Assignment (STAL) und den MuSGD-Optimierer. Zusammen verbessern diese Änderungen die Gewichtung des Lernfehlers, die Zuweisung von Labels und das Optimierungsverhalten im Zeitverlauf.
In diesem Artikel untersuchen wir, wie jeder dieser Mechanismen funktioniert und warum sie das Training von Ultralytics YOLO26 einfacher und das Modell bei der Skalierung zuverlässiger machen. Legen wir los!
Ultralytics YOLO26: Für intelligenteres Training statt nur für schnellere Ausführung entwickelt#
Ultralytics YOLO26 optimiert die gesamte Inferenzpipeline nativ, indem es auf nachgelagerte Verarbeitungsschritte wie die Unterdrückung nicht-maximaler Werte verzichtet. Statt viele überlappende Vorhersagen zu erzeugen und anschließend zu filtern, generiert YOLO26 die endgültigen Erkennungen direkt im Netzwerk.
Damit wird YOLO26 zu einem End-to-End-Modell, in dem Vorhersage, Auflösung von Duplikaten und endgültige Ausgaben vollständig im Netzwerk selbst gelernt werden. Das vereinfacht die Bereitstellung und verbessert die Inferenzleistung, beeinflusst aber auch, wie das Modell während des Trainings lernt.

Abb. 2. YOLO26 liefert eine hochmoderne End-to-End-Inferenz ohne NMS (Quelle)
In einem solchen End-to-End-System sind Training und Inferenz eng miteinander verknüpft. Da es keine externe Phase der nachgelagerten Verarbeitung gibt, die Vorhersagen später korrigiert, muss das Modell bereits während des Trainings klare und sichere Entscheidungen lernen.
Dadurch wird die Abstimmung zwischen Trainingszielen und Inferenzverhalten besonders wichtig. Jede Abweichung zwischen der Trainingsweise des Modells und seiner Verwendung zur Inferenz kann zu instabilem Lernen oder langsamerer Konvergenz führen.
Ultralytics YOLO26 trägt dem Rechnung, indem der Trainingsprozess von Anfang an auf die Nutzung in der Praxis ausgerichtet ist. Statt sich ausschließlich auf die Inferenzgeschwindigkeit zu konzentrieren, unterstützt das Trainingssystem stabiles Lernen über lange Läufe, eine konsistente Konvergenz über Modellgrößen von Nano bis Extra Large sowie robuste Leistung auf vielfältigen Datensätzen.
Wie zwei Trainingsköpfe das Lernen in Ultralytics YOLO26 verbessern#
Eine der wichtigsten Trainingsinnovationen in Ultralytics YOLO26 baut auf einem Ansatz mit zwei Trainingsköpfen auf, der bereits bei früheren YOLO-Modellen verwendet wurde. Bei Objekterkennungsmodellen bezeichnet ein Kopf den Teil des Netzwerks, der für die Erstellung von Vorhersagen zuständig ist.
Anders gesagt lernen Erkennungsköpfe vorherzusagen, wo sich Objekte in einem Bild befinden und um welche Objekte es sich handelt. Dazu regressieren sie die Koordinaten von Begrenzungsrahmen, also lernen sie, Position und Größe jedes Objekts im Eingabebild zu schätzen.
Während des Trainings lernt das Modell, indem es einen Loss minimiert, also ein numerisches Maß dafür, wie weit seine Vorhersagen von den korrekten Antworten oder der Ground Truth entfernt sind. Ein niedriger Loss bedeutet, dass die Vorhersagen des Modells näher an der Ground Truth liegen, während ein hoher Loss auf größere Fehler hindeutet. Die Loss-Berechnung steuert, wie das Modell seine Parameter während des Trainings aktualisiert.
Ultralytics YOLO26 verwendet während des Trainings zwei Erkennungsköpfe, die dasselbe zugrunde liegende Modell nutzen, aber unterschiedliche Aufgaben erfüllen. Der One-to-One-Kopf wird zur Inferenz verwendet. Er lernt, jedes Objekt mit genau einer sicheren Vorhersage zu verknüpfen, was für das End-to-End-Design von YOLO26 ohne NMS entscheidend ist.
Der One-to-Many-Kopf wird dagegen ausschließlich während des Trainings verwendet. Er ermöglicht, mehrere Vorhersagen demselben Objekt zuzuordnen, und sorgt dadurch für eine dichtere Überwachung. Dieses umfangreichere Lernsignal stabilisiert das Training und verbessert die Genauigkeit, insbesondere in den frühen Phasen.
Bei Ultralytics YOLO26 verwenden beide Köpfe dieselbe Loss-Berechnung für Box-Regression und Klassifizierung. Frühere Implementierungen nutzten während des gesamten Trainings ein festes Verhältnis zwischen diesen beiden Loss-Signalen.
In der Praxis verändert sich die Bedeutung jedes Kopfes jedoch im Laufe der Zeit. Eine dichte Überwachung ist anfangs am nützlichsten, während die Übereinstimmung mit dem Inferenzverhalten später im Training wichtiger wird. Ultralytics YOLO26 basiert auf dieser Erkenntnis, die direkt dazu führt, wie die Lernsignale im Verlauf des Trainings neu gewichtet werden.
Ultralytics YOLO26 verwendet Progressive Loss Balancing#
Wie geht Ultralytics YOLO26 also während des Trainings mit diesen wechselnden Lernanforderungen um? Das Modell verwendet Progressive Loss Balancing, um die Gewichtung der Lernsignale im Zeitverlauf anzupassen.
ProgLoss verschiebt dynamisch den Beitrag jedes Kopfes zum gesamten Loss, während das Training fortschreitet. Zu Beginn wird der One-to-Many-Kopf stärker gewichtet, um das Lernen zu stabilisieren und den Recall zu verbessern. Im weiteren Verlauf verschiebt sich das Gleichgewicht allmählich zum One-to-One-Kopf, wodurch das Training stärker an das Inferenzverhalten angeglichen wird.
Dieser allmähliche Übergang ermöglicht es Ultralytics YOLO26, in der richtigen Reihenfolge zu lernen. Statt das Modell zu zwingen, konkurrierende Ziele gleichzeitig zu optimieren, priorisiert Progressive Loss Balancing in jeder Trainingsphase das jeweils nützlichste Lernsignal. Das Ergebnis sind eine gleichmäßigere Konvergenz, weniger instabile Trainingsläufe und eine konsistentere endgültige Leistung.
Wie STAL Ultralytics YOLO26 dabei hilft, von winzigen Objekten zu lernen#
Eine weitere interessante Trainingsverbesserung in Ultralytics YOLO26 ergibt sich aus der Art und Weise, wie das Modell Trainingsziele den Vorhersagen zuweist – ein Prozess, der als Label Assignment bezeichnet wird. Dabei werden Objekte aus der Ground Truth den Kandidatenvorhersagen zugeordnet, die oft Anchors genannt werden.
Diese Zuordnungen bestimmen, welche Vorhersagen überwacht werden und zum Loss beitragen. Ultralytics YOLO26 baut auf einer bestehenden Methode für das Label Assignment namens Task Alignment Learning (TAL) auf, die eine bessere Abstimmung von Klassifizierung und Lokalisierung während des Trainings ermöglicht.
Obwohl TAL für die meisten Objekte gut funktioniert, zeigte das Training eine wichtige Einschränkung. Während des Zuordnungsprozesses konnten sehr kleine Objekte vollständig verloren gehen. In der Praxis erhielten Objekte, die in einem 640 Pixel großen Eingabebild kleiner als etwa 8 Pixel waren, häufig keine Anchor-Zuordnungen. In diesem Fall erhält das Modell für diese Objekte wenig oder gar keine Überwachung, wodurch es schwierig wird, sie zuverlässig zu erkennen.
Um dieses Problem zu beheben, führt Ultralytics YOLO26 Small-Target-Aware Label Assignment (STAL) ein. STAL passt den Zuordnungsprozess so an, dass kleine Objekte während des Trainings nicht ignoriert werden. Konkret erzwingt die Methode mindestens vier Anchor-Zuordnungen für Objekte, die kleiner als 8 Pixel sind. Dadurch tragen selbst winzige Objekte zuverlässig zum Trainings-Loss bei.
Durch die stärkere Überwachung kleiner Ziele verbessert STAL die Stabilität des Lernens und die Erkennungsleistung in Szenarien, in denen kleine oder weit entfernte Objekte häufig vorkommen. Diese Verbesserung ist besonders für Anwendungen mit Edge-Fokus und YOLO26 wie Luftaufnahmen, Robotik und Systeme des Internets der Dinge (IoT) wichtig, da Objekte dort oft klein, weit entfernt oder teilweise sichtbar sind und eine zuverlässige Erkennung entscheidend ist.
Ultralytics YOLO26 führt den MuSGD-Optimierer ein#
Für ein stabileres und vorhersehbareres Training führt Ultralytics YOLO26 außerdem einen neuen Optimierer namens MuSGD ein. Dieser Optimierer wurde entwickelt, um die Konvergenz und die Zuverlässigkeit des Trainings bei End-to-End-Erkennungsmodellen zu verbessern, insbesondere wenn Modellgröße und Trainingskomplexität zunehmen.
Damit ein neuronales Netzwerk während des Trainings lernen und folglich seine Gewichte entsprechend ändern kann, berechnen wir einen Fehler, der auch als „Loss“ bezeichnet wird. Das Modell misst also mithilfe eines Loss-Werts, wie falsch seine Vorhersagen sind, berechnet Gradienten, die angeben, wie sich seine Parameter ändern sollten, und aktualisiert diese Parameter anschließend, um den Fehler zu reduzieren. Stochastic Gradient Descent (SGD) ist ein weit verbreiteter Optimierer, der diese Aktualisierungen durchführt und das Training dadurch effizient und skalierbar macht.

Abb. 3. Stochastic Gradient Descent im Vergleich zu Gradient Descent (Quelle)
MuSGD baut auf dieser bekannten Grundlage auf und integriert von Muon inspirierte Optimierungskonzepte, eine Methode, die beim Training großer Sprachmodelle eingesetzt wird. Diese Konzepte wurden durch aktuelle Fortschritte wie Moonshot AIs Kimi K2 beeinflusst, das durch stärker strukturierte Parameteraktualisierungen ein verbessertes Trainingsverhalten zeigte.
Ultralytics YOLO26 verwendet eine hybride Aktualisierungsstrategie. Einige Parameter werden mit einer Kombination aus von Muon inspirierten Aktualisierungen und SGD aktualisiert, während für andere ausschließlich SGD verwendet wird. Dadurch kann YOLO26 zusätzliche Struktur in den Optimierungsprozess einbringen und zugleich die Robustheit und Generalisierungseigenschaften beibehalten, die SGD so effektiv machen.
Das Ergebnis sind eine gleichmäßigere Optimierung, schnellere Konvergenz und ein vorhersehbareres Trainingsverhalten über verschiedene Modellgrößen hinweg. Damit ist MuSGD ein wichtiger Grund dafür, dass sich Ultralytics YOLO26 einfacher trainieren lässt und bei der Skalierung zuverlässiger ist.
Die Bedeutung der Trainingsinnovationen von Ultralytics YOLO26#
Die Trainingsinnovationen von Ultralytics YOLO26 machen das Modell zusammen mit wichtigen Eigenschaften wie dem End-to-End-, NMS-freien Design und dem Fokus auf Edge-Geräte einfacher zu trainieren und bei der Skalierung zuverlässiger. Vielleicht fragst du dich, was das für Computer-Vision-Anwendungen tatsächlich bedeutet.

Abb. 4. Ein Überblick über die wichtigsten Eigenschaften von YOLO26 (Quelle)
In der Praxis wird es dadurch deutlich einfacher, Computer Vision dorthin zu bringen, wo sie tatsächlich eingesetzt wird. Modelle werden vorhersehbarer trainiert, lassen sich über verschiedene Größen hinweg konsistenter skalieren und einfacher an neue Datensätze anpassen. Das verringert die Reibung zwischen Experimentieren und Bereitstellung, insbesondere in Umgebungen, in denen Zuverlässigkeit und Effizienz ebenso wichtig sind wie die reine Leistung.
Beispielsweise müssen Modelle in Robotik und industriellen Bildverarbeitungsanwendungen häufig neu trainiert werden, wenn sich Umgebungen, Sensoren oder Aufgaben ändern. Mit Ultralytics YOLO26 können Teams schneller iterieren, ohne sich um instabile Trainingsläufe oder inkonsistentes Verhalten über verschiedene Modellgrößen hinweg sorgen zu müssen.
Wichtige Erkenntnisse#
Zuverlässige Computer-Vision-Systeme hängen ebenso stark davon ab, wie Modelle trainiert werden, wie davon, welche Leistung sie zur Inferenz erbringen. Durch die Verbesserung der Gewichtung von Lernsignalen, des Umgangs mit kleinen Objekten und des Verlaufs der Optimierung macht Ultralytics YOLO26 das Training stabiler und leichter skalierbar. Dieser Fokus auf zuverlässiges Training hilft Teams, reibungsloser vom Experimentieren zur Bereitstellung in der Praxis überzugehen, insbesondere bei Anwendungen mit Fokus auf Edge-Geräte.
Möchtest du mehr über KI erfahren? Besuche unser GitHub-Repository, um mehr zu entdecken. Werde Teil unserer aktiven Community und erfahre mehr über Innovationen in Bereichen wie KI in der Logistik und Bildverarbeitung mit KI in der Automobilindustrie. Um heute mit Computer Vision zu beginnen, sieh dir unsere Lizenzoptionen an.









