So trainierst du Ultralytics YOLO26 mit eigenen Daten für die Instanzsegmentierung
Erfahre, wie du Ultralytics YOLO26 mit eigenen Daten für die Instanzsegmentierung trainierst, bei der das Modell jedes einzelne Objekt mithilfe von Masken auf Pixelebene erkennt und abgrenzt.

Dank jüngster technologischer Fortschritte steckt KI hinter vielen intelligenten Systemen, die unauffällig, aber wirkungsvoll unseren Alltag prägen. Wenn zum Beispiel ein Auto bei Rot über die Ampel fährt und eine Kamera den Verstoß automatisch aufzeichnet oder ein automatisiertes Qualitätsprüfsystem einen Fertigungsfehler an der Produktionslinie erkennt, erledigt KI im Hintergrund die Arbeit.
Ein Teilgebiet der KI, die sogenannte Computer Vision, ermöglicht es Maschinen, Bilder und Videos zu interpretieren und zu verstehen. Computer Vision befähigt Systeme dazu, Objekte zu erkennen, Bewegungen zu verfolgen und visuelle Details in Echtzeit zu analysieren. Damit ist sie für Anwendungen wie Verkehrsüberwachung, industrielle Inspektion und Robotik unverzichtbar.
Diese Fähigkeiten werden durch Computer-Vision-Modelle wie Ultralytics YOLO26 ermöglicht, das verschiedene Bildverarbeitungsaufgaben unterstützt, darunter Objekterkennung und Instanzsegmentierung. Während die Objekterkennung Objekte mithilfe einfacher Begrenzungsrahmen identifiziert, geht die Instanzsegmentierung weiter und zeichnet jedes Objekt auf Pixelebene nach. So liefert sie in realen Anwendungsszenarien genauere und zuverlässigere Ergebnisse.

Abb. 1. Objekte in einem Bild mit Ultralytics YOLO26 segmentieren
Modelle wie Ultralytics YOLO26 sind vortrainiert und können gängige Objekte wie Menschen, Autos und Tiere sofort erkennen und segmentieren. Für spezifischere Anwendungen lassen sie sich jedoch auch mit eigenen Daten trainieren. Anders gesagt: Die Modelle können lernen, wie Objekte aussehen und wie sie präzise umrissen werden.
In diesem Artikel zeigen wir dir, wie du Ultralytics YOLO26 für die Instanzsegmentierung mit eigenen Daten trainierst. Los geht’s!
Was ist Instanzsegmentierung?#
Bevor wir uns mit dem Modelltraining befassen, machen wir einen Schritt zurück und klären, was Instanzsegmentierung eigentlich bedeutet.
Instanzsegmentierung ist eine Computer-Vision-Aufgabe, bei der ein Modell jedes einzelne Objekt in einem Bild findet und dessen genaue Form umreißt. Statt nur festzustellen, dass ein Objekt vorhanden ist, betrachtet das Modell jedes Pixel im Bild und entscheidet, ob es zu einem bestimmten Objekt gehört.
Dadurch kann das Modell Objekte auch dann voneinander trennen, wenn sie sich überlappen oder sehr dicht beieinanderliegen. Ein wichtiger Begriff, der die Instanzsegmentierung anschaulich macht, ist die Maske.
Eine Maske ist eine Kontur auf Pixelebene, die nur den Bereich eines Objekts abdeckt. Du kannst sie dir so vorstellen, als würdest du das Objekt mit einem Textmarker ausmalen und alles andere unverändert lassen.
Jedes Objekt erhält eine eigene Maske. So kann das Modell ein Objekt von einem anderen unterscheiden, selbst wenn beide derselben Kategorie angehören, etwa zwei Autos oder zwei nebeneinanderstehende Menschen.

Abb. 2. Einblick in die Instanzsegmentierung
Um die Instanzsegmentierung besser zu verstehen, können wir sie mit anderen gängigen Computer-Vision-Aufgaben vergleichen. Bei der Objekterkennung werden Begrenzungsrahmen verwendet, also einfache Rechtecke um Objekte. Begrenzungsrahmen sind schnell und nützlich, erfassen aber nicht die genaue Form eines Objekts.
Die semantische Segmentierung kennzeichnet dagegen jedes Pixel im Bild mit einer Kategorie, unterscheidet aber nicht zwischen einzelnen Objekten derselben Klasse. Die Instanzsegmentierung verbindet die Vorteile beider Verfahren: Sie erkennt Objektkategorien und weist jedem einzelnen Objekt eine eigene Maske zu.
Da die Instanzsegmentierung so detaillierte Informationen liefert, ist sie besonders nützlich für Anwendungen in der Praxis, etwa die automatisierte Qualitätsprüfung, medizinische Bildgebung und Robotik. Aufgaben, die genaue Messungen, präzise Konturen oder die Trennung von Objekten erfordern, profitieren von diesem Verständnis auf Pixelebene.
Ultralytics YOLO26 unterstützt die Instanzsegmentierung#
Ultralytics YOLO26 ist ein End-to-End-Computer-Vision-Modell auf dem neuesten Stand der Technik, das ohne Non-Maximum Suppression (NMS) auskommt und reale Bildverarbeitungsaufgaben schnell und effizient bewältigt. Es gehört zur Ultralytics-YOLO-Familie von Erkennungsmodellen, die Bilder und Videos in Echtzeit verarbeiten und dabei präzise Ergebnisse liefern.
Ultralytics YOLO26 unterstützt in einem einzigen Framework mehrere Bildverarbeitungsaufgaben, darunter Objekterkennung, Posenschätzung, Bildklassifizierung, Erkennung gedrehter Begrenzungsrahmen (obb detection) und Instanzsegmentierung.
Ultralytics YOLO26 ist sofort einsatzbereit und vortrainiert. Das bedeutet, dass es bereits anhand großer, weit verbreiteter Datensätze wie COCO und ImageNet gelernt hat, gängige Objekte wie Menschen, Fahrzeuge und Alltagsgegenstände zu erkennen. Du kannst das Modell sofort ohne zusätzliches Training verwenden.
Wenn deine Anwendung jedoch einzigartige Objekte, besondere Umgebungen oder ungewöhnliche Lichtverhältnisse umfasst, kann das Training eines eigenen Modells die Ergebnisse deutlich verbessern. Indem du Ultralytics YOLO26 mit deinen eigenen beschrifteten Bildern trainierst, kannst du dem Modell genau beibringen, worauf es achten und wie es Objekte für deinen konkreten Anwendungsfall präziser umranden soll.
Dieses Verfahren wird auch als Feinabstimmung bezeichnet. Statt ein Modell von Grund auf zu trainieren, setzt die Feinabstimmung bei einem vortrainierten Ultralytics-YOLO26-Modell an und passt es behutsam mit deinen eigenen Daten an. Da das Modell allgemeine visuelle Muster wie Kanten, Formen und Texturen bereits kennt, benötigt es deutlich weniger beschriftete Bilder und viel weniger Zeit, um deine spezifischen Objekte zu lernen.
Kurz gesagt: Die Feinabstimmung ist schneller, effizienter und leichter zugänglich als das Training eines Modells von Grund auf. Das Training von Ultralytics YOLO26 mit eigenen Daten ist auch für Einsteiger und Teams mit begrenzten Daten- und Rechenressourcen eine praktische Option.
Anwendungsbereiche der Instanzsegmentierung mit Ultralytics YOLO26#
Wo kann die Instanzsegmentierung also besonders nützlich sein? In Situationen, in denen es wichtig ist, Objekte auseinanderzuhalten und ihre genaue Form zu erfassen – vor allem, wenn sich viele Objekte drängen oder überlappen.
Hier sind einige gängige Arbeitsabläufe, bei denen die Instanzsegmentierung einen echten Unterschied macht:
- Luft- und Drohnenaufnahmen: Mit dieser Aufgabe können Drohnen Objekte wie Gebäude, Fahrzeuge und Vegetation in Luftbildern für Kartierung, Inspektion und Vermessung voneinander trennen.
- Sportanalysen: Die Instanzsegmentierung unterstützt die Analyse von Spielerbewegungen und Interaktionen, indem sie einzelne Athleten während Spielen oder Trainingseinheiten vom Hintergrund trennt.
- Überwachung von Bauwerken und Infrastruktur: Sie hilft dabei, Bauteile, Risse oder beschädigte Bereiche an Gebäuden, Brücken und Straßen zu erkennen und so die Instandhaltung zu planen.
- Gesundheitswesen und medizinische Bildgebung: Mit der Instanzsegmentierung lassen sich Zellen, Gewebe oder medizinische Instrumente präzise umranden. Das ermöglicht genauere Analysen und Diagnosen.
- Landwirtschaft und Umweltüberwachung: Sie kann Nutzpflanzen, Früchte oder Pflanzenkrankheiten erkennen und voneinander trennen. Dadurch lassen sich Erträge leichter schätzen und gezielte Behandlungen anwenden.

Abb. 3. Beispiel für die Segmentierung von Unkraut mit YOLO26 (Quelle)
So funktioniert das Training von Ultralytics YOLO26 für die Instanzsegmentierung mit eigenen Daten#
Sehen wir uns nun an, wie das Training mit eigenen Daten abläuft. Das Modelltraining mag technisch klingen, doch der gesamte Prozess ist unkompliziert.
Du kannst deine Bilder vorbereiten, die Objekte beschriften, die das Modell lernen soll, eine kleine Konfigurationsdatei einrichten und YOLO26 anschließend mit dem Ultralytics-Python-Paket trainieren. Das Ultralytics-Python-Paket ist eine Softwarebibliothek mit sofort einsetzbaren Werkzeugen zum Trainieren, Testen und Bereitstellen von YOLO-Modellen, ohne alles von Grund auf neu entwickeln zu müssen.
Schritt 1: Deinen benutzerdefinierten Datensatz vorbereiten#
Der erste Schritt besteht darin, deinen benutzerdefinierten Segmentierungsdatensatz vorzubereiten. Ein Datensatz ist einfach eine Sammlung von Bildern, auf denen die Objekte zu sehen sind, die das Modell lernen soll.
Versuche, Bilder einzubeziehen, die reale Bedingungen widerspiegeln, etwa unterschiedliche Blickwinkel, Lichtverhältnisse, Hintergründe und Objektgrößen. Je vielfältiger deine Bilder sind, desto besser wird dein Modell abschneiden.
Für die Instanzsegmentierung benötigen deine Bilder außerdem Annotationen. Beim Annotieren werden die Objekte in jedem Bild markiert, damit das Modell weiß, was es lernen soll. Anstatt einfache Boxen zu zeichnen, zeichnest du detaillierte Umrisse (Polygone) um jedes Objekt, um dessen genaue Form zu markieren. Aus diesen Umrissen entstehen die Masken, deren Vorhersage das Modell lernt.
Es gibt mehrere quelloffene Annotationswerkzeuge, mit denen du diese Markierungen erstellen kannst. Viele dieser Werkzeuge bieten benutzerfreundliche Oberflächen, über die du Bilder hochladen und Objektumrisse direkt darauf zeichnen kannst.
Sobald deine Bilder und Annotationen fertig sind, kannst du sie in Trainings- und Validierungsordnern organisieren. Eine übliche Aufteilung besteht aus 80 % der Bilder für das Training und 20 % für die Validierung. Je nach Größe deines Datensatzes sind jedoch auch 70 % für das Training und 30 % für die Validierung verbreitet. Mit dem Trainingssatz lernt das Modell, während der Validierungssatz dazu dient, zu messen, wie gut es bei bisher unbekannten Bildern abschneidet.
Es ist wichtig, diese Aufteilung ausgewogen zu halten und sicherzustellen, dass beide Ordner eine vielfältige Auswahl an Beispielen enthalten. Ein sauberer, gut beschrifteter Datensatz mit einer passenden Aufteilung in Trainings- und Validierungsdaten bildet die Grundlage für ein leistungsfähiges Modell zur Instanzsegmentierung.
Schritt 2: Eine YAML-Datei für den Datensatz erstellen#
Nachdem du deine Bilder und Annotationen vorbereitet hast, erstellst du als Nächstes eine YAML-Datei für den Datensatz. In dieser Datei wird angegeben, wo sich dein Datensatz befindet und welche Objektklassen das Modell während des Trainings lernen soll.
In dieser Datei kannst du das Stammverzeichnis des Datensatzes, die Pfade zu deinen Trainings- und Validierungsbildordnern sowie die Liste der Klassennamen festlegen. Die Klassennamen müssen in derselben Reihenfolge aufgeführt sein wie die Klassennummern in deinen Annotationsdateien, damit alles korrekt übereinstimmt.
Wenn du Fragen zum genauen Format hast, findest du weitere Informationen in der offiziellen Ultralytics-Dokumentation.
Schritt 3: Das Ultralytics-Python-Paket installieren#
Nachdem dein Datensatz und die YAML-Datei nun fertig sind, installierst du als Nächstes das Ultralytics-Python-Paket.
Dieses Paket enthält die Werkzeuge, die du zum Trainieren, Validieren, Ausführen von Inferenz und Exportieren von Ultralytics YOLO26-Modellen benötigst. Es ermöglicht dir eine unkomplizierte Arbeit mit YOLO-Modellen, ohne komplexe Trainingspipelines von Grund auf erstellen zu müssen.
Bevor du das Ultralytics-Python-Paket installierst, solltest du außerdem entscheiden, wo du deinen Code ausführen möchtest. Du kannst mit dem Ultralytics-Paket in verschiedenen Entwicklungsumgebungen arbeiten, zum Beispiel:
- Kommandozeilenschnittstelle (CLI): Dabei handelt es sich um eine textbasierte Umgebung, in der du mit deinem Computer interagierst, indem du Befehle eingibst. Anstatt wie bei einer grafischen Oberfläche auf Schaltflächen zu klicken oder durch Menüs zu navigieren, gibst du schriftliche Anweisungen ein, um Programme auszuführen und Aufgaben direkt zu erledigen.
- Jupyter Notebooks: Eine interaktive Umgebung, in der du Code in kleinen Abschnitten schreibst und ausführst und die Ausgabe sofort siehst. Das ist hilfreich zum Experimentieren und Lernen.
- Google Colab: Eine cloudbasierte Notebook-Plattform, die keine lokale Installation erfordert und optional Zugriff auf Grafikprozessoren (GPUs) bietet. Für Einsteiger ist dies oft die einfachste Option.
Sobald du deine Umgebung ausgewählt hast, kannst du das Ultralytics-Python-Paket installieren. Führe dazu den folgenden Befehl aus:
pip install ultralytics
Wenn du eine Notebook-Umgebung wie Google Colab oder Jupyter Notebook verwendest, setze ein Ausrufezeichen an den Anfang des Befehls. Sollten bei der Installation Probleme auftreten, findest du in der Ultralytics-Dokumentation oder im Leitfaden zur Fehlerbehebung häufige Lösungen und Tipps zur Einrichtung deiner Umgebung.
Nach der Installation kannst du ein vortrainiertes Ultralytics-YOLO26-Segmentierungsmodell laden und mit dem Training beginnen.
Schritt 4: Ultralytics YOLO26 für die Instanzsegmentierung trainieren#
Bevor du mit dem Training beginnst, musst du eine Modellgröße auswählen. Ultralytics-YOLO26-Modelle sind in verschiedenen Größen verfügbar: Nano (n), Small (s), Medium (m), Large (l) und Extra Large (x).
Kleinere Modelle lassen sich schneller trainieren und laufen effizienter auf Zentralprozessoren (CPUs) oder Edge-Geräten. Größere Modelle bieten dagegen in der Regel eine höhere Genauigkeit, benötigen jedoch mehr Arbeitsspeicher und profitieren von der Beschleunigung durch eine GPU. Wenn du gerade erst anfängst oder mit begrenzter Hardware arbeitest, ist die Nano-Version (YOLO26n) eine praktische Wahl.
Nachdem du eine Modellgröße ausgewählt hast, lädst du als Nächstes ein vortrainiertes Segmentierungsmodell und beginnst mit dem Training auf deinem benutzerdefinierten Datensatz. Dazu musst du die Datei des vortrainierten Modells, den Pfad zu deiner YAML-Datei für den Datensatz, die Anzahl der Epochen und die Bildgröße wie unten gezeigt angeben.
from ultralytics import YOLO
model = YOLO("yolo26n-seg.pt")
results = model.train(data="path/to/file.yaml", epochs=100, imgsz=640)Die Anzahl der Epochen gibt an, wie oft das Modell den gesamten Trainingsdatensatz durchläuft. In jeder Epoche erstellt das Modell Vorhersagen, vergleicht sie mit den korrekten Annotationen, berechnet Fehler und aktualisiert seine internen Parameter, um die Leistung zu verbessern.
Wenn das Training korrekt beginnt, werden die Modellkonfiguration, die Datensatzprüfung und der Trainingsfortschritt in deinem Terminal oder Notebook angezeigt. Während des Trainings werden die Verlustwerte und Bewertungsmetriken nach jeder Epoche aktualisiert und zeigen, wie sich das Modell mit der Zeit verbessert.
Schritt 5: Die Leistung des benutzerdefiniert trainierten Modells bewerten#
Nach Abschluss des Trainings kannst du die Leistungsmetriken des Modells überprüfen und validieren. In Google Colab kannst du zum Ordner „runs“, dann zum Ordner „segment“ und schließlich zum Ordner „train“ wechseln. Dort findest du Protokolle mit wichtigen Leistungsindikatoren.
Wenn du in einer Python-Umgebung arbeitest, werden die Trainingsergebnisse standardmäßig im Verzeichnis „runs/train/“ innerhalb deines aktuellen Arbeitsverzeichnisses gespeichert. Für jeden Trainingslauf wird ein neues Unterverzeichnis erstellt, zum Beispiel runs/train/exp oder runs/train/exp2. Dort findest du Protokolle, gespeicherte Gewichte und weitere Ausgaben zu diesem Experiment.
Wenn du die CLI verwendest, kannst du mit dem Befehl „yolo settings“ auf diese Ergebnisse zugreifen und sie verwalten. Mit diesem Befehl kannst du die Pfade und Konfigurationen für Trainingsprotokolle und Experimentdetails anzeigen oder ändern.
Unter den gespeicherten Ausgaben findest du außerdem Diagramme, die während des Trainings erstellt wurden. Sie zeigen, wie sich das Modell mit der Zeit verbessert hat. Beispielsweise veranschaulichen sie, wie der Verlust beim Lernen des Modells gesunken ist und wie Bewertungsmetriken wie Präzision, Trefferquote und mittlere durchschnittliche Präzision über die Epochen hinweg gestiegen sind.

Abb. 4. Diagrammtypen, die du zur Bewertung deines Modells analysieren kannst (Quelle)
Diese visuellen Trends helfen dir zu verstehen, ob das Modell erfolgreich trainiert wurde und wie stark es sich vom Beginn bis zum Ende des Trainings verbessert hat. Wenn du sowohl die Zahlenwerte als auch die Diagramme überprüfst, erhältst du ein klareres Bild davon, wie gut dein Instanzsegmentierungsmodell funktioniert, bevor du es mit neuen Bildern testest.
Schritt 6: Dein Modell testen und Inferenzen ausführen#
Nachdem du dein Modell validiert hast, testest du es im letzten Schritt mit neuen Bildern. Dieser Vorgang heißt Inferenz und bedeutet einfach, dass dein trainiertes Modell Vorhersagen für unbekannte Daten erstellt.
Du kannst die Inferenz in Python wie folgt ausführen:
results = model.predict("path/to/image.jpg", save=True, conf=0.3)In diesem Beispiel kannst du "path/to/image.jpg" durch den Pfad zu dem Bild ersetzen, das du testen möchtest.
Mit der Einstellung „save=True“ weist du das Modell an, ein neues Bild zu erstellen und zu speichern, auf dem die vorhergesagten Segmentierungsmasken über das Originalbild gelegt sind.
Mit der Einstellung „conf=0.3“ legst du den Konfidenzschwellenwert fest. Das bedeutet, dass das Modell nur Vorhersagen anzeigt, bei denen es sich zu mindestens 30 % sicher ist, dass sie korrekt sind. Wenn du diesen Wert senkst, werden möglicherweise mehr Erkennungen angezeigt; bei einem höheren Wert wählt das Modell stärker aus.
Nach Ausführung des Befehls erstellt das Modell einen neuen Ordner im Verzeichnis runs und speichert dort das Ausgabebild. Du kannst das gespeicherte Bild öffnen, um visuell zu prüfen, wie gut die Segmentierungsmasken den Objektgrenzen folgen und ob überlappende Objekte korrekt voneinander getrennt werden.
Wenn du das Modell mit verschiedenen Bildern, Hintergründen und Lichtverhältnissen testest, erhältst du ein klareres Bild davon, wie es außerhalb des Trainingsdatensatzes funktioniert. Sobald die Ergebnisse konsistent und präzise sind, kann das Modell exportiert und eingesetzt werden.
Schritt 7: Dein Modell exportieren und einsetzen#
Nachdem du dein Modell getestet und seine gute Leistung bestätigt hast, exportierst und setzt du es im letzten Schritt ein. Beim Export wird dein trainiertes Ultralytics-YOLO26-Modell in ein Format umgewandelt, das in verschiedenen Umgebungen ausgeführt werden kann, etwa auf Produktionsservern, Edge-Geräten oder in mobilen Anwendungen.
Ultralytics unterstützt mehrere Exportformate, sodass du das Format auswählen kannst, das am besten zu deiner Einsatzumgebung passt. Du kannst beispielsweise nach ONNX exportieren, um eine breite Plattformkompatibilität zu erreichen, nach TensorRT, um die GPU-Leistung auf NVIDIA-Hardware zu optimieren, oder nach OpenVINO, um Modelle effizient auf Intel-Geräten mit CPUs einzusetzen. Dank dieser Integrationen lässt sich dein Modell einfacher außerhalb der Trainingsumgebung ausführen und eine starke Echtzeitleistung erzielen.
Du kannst dein Modell in Python mit dem folgenden Befehl exportieren:
model.export(format="onnx")Dieser Befehl wandelt dein trainiertes Modell in das ONNX-Format um. Je nach Anforderungen für den Einsatz kannst du "onnx" durch andere unterstützte Formate ersetzen.
Nach dem Export kannst du dein Modell in Anwendungen wie Webdiensten, eingebetteten Bildverarbeitungssystemen, Robotikplattformen oder industriellen Prüfsystemen integrieren. Damit kann dein benutzerdefiniert trainiertes Ultralytics-YOLO26-Modell für die Instanzsegmentierung von der Experimentierphase in den praktischen Einsatz übergehen.
Die wichtigsten Erkenntnisse#
Wenn du Ultralytics YOLO26 für die Instanzsegmentierung benutzerdefiniert trainierst, kannst du ein Modell erstellen, das genau zu deinem Anwendungsfall passt. Mit einem gut vorbereiteten Datensatz, einer eingerichteten YAML-Datei, dem Training mit vortrainierten Segmentierungsgewichten und der Überprüfung der Ergebnisse kannst du dem Modell beibringen, jedes Objekt auf Pixelebene präzise zu umreißen. Nach dem Testen und Exportieren kann dein YOLO26-Modell von der Entwicklungsphase in reale Anwendungen unterschiedlicher Größenordnungen übergehen.
Werde Teil unserer Community und wirf einen Blick auf unser GitHub-Repository, um mehr über KI zu erfahren. Wenn du dein eigenes KI-Projekt im Bereich Bildverarbeitung entwickeln möchtest, informiere dich über unsere Lizenzoptionen. Erfahre mehr über Anwendungen wie KI im Gesundheitswesen und KI-gestützte Bildverarbeitung im Einzelhandel auf unseren Lösungsseiten.









