Erkennung kleiner Objekte mit Ultralytics YOLO11
Entdecke, wie Ultralytics YOLO11 schnelle und präzise Erkennung kleiner Objekte in realen Anwendungen wie Überwachung und Robotik ermöglicht.

Drohnen mit integrierter visueller KI können mehrere hundert Meter über dem Boden fliegen und sollen dennoch eine Person erkennen, die in ihrem Videobild nur als wenige Pixel erscheint. Tatsächlich ist dies eine häufige Herausforderung in Anwendungen wie Robotik, Überwachung und Fernerkundung, bei denen Systeme sehr kleine Objekte in einem Bild identifizieren müssen.
Herkömmliche Modelle zur Objekterkennung können damit jedoch Schwierigkeiten haben. Kleine Objekte in Bildern und Videos enthalten nur sehr wenige visuelle Informationen. Einfach gesagt gibt es für ein Modell beim Betrachten nicht viele Details, aus denen es lernen oder die es erkennen kann.
Im Hintergrund basieren diese Modelle typischerweise auf einer Architektur auf Grundlage eines faltenden neuronalen Netzes (CNN). Bilder durchlaufen Schichten des Netzwerks und werden in Merkmalskarten oder vereinfachte Darstellungen umgewandelt, die relevante Muster anstelle der Rohpixel hervorheben.
Je tiefer das Bild durch das Netzwerk läuft, desto kleiner werden diese Merkmalskarten. Dadurch wird die Berechnung schneller, zugleich können jedoch feine Details verloren gehen.
Für winzige Objekte sind diese Details entscheidend. Sobald sie verschwinden, kann ein Computer-Vision-Modell Schwierigkeiten haben, das Objekt zu erkennen, was zu weniger präzisen oder inkonsistenten Begrenzungsrahmen führen kann.
Echtzeitfähige End-to-End-Computer-Vision-Systeme machen dies noch schwieriger. Bilder mit hoher Auflösung bewahren mehr Details, verlangsamen jedoch die Inferenz und benötigen mehr GPU-Leistung. Niedrigere Auflösungen laufen schneller, aber kleine Objekte werden noch schwerer erkennbar.
Es entsteht ein ständiger Balanceakt zwischen Geschwindigkeit, Genauigkeit und den Grenzen der Hardware. Dank aktueller technologischer Fortschritte sind Computer-Vision-Modelle wie Ultralytics YOLO11 und das bevorstehende Ultralytics YOLO26 darauf ausgelegt, diesen Zielkonflikt effektiver zu bewältigen.

Abb. 1. Verwendung von YOLO11 zur Erkennung kleiner Objekte in Luftbildern (Quelle)
In diesem Artikel untersuchen wir, warum die Erkennung kleiner Objekte schwierig ist und wie Ultralytics YOLO11 sie erleichtern kann. Legen wir los!
Was ist die Erkennung kleiner Objekte und warum ist sie wichtig?#
Die Erkennung kleiner Objekte ist eine Aufgabe des Computer Vision, eines Teilgebiets der KI, und konzentriert sich auf das Identifizieren und Lokalisieren von Objekten, die nur einen sehr kleinen Teil eines Bildes einnehmen. Diese Objekte werden im Bild oft durch eine begrenzte Anzahl von Pixeln dargestellt, den kleinsten Einheiten eines digitalen Bildes. Dadurch sind sie schwerer zu erkennen als größere und deutlichere Ziele, die häufig mehr Pixel enthalten.
Fahrzeuge in Luftbildern, Werkzeuge auf einer Fabrikfläche oder von Weitwinkel-Überwachungskameras erfasste Personen können beispielsweise als kleine Objekte im Bild erscheinen. Ihre Erkennung ist wichtig, weil sie oft kritische Informationen liefern und viele Anwendungen in der Praxis, etwa Überwachungssysteme, darauf angewiesen sind, um korrekt zu funktionieren.
Wenn kleine Objekte übersehen werden, können Systemleistung und Entscheidungsfindung beeinträchtigt werden. Die Überwachung unbemannter Luftfahrzeuge (UAV) ist ein gutes Beispiel: Wird ein kleines bewegliches Objekt am Boden übersehen, kann dies die Genauigkeit der Navigation oder Verfolgung beeinträchtigen.
Herausforderungen bei der Erkennung kleiner Objekte#
Frühere Systeme verwendeten von Hand entwickelte Merkmale und herkömmliche Computer-Vision-Verfahren, die in unübersichtlichen oder abwechslungsreichen Szenen Schwierigkeiten hatten. Auch heute ist die Erkennung kleiner Ziele schwierig, wenn sie nur einen winzigen Teil des Bildes einnehmen, obwohl Deep-Learning-Modelle deutlich bessere Ergebnisse erzielen.
Sehen wir uns als Nächstes einige der häufigen Herausforderungen an, die bei der Erkennung kleiner Objekte in verschiedenen realen Szenarien auftreten.
Größe, Pixel und Informationsverlust#
Kleine Objekte enthalten sehr wenige Pixel, wodurch die Menge an visuellen Details begrenzt wird, die ein Modell in Phasen wie der Merkmalsextraktion lernen kann. Dadurch sind Muster wie Kanten, Formen und Texturen schwerer zu erkennen, und kleine Objekte verschmelzen eher mit dem Hintergrund.
Wenn Bilder die Faltungsschichten eines neuronalen Netzwerks durchlaufen, werden die visuellen Informationen in den Pixeln schrittweise zu Merkmalskarten komprimiert. Das hilft dem Modell, effizient zu bleiben, bedeutet aber auch, dass feine Details verblassen.

Abb. 2. Merkmalskarten stellen visuelle Muster in einem Bild dar (Quelle)
Bei kleinen Zielen können wichtige Hinweise verschwinden, bevor das Erkennungsnetzwerk sie verarbeiten kann. In diesem Fall wird die Lokalisierung unzuverlässiger, und Begrenzungsrahmen können sich verschieben, überlappen oder die Zielobjekte vollständig verfehlen.
Verdeckung, Maßstabsvariation und Kontext#
Herausforderungen im Zusammenhang mit der Größe werden auch häufig durch Verdeckungen verursacht. Eine Verdeckung tritt auf, wenn Objekte, insbesondere kleinere, teilweise von anderen Objekten in der Szene verborgen werden.
Dadurch wird die sichtbare Fläche eines Ziels kleiner, was die dem Objektdetektor verfügbaren Informationen begrenzt. Selbst eine geringe Verdeckung kann Erkennungsnetzwerke verwirren, insbesondere in Verbindung mit Eingaben niedriger Auflösung. Ein interessantes Beispiel dafür findet sich in UAV-Datensätzen wie VisDrone, in denen Fußgänger, Fahrräder oder Fahrzeuge teilweise von Gebäuden, Bäumen oder anderen beweglichen Objekten verdeckt sein können.

Abb. 3. Ein Beispiel aus dem VisDrone-Datensatz mit kleinen Objekten (Quelle)
Ebenso führt die Maßstabsvariation zu einer weiteren Schwierigkeit, wenn dasselbe Objekt je nach Entfernung und Kameraposition sehr klein oder relativ groß erscheint. Trotz dieser Hürden müssen Erkennungsalgorithmen diese kleinen Objekte über verschiedene Maßstäbe hinweg erkennen, ohne an Genauigkeit zu verlieren.
Auch der Kontext spielt bei der Erkennung eine wichtige Rolle. Große Objekte erscheinen beispielsweise meist in einer klar erkennbaren Umgebung, die hilfreiche visuelle Hinweise liefert. Kleine Ziele verfügen dagegen oft über weniger Kontextinformationen, was die Mustererkennung erschwert.
Das verborgene Metrikproblem bei der Erkennung kleiner Objekte#
Gängige Bewertungsmetriken wie Intersection over Union (IoU) messen, wie stark sich ein vorhergesagter Begrenzungsrahmen mit dem Referenzrahmen überlappt. Während IoU bei größeren Objekten gut funktioniert, verhält sich die Metrik bei kleinen Objekten deutlich anders.
Kleine Objekte nehmen nur wenige Pixel ein. Daher kann bereits eine geringfügige Verschiebung des vorhergesagten Rahmens einen großen relativen Fehler verursachen und den IoU-Wert stark senken. Das bedeutet, dass kleine Objekte den standardmäßigen IoU-Schwellenwert für eine korrekte Vorhersage häufig nicht erreichen, selbst wenn das Objekt im Bild sichtbar ist.
Daher werden Lokalisierungsfehler häufiger als falsch-positive oder falsch-negative Ergebnisse klassifiziert. Diese Einschränkungen haben Forschende dazu veranlasst, die Bewertung und Verarbeitung kleiner, schwer erkennbarer Ziele durch Objekterkennungssysteme neu zu überdenken.
Merkmale über mehrere Maßstäbe: Der Schlüssel zur Echtzeit-Erkennung kleiner Objekte#
Bei der Arbeit an der Verbesserung der Erkennung kleiner Objekte wurde deutlich, dass die Bewahrung und Darstellung visueller Informationen über mehrere Maßstäbe hinweg entscheidend ist. Diese Erkenntnis findet sich auch in aktuellen arXiv-Forschungsarbeiten und in Beiträgen wieder, die auf Veranstaltungen wie IEEE-Konferenzen und der European Computer Vision Association (ECCV) vorgestellt wurden.
Je tiefer Bilder ein neuronales Netzwerk durchlaufen, desto mehr Details können kleine Objekte verlieren oder vollständig verschwinden. Deshalb legen moderne Computer-Vision-Modelle wie Ultralytics YOLO11 großen Wert auf eine bessere Merkmalsextraktion. Sehen wir uns als Nächstes die grundlegenden Konzepte hinter Merkmalskarten und Merkmals-Pyramiden-Netzwerken an, um sie besser zu verstehen.
Merkmalskarten und Darstellung über verschiedene Maßstäbe#
Wenn ein Eingabebild, etwa ein Fernerkundungsbild, in ein neuronales Netzwerk gelangt, wird es schrittweise in Merkmalskarten umgewandelt. Dabei handelt es sich um vereinfachte Darstellungen des Bildes, die visuelle Muster wie Kanten, Formen und Texturen hervorheben.
Je tiefer das Netzwerk wird, desto kleiner werden diese Merkmalskarten in ihrer räumlichen Größe. Diese Reduzierung hilft dem Modell, effizient zu arbeiten und sich auf Informationen höherer Ebene zu konzentrieren. Verkleinerte und tiefe Merkmalskarten verringern jedoch auch die räumlichen Details.

Abb. 4. Merkmalsextraktion ist entscheidend für die Erkennung kleiner Objekte. (Quelle)
Während große Objekte genügend visuelle Informationen für eine präzise Erkennung behalten, können kleine Ziele bereits nach wenigen Netzwerkschichten wichtige Details verlieren. In diesem Fall kann ein Modell Schwierigkeiten haben, überhaupt zu erkennen, dass ein kleines Objekt vorhanden ist. Dies ist einer der Hauptgründe, warum kleine Objekte in tiefen Objekterkennungsmodellen übersehen werden.
Merkmals-Pyramiden-Netzwerke und Lernen über mehrere Maßstäbe#
Merkmals-Pyramiden-Netzwerke, häufig als FPN bezeichnet, wurden entwickelt, um den Verlust räumlicher Details auszugleichen. Sie dienen als unterstützendes Modul, das Informationen aus mehreren Schichten kombiniert, damit Modelle kleine Objekte effektiver erkennen können. Dieser Prozess wird auch als Merkmalsaggregation und Merkmalsfusion bezeichnet.
Flache Schichten liefern feine räumliche Details, während tiefere Schichten semantischen Kontext hinzufügen und so effektives Lernen von Merkmalen über mehrere Maßstäbe ermöglichen. Anders als beim naiven Upsampling, bei dem Merkmalskarten einfach vergrößert werden, bewahrt FPN aussagekräftige Informationen und verbessert die Erkennung kleiner Objekte.
Moderne Ansätze bauen auf dieser Idee auf und verwenden adaptive Merkmalsfusion sowie kontextbewusste Entwürfe, um die Erkennung kleiner Ziele weiter zu verbessern. Anders gesagt hilft FPN Modellen, gleichzeitig das große Ganze und winzige Details zu erkennen. Diese Optimierung ist entscheidend, wenn Objekte klein sind.
Wie sich Objekterkennungsmodelle zur Verarbeitung kleiner Objekte entwickelt haben#
Hier ist ein kurzer Überblick darüber, wie sich Objekterkennungsmodelle im Laufe der Zeit weiterentwickelt haben, um Objekte unterschiedlicher Größe, einschließlich sehr kleiner Objekte, besser zu erkennen:
- Frühe Erkennungsverfahren: Frühe Ansätze zur Objekterkennung stützten sich auf manuell entwickelte Merkmale und regelbasierte Algorithmen aus der klassischen Bildverarbeitung. Da diese Merkmale fest vorgegeben waren, nahm die Leistung bei unterschiedlichen Bildern ab.
- Einführung von maschinellem Lernen und Deep Learning: Die Einführung von maschinellem Lernen und Deep Learning markierte einen bedeutenden Wandel in der Forschung zur Objekterkennung. Anstatt sich auf vorgegebene Regeln zu verlassen, lernten neuronale Netzwerke visuelle Darstellungen direkt aus Trainingsdaten und verbesserten so ihre Anpassungsfähigkeit an unterschiedliche Objektgrößen und Szenen.
- Faltungsnetzwerke: Diese neuronalen Netzwerke lernen, Muster in Bildern zu erkennen. Jede Schicht erfasst andere Details: zunächst einfache Kanten und Farben, dann Formen und schließlich vollständige Objekte. Dadurch sind sie für modernes Computer Vision unverzichtbar.
- Objektdetektoren mit zwei Stufen: Detektoren mit zwei Stufen, etwa Faster R-CNN, das von Girshick und Ren vorgestellt wurde, erzeugten zunächst Kandidatenregionen und klassifizierten diese anschließend. Dieser Ansatz verbesserte die Genauigkeit bei kleinen Objekten, erhöhte jedoch die Rechenkosten und verringerte die Echtzeitleistung.
- Objektdetektoren mit einer Stufe: Detektoren mit einer Stufe wie SSD (Single-Shot Detector) und die YOLO-Familie (You Only Look Once), einschließlich YOLOv3, Ultralytics YOLOv5 und später Ultralytics YOLOv8, führen die Erkennung in einem einzigen Durchlauf durch. Dieses Design verbessert die Inferenzgeschwindigkeit deutlich und behält dabei eine konkurrenzfähige Genauigkeit bei.
- Modernste Modelle: Neuere Objekterkennungsmodelle legen größeren Wert auf Echtzeitleistung und die Bereitstellung auf Edge-Geräten. Aktuelle Veröffentlichungen von Ultralytics-YOLO-Modellen wie Ultralytics YOLO11 und das bevorstehende Ultralytics YOLO26 sind darauf ausgelegt, hohe Genauigkeit mit Inferenz mit geringer Latenz zu verbinden. Dadurch eignen sie sich gut für die Erkennung von Objekten jeder Größe, einschließlich kleiner Ziele, auf Geräten mit begrenzter Rechenleistung.
Ultralytics YOLO11 für Anwendungsfälle zur Erkennung kleiner Objekte#
Nachdem wir nun besser verstehen, wie die Erkennung kleiner Objekte funktioniert, sehen wir uns einige reale Anwendungen an, in denen Ultralytics YOLO11 eingesetzt werden kann.
UAV- und Luftbildverarbeitung#
Stell dir eine Drohne vor, die hoch über einer belebten Stadtstraße fliegt. Aus dieser Höhe schrumpfen Autos, Fahrräder und sogar Menschen auf einem Bildschirm zu wenigen Pixeln.
Module für UAV- und Luftbildverarbeitung erfassen häufig solche Szenen, in denen die interessanten Objekte winzig und von unübersichtlichen Hintergründen umgeben sind, was ihre Erkennung für Computer-Vision-Modelle erschwert.
In solchen Szenarien kann Ultralytics YOLO11 eine ideale Modellwahl sein. Eine mit einem Modell wie YOLO11 ausgestattete Drohne könnte beispielsweise den Verkehr in Echtzeit überwachen und Fahrzeuge, Radfahrende sowie Fußgänger erkennen, während sie sich durch die Szene bewegen, selbst wenn jedes Objekt nur einen kleinen Teil des Bildes einnimmt. Dies ermöglicht schnellere Entscheidungen und präzisere Erkenntnisse in Anwendungen wie Verkehrsmanagement, öffentlicher Sicherheit oder Stadtplanung.
Robotik und Automatisierung#
Roboter werden häufig in Umgebungen eingesetzt, in denen Genauigkeit und der richtige Zeitpunkt entscheidend sind. In Bereichen wie Lagern, Fabriken und landwirtschaftlichen Betrieben muss ein Roboter möglicherweise sehr kleine Objekte erkennen, etwa ein Bauteil an einer Montagelinie, ein Etikett auf einem Paket oder eine kleine Pflanzentriebspitze auf einem Feld, und schnell reagieren.
Die Erkennung von Objekten dieser Größe kann schwierig sein, insbesondere wenn sie im Kamerabild nur als wenige Pixel erscheinen oder teilweise von anderen Objekten verdeckt werden. Das Übersehen dieser kleinen Details kann die Automatisierung verlangsamen oder die Fähigkeit des Roboters beeinträchtigen, eine Aufgabe abzuschließen.
Ultralytics YOLO11 kann in diesen Situationen einen entscheidenden Unterschied machen. Die verbesserte Merkmalsextraktion und die schnelle Inferenz ermöglichen es Robotern, kleine Objekte in Echtzeit zu erkennen und sofort zu handeln.
Ultralytics YOLO11 unterstützt außerdem die Instanzsegmentierung. Dadurch können Roboter Objektgrenzen und Greifpunkte präziser erfassen, anstatt lediglich allgemeine Begrenzungsrahmen zu lokalisieren. Ein mit YOLO11 ausgestatteter Roboterarm könnte beispielsweise kleine Bauteile auf einem Förderband erkennen, ihre genaue Form segmentieren und sie aufnehmen, bevor sie außer Reichweite gelangen. So bleibt das System effizient und zuverlässig.
Was Ultralytics YOLO11 für die Erkennung kleiner Objekte leistungsfähig macht#
Bei der großen Auswahl an Computer-Vision-Modellen fragst du dich vielleicht, wodurch sich Ultralytics YOLO11 hervorhebt.
Hier sind einige Gründe, warum Ultralytics YOLO11 eine gute Option für Anwendungen ist, in denen kleine Objekte erkannt werden müssen:
- Bessere Merkmalsextraktion: YOLO11 verwendet eine verbesserte Backbone- und Neck-Architektur, um die Merkmalsextraktion zu optimieren und dadurch eine präzisere Objekterkennung zu ermöglichen.
- Ökosystem und einfache Nutzung: Das Ultralytics-Python-Paket ist eine Bibliothek mit integrierten Funktionen zum Laden, Trainieren, Validieren und Bereitstellen von Modellen wie YOLO11. Da diese Arbeitsabläufe nur wenige Codezeilen erfordern, können Teams Modelle für die Erkennung kleiner Objekte schnell ausprobieren und feinabstimmen.
- Für die Bereitstellung auf Edge-Geräten optimiert: Ultralytics YOLO11 kann effizient auf Edge-Geräten wie NVIDIA Jetson, Raspberry Pi und industriellen Kamerasystemen ausgeführt werden. Einfach gesagt ermöglicht es Aufgaben der visuellen KI in Echtzeit direkt auf dem Gerät.
Praktische Strategien für die Erkennung kleiner Objekte mit Ultralytics YOLO11#
Neben der Verwendung eines Modells wie Ultralytics YOLO11 können auch die Vorbereitung deiner Annotationen, der gesamte Datensatz und das Modelltraining die Erkennungsleistung erheblich beeinflussen.
Hier ist ein kurzer Überblick über die wichtigsten Punkte:
- Geeignete Datenerweiterung: Moderate Datenerweiterungen wie Skalieren oder Zuschneiden können dem Modell helfen, auf neue Bilder zu verallgemeinern. Eine aggressive Erweiterung mit großen Maßstabsänderungen kann jedoch kleine Objekte verzerren oder entfernen, wodurch sie für das Modell schwerer zu lernen sind.
- Fehlerfälle untersuchen: Die Analyse, wann das Modell Objekte übersieht oder falsch identifiziert, hilft dabei, eine Ausgangsbasis zu schaffen und zu erkennen, ob die Probleme aus dem Datensatz, dem Informationsverlust während der Merkmalsextraktion oder der Notwendigkeit entstehen, Trainingseinstellungen anzupassen.
- Zusammensetzung des Datensatzes: Dein Datensatz sollte genügend Beispiele für kleine Objekte enthalten, damit das Modell aussagekräftige Muster lernen kann. Außerdem sollte er ausgewogen bleiben, damit größere Objekte kleinere während des Trainings nicht überlagern.
Wichtige Erkenntnisse#
Die Erkennung kleiner Objekte ist schwierig, weil kleine Ziele Details verlieren, während Bilder ein Computer-Vision-Modell durchlaufen. Ultralytics YOLO11 verbessert die Bewahrung dieser Details und macht die Erkennung kleiner Objekte zuverlässiger, ohne die Echtzeitleistung zu beeinträchtigen. Dieses Gleichgewicht ermöglicht es YOLO11, in realen Anwendungen eine präzise und effiziente Erkennung zu unterstützen.
Werde Teil unserer wachsenden Community! Erfahre mehr über KI in unserem GitHub-Repository. Entdecke Innovationen wie Computer Vision im Einzelhandel und KI in der Automobilbranche, indem du unsere Lösungsseiten besuchst. Wenn du heute mit der Entwicklung von Computer-Vision-Anwendungen beginnen möchtest, informiere dich über unsere Lizenzoptionen.









