Selbstüberwachtes Lernen zur Rauschunterdrückung: Schritt für Schritt erklärt
Sieh dir an, wie selbstüberwachtes Lernen zur Rauschunterdrückung funktioniert, warum Bilder verrauscht werden und welche wichtigen Methoden und Schritte zur Wiederherstellung sauberer visueller Details eingesetzt werden.

Kameras erfassen die Welt nicht immer so, wie wir sie sehen. Ein bei schwachem Licht aufgenommenes Porträt oder das Foto eines schnell fahrenden Autos kann körnig, verschwommen oder verzerrt wirken.
Langsame Sensoren, dunkle Umgebungen und Bewegung können winzige Rauschpunkte erzeugen, die Kanten abschwächen und wichtige Details verdecken. Geht diese Klarheit verloren, können selbst fortschrittliche Systeme für künstliche Intelligenz und maschinelles Lernen Schwierigkeiten haben, den Bildinhalt zu verstehen, da viele intelligente Systeme auf diese feinen Details angewiesen sind, um gut zu funktionieren.
Beispielsweise ist Computer Vision ein Bereich der künstlichen Intelligenz, der es Maschinen ermöglicht, Bilder und Videos zu interpretieren. Damit dies präzise gelingt, benötigen Modelle für Computer Vision saubere visuelle Daten hoher Qualität, aus denen sie lernen können.
Insbesondere unterstützen Modelle wie Ultralytics YOLO11 und das kommende Ultralytics YOLO26 Aufgaben wie Objekterkennung, Instanzsegmentierung und Posenschätzung und können für verschiedene Anwendungsfälle individuell trainiert werden. Diese Aufgaben beruhen auf klaren visuellen Merkmalen wie Kanten, Texturen, Farben und feinen strukturellen Details.
Wenn Rauschen diese Merkmale verdeckt, erhält das Modell schwächere Trainingssignale, wodurch das Lernen präziser Muster erschwert wird. Infolgedessen können bereits geringe Rauschmengen die Leistung in realen Anwendungen beeinträchtigen.
Zuvor haben wir uns angesehen, wie selbstüberwachtes Lernen Bilder entrauscht. In diesem Artikel gehen wir näher darauf ein, wie selbstüberwachte Verfahren zur Rauschunterdrückung funktionieren und wie sie dabei helfen, aussagekräftige visuelle Informationen wiederherzustellen. Legen wir los!
Häufige Rauscharten in Bildern aus der realen Welt#
Bevor wir untersuchen, wie selbstüberwachtes Lernen zur Bildentrauschung eingesetzt wird, sehen wir uns zunächst noch einmal an, warum Bilder überhaupt verrauschen.
Bilder realer Objekte und Szenen sind nur selten perfekt. Schwaches Licht, eine begrenzte Sensorqualität und schnelle Bewegungen können zufällige Störungen in einzelnen Pixeln des Bildes verursachen. Diese als Rauschen bezeichneten Störungen auf Pixelebene verringern die Gesamtklarheit und erschweren das Erkennen wichtiger Details.
Wenn Rauschen Kanten, Texturen und subtile Muster verdeckt, haben Computer-Vision-Systeme Schwierigkeiten, Objekte zu erkennen oder Szenen präzise zu interpretieren. Unterschiedliche Bedingungen erzeugen unterschiedliche Rauscharten, die das Bild jeweils auf eigene Weise beeinflussen.

Abb. 1. Ein Beispiel dafür, wie Rauschen die Unsicherheit in einem Bild erhöhen kann. (Quelle)
Hier sind einige der häufigsten Rauscharten in Bildern:
- Gaußsches Rauschen: Diese Rauschart erscheint als weiches, zufälliges Körnchen, das durch elektronische Störungen des Sensors oder thermische Schwankungen verursacht wird. Sie folgt einer Gaußverteilung (Normalverteilung), bei der kleine Pixelabweichungen feine Details verwischen und die Gesamtschärfe verringern.
- Poisson-Rauschen: Diese auch als Schrotrauschen bezeichnete Rauschart tritt bei schwachem Licht oder kurzen Belichtungszeiten auf. Ihre Varianz steigt mit der Helligkeit, doch das Rauschen fällt in dunkleren Bereichen oft stärker auf, weil weniger Photonen erfasst werden und dadurch das Signal-Rausch-Verhältnis geringer ist.
- Salz-und-Pfeffer-Rauschen: Diese Rauschart erscheint als scharfe schwarze oder weiße Pixelausreißer. Sie wird typischerweise durch Übertragungsfehler, Bitfehler oder fehlerhafte Kamerasensoren verursacht und führt häufig zu fehlenden oder beschädigten Pixelwerten.
- Sprenkelrauschen: Diese Rauschart erscheint als körnige, fleckenartige Muster und tritt häufig in medizinischen Aufnahmen, Radaraufnahmen und Ultraschallbildern auf. Sie wird durch Signalinterferenz und Streuung verursacht, wodurch der Kontrast abnimmt und Kanten schwerer zu erkennen sind.
Wann solltest du selbstüberwachte Rauschunterdrückung einsetzen?#
Was macht selbstüberwachte Rauschunterdrückung also so besonders? Sie ist besonders hilfreich in Situationen, in denen saubere Referenzbilder schlicht nicht existieren oder nur sehr schwer aufgenommen werden können.
Das kommt häufig bei Aufnahmen unter schwachem Licht, Bildern mit hoher ISO-Empfindlichkeit, medizinischer und wissenschaftlicher Bildgebung oder in Umgebungen vor, in denen Rauschen unvermeidbar ist und das Sammeln perfekter Referenzdaten unrealistisch wäre. Statt saubere Beispiele zu benötigen, lernt das Modell direkt aus den bereits vorhandenen verrauschten Bildern und kann sich dadurch an die spezifischen Rauschmuster deiner Kamera oder deines Sensors anpassen.
Selbstüberwachte Rauschunterdrückung ist auch eine gute Option, wenn du die Leistung nachgelagerter Computer-Vision-Aufgaben steigern möchtest, dein Datensatz aber mit uneinheitlichen oder verrauschten Bildern gefüllt ist. Durch die Wiederherstellung klarerer Kanten, Texturen und Strukturen helfen diese Verfahren Modellen wie YOLO dabei, Szenen zuverlässiger zu erkennen, zu segmentieren und zu verstehen. Kurz gesagt: Wenn du mit verrauschten Daten arbeitest und keine sauberen Trainingsbilder verfügbar sind, bietet selbstüberwachte Rauschunterdrückung oft die praktischste und effektivste Lösung.
Die zentralen Verfahren hinter der selbstüberwachten Rauschunterdrückung#
Wie wir bereits gesehen haben, ist selbstüberwachte Rauschunterdrückung ein auf Deep Learning basierender KI-Ansatz, bei dem Modelle direkt aus verrauschten Bildern lernen, ohne auf saubere Labels angewiesen zu sein. Sie baut auf den Prinzipien des selbstüberwachten Lernens auf, bei dem Modelle ihre Trainingssignale aus den Daten selbst erzeugen.
Mit anderen Worten: Ein Modell kann sich selbst beibringen, indem es verrauschte Bilder sowohl als Eingabe als auch als Quelle seines Lernsignals verwendet. Durch den Vergleich verschiedener beschädigter Versionen desselben Bildes oder die Vorhersage maskierter Pixel lernt das Modell, welche Muster eine echte Struktur darstellen und welche lediglich Rauschen sind. Durch wiederholte Optimierung und Mustererkennung verbessert das Netzwerk nach und nach seine Fähigkeit, aussagekräftige Bildinhalte von zufälligen Abweichungen zu unterscheiden.

Abb. 2. Ein Rohbild und ein entrauschtes Bild. (Quelle)
Dies wird durch spezielle Lernstrategien ermöglicht, die das Modell dabei unterstützen, eine stabile Bildstruktur von zufälligem Rauschen zu trennen. Sehen wir uns als Nächstes die zentralen Verfahren und Algorithmen genauer an, die diesen Prozess vereinfachen, und betrachten wir, wie jeder Ansatz Modellen dabei hilft, sauberere und zuverlässigere Bilder zu rekonstruieren.
Verfahren zur paarweisen Bildentrauschung#
Viele frühe selbstüberwachte Lernverfahren zur Rauschunterdrückung arbeiteten, indem sie zwei verrauschte Versionen desselben Bildes verglichen. Da sich das Rauschen bei jeder Aufnahme oder Beschädigung eines Bildes zufällig verändert, die echte Struktur jedoch gleich bleibt, können diese Unterschiede als Lernsignal für ein Modell dienen.
Diese Ansätze werden üblicherweise als Verfahren zur paarweisen Bildentrauschung bezeichnet, da sie während des Trainings Paare verrauschter Bilder verwenden oder erzeugen. Der Ansatz Noise2Noise beispielsweise, der von Jaakko Lehtinen und seinem Team vorgeschlagen wurde, trainiert ein Modell mit zwei unabhängig verrauschten Bildern derselben Szene. Da sich die Rauschmuster zwischen den beiden Versionen unterscheiden, lernt das Modell, die konsistenten Details zu erkennen, die das tatsächliche zugrunde liegende Bild darstellen.

Abb. 3. So funktioniert Noise2Noise (Quelle)
Mit der Zeit lernt das Netzwerk dadurch, zufälliges Rauschen zu unterdrücken und die echte Struktur zu bewahren, obwohl es nie ein sauberes Referenzbild sieht. Stell dir ein einfaches Szenario vor, in dem du nachts zwei Fotos einer schlecht beleuchteten Straße aufnimmst.
Jedes Bild enthält dieselben Gebäude, Lichter und Schatten, aber das körnige Rauschen tritt an unterschiedlichen Stellen auf. Durch den Vergleich dieser beiden verrauschten Fotos während des Trainings kann ein selbstüberwachtes Modell lernen, welche visuellen Muster stabil sind und welche durch Rauschen verursacht werden, und so letztlich seine Fähigkeit verbessern, sauberere Bilder zu rekonstruieren.
Selbstüberwachte Lernverfahren zur Rauschunterdrückung mit Blindspots#
Während paarweise Verfahren auf dem Vergleich zweier unterschiedlich beschädigter Versionen desselben Bildes beruhen, verfolgen Blindspot-Verfahren einen anderen Ansatz. Sie ermöglichen es einem Modell, aus einem einzigen verrauschten Bild zu lernen, indem ausgewählte Pixel verborgen werden, sodass das Netzwerk ihre beschädigten Werte nicht sehen kann.
Das Modell muss die verborgenen Pixel anschließend ausschließlich anhand des umgebenden Kontexts vorhersagen. Die zentrale Idee dahinter ist, dass Rauschen zufällig ist, die zugrunde liegende Struktur eines Bildes jedoch nicht.
Indem Blindspot-Verfahren verhindern, dass das Modell den verrauschten Wert eines Pixels kopiert, regen sie es dazu an, anhand stabiler Bildmuster wie nahegelegener Kanten, Texturen oder Farbverläufe abzuleiten, welchen Wert dieses Pixel haben sollte. Verfahren wie Noise2Void, das von Alexander Krull und seinem Team eingeführt wurde, und Noise2Self, das von Joshua Batson und Loïc Royer entwickelt wurde, setzen dieses Prinzip um, indem sie einzelne Pixel oder kleine Nachbarschaften maskieren und das Modell darauf trainieren, diese zu rekonstruieren.
Fortschrittlichere Ansätze wie Noise2Same und PN2V verbessern die Robustheit, indem sie konsistente Vorhersagen über mehrere maskierte Versionen hinweg erzwingen oder die Rauschverteilung explizit modellieren, um die Unsicherheit zu schätzen. Da diese Verfahren nur ein einziges verrauschtes Bild benötigen, sind sie besonders nützlich in Bereichen, in denen die Aufnahme sauberer oder gepaarter Bilder unpraktisch oder unmöglich ist, etwa bei der Mikroskopie, in der Astronomie, der biomedizinischen Bildgebung oder bei Aufnahmen unter schwachem Licht.
Verfahren zur Rauschunterdrückung mit Transformer-Unterstützung#
Die meisten paarweisen und auf Blindspots basierenden selbstüberwachten Verfahren zur Rauschunterdrückung beruhen auf neuronalen Faltungsnetzen (CNNs) oder Entrauschungsnetzwerken. CNNs eignen sich gut für diese Ansätze, da sie sich auf lokale Muster konzentrieren, insbesondere auf Kanten, Texturen und kleine Details.
Architekturen wie U-Net werden häufig eingesetzt, da sie feingranulare Merkmale mit Informationen über mehrere Maßstäbe verbinden. CNNs arbeiten jedoch hauptsächlich in begrenzten Nachbarschaften, wodurch sie wichtige Beziehungen übersehen können, die sich über größere Bildbereiche erstrecken.
Transformer-gestützte, hochmoderne Verfahren zur Rauschunterdrückung wurden entwickelt, um diese Einschränkung zu beheben. Statt nur benachbarte Pixel zu betrachten, verwendet der vorgeschlagene Ansatz Aufmerksamkeitsmechanismen, um zu verstehen, wie verschiedene Bildbereiche miteinander zusammenhängen.
Einige Modelle verwenden eine vollständig globale Aufmerksamkeit, während andere fensterbasierte oder hierarchische Aufmerksamkeit nutzen, um den Rechenaufwand zu verringern. Im Allgemeinen sind sie jedoch darauf ausgelegt, weitreichende Strukturen zu erfassen, die CNNs allein nicht erkennen können. Diese umfassendere Perspektive hilft dem Modell dabei, sich wiederholende Texturen, glatte Oberflächen oder große Objekte wiederherzustellen, für die Informationen aus dem gesamten Bild erforderlich sind.
Weitere Verfahren zur Bildentrauschung#
Neben selbstüberwachten Verfahren gibt es auch mehrere andere Möglichkeiten, verrauschte Bilder zu bereinigen. Traditionelle Verfahren wie bilaterale Filterung, Wavelet-Entrauschung und nichtlokale Mittelwertbildung verwenden einfache mathematische Regeln, um Rauschen zu glätten und dabei wichtige Details möglichst zu erhalten.
Daneben gibt es auch Deep-Learning-Ansätze, darunter überwachte Modelle, die aus Paaren sauberer und verrauschter Bilder lernen, sowie generative gegnerische Netzwerke (GANs), die schärfere und realistischere Ergebnisse erzeugen. Diese Verfahren benötigen für das Training jedoch in der Regel eine bessere Bildqualität.
Eine schrittweise Betrachtung der Funktionsweise selbstüberwachter Bildentrauschung#
Nachdem wir gerade mehrere unterschiedliche Verfahren durchgegangen sind, fragst du dich vielleicht, ob jedes davon aufgrund seiner eigenen Architektur völlig anders funktioniert. Sie alle folgen jedoch einer ähnlichen Pipeline, die mit der Datenvorbereitung beginnt und mit der Modellbewertung endet.
Sehen wir uns nun genauer an, wie der gesamte Prozess der selbstüberwachten Bildentrauschung Schritt für Schritt abläuft.
Schritt 1: Vorverarbeitung und Normalisierung#
Bevor das Modell aus verrauschten Bildern lernen kann, muss zunächst sichergestellt werden, dass alle Bilder einheitlich aussehen. Echte Fotos können stark variieren.
Manche Bilder sind möglicherweise zu hell, andere zu dunkel, und bei einigen können die Farben leicht abweichen. Wenn wir diese Abweichungen direkt in ein Modell einspeisen, wird es für das Modell schwieriger, sich darauf zu konzentrieren, wie Rauschen aussieht.
Um damit umzugehen, durchläuft jedes Bild eine Normalisierung und grundlegende Vorverarbeitung. Dazu können die Skalierung der Pixelwerte auf einen Standardbereich, die Korrektur von Helligkeitsabweichungen oder das Zuschneiden und Ändern der Größe gehören. Entscheidend ist, dass das Modell saubere Daten als stabile und vergleichbare Eingaben erhält.
Schritt 2: Erzeugung eines selbstüberwachten Trainingssignals#
Sobald die Bilder normalisiert wurden, besteht der nächste Schritt darin, ein Trainingssignal zu erzeugen, das dem Modell das Lernen ermöglicht, ohne dass es jemals ein sauberes Bild sieht. Selbstüberwachte Verfahren zur Rauschunterdrückung erreichen dies, indem sie verhindern, dass das Modell die empfangenen verrauschten Pixelwerte einfach kopiert.
Stattdessen schaffen sie Situationen, in denen sich das Modell auf den umgebenden Bildkontext stützen muss, der eine stabile Struktur enthält, und nicht auf das unvorhersehbare Rauschen. Die verschiedenen Verfahren erreichen dies auf leicht unterschiedliche Weise, aber die grundlegende Idee ist dieselbe.
Einige Ansätze verbergen oder maskieren bestimmte Pixel vorübergehend, sodass das Modell sie anhand ihrer Nachbarn ableiten muss. Andere erzeugen eine separat beschädigte Version desselben verrauschten Bildes, sodass Eingabe und Ziel unabhängiges Rauschen enthalten. In beiden Fällen trägt das Zielbild aussagekräftige strukturelle Informationen, verhindert aber, dass das Netzwerk auf den ursprünglichen verrauschten Wert des vorherzusagenden Pixels zugreift.
Da sich das Rauschen zufällig verändert, während das zugrunde liegende Bild konsistent bleibt, regt dieser Aufbau das Modell auf natürliche Weise dazu an, die tatsächliche Struktur zu lernen und das Rauschen zu ignorieren, das von einer Version zur nächsten variiert.
Schritt 3: Erlernen der Rauschunterdrückung zur Wiederherstellung der Bildstruktur#
Sobald das Trainingssignal vorhanden ist, kann das Modell durch das Training lernen, aussagekräftige Bildstrukturen von Rauschen zu trennen. Bei jeder Vorhersage eines maskierten oder erneut beschädigten Pixels muss es sich auf den umgebenden Kontext stützen und nicht auf den verrauschten Wert, der ursprünglich an dieser Stelle stand.
Über viele Iterationen oder Epochen lernt das Netzwerk dadurch, Muster zu erkennen, die in einem Bild stabil bleiben, etwa Kanten, Texturen und glatte Oberflächen. Außerdem lernt es, die zufälligen Schwankungen zu ignorieren, die für Rauschen charakteristisch sind.
Betrachte beispielsweise ein Foto bei schwachem Licht, auf dem eine Oberfläche extrem körnig wirkt. Obwohl sich das Rauschen von Pixel zu Pixel verändert, ist die zugrunde liegende Oberfläche weiterhin glatt. Indem das Modell die verborgenen Pixel in solchen Bereichen wiederholt ableitet, wird es allmählich besser darin, das stabile Muster unter dem Rauschen zu erkennen und sauberer zu rekonstruieren.
Durch den Modelltrainingsprozess lernt das Netzwerk eine interne Repräsentation der Bildstruktur. Dadurch kann das Modell zusammenhängende Details wiederherstellen, selbst wenn die Eingabe stark beschädigt ist.
Schritt 4: Validierung und Ergebnisse der Rauschreduzierung#
Nachdem das Modell gelernt hat, verborgene oder erneut beschädigte Pixel vorherzusagen, besteht der letzte Schritt darin, seine Leistung bei vollständigen Bildern zu bewerten. Während des Tests erhält das Modell ein vollständiges verrauschtes Bild und erzeugt auf Grundlage seines erlernten Verständnisses der Bildstruktur eine vollständige entrauschte Version. Um die Wirksamkeit dieses Prozesses zu messen, wird die Ausgabe mit sauberen Referenzbildern oder Standard-Benchmarkdatensätzen verglichen.
Zwei häufig verwendete Metriken sind PSNR (Spitzen-Signal-Rausch-Verhältnis), das misst, wie nahe die Rekonstruktion an der sauberen Referenz liegt, und SSIM (Struktureller Ähnlichkeitsindex), der bewertet, wie gut wichtige Merkmale wie Kanten und Texturen erhalten bleiben. Höhere Werte weisen im Allgemeinen auf eine präzisere und visuell zuverlässigere Rauschunterdrückung hin.
Für Training und Benchmarking verwendete Bilddatensätze#
Die Forschung zur selbstüberwachten Rauschunterdrückung, die unter anderem in IEEE-Zeitschriften und auf CVF-Konferenzen wie CVPR, ICCV und ECCV erscheint und weithin auf arXiv veröffentlicht wird, stützt sich häufig auf eine Mischung aus synthetischen und realen Datensätzen. Damit wird die Leistung von Deep-Learning-Verfahren sowohl unter kontrollierten als auch unter praxisnahen Bedingungen bewertet. Synthetische Datensätze beginnen dabei mit sauberen Bildern und fügen künstliches Rauschen hinzu, wodurch sich Verfahren mithilfe von Metriken wie PSNR und SSIM leicht vergleichen lassen.
Hier sind einige beliebte Datensätze, die häufig mit hinzugefügtem synthetischem Rauschen für das Benchmarking verwendet werden:
- Kodak24: Dieser Datensatz enthält hochwertige Fotografien natürlicher Szenen, die häufig zum visuellen Vergleich von Ergebnissen der Rauschunterdrückung verwendet werden.
- DIV2K: Dieser hochauflösende Datensatz enthält vielfältige, detailreiche Bilder zur Bewertung der Texturtreue und der allgemeinen Qualität der Wiederherstellung.
Reale verrauschte Datensätze enthalten dagegen Bilder, die direkt mit Kamerasensoren bei schwachem Licht, hoher ISO-Empfindlichkeit oder unter anderen schwierigen Bedingungen aufgenommen wurden. Mit diesen Datensätzen wird geprüft, ob ein Modell komplexes, nicht gaußsches Rauschen verarbeiten kann, das sich nicht einfach simulieren lässt.
Hier sind einige beliebte reale verrauschte Datensätze:
- SIDD: Dieser Datensatz enthält Paare realer verrauschter und sauberer Bilder, die mit Smartphone-Sensoren unter verschiedenen Lichtbedingungen aufgenommen wurden.
- DND: Er enthält Fotografien mit hoher ISO-Empfindlichkeit, die realistische, bei Consumer-Kameras auftretende Sensorausprägungen des Rauschens erfassen.

Abb. 4. Ein Beispiel aus dem DND-Datensatz. (Quelle)
Zu berücksichtigende Faktoren beim Training eines selbstüberwachten Modells zur Rauschunterdrückung#
Wenn du ein auf Deep Learning basierendes selbstüberwachtes Modell zur Rauschunterdrückung trainieren möchtest, solltest du die folgenden Faktoren und Einschränkungen berücksichtigen:
- Rauschverteilung abstimmen: Die für das Training verwendeten verrauschten Bilder sollten dasselbe Rauschen abbilden, dem das Modell im praktischen Einsatz begegnet. Nicht übereinstimmendes Rauschen führt zu einer schlechten Verallgemeinerung.
- Vielfalt der Trainingsdaten sicherstellen: Eine begrenzte Variation kann bei komplexen Texturen zu Überanpassung oder übermäßiger Glättung führen.
- Einschränkungen je nach Rauschart beachten: Selbstüberwachte Verfahren haben größere Schwierigkeiten mit strukturiertem, korreliertem oder nicht zufälligem Rauschen.
- Über verschiedene Geräte oder Sensoren hinweg testen: Die Leistung der Rauschunterdrückung kann sich zwischen Kameras oder Bildgebungssystemen stark unterscheiden.
Wichtige Erkenntnisse#
Selbstüberwachte Rauschunterdrückung bietet KI-Enthusiasten eine praktische Möglichkeit, Bilder ausschließlich mit den bereits vorhandenen verrauschten Daten zu bereinigen. Indem diese Verfahren lernen, echte Strukturen unter dem Rauschen zu erkennen, können sie wichtige visuelle Details wiederherstellen. Mit der weiteren Verbesserung der Technologie zur Rauschunterdrückung wird sie wahrscheinlich eine Vielzahl von Computer-Vision-Aufgaben im Alltag zuverlässiger machen.
Werde Teil unserer wachsenden Community! Besuche unser GitHub-Repository, um mehr über KI zu erfahren. Wenn du Lösungen für Computer Vision entwickeln möchtest, sieh dir unsere Lizenzierungsoptionen an. Entdecke die Vorteile von Computer Vision im Einzelhandel und erfahre, wie KI in der Fertigung etwas bewirkt!









