Was ist Dataset Distillation? Ein kurzer Überblick
Erfahre, wie Dataset Distillation das Modelltraining beschleunigt und Rechenkosten senkt, indem große Datensätze durch eine kleine, optimierte Menge synthetischer Beispiele ersetzt werden.

Das Trainieren von Modellen mag wie der zeitaufwendigste Teil der Arbeit von Data Scientists erscheinen. Doch der größte Teil ihrer Zeit, oft 60 bis 80 %, fließt tatsächlich in die Vorbereitung der Daten: in das Sammeln, Bereinigen und Strukturieren für die Modellierung. Je größer Datensätze werden, desto mehr Zeit nimmt auch diese Vorbereitung in Anspruch. Das verlangsamt Experimente und erschwert Iterationen.
Um dieses Problem anzugehen, haben Forschende jahrelang nach Möglichkeiten gesucht, das Training effizienter zu gestalten. Ansätze wie synthetische Daten, Datenkomprimierung und bessere Optimierungsmethoden zielen alle darauf ab, Kosten und Aufwand bei der Arbeit mit großen Datensätzen zu reduzieren und Arbeitsabläufe im maschinellen Lernen zu beschleunigen.
Dabei stellt sich eine zentrale Frage: Können wir einen Datensatz drastisch verkleinern und dennoch dieselbe Leistung erzielen wie beim Training eines Modells mit den vollständigen Daten? Dataset-Destillation ist eine vielversprechende Antwort darauf.
Dabei wird eine kompakte Version eines großen Trainings datensatzes erstellt, wobei die wesentlichen Muster erhalten bleiben, die das Modell für effektives Lernen benötigt. Das ermöglicht schnelleres Training, einen geringeren Rechenbedarf und effizientere Experimente. Du kannst dir das wie einen Lernzettel für das Modell vorstellen: eine kleine Menge von synthetischen Daten, die so gestaltet sind, dass sie dieselben grundlegenden Muster vermitteln wie der vollständige Datensatz.
In diesem Artikel untersuchen wir, wie Dataset-Destillation funktioniert und wie sie skalierbares maschinelles Lernen und Deep Learning in realen Anwendungen unterstützt. Legen wir los!
Dataset-Destillation verstehen#
Dataset-Destillation ist ein Verfahren, bei dem ein großer Trainingsdatensatz zu einer deutlich kleineren Datenmenge verdichtet wird, die einem Modell nahezu dieselben Informationen vermittelt wie der ursprüngliche Datensatz. Viele Forschende bezeichnen diesen Prozess auch als Datenkondensation, weil das Ziel darin besteht, die wesentlichen Muster zu erfassen, die im gesamten Datensatz vorkommen.
Ein destillierter Datensatz unterscheidet sich von zufällig erzeugten synthetischen Daten oder der einfachen Auswahl einer kleineren Teilmenge echter Bilder. Er ist weder ein zufälliger künstlicher Datensatz noch eine gekürzte Kopie des Originals.
Stattdessen wird er gezielt optimiert, um die wichtigsten Muster zu erfassen. Während dieses Prozesses werden jedes Pixel und jedes Merkmal angepasst und optimiert, damit ein neuronales Netzwerk, das mit den destillierten Daten trainiert wird, nahezu so lernt, als wäre es mit dem gesamten Datensatz trainiert worden.
Diese Idee erschien erstmals in einem arXiv-Artikel von 2018 von Tongzhou Wang, Jun-Yan Zhu, Antonio Torralba und Alexei A. Efros. In frühen Tests wurden einfache Datensätze wie MNIST und CIFAR-10 verwendet. Dadurch ließ sich leicht zeigen, dass wenige destillierte Beispiele Tausende echter Bilder ersetzen konnten.

Abb. 1. Dataset-Destillation für Bilddaten (Quelle)
Seitdem haben weiterführende Arbeiten die Dataset-Destillation vorangetrieben, darunter auf ICML und ICLR veröffentlichte Methoden, die die Kondensation effizienter und skalierbarer machen.
Die Bedeutung der Dataset-Destillation#
Dataset-Destillation verbessert die Trainingseffizienz und beschleunigt Entwicklungszyklen. Indem sie die Datenmenge reduziert, aus der ein Modell lernen muss, senkt sie den Rechenbedarf.
Das ist besonders nützlich für kontinuierliches Lernen, bei dem Modelle im Laufe der Zeit aktualisiert werden, für die Suche nach neuronalen Architekturen, bei der viele Modellentwürfe getestet werden, und für das Training am Rand, bei dem Modelle auf kleinen Geräten mit begrenztem Speicher und begrenzter Energieversorgung ausgeführt werden. Insgesamt machen diese Vorteile Dataset-Destillation zu einer guten Option für eine schnelle Initialisierung, zügiges Fine-Tuning und die Entwicklung früher Prototypen in vielen Arbeitsabläufen des maschinellen Lernens.
Ein Überblick über die Funktionsweise der Dataset-Destillation#
Dataset-Destillation erzeugt synthetische, also künstlich generierte Trainingsbeispiele. Diese Beispiele helfen einem Modell, auf eine Weise zu lernen, die dem Training mit echten Daten sehr ähnlich ist. Dabei werden während des normalen Trainings drei Schlüsselfaktoren verfolgt.
Der erste ist die Verlustfunktion, also der Fehlerwert des Modells, der zeigt, wie falsch seine Vorhersagen sind. Der zweite sind die Modellparameter, also die internen Gewichte des Netzwerks, die beim Lernen aktualisiert werden.
Der dritte ist die Trainingsbahn, die beschreibt, wie sich Fehler und Gewichte im Laufe der Zeit Schritt für Schritt verändern. Die synthetischen Beispiele werden anschließend so optimiert, dass der Fehler eines darauf trainierten Modells sinkt und sich seine Gewichte genauso aktualisieren wie beim vollständigen Datensatz.
Dataset-Destillation Schritt für Schritt#
Hier siehst du genauer, wie der Prozess der Dataset-Destillation funktioniert:
- Schritt 1 – Synthetische Pixel initialisieren: Der Prozess beginnt mit synthetischen Bildern, die als lernbare Eingaben dienen. Zu Beginn weisen diese Bilder kaum Struktur auf und wirken wie unbeschriebene Blätter. Mit der Zeit werden sie zu aussagekräftigen Beispielen optimiert.
- Schritt 2 – Optimierung durch Gradientenabgleich und Backpropagation: Während das Modell mit diesen synthetischen Bildern trainiert wird, erzeugt es Gradienten, die angeben, wie sich jedes Pixel ändern sollte, damit das Trainingsverhalten echter Daten besser nachgebildet wird. Backpropagation ist die Methode, mit der das Netzwerk aus Fehlern lernt. Sie leitet den Fehler rückwärts durch das Modell, um herauszufinden, welche Pixel und Gewichte ihn verursacht haben, und aktualisiert diese anschließend geringfügig. Mithilfe dieser Gradienten passt Backpropagation die synthetischen Bilder Schritt für Schritt an, damit sie für das Training aussagekräftiger werden.
- Schritt 3 – Abgleich des Verhaltens über die Trainingsschritte hinweg: Die Methode gleicht außerdem Trainingsbahnen ab, also die schrittweisen Veränderungen, die das Modell während des Lernens durchläuft. So führt der destillierte Datensatz das Modell auf einem Lernpfad, der dem Pfad beim vollständigen Datensatz ähnelt.
- Schritt 4 – Validierung und Generalisierung: Zum Schluss wird der destillierte Datensatz mit echten Validierungsdaten bewertet, um zu sehen, wie gut das trainierte Modell bei neuen Beispielen abschneidet. So wird geprüft, ob die synthetischen Daten allgemeine, funktionale Muster vermitteln, statt das Modell dazu zu bringen, sich bestimmte Beispiele zu merken.

Abb. 2. Einblick in die Dataset-Destillation (Quelle)
Wichtige Methoden der Dataset-Destillation#
Alle Methoden der Dataset-Destillation beruhen auf derselben Grundidee, auch wenn sie unterschiedliche Algorithmen dafür verwenden. Die meisten Ansätze lassen sich in drei Kategorien einteilen: Leistungsabgleich, Verteilungsabgleich und Parameterabgleich.
Sehen wir uns nun jede Kategorie an und betrachten ihre Funktionsweise.
Leistungsabgleich#
Der Leistungsabgleich bei der Dataset-Destillation konzentriert sich auf die Erstellung einer winzigen, optimierten Trainingsmenge, mit der ein Modell nahezu dieselbe Genauigkeit erreicht wie beim Training mit dem vollständigen ursprünglichen Datensatz. Statt eine zufällige Teilmenge auszuwählen, werden die destillierten Beispiele so optimiert, dass ein darauf trainiertes Modell ähnliche Vorhersagen, ein ähnliches Verlustverhalten während des Trainings oder eine ähnliche endgültige Genauigkeit wie ein Modell erzielt, das mit dem ursprünglichen Datensatz trainiert wurde.
Meta-Learning ist eine gängige Methode, um diesen Prozess zu verbessern. Der destillierte Datensatz wird durch wiederholte Trainingsepisoden aktualisiert und dadurch für viele mögliche Situationen geeignet.
Während dieser Episoden simuliert die Methode, wie ein Schülermodell aus den aktuellen destillierten Beispielen lernt, prüft, wie gut dieses Modell mit echten Daten abschneidet, und passt anschließend die destillierten Beispiele an, damit sie bessere Lehrbeispiele sind. Mit der Zeit lernt die destillierte Menge, schnelles Lernen und eine gute Generalisierung zu unterstützen, selbst wenn das Schülermodell mit anderen Anfangsgewichten startet oder eine andere Architektur verwendet. Dadurch wird der destillierte Datensatz zuverlässiger und nicht an einen einzelnen Trainingslauf gebunden.

Abb. 3. Der Meta-Learning-Prozess (Quelle)
Verfahren zum Verteilungsabgleich#
Beim Verteilungsabgleich werden synthetische Daten erzeugt, die den statistischen Mustern des echten Datensatzes entsprechen. Statt sich nur auf die endgültige Genauigkeit eines Modells zu konzentrieren, betrachtet dieser Ansatz die internen Merkmale, die ein neuronales Netzwerk während des Lernens erzeugt.
Sehen wir uns nun die beiden Verfahren an, die den Verteilungsabgleich bestimmen.
Verteilungsabgleich auf einer einzelnen Schicht#
Der Verteilungsabgleich auf einer einzelnen Schicht konzentriert sich auf eine einzelne Schicht eines neuronalen Netzwerks und vergleicht die von ihr erzeugten Merkmale für echte und synthetische Daten. Diese Merkmale, auch Aktivierungen genannt, erfassen, was das Modell an dieser Stelle im Netzwerk gelernt hat.
Indem die synthetischen Daten ähnliche Aktivierungen erzeugen, sorgt die Methode dafür, dass der destillierte Datensatz dieselben wichtigen Muster wie der ursprüngliche Datensatz widerspiegelt. In der Praxis werden die synthetischen Beispiele wiederholt aktualisiert, bis die Aktivierungen in der ausgewählten Schicht eng mit denen echter Bilder übereinstimmen.
Dieser Ansatz ist relativ einfach, weil er jeweils nur eine Darstellungsebene abgleicht. Er kann besonders gut bei kleineren Datensätzen oder Aufgaben funktionieren, bei denen kein Abgleich tiefer, mehrstufiger Merkmals-Hierarchien erforderlich ist. Durch die klare Ausrichtung eines Merkmalsraums liefert der Abgleich auf einer einzelnen Schicht ein stabiles und aussagekräftiges Signal für das Lernen mit dem destillierten Datensatz.
Verteilungsabgleich auf mehreren Schichten#
Der Verteilungsabgleich auf mehreren Schichten baut auf dem Vergleich echter und synthetischer Daten auf, führt ihn jedoch in mehreren Schichten eines neuronalen Netzwerks statt nur in einer durch. Verschiedene Schichten erfassen unterschiedliche Informationsarten – von einfachen Kanten und Texturen in frühen Schichten bis hin zu Formen und komplexeren Mustern in tieferen Schichten.
Durch den Abgleich der Merkmale über diese Schichten hinweg wird der destillierte Datensatz dazu gebracht, das Gelernte auf mehreren Ebenen widerzuspiegeln. Da dieser Ansatz die Merkmale im gesamten Netzwerk abgleicht, hilft er den synthetischen Daten, reichhaltigere Signale zu bewahren, auf die das Modell angewiesen ist, um Klassen voneinander zu unterscheiden.
Das ist besonders hilfreich bei Computer Vision, also bei Aufgaben, in denen Modelle lernen, Bilder und Videos zu verstehen, weil sich nützliche Muster über viele Schichten verteilen. Stimmen die Merkmalsverteilungen in mehreren Tiefen gut überein, dient der destillierte Datensatz als stärkerer und zuverlässigerer Ersatz für die ursprünglichen Trainingsdaten.
Verfahren zum Parameterabgleich#
Eine weitere wichtige Kategorie der Dataset-Destillation ist der Parameterabgleich. Statt Genauigkeit oder Merkmalsverteilungen abzugleichen, wird untersucht, wie sich die Gewichte eines Modells während des Trainings verändern. Wenn das Training mit dem destillierten Datensatz ähnliche Parameteraktualisierungen wie das Training mit echten Daten erzeugt, folgt das Modell einem nahezu identischen Lernpfad.
Als Nächstes sehen wir uns die beiden wichtigsten Verfahren zum Parameterabgleich an.
Abgleich über einen einzelnen Schritt#
Beim Abgleich über einen einzelnen Schritt wird verglichen, wie sich die Gewichte eines Modells nach genau einem Trainingsschritt mit echten Daten verändern. Anschließend wird der destillierte Datensatz so angepasst, dass ein Modell, das damit einen Schritt lang trainiert wird, eine sehr ähnliche Gewichtsaktualisierung erzeugt. Da sich die Methode nur auf diese eine Aktualisierung konzentriert, ist sie unkompliziert und schnell ausführbar.
Der Nachteil besteht darin, dass ein einzelner Schritt nicht den vollständigen Lernprozess widerspiegelt – insbesondere bei schwierigeren Aufgaben, bei denen das Modell viele Aktualisierungen benötigt, um reichhaltigere Merkmale aufzubauen. Daher funktioniert dieser Abgleich meist am besten bei einfacheren Problemen oder kleineren Datensätzen, bei denen nützliche Muster schnell erfasst werden können.
Mehrschrittiger Parameterabgleich#
Der mehrschrittige Parameterabgleich betrachtet dagegen, wie sich die Gewichte eines Modells über mehrere Trainingsschritte hinweg verändern, nicht nur über einen. Diese Folge von Aktualisierungen bildet die Trainingsbahn des Modells.
Der destillierte Datensatz wird so erstellt, dass die Trainingsbahn eines Modells, das mit den synthetischen Beispielen trainiert wird, eng derjenigen folgt, die es mit echten Daten durchlaufen würde. Durch den Abgleich eines längeren Lernabschnitts erfasst die destillierte Menge mehr von der Struktur des ursprünglichen Trainingsprozesses.
Da dieser Ansatz widerspiegelt, wie sich Lernen im Laufe der Zeit entwickelt, funktioniert der mehrschrittige Abgleich meist besser bei größeren oder komplexeren Datensätzen, bei denen Modelle viele Aktualisierungen benötigen, um nützliche Muster zu erfassen. Er benötigt zwar mehr Rechenleistung, da mehrere Schritte verfolgt werden müssen, erzeugt aber häufig destillierte Datensätze, die besser generalisieren und eine höhere Leistung als der Abgleich über einen einzelnen Schritt bieten.
Funktionsweise der Erzeugung und Optimierung synthetischer Datensätze#
Nachdem wir die wichtigsten Destillationsansätze besser verstanden haben, können wir nun betrachten, wie synthetische Daten erstellt werden. Bei der Dataset-Destillation werden synthetische Beispiele so optimiert, dass sie das wichtigste Lernsignal erfassen und eine kleine Menge einen deutlich größeren Datensatz ersetzen kann.
Als Nächstes sehen wir, wie diese destillierten Daten erzeugt und bewertet werden.
Erstellen und Bewerten destillierter Bilder#
Während der Dataset-Destillation werden die synthetischen Pixel über viele Trainingsschritte hinweg aktualisiert. Das neuronale Netzwerk lernt aus den aktuellen synthetischen Bildern und gibt gradientenbasiertes Feedback, das zeigt, wie sich jedes Pixel ändern sollte, damit die Muster des echten Datensatzes besser nachgebildet werden.
Das funktioniert, weil der Prozess differenzierbar ist (das heißt, jeder Schritt verläuft gleichmäßig und besitzt wohldefinierte Gradienten, sodass kleine Pixeländerungen vorhersehbare Änderungen des Verlusts bewirken). Dadurch kann das Modell die synthetischen Daten während des Gradientenabstiegs gleichmäßig anpassen.
Mit fortschreitender Optimierung beginnen die synthetischen Bilder, eine bedeutungsvolle Struktur zu bilden, darunter Formen und Texturen, die das Modell erkennt. Diese verfeinerten synthetischen Bilder werden häufig für Aufgaben der Bildklassifizierung verwendet, da sie die wichtigen visuellen Hinweise erfassen, die ein Klassifikator zum Lernen benötigt.
Destillierte Datensätze werden bewertet, indem Modelle mit ihnen trainiert und die Ergebnisse mit Modellen verglichen werden, die mit echten Daten trainiert wurden. Forschende messen die Validierungsgenauigkeit und prüfen, ob die synthetische Menge die diskriminierenden Merkmale (die Muster oder Signale, auf die sich das Modell beim Unterscheiden von Klassen stützt) bewahrt, die zum Trennen der Klassen erforderlich sind. Außerdem testen sie Stabilität und Generalisierung über verschiedene Läufe oder Modellkonfigurationen hinweg, um sicherzustellen, dass die destillierten Daten nicht zu Overfitting führen.
Praktische Anwendungen der Datendestillation#
Als Nächstes betrachten wir Beispiele dafür, wie destillierte Datensätze das Training beschleunigen und Rechenkosten senken, dabei aber eine hohe Leistung aufrechterhalten – selbst wenn die Datenmenge begrenzt oder das Datenmaterial stark spezialisiert ist.
Dataset-Destillation für Computer-Vision-Anwendungen#
Bei Computer Vision besteht das Ziel darin, Modelle darauf zu trainieren, visuelle Daten wie Bilder und Videos zu verstehen. Diese Modelle lernen Muster wie Kanten, Texturen, Formen und Objekte und verwenden sie anschließend für Aufgaben wie Bildklassifizierung, Objekterkennung oder Segmentierung. Da Bildverarbeitungsprobleme häufig große Variationen bei Beleuchtung, Hintergründen und Perspektiven aufweisen, benötigen Computer-Vision-Systeme meist große Datensätze für eine gute Generalisierung. Das macht das Training teuer und langsam.

Abb. 4. Ein Beispiel für Dataset-Destillation (Quelle)
Bei Anwendungsfällen der Bildklassifizierung wie medizinischen Aufnahmen, der Beobachtung von Wildtieren oder der Erkennung von Produktionsfehlern stehen Modelle häufig vor einem schwierigen Zielkonflikt zwischen Genauigkeit und Trainingskosten. Diese Aufgaben umfassen typischerweise sehr große Datensätze.
Dataset-Destillation kann den ursprünglichen Trainingsdatensatz auf eine kleine Anzahl synthetischer Bilder komprimieren, die weiterhin die wichtigsten visuellen Hinweise für den Klassifikator enthalten. Für große Benchmarks wie ImageNet wurde gezeigt, dass destillierte Mengen mit nur etwa 4,2 % der ursprünglichen Bilder eine hohe Klassifizierungsgenauigkeit beibehalten. Das bedeutet, dass ein winziger synthetischer Ersatz Millionen echter Beispiele mit deutlich weniger Rechenaufwand ersetzen kann.
Suche nach neuronalen Architekturen#
Die Suche nach neuronalen Architekturen (NAS) ist ein Verfahren, das automatisch viele mögliche Entwürfe neuronaler Netzwerke untersucht, um den für eine Aufgabe am besten geeigneten zu finden. Da NAS eine große Zahl von Kandidatenmodellen trainieren und bewerten muss, kann die Ausführung mit vollständigen Datensätzen langsam und sehr rechenintensiv sein.
Dataset-Destillation hilft, indem sie eine winzige synthetische Trainingsmenge erstellt, die weiterhin das zentrale Lernsignal der ursprünglichen Daten enthält, sodass jede Kandidatenarchitektur deutlich schneller getestet werden kann. So kann NAS Entwürfe effizient vergleichen und die Rangfolge guter und schlechter Architekturen einigermaßen zuverlässig beibehalten. Dadurch sinken die Suchkosten, ohne dass die endgültige Modellqualität wesentlich beeinträchtigt wird.
Kontinuierliches Lernen und Bereitstellung am Rand#
Systeme für kontinuierliches Lernen, also Modelle, die sich bei Eingang neuer Daten fortlaufend aktualisieren, statt nur einmal trainiert zu werden, benötigen schnelle und speichereffiziente Aktualisierungen. Edge-Geräte wie Kameras, Smartphones und Sensoren unterliegen ähnlichen Einschränkungen, da ihre Rechen- und Speicherkapazitäten begrenzt sind.
Dataset-Destillation hilft in beiden Fällen, indem sie einen großen Trainingsdatensatz zu einer winzigen synthetischen Menge komprimiert. So können sich Modelle mit einer kleinen Wiedergabemenge anpassen oder neu trainiert werden, statt den vollständigen Datensatz zu benötigen. Beispielsweise zeigte eine Arbeit zum Kernel-basierten Meta-Learning, dass nur 10 destillierte Beispiele bei CIFAR-10 eine Genauigkeit von über 64 % erreichen können, einem gängigen Benchmark für Bildklassifizierung. Da die Wiedergabemenge so kompakt ist, werden Aktualisierungen deutlich schneller und praktikabler – insbesondere wenn Modelle häufig aktualisiert werden müssen.
Dataset-Destillation kann auch gemeinsam mit Knowledge Distillation für große Sprachmodelle eingesetzt werden. Ein kleiner destillierter Datensatz kann die wichtigsten Aufgabensignale des Lehrermodells bewahren, sodass ein komprimiertes Schülermodell effizienter trainiert oder aktualisiert werden kann, ohne viel Leistung einzubüßen. Da diese Datensätze winzig sind, eignen sie sich besonders für Edge- oder On-Device-Anwendungen, bei denen Speicher und Rechenleistung begrenzt sind, das Modell aber auch nach Aktualisierungen genau bleiben soll.
Vor- und Nachteile der Datendestillation#
Hier sind einige Vorteile der Dataset-Destillation:
- Ideal für schnelle Experimente. Du kannst neue Architekturen, Verlustfunktionen oder Hyperparameter testen, ohne jedes Mal mit einem riesigen Datensatz neu trainieren zu müssen.
- Möglicher Datenschutzvorteil. Das Teilen destillierter synthetischer Beispiele kann sicherer sein als das Teilen echter Nutzerdaten, da Rohbeispiele nicht direkt offengelegt werden.
- Oft besser als die einfache Auswahl einer Teilmenge. Statt Beispiele nur auszuwählen, optimiert die Destillation sie aktiv, damit sie maximal aussagekräftig sind.
Dataset-Destillation bietet zwar mehrere Vorteile, aber du solltest auch die folgenden Einschränkungen beachten:
- Overfitting: Destillierte Daten funktionieren häufig am besten für die während der Destillation verwendete Architektur und lassen sich möglicherweise nur schlecht auf sehr unterschiedliche Modelle übertragen.
- Empfindlich gegenüber Hyperparametern. Die Ergebnisse können stark von Faktoren wie Lernrate, Initialisierung oder der Anzahl der Destillationsschritte abhängen.
- Schwieriger auf die Komplexität realer Anwendungen zu skalieren. Methoden, die auf Benchmarks gut funktionieren, können bei großen, unstrukturierten oder hochauflösenden Datensätzen an Genauigkeit verlieren.
Wichtige Erkenntnisse#
Dataset-Destillation ermöglicht es, dass eine kleine Menge synthetischer Beispiele einem Modell nahezu so effektiv Wissen vermittelt wie ein vollständiger Datensatz. Dadurch wird maschinelles Lernen schneller, effizienter und leichter skalierbar. Da Modelle größer werden und mehr Daten benötigen, bieten destillierte Datensätze eine praktische Möglichkeit, Rechenkosten zu senken, ohne die Genauigkeit zu beeinträchtigen.
Tritt unserer Community bei und sieh dir unser GitHub-Repository an, um mehr über KI zu erfahren. Wenn du dein eigenes Vision-KI-Projekt entwickeln möchtest, informiere dich über unsere Lizenzoptionen. Erfahre auf unseren Lösungsseiten mehr über Anwendungen wie KI im Gesundheitswesen und Vision-KI im Einzelhandel.









