Unsupervised Learning
Entdecke das unüberwachte Lernen, um verborgene Muster in unbeschrifteten Daten zu finden. Erfahre mehr über Clustering, Anomalieerkennung und seine Bedeutung für moderne KI-Lösungen.
Unüberwachtes Lernen ist eine Form des maschinellen Lernens, bei der ein Algorithmus ohne menschliches Eingreifen Muster aus unbeschrifteten Daten lernt. Im Gegensatz zum überwachten Lernen, das sich beim Trainieren eines Modells auf beschriftete Eingabe-Ausgabe-Paare stützt, arbeitet unüberwachtes Lernen mit Daten ohne historische Beschriftungen. Das System versucht im Wesentlichen, sich selbst zu unterrichten, indem es verborgene Strukturen, Muster oder Beziehungen innerhalb der Eingabedaten entdeckt. Dieser Ansatz ist besonders wertvoll, da der weitaus größte Teil der heute erzeugten Daten – Bilder, Videos, Text und Sensorprotokolle – unstrukturiert und unbeschriftet ist.
Funktionsweise des unüberwachten Lernens#
In Szenarien des unüberwachten Lernens bleibt es dem Algorithmus überlassen, interessante Strukturen in den Daten zu entdecken. Ziel ist häufig, die zugrunde liegende Verteilung der Daten zu modellieren oder mehr über die Daten selbst zu lernen. Da beim Training keine „richtigen Antworten“ vorgegeben werden, kann das Modell nicht im herkömmlichen Sinn anhand seiner Genauigkeit bewertet werden. Stattdessen wird die Leistung häufig danach beurteilt, wie gut das Modell die Dimensionalität reduziert oder ähnliche Datenpunkte zu Clustern zusammenfasst.
Diese Methodik ähnelt der Art und Weise, wie Menschen häufig neue Konzepte lernen. So kann ein Kind beispielsweise Hunde und Katzen anhand ihrer unterschiedlichen Formen und Verhaltensweisen unterscheiden, ohne die Bezeichnungen „Hund“ und „Katze“ zunächst unbedingt zu kennen. Ebenso gruppieren unüberwachte Algorithmen Informationen anhand ihrer grundlegenden Ähnlichkeiten. Diese Fähigkeit ist für die Entwicklung einer künstlichen allgemeinen Intelligenz (AGI) von grundlegender Bedeutung, da sie es Systemen ermöglicht, sich ohne ständige menschliche Überwachung an neue Umgebungen anzupassen.
Wichtige Techniken des unüberwachten Lernens#
Das unüberwachte Lernen umfasst mehrere unterschiedliche Techniken, die jeweils für verschiedene Arten von Datenanalyseproblemen geeignet sind:
- Clustering: Dies ist die häufigste Anwendung. Dabei gruppiert der Algorithmus Datenpunkte, die einander ähnlich sind. Eine beliebte Methode ist das K-Means-Clustering, bei dem Daten anhand der Merkmalsähnlichkeit in k unterschiedliche Gruppen aufgeteilt werden. Dies wird häufig bei der Marktsegmentierung eingesetzt, um Kundengruppen mit ähnlichem Kaufverhalten zu identifizieren.
- Dimensionsreduktion: Hochdimensionale Daten können komplex und rechenintensiv zu verarbeiten sein. Techniken wie die Hauptkomponentenanalyse (PCA) reduzieren die Anzahl der Variablen in einem Datensatz und bewahren dabei dessen wesentliche Informationen. Dies vereinfacht die Datenvisualisierung und beschleunigt das Training anderer Modelle des maschinellen Lernens.
- Anomalieerkennung: Indem sie lernen, wie „normale“ Daten aussehen, können unüberwachte Modelle Ausreißer identifizieren, die deutlich von der Norm abweichen. Dies ist für die Betrugserkennung im Finanzwesen von entscheidender Bedeutung, da ungewöhnliche Transaktionsmuster Sicherheitswarnungen auslösen.
- Lernen von Assoziationsregeln: Diese Technik entdeckt interessante Beziehungen zwischen Variablen in großen Datenbanken. Sie wird häufig bei der Warenkorbanalyse eingesetzt und hilft Einzelhändlern zu verstehen, dass Kunden, die Brot kaufen, wahrscheinlich auch Butter kaufen.
Unüberwachtes und überwachtes Lernen#
Es ist wichtig, unüberwachtes Lernen vom überwachten Lernen zu unterscheiden. Der wichtigste Unterschied liegt in den verwendeten Daten. Überwachtes Lernen erfordert einen beschrifteten Datensatz, bei dem jedes Trainingsbeispiel mit einer korrekten Ausgabe verknüpft ist (z. B. ein Bild einer Katze mit der Beschriftung „Katze“). Das Modell lernt, Eingaben auf Ausgaben abzubilden, um den Fehler zu minimieren.
Im Gegensatz dazu verwendet unüberwachtes Lernen unbeschriftete Daten. Es gibt keine Rückkopplung, die dem Modell mitteilt, ob seine Ausgabe korrekt ist. Als Mittelweg gibt es das teilüberwachte Lernen, das eine kleine Menge beschrifteter Daten mit einer großen Menge unbeschrifteter Daten kombiniert, um die Lernqualität zu verbessern. Es wird häufig eingesetzt, wenn die Beschriftung von Daten teuer oder zeitaufwendig ist.
Anwendungen in der Praxis#
Unüberwachtes Lernen bildet die Grundlage für viele Technologien, mit denen wir täglich in Berührung kommen. Hier sind zwei konkrete Beispiele:
-
Kundensegmentierung im Einzelhandel: E-Commerce-Plattformen analysieren Millionen von Nutzerinteraktionen ohne vordefinierte Kategorien. Mithilfe von Clustering-Algorithmen identifizieren sie unterschiedliche Nutzerprofile – etwa „Schnäppchenjäger am Wochenende“ oder „Technikbegeisterte“. Dies ermöglicht stark personalisierte Marketingkampagnen und Empfehlungssysteme und verbessert das Kundenerlebnis deutlich.
-
Analyse genomischer Sequenzen: In der Bioinformatik verwenden Forschende unüberwachtes Lernen zur Analyse genetischer Daten. Algorithmen gruppieren DNA-Sequenzen, um ähnliche genetische Marker oder Mutationen in verschiedenen Populationen zu finden. Dies hilft dabei, evolutionäre Beziehungen zu verstehen und genetische Prädispositionen für Krankheiten zu identifizieren, ohne dass Vorwissen über die Funktion jedes einzelnen Gens erforderlich ist.
Codebeispiel: Clustering mit Scikit-Learn#
Obwohl Ultralytics YOLO26 in erster Linie ein Framework für die überwachte Objekterkennung ist, werden Techniken des unüberwachten Lernens häufig in den Vorverarbeitungsschritten eingesetzt, etwa zur Analyse von Anchor-Box-Verteilungen oder zum Clustering von Datensatzmerkmalen. Nachfolgend findest du ein einfaches Beispiel, das sklearn für ein K-Means-Clustering verwendet, eine grundlegende Technik des unüberwachten Lernens.
import numpy as np
from sklearn.cluster import KMeans
# Generate synthetic data: 10 points with 2 features each
X = np.array([[1, 2], [1, 4], [1, 0], [10, 2], [10, 4], [10, 0]])
# Initialize KMeans with 2 clusters (k=2)
kmeans = KMeans(n_clusters=2, random_state=0, n_init="auto")
# Fit the model to the data (no labels provided!)
kmeans.fit(X)
# Predict which cluster each point belongs to
print(f"Labels: {kmeans.labels_}")
# Output will group the first 3 points together (0) and the last 3 together (1)Die Rolle des unüberwachten Lernens im Deep Learning#
Modernes tiefes Lernen (DL) integriert zunehmend Prinzipien des unüberwachten Lernens. Techniken wie das selbstüberwachte Lernen (SSL) ermöglichen es Modellen, ihre eigenen Überwachungssignale aus den Daten zu erzeugen. So werden Modelle beispielsweise bei der Verarbeitung natürlicher Sprache (NLP) wie GPT-4 mit riesigen Textmengen vortrainiert, um das nächste Wort in einem Satz vorherzusagen. Dadurch lernen sie die Struktur der Sprache effektiv ohne explizite Beschriftungen.
Ebenso werden bei der Computer Vision (CV) Autoencoder eingesetzt, um effiziente Datencodierungen zu erlernen. Diese neuronalen Netze komprimieren Bilder in eine niedrigdimensionale Darstellung und rekonstruieren sie anschließend. Durch diesen Prozess lernt das Netzwerk die wichtigsten Merkmale der visuellen Daten, was für Aufgaben wie die Bildentrauschung und die generative Modellierung nützlich ist.
Wenn du Datensätze für das Training verwalten möchtest, bietet die Ultralytics Platform Werkzeuge zur Visualisierung von Datenverteilungen. Damit kannst du Cluster oder Anomalien identifizieren, bevor der überwachte Trainingsprozess beginnt. Das Verständnis der Struktur deiner Daten durch unüberwachtes Erkunden ist häufig der erste Schritt zum Aufbau robuster KI-Lösungen.









