Unsupervised Learning
Explore l’apprentissage non supervisé pour découvrir des schémas cachés dans des données non étiquetées. Découvre le clustering, la détection des anomalies et la manière dont ils alimentent les solutions modernes d’IA.
L'apprentissage non supervisé est un type d'apprentissage automatique dans lequel un algorithme apprend des schémas à partir de données non annotées, sans intervention humaine. Contrairement à l'apprentissage supervisé, qui repose sur des paires entrée-sortie étiquetées pour entraîner un modèle, l'apprentissage non supervisé traite des données dépourvues d'étiquettes historiques. Le système tente essentiellement de s'enseigner à lui-même en découvrant des structures cachées, des schémas ou des relations au sein des données d'entrée. Cette approche est particulièrement utile, car la grande majorité des données générées aujourd'hui — images, vidéos, textes et journaux de capteurs — sont non structurées et non étiquetées.
Fonctionnement de l'apprentissage non supervisé#
Dans les scénarios non supervisés, l'algorithme est laissé libre de découvrir des structures intéressantes dans les données. L'objectif consiste souvent à modéliser la distribution sous-jacente des données ou à mieux comprendre les données elles-mêmes. Comme aucune « réponse correcte » n'est fournie pendant l'entraînement, le modèle ne peut pas être évalué sur sa précision au sens traditionnel. Les performances sont plutôt mesurées selon la capacité du modèle à réduire la dimensionnalité ou à regrouper des points de données similaires.
Cette méthodologie reflète la façon dont les humains apprennent souvent de nouveaux concepts. Par exemple, un enfant peut distinguer les chiens des chats en observant leurs formes et leurs comportements différents, sans nécessairement connaître au départ les noms « chien » et « chat ». De même, les algorithmes non supervisés regroupent les informations en fonction de leurs similitudes intrinsèques. Cette capacité est fondamentale pour le développement de l'intelligence artificielle générale (AGI), car elle permet aux systèmes de s'adapter à de nouveaux environnements sans supervision humaine constante.
Principales techniques d'apprentissage non supervisé#
L'apprentissage non supervisé englobe plusieurs techniques distinctes, chacune adaptée à différents types de problèmes d'analyse des données :
- Regroupement : il s'agit de l'application la plus courante, dans laquelle l'algorithme regroupe les points de données qui se ressemblent. Une méthode populaire est le regroupement K-Means, qui partitionne les données en k groupes distincts en fonction de la similarité des caractéristiques. Cette méthode est largement utilisée pour la segmentation de marché afin d'identifier des groupes de clients ayant des comportements d'achat similaires.
- Réduction de la dimensionnalité : les données de grande dimension peuvent être complexes et coûteuses à traiter sur le plan computationnel. Des techniques comme l'analyse en composantes principales (PCA) réduisent le nombre de variables d'un jeu de données tout en préservant ses informations essentielles. Cela simplifie la visualisation des données et accélère l'entraînement d'autres modèles d'apprentissage automatique.
- Détection des anomalies : en apprenant à quoi ressemblent les données « normales », les modèles non supervisés peuvent identifier les valeurs aberrantes qui s'écartent considérablement de la norme. Cette capacité est essentielle pour la détection des fraudes dans le secteur financier, où des schémas de transaction inhabituels déclenchent des alertes de sécurité.
- Apprentissage de règles d'association : cette technique permet de découvrir des relations intéressantes entre les variables de grandes bases de données. Elle est notamment utilisée pour l'analyse du panier d'achat, afin d'aider les détaillants à comprendre que les clients qui achètent du pain sont également susceptibles d'acheter du beurre.
Apprentissage non supervisé et supervisé#
Il est important de distinguer l'apprentissage non supervisé de l'apprentissage supervisé. La principale différence réside dans les données utilisées. L'apprentissage supervisé nécessite un jeu de données étiqueté, ce qui signifie que chaque exemple d'entraînement est associé à une sortie correcte (par exemple, l'image d'un chat étiquetée « chat »). Le modèle apprend à associer les entrées aux sorties afin de réduire l'erreur.
À l'inverse, l'apprentissage non supervisé utilise des données non étiquetées. Aucun mécanisme de rétroaction n'indique au modèle si sa sortie est correcte. Il existe une solution intermédiaire appelée apprentissage semi-supervisé, qui combine une petite quantité de données étiquetées avec une grande quantité de données non étiquetées pour améliorer la précision de l'apprentissage. Cette approche est souvent utilisée lorsque l'étiquetage des données est coûteux ou chronophage.
Applications concrètes#
L'apprentissage non supervisé alimente de nombreuses technologies que nous utilisons au quotidien. Voici deux exemples concrets :
-
Segmentation des clients dans le commerce de détail : les plateformes de commerce électronique analysent des millions d'interactions utilisateur sans catégories prédéfinies. À l'aide d'algorithmes de regroupement, elles identifient des profils d'utilisateurs distincts, tels que les « chasseurs de bonnes affaires du week-end » ou les « passionnés de technologie ». Cela permet de créer des campagnes marketing hautement personnalisées et des systèmes de recommandation, améliorant considérablement l'expérience client.
-
Analyse des séquences génomiques : en bio-informatique, les chercheurs utilisent l'apprentissage non supervisé pour analyser les données génétiques. Les algorithmes regroupent les séquences d'ADN afin de trouver des marqueurs génétiques ou des mutations similaires dans différentes populations. Cela contribue à comprendre les relations évolutives et à identifier les prédispositions génétiques à certaines maladies, sans nécessiter de connaissances préalables sur la fonction de chaque gène.
Exemple de code : regroupement avec Scikit-Learn#
Bien que Ultralytics YOLO26 soit principalement un framework supervisé de détection d'objets, les techniques non supervisées sont souvent utilisées lors des étapes de prétraitement, par exemple pour analyser les distributions des anchor boxes ou regrouper les caractéristiques des jeux de données. Voici un exemple simple utilisant sklearn pour effectuer un regroupement K-Means, une technique fondamentale d'apprentissage non supervisé.
import numpy as np
from sklearn.cluster import KMeans
# Generate synthetic data: 10 points with 2 features each
X = np.array([[1, 2], [1, 4], [1, 0], [10, 2], [10, 4], [10, 0]])
# Initialize KMeans with 2 clusters (k=2)
kmeans = KMeans(n_clusters=2, random_state=0, n_init="auto")
# Fit the model to the data (no labels provided!)
kmeans.fit(X)
# Predict which cluster each point belongs to
print(f"Labels: {kmeans.labels_}")
# Output will group the first 3 points together (0) and the last 3 together (1)Rôle de l'apprentissage non supervisé dans l'apprentissage profond#
L'apprentissage profond (DL) moderne intègre de plus en plus les principes de l'apprentissage non supervisé. Des techniques comme l'apprentissage auto-supervisé (SSL) permettent aux modèles de générer leurs propres signaux de supervision à partir des données. Par exemple, dans le traitement automatique du langage naturel (NLP), des modèles comme GPT-4 sont préentraînés sur de vastes quantités de textes afin de prédire le mot suivant d'une phrase, apprenant ainsi efficacement la structure du langage sans étiquettes explicites.
De même, en vision par ordinateur (CV), les autoencodeurs sont utilisés pour apprendre des représentations efficaces des données. Ces réseaux neuronaux compressent les images en une représentation de dimension inférieure, puis les reconstruisent. Ce processus permet au réseau d'apprendre les caractéristiques les plus saillantes des données visuelles, ce qui est utile pour des tâches comme la réduction du bruit dans les images et la modélisation générative.
Si tu cherches à gérer des jeux de données pour l'entraînement, l'Ultralytics Platform propose des outils permettant de visualiser les distributions des données, ce qui peut aider à identifier les regroupements ou les anomalies avant le début du processus d'entraînement supervisé. Comprendre la structure de tes données grâce à une exploration non supervisée constitue souvent la première étape vers la création de solutions d'IA robustes.









