Grokking
Découvre le phénomène de grokking en deep learning. Apprends comment les modèles Ultralytics YOLO26 passent de la mémorisation à la généralisation au cours d’un entraînement prolongé.
Le grokking désigne un phénomène fascinant de l'apprentissage profond dans lequel un réseau neuronal, après avoir été entraîné pendant une période considérablement prolongée — souvent longtemps après avoir semblé avoir surajusté les données d'entraînement — connaît soudainement une nette amélioration de sa précision de validation. Contrairement aux courbes d'apprentissage standard, où les performances s'améliorent progressivement, le grokking implique une « transition de phase » au cours de laquelle le modèle passe de la mémorisation d'exemples spécifiques à la compréhension de motifs généralisables. Ce concept remet en question les principes traditionnels de l'« arrêt précoce », en suggérant que, pour certaines tâches complexes, notamment dans les grands modèles de langage (LLMs) et le raisonnement algorithmique, la persévérance dans l'entraînement est essentielle pour révéler une véritable intelligence.
Les phases du grokking#
Le processus de grokking se déroule généralement en deux étapes distinctes, ce qui peut dérouter les praticiens qui s'appuient sur les métriques standard de suivi des expériences. Au début, le modèle minimise rapidement la perte sur les données d'entraînement, tandis que les performances sur les données de validation restent faibles ou stagnantes. Cela crée un écart de généralisation important, généralement interprété comme du surajustement. Toutefois, si l'entraînement se poursuit bien au-delà de ce stade, le réseau finit par « comprendre » la structure sous-jacente, ce qui fait chuter la perte de validation et bondir la précision.
Des recherches récentes suggèrent que cette généralisation différée se produit parce que le réseau neuronal apprend d'abord des corrélations « rapides » mais fragiles (mémorisation), puis découvre seulement plus tard des caractéristiques « lentes » mais robustes (généralisation). Ce comportement est étroitement lié à la géométrie du paysage de la fonction de perte et à la dynamique de l'optimisation, comme l'ont étudié des chercheurs d'OpenAI et de Google DeepMind dans plusieurs articles.
Grokking et surajustement#
Il est essentiel de distinguer le grokking du surajustement standard, car ils se manifestent de façon similaire au début, mais divergent ensuite dans leurs résultats.
- Surajustement : Le modèle mémorise le bruit présent dans l'ensemble d'entraînement. À mesure que l'entraînement progresse, l'erreur de validation augmente et ne diminue jamais. Les techniques standard de régularisation ou l'arrêt précoce de l'entraînement sont les solutions habituelles.
- Grokking : Le modèle mémorise d'abord les données, puis restructure finalement ses poids de modèle internes pour trouver une solution plus simple et plus générale. L'erreur de validation diminue considérablement après un long plateau.
Comprendre cette distinction est essentiel lors de l'entraînement d'architectures modernes comme Ultralytics YOLO26, pour lesquelles il peut être nécessaire de désactiver les mécanismes d'arrêt précoce afin d'obtenir les meilleures performances possibles sur des jeux de données difficiles et riches en motifs.
Applications concrètes#
Bien qu'il ait d'abord été observé sur de petits jeux de données algorithmiques, le grokking a d'importantes implications pour le développement pratique de l'IA.
- Raisonnement algorithmique : Dans les tâches qui nécessitent une déduction logique ou des opérations mathématiques (comme l'addition modulaire), les modèles ne parviennent souvent pas à généraliser avant d'avoir traversé la phase de grokking. Cela est essentiel pour développer des modèles de raisonnement capables de résoudre des problèmes en plusieurs étapes plutôt que de simplement imiter du texte.
- Entraînement de modèles compacts : Pour créer des modèles efficaces destinés à l'IA en périphérie, les ingénieurs entraînent souvent de petits réseaux pendant de plus longues périodes. Le grokking permet à ces modèles compacts d'apprendre des représentations compressées et efficaces des données, conformément aux objectifs d'efficacité de l'Ultralytics Platform.
Bonnes pratiques et optimisation#
Pour induire le grokking, les chercheurs utilisent souvent des stratégies d'optimisation spécifiques. Des taux d'apprentissage élevés et une décroissance des poids importante (une forme de régularisation L2) sont connus pour favoriser la transition de phase. En outre, la quantité de données joue un rôle ; le grokking est particulièrement visible lorsque la taille du jeu de données se situe juste au seuil de ce que le modèle peut gérer, un concept lié au phénomène de double descente.
Lors de l'utilisation de bibliothèques hautes performances comme PyTorch, il est essentiel de garantir la stabilité numérique pendant ces entraînements prolongés. Le processus nécessite d'importantes ressources de calcul, ce qui rend les pipelines d'entraînement efficaces sur l'Ultralytics Platform précieux pour gérer les expériences de longue durée.
Exemple de code : activer un entraînement prolongé#
Pour permettre un éventuel grokking, il faut souvent contourner les mécanismes standard d'arrêt précoce. L'exemple suivant montre comment configurer un entraînement Ultralytics YOLO avec un nombre d'époques prolongé et une patience désactivée, afin de laisser au modèle le temps de passer de la mémorisation à la généralisation.
from ultralytics import YOLO
# Load the state-of-the-art YOLO26 model
model = YOLO("yolo26n.pt")
# Train for extended epochs to facilitate grokking
# Setting patience=0 disables early stopping, allowing training to continue
# even if validation performance plateaus temporarily.
model.train(data="coco8.yaml", epochs=1000, patience=0, weight_decay=0.01)Concepts associés#
- Double descente : Phénomène associé au cours duquel l'erreur de test diminue, augmente, puis diminue à nouveau lorsque la taille du modèle ou la quantité de données augmente.
- Généralisation : Capacité d'un modèle à fonctionner correctement sur des données inédites, ce qui constitue l'objectif ultime du processus de grokking.
- Algorithmes d'optimisation : Méthodes (comme SGD ou Adam) utilisées pour parcourir le paysage de la perte et faciliter la transition de phase.









