Token
Apprends comment les tokens constituent les unités fondamentales de l’information en IA. Explore leur rôle dans le NLP, la vision par ordinateur et la détection à vocabulaire ouvert avec YOLO26.
Dans l’architecture sophistiquée de l’intelligence artificielle moderne, un token représente l’unité d’information fondamentale et atomique qu’un modèle traite. Avant qu’un algorithme puisse interpréter une phrase, analyser un script logiciel ou reconnaître des objets dans une image, les données d’entrée brutes doivent être décomposées en ces éléments discrets et standardisés. Cette segmentation constitue une étape essentielle du prétraitement des données, qui transforme des entrées non structurées en un format numérique que les réseaux neuronaux peuvent calculer efficacement. Alors que les humains perçoivent le langage comme un flux continu de pensées ou les images comme des scènes visuelles homogènes, les modèles informatiques ont besoin de ces blocs de construction élémentaires pour effectuer des opérations telles que la reconnaissance de formes et l’analyse sémantique.
Token ou tokenisation#
Pour comprendre les mécanismes de l’apprentissage automatique, il est essentiel de distinguer l’unité de données du processus utilisé pour la créer. Cette distinction évite toute confusion lors de la conception des pipelines de données et de la préparation du matériel d’entraînement sur la plateforme Ultralytics.
- Tokenisation : il s’agit du processus algorithmique (le verbe) qui consiste à diviser les données brutes en éléments. Pour le texte, cela peut impliquer l’utilisation de bibliothèques comme le kit de traitement automatique du langage (NLTK) afin de déterminer où une unité se termine et où une autre commence.
- Token : il s’agit du résultat obtenu (le nom). C’est le fragment de données réel — par exemple un mot, un sous-mot ou une portion d’image — qui est finalement converti en un vecteur numérique appelé plongement.
Les tokens dans différents domaines de l’IA#
La nature d’un token varie considérablement selon la modalité des données traitées, en particulier entre les domaines textuel et visuel.
Tokens textuels en TAL#
Dans le domaine du traitement automatique du langage (NLP), les tokens constituent les entrées des grands modèles de langage (LLMs). Les premières approches correspondaient strictement à des mots entiers, mais les architectures modernes utilisent des algorithmes de sous-mots comme le codage par paires d’octets (BPE). Cette méthode permet aux modèles de gérer les mots rares en les décomposant en syllabes porteuses de sens, ce qui équilibre la taille du vocabulaire et la couverture sémantique. Par exemple, le mot « unhappiness » peut être tokenisé en « un », « happi » et « ness ».
Tokens visuels en vision par ordinateur#
Le concept de tokenisation s’est étendu à la vision par ordinateur avec l’apparition du Transformer de vision (ViT). Contrairement aux réseaux convolutionnels traditionnels, qui traitent les pixels dans des fenêtres glissantes, les Transformers divisent une image en une grille de portions de taille fixe (par exemple, 16x16 pixels). Chaque portion est aplatie et traitée comme un token visuel distinct. Cette approche permet au modèle d’utiliser des mécanismes d’auto-attention pour comprendre les relations entre des parties éloignées d’une image, de manière similaire à l’application initiale des Transformers au texte par Google Research.
Applications concrètes#
Les tokens servent de pont entre les données humaines et l’intelligence machine dans d’innombrables applications.
-
Détection d’objets à vocabulaire ouvert : des modèles avancés comme YOLO-World utilisent une approche multimodale dans laquelle les tokens textuels interagissent avec les caractéristiques visuelles. Tu peux saisir des invites textuelles personnalisées (par exemple, « casque bleu »), que le modèle tokenise et compare aux objets présents dans l’image. Cela permet l’apprentissage en contexte nul, grâce auquel le modèle peut détecter des objets sur lesquels il n’a pas été explicitement entraîné.
-
IA générative : dans les systèmes de génération de texte comme les chatbots, l’IA fonctionne en prédisant la probabilité du token suivant dans une séquence. En sélectionnant de manière itérative le token suivant le plus probable, le système construit des phrases et des paragraphes cohérents, alimentant des outils allant du support client automatisé aux assistants virtuels.
Exemple Python : utiliser des tokens textuels pour la détection#
L’extrait de code suivant montre comment le package ultralytics utilise des tokens textuels pour guider la détection d’objets. Bien que le YOLO26, à la pointe de la technologie, soit recommandé pour l’inférence rapide à classes fixes, l’architecture YOLO-World permet de manière unique aux utilisateurs de définir les classes sous forme de tokens textuels lors de l’exécution.
from ultralytics import YOLO
# Load a pre-trained YOLO-World model capable of understanding text tokens
model = YOLO("yolov8s-world.pt")
# Define specific classes; these text strings are tokenized internally
# The model will look specifically for these "tokens" in the visual data
model.set_classes(["bus", "backpack"])
# Run prediction on an image using the defined tokens
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Display the results showing only the tokenized classes
results[0].show()Comprendre les tokens est essentiel pour évoluer dans l’univers de l’IA générative et de l’analytique avancée. Qu’il s’agisse de permettre à un chatbot de converser avec fluidité ou d’aider un système de vision à distinguer des classes d’objets similaires, les tokens restent la monnaie essentielle de l’intelligence machine utilisée par des frameworks comme PyTorch et TensorFlow.









