Token
Erfahre, wie Tokens als grundlegende Informationseinheiten in der KI dienen. Entdecke ihre Rolle in NLP, Computer Vision und der Erkennung mit offenem Vokabular mit YOLO26.
In der anspruchsvollen Architektur moderner künstlicher Intelligenz bezeichnet ein Token die grundlegende, atomare Informationseinheit, die ein Modell verarbeitet. Bevor ein Algorithmus einen Satz interpretieren, ein Softwareskript analysieren oder Objekte in einem Bild erkennen kann, müssen die Rohdaten in diese diskreten, standardisierten Elemente zerlegt werden. Diese Segmentierung ist ein entscheidender Schritt der Datenvorverarbeitung, bei dem unstrukturierte Eingaben in ein numerisches Format umgewandelt werden, das neuronale Netze effizient verarbeiten können. Während Menschen Sprache als kontinuierlichen Gedankenstrom oder Bilder als nahtlose visuelle Szenen wahrnehmen, benötigen Rechenmodelle diese kleinteiligen Bausteine für Vorgänge wie Mustererkennung und semantische Analyse.
Token vs. Tokenisierung#
Um die Funktionsweise des maschinellen Lernens zu verstehen, ist es wichtig, zwischen der Dateneinheit und dem zu ihrer Erstellung verwendeten Prozess zu unterscheiden. Diese Unterscheidung verhindert Verwirrung beim Entwurf von Datenpipelines und bei der Vorbereitung von Trainingsmaterial für die Ultralytics Platform.
- Tokenisierung: Dabei handelt es sich um den algorithmischen Prozess (das Verb), bei dem Rohdaten in Teilstücke zerlegt werden. Bei Text kann dies den Einsatz von Bibliotheken wie dem Toolkit für natürliche Sprachverarbeitung (NLTK) umfassen, um zu bestimmen, wo eine Einheit endet und die nächste beginnt.
- Token: Dies ist das daraus entstehende Ergebnis (das Substantiv). Es handelt sich um den tatsächlichen Datenabschnitt – etwa ein Wort, ein Teilwort oder einen Bildausschnitt –, der schließlich einem numerischen Vektor zugeordnet wird, der als Embedding bekannt ist.
Tokens in verschiedenen KI-Bereichen#
Die Beschaffenheit eines Tokens variiert erheblich abhängig von der Modalität der verarbeiteten Daten, insbesondere zwischen textuellen und visuellen Bereichen.
Text-Tokens in NLP#
Im Bereich der Verarbeitung natürlicher Sprache (NLP) sind Tokens die Eingaben für große Sprachmodelle (LLMs). Frühe Ansätze ordneten Tokens strikt ganzen Wörtern zu, moderne Architekturen verwenden jedoch Teilwortalgorithmen wie die Byte-Paar-Kodierung (BPE). Mit dieser Methode können Modelle seltene Wörter verarbeiten, indem sie sie in bedeutungstragende Silben zerlegen und so den Umfang des Vokabulars mit der semantischen Abdeckung ausbalancieren. Beispielsweise könnte das Wort „unhappiness“ in „un“, „happi“ und „ness“ tokenisiert werden.
Visuelle Tokens in der Computer Vision#
Das Konzept der Tokenisierung hat sich mit dem Aufkommen des Vision-Transformers (ViT) auf die Computer Vision ausgeweitet. Im Gegensatz zu herkömmlichen Faltungsnetzen, die Pixel in gleitenden Fenstern verarbeiten, teilen Transformer ein Bild in ein Raster aus Bildausschnitten fester Größe auf (z. B. 16x16 Pixel). Jeder Ausschnitt wird abgeflacht und als eigenständiges visuelles Token behandelt. Dieser Ansatz ermöglicht es dem Modell, mithilfe von Selbstaufmerksamkeitsmechanismen die Beziehung zwischen weit voneinander entfernten Bildbereichen zu verstehen – ähnlich wie Google Research Transformer ursprünglich auf Texte anwendete.
Anwendungen in der Praxis#
Tokens fungieren in unzähligen Anwendungen als Brücke zwischen menschlichen Daten und maschineller Intelligenz.
-
Objekterkennung mit offenem Vokabular: Fortschrittliche Modelle wie YOLO-World verwenden einen multimodalen Ansatz, bei dem Text-Tokens mit visuellen Merkmalen interagieren. Du kannst benutzerdefinierte Textvorgaben eingeben (z. B. „blue helmet“), die das Modell tokenisiert und mit Objekten im Bild abgleicht. Dadurch wird Zero-Shot-Lernen ermöglicht, sodass Objekte erkannt werden können, auf die das Modell nicht ausdrücklich trainiert wurde.
-
Generative KI: In Systemen zur Texterzeugung wie Chatbots arbeitet die KI, indem sie die Wahrscheinlichkeit des nächsten Tokens in einer Sequenz vorhersagt. Durch die schrittweise Auswahl des wahrscheinlichsten nachfolgenden Tokens erstellt das System zusammenhängende Sätze und Absätze und ermöglicht damit Anwendungen von automatisiertem Kundensupport bis hin zu virtuellen Assistenten.
Python-Beispiel: Text-Tokens für die Erkennung verwenden#
Das folgende Codebeispiel zeigt, wie das Paket ultralytics Text-Tokens zur Steuerung der Objekterkennung verwendet. Während das hochmoderne YOLO26 für schnelle Inferenz mit festen Klassen empfohlen wird, ermöglicht die YOLO-World-Architektur es Benutzern auf einzigartige Weise, Klassen zur Laufzeit als Text-Tokens zu definieren.
from ultralytics import YOLO
# Load a pre-trained YOLO-World model capable of understanding text tokens
model = YOLO("yolov8s-world.pt")
# Define specific classes; these text strings are tokenized internally
# The model will look specifically for these "tokens" in the visual data
model.set_classes(["bus", "backpack"])
# Run prediction on an image using the defined tokens
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Display the results showing only the tokenized classes
results[0].show()Das Verständnis von Tokens ist grundlegend, um sich in der Welt der generativen KI und der fortgeschrittenen Analytik zurechtzufinden. Ob sie einem Chatbot ermöglichen, sich fließend zu unterhalten, oder einem Bildverarbeitungssystem helfen, subtile Objektklassen zu unterscheiden – Tokens bleiben die wesentliche Währung maschineller Intelligenz, die von Frameworks wie PyTorch und TensorFlow verwendet wird.









