Tokenization
Entdecke, wie Tokenisierung Rohtext und Bilder in KI-taugliche Daten umwandelt. Erfahre mehr über Verfahren aus NLP und Computer Vision, die von Modellen wie Ultralytics YOLO26 verwendet werden.
Tokenisierung ist der algorithmische Prozess, bei dem ein Strom unverarbeiteter Daten – etwa Text, Bilder oder Audio – in kleinere, handhabbare Einheiten zerlegt wird, die als Token bezeichnet werden. Diese Umwandlung bildet eine entscheidende Brücke in der Pipeline zur Datenvorverarbeitung, indem sie unstrukturierte Eingaben in ein numerisches Format überführt, das Systeme der künstlichen Intelligenz (AI) interpretieren können. Computer können menschliche Sprache oder visuelle Szenen nicht von sich aus verstehen; für Berechnungen benötigen sie numerische Repräsentationen. Durch die Aufteilung von Daten in Token ermöglichen Ingenieure neuronalen Netzen, diese Einheiten Einbettungen zuzuordnen – Vektorrepräsentationen, die semantische Bedeutung erfassen. Ohne diesen grundlegenden Schritt wären Modelle des maschinellen Lernens nicht in der Lage, Muster zu erkennen, Kontext zu erlernen oder die umfangreichen Datensätze zu verarbeiten, die für modernes Training erforderlich sind.
Tokenisierung vs. Token#
Obwohl die Begriffe in Diskussionen über Deep Learning häufig gemeinsam vorkommen, ist es hilfreich, Methode und Ergebnis zu unterscheiden, um den Ablauf zu verstehen.
- Tokenisierung ist der Prozess (das Verb). Damit ist die konkrete Zusammenstellung von Regeln oder Algorithmen gemeint, die zum Aufteilen der Daten verwendet wird. Bei Text kann dies den Einsatz von Bibliotheken wie NLTK oder spaCy umfassen, um zu bestimmen, wo eine Einheit endet und die nächste beginnt.
- Token ist das Ergebnis (das Substantiv). Dabei handelt es sich um die einzelne Einheit, die durch den Prozess erzeugt wird, etwa ein einzelnes Wort, ein Teilwort, ein Zeichen oder ein Bildausschnitt.
Methoden in verschiedenen Anwendungsbereichen#
Die Strategie zur Tokenisierung unterscheidet sich je nach Datenmodalität erheblich und beeinflusst, wie ein Basismodell die Welt wahrnimmt.
Tokenisierung von Text in NLP#
Beim Verarbeiten natürlicher Sprache (NLP) besteht das Ziel darin, Text unter Beibehaltung seiner Bedeutung zu segmentieren. Frühe Methoden beruhten auf einfachen Techniken wie der Trennung von Wörtern anhand von Leerzeichen oder dem Entfernen von Stoppwörtern. Moderne große Sprachmodelle (LLMs) verwenden jedoch anspruchsvollere Teilwortalgorithmen wie Byte-Pair-Kodierung (BPE) oder WordPiece. Diese Algorithmen führen die häufigsten Zeichenpaare schrittweise zusammen, sodass das Modell seltene Wörter verarbeiten kann, indem es sie in bekannte Teilkomponenten zerlegt (z. B. wird „smartphones“ zu „smart“ + „phones“). Dieser Ansatz schafft ein Gleichgewicht zwischen der Größe des Vokabulars und der Fähigkeit, komplexe Sprache darzustellen.
Visuelle Tokenisierung in Computer Vision#
Traditionell verarbeiteten Computer-Vision-Modelle (CV) wie CNNs Pixel mithilfe von Gleitfenstern. Die Einführung des Vision Transformer (ViT) veränderte dieses Paradigma, indem Tokenisierung auf Bilder angewendet wurde. Das Bild wird in Bildausschnitte fester Größe (z. B. 16x16 Pixel) aufgeteilt, die anschließend abgeflacht und linear projiziert werden. Diese „visuellen Token“ ermöglichen es dem Modell, Selbstaufmerksamkeitsmechanismen zu nutzen, um globale Beziehungen im gesamten Bild zu erlernen – ähnlich wie ein Transformer einen Satz verarbeitet.
Anwendungen in der Praxis#
Tokenisierung ist der unauffällige Motor hinter vielen heute in Produktionsumgebungen eingesetzten Anwendungen der künstlichen Intelligenz.
-
Objekterkennung mit offenem Vokabular: Fortschrittliche Architekturen wie YOLO-World nutzen einen Ansatz mit einem multimodalen Modell. Gibt ein Benutzer eine Eingabe wie „Person mit rotem Hut“ ein, tokenisiert das System diesen Text und ordnet ihn demselben Merkmalsraum wie die visuellen Daten zu. Dies ermöglicht Zero-Shot-Lernen, sodass das Modell Objekte erkennen kann, auf die es nicht ausdrücklich trainiert wurde, indem es Text-Token visuellen Merkmalen zuordnet.
-
Generative Kunst und Design: Bei der Text-zu-Bild-Generierung werden Benutzereingaben tokenisiert, um den Diffusionsprozess zu steuern. Das Modell verwendet diese Token zur Konditionierung der Generierung und stellt so sicher, dass das resultierende Bild mit den semantischen Konzepten (z. B. „Sonnenuntergang“, „Strand“) übereinstimmt, die während der Tokenisierungsphase extrahiert wurden.
Python-Beispiel: Token-basierte Erkennung#
Das folgende Beispiel zeigt, wie das Paket ultralytics die Tokenisierung von Text innerhalb des YOLO-World-Ablaufs implizit verwendet. Durch die Definition benutzerdefinierter Klassen tokenisiert das Modell diese Zeichenfolgen, um dynamisch nach bestimmten Objekten zu suchen.
from ultralytics import YOLO
# Load a pre-trained YOLO-World model capable of text-based detection
model = YOLO("yolov8s-world.pt")
# Define custom classes; these are tokenized internally to guide the model
# The model will look for visual features matching these text tokens
model.set_classes(["backpack", "bus"])
# Run prediction on an image
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Show results (only detects the tokenized classes defined above)
results[0].show()Auswirkungen auf die Modellleistung#
Die Wahl der Tokenisierungsstrategie wirkt sich unmittelbar auf die Genauigkeit und die Recheneffizienz aus. Ineffiziente Tokenisierung kann in NLP zu Fehlern durch Wörter außerhalb des Vokabulars oder bei der Bildanalyse zum Verlust feingranularer Details führen. Frameworks wie PyTorch und TensorFlow bieten flexible Werkzeuge zur Optimierung dieses Schritts. Mit der Weiterentwicklung von Architekturen wie dem hochmodernen YOLO26 stellt eine effiziente Datenverarbeitung sicher, dass Modelle auf unterschiedlichster Hardware Echtzeit-Inferenz ausführen können – von leistungsstarken Cloud-GPUs bis hin zu Edge-Geräten. Teams, die diese komplexen Datenabläufe verwalten, nutzen häufig die Ultralytics Platform, um die Annotation von Datensätzen, das Training von Modellen und die Bereitstellung zu optimieren.









