Tokenization
Explora cómo la tokenización transforma texto e imágenes sin procesar en datos listos para la IA. Aprende sobre los métodos de NLP y visión artificial utilizados por modelos como Ultralytics YOLO26.
La tokenización es el proceso algorítmico de descomponer un flujo de datos sin procesar —como texto, imágenes o audio— en unidades más pequeñas y manejables llamadas tokens. Esta transformación actúa como un puente fundamental en el proceso de data preprocessing, convirtiendo la entrada no estructurada en un formato numérico que los sistemas de artificial intelligence (AI) pueden interpretar. Los ordenadores no pueden entender de forma intrínseca el lenguaje humano ni las escenas visuales; necesitan representaciones numéricas para realizar cálculos. Al segmentar los datos en tokens, permites que las neural networks asignen estas unidades a embeddings —representaciones vectoriales que capturan significado semántico. Sin este paso fundamental, los modelos de machine learning no podrían identificar patrones, aprender contexto o procesar los vastos datasets necesarios para el entrenamiento moderno.
Tokenización vs. Token#
Aunque los términos se escuchan a menudo juntos en debates sobre deep learning, resulta útil distinguir el método del resultado para comprender el flujo de trabajo.
- Tokenization es el proceso (el verbo). Se refiere al conjunto específico de reglas o algoritmos utilizados para dividir los datos. Para el texto, esto puede implicar el uso de bibliotecas como NLTK o spaCy para determinar dónde termina una unidad y empieza otra.
- Token es el resultado (el sustantivo). Es la unidad individual generada por el proceso, como una sola palabra, un subtoken, un carácter o un parche de píxeles.
Métodos en diferentes dominios#
La estrategia de tokenización varía significativamente según la modalidad de los datos, influyendo en cómo un foundation model percibe el mundo.
Tokenización de texto en NLP#
En Natural Language Processing (NLP), el objetivo es segmentar el texto preservando el significado. Los primeros métodos se basaban en técnicas sencillas como separar palabras por espacios o eliminar stop words. Sin embargo, los Large Language Models (LLMs) modernos utilizan algoritmos de subtokens más sofisticados, como Byte Pair Encoding (BPE) o WordPiece. Estos algoritmos combinan de forma iterativa los pares de caracteres más frecuentes, permitiendo al modelo manejar palabras poco comunes dividiéndolas en subcomponentes familiares (por ejemplo, "smartphones" pasa a ser "smart" + "phones"). Este enfoque equilibra el tamaño del vocabulario con la capacidad de representar lenguaje complejo.
Tokenización visual en visión artificial#
Tradicionalmente, los modelos de computer vision (CV) como las CNN procesaban píxeles utilizando ventanas deslizantes. La introducción del Vision Transformer (ViT) cambió este paradigma al aplicar la tokenización a las imágenes. La imagen se divide en parches de tamaño fijo (por ejemplo, 16x16 píxeles), los cuales se aplanan y proyectan linealmente. Estos "tokens visuales" permiten al modelo utilizar mecanismos de self-attention para aprender relaciones globales en toda la imagen, de manera similar a como un Transformer procesa una frase.
Aplicaciones en el mundo real#
La tokenización es el motor silencioso detrás de muchas aplicaciones de IA utilizadas en entornos de producción hoy en día.
-
Detección de objetos de vocabulario abierto: Las arquitecturas avanzadas como YOLO-World emplean un enfoque de multi-modal model. Cuando introduces una orden como "persona con gorro rojo", el sistema tokeniza este texto y lo asigna al mismo espacio de características que los datos visuales. Esto permite el zero-shot learning, permitiendo que el modelo detecte objetos para los que no ha sido entrenado explícitamente al emparejar tokens de texto con características visuales.
-
Arte y diseño generativo: En la generación de text-to-image, las órdenes del usuario se tokenizan para guiar el proceso de difusión. El modelo utiliza estos tokens para condicionar la generación, asegurando que la imagen resultante se alinee con los conceptos semánticos (por ejemplo, "puesta de sol", "playa") extraídos durante la fase de tokenización.
Ejemplo en Python: Detección basada en tokens#
El siguiente ejemplo demuestra cómo el paquete ultralytics utiliza la tokenización de texto de forma implícita dentro del flujo de trabajo de YOLO-World. Al definir clases personalizadas, el modelo tokeniza estas cadenas de texto para buscar objetos específicos de manera dinámica.
from ultralytics import YOLO
# Load a pre-trained YOLO-World model capable of text-based detection
model = YOLO("yolov8s-world.pt")
# Define custom classes; these are tokenized internally to guide the model
# The model will look for visual features matching these text tokens
model.set_classes(["backpack", "bus"])
# Run prediction on an image
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Show results (only detects the tokenized classes defined above)
results[0].show()Impacto en el rendimiento del modelo#
The choice of tokenization strategy directly impacts accuracy and computational efficiency. Inefficient tokenization can lead to "out-of-vocabulary" errors in NLP or the loss of fine-grained details in image analysis. Frameworks like PyTorch and TensorFlow provide flexible tools to optimize this step. As architectures evolve—such as the state-of-the-art YOLO26—efficient data processing ensures that models can run real-time inference on diverse hardware, from powerful cloud GPUs to edge devices. Teams managing these complex data workflows often rely on the Ultralytics Platform to streamline dataset annotation, model training, and deployment.






