Tokenization
Explora cómo la tokenización transforma texto e imágenes sin procesar en datos preparados para la IA. Aprende sobre los métodos de NLP y visión artificial que utilizan modelos como Ultralytics YOLO26.
La tokenización es el proceso algorítmico de dividir un flujo de datos sin procesar —como texto, imágenes o audio— en unidades más pequeñas y manejables denominadas tokens. Esta transformación actúa como un puente fundamental en la canalización de preprocesamiento de datos, ya que convierte una entrada no estructurada en un formato numérico que los sistemas de inteligencia artificial (AI) pueden interpretar. Los ordenadores no pueden comprender de forma inherente el lenguaje humano ni las escenas visuales; necesitan representaciones numéricas para realizar cálculos. Al segmentar los datos en tokens, los ingenieros permiten que las redes neuronales asignen estas unidades a embeddings: representaciones vectoriales que capturan el significado semántico. Sin este paso fundamental, los modelos de aprendizaje automático no podrían identificar patrones, aprender el contexto ni procesar los enormes conjuntos de datos necesarios para el entrenamiento moderno.
Tokenización frente a token#
Aunque estos términos suelen aparecer juntos en los debates sobre aprendizaje profundo, resulta útil distinguir el método del resultado para comprender el flujo de trabajo.
- La tokenización es el proceso (el verbo). Hace referencia al conjunto específico de reglas o algoritmos utilizados para dividir los datos. En el caso del texto, puede implicar el uso de bibliotecas como NLTK o spaCy para determinar dónde termina una unidad y comienza otra.
- El token es el resultado (el sustantivo). Es la unidad individual generada por el proceso, como una palabra, un subtoken, un carácter o un parche de píxeles.
Métodos en distintos ámbitos#
La estrategia de tokenización varía considerablemente en función de la modalidad de los datos e influye en cómo un modelo fundacional percibe el mundo.
Tokenización de texto en NLP#
En el procesamiento del lenguaje natural (NLP), el objetivo es segmentar el texto conservando su significado. Los primeros métodos se basaban en técnicas sencillas, como separar las palabras por espacios o eliminar las palabras vacías. Sin embargo, los modelos de lenguaje grandes (LLMs) modernos utilizan algoritmos de subtokens más sofisticados, como la codificación por pares de bytes (BPE) o WordPiece. Estos algoritmos fusionan iterativamente los pares de caracteres más frecuentes, lo que permite al modelo gestionar palabras poco comunes dividiéndolas en subcomponentes conocidos (por ejemplo, "smartphones" se convierte en "smart" + "phones"). Este enfoque equilibra el tamaño del vocabulario con la capacidad de representar un lenguaje complejo.
Tokenización visual en visión por ordenador#
Tradicionalmente, los modelos de visión por ordenador (CV), como las CNNs, procesaban los píxeles mediante ventanas deslizantes. La introducción del Transformer de visión (ViT) cambió este paradigma al aplicar la tokenización a las imágenes. La imagen se divide en parches de tamaño fijo (por ejemplo, de 16x16 píxeles), que después se aplanan y se proyectan linealmente. Estos "tokens visuales" permiten al modelo utilizar mecanismos de autoatención para aprender relaciones globales en toda la imagen, de forma similar a cómo un Transformer procesa una frase.
Aplicaciones en el mundo real#
La tokenización es el motor silencioso que impulsa muchas aplicaciones de AI utilizadas actualmente en entornos de producción.
-
Detección de objetos con vocabulario abierto: Las arquitecturas avanzadas, como YOLO-World, emplean un enfoque de modelo multimodal. Cuando un usuario introduce una indicación como "persona con un sombrero rojo", el sistema tokeniza este texto y lo asigna al mismo espacio de características que los datos visuales. Esto permite el aprendizaje zero-shot, de modo que el modelo puede detectar objetos con los que no se ha entrenado explícitamente al asociar tokens de texto con características visuales.
-
Arte y diseño generativos: En la generación de texto a imagen, las indicaciones del usuario se tokenizan para guiar el proceso de difusión. El modelo utiliza estos tokens para condicionar la generación y garantizar que la imagen resultante se ajuste a los conceptos semánticos (por ejemplo, "atardecer" o "playa") extraídos durante la fase de tokenización.
Ejemplo en Python: detección basada en tokens#
El siguiente ejemplo muestra cómo el paquete ultralytics utiliza implícitamente la tokenización de texto en el flujo de trabajo de YOLO-World. Al definir clases personalizadas, el modelo tokeniza estas cadenas para buscar objetos específicos de forma dinámica.
from ultralytics import YOLO
# Load a pre-trained YOLO-World model capable of text-based detection
model = YOLO("yolov8s-world.pt")
# Define custom classes; these are tokenized internally to guide the model
# The model will look for visual features matching these text tokens
model.set_classes(["backpack", "bus"])
# Run prediction on an image
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Show results (only detects the tokenized classes defined above)
results[0].show()Impacto en el rendimiento del modelo#
La elección de la estrategia de tokenización afecta directamente a la precisión y a la eficiencia computacional. Una tokenización ineficiente puede provocar errores de "fuera de vocabulario" en NLP o la pérdida de detalles precisos en el análisis de imágenes. Frameworks como PyTorch y TensorFlow proporcionan herramientas flexibles para optimizar este paso. A medida que evolucionan las arquitecturas —como la YOLO26, de última generación—, un procesamiento eficiente de los datos garantiza que los modelos puedan ejecutar inferencias en tiempo real en hardware diverso, desde potentes GPUs en la nube hasta dispositivos periféricos. Los equipos que gestionan estos complejos flujos de trabajo de datos suelen recurrir a Ultralytics Platform para agilizar la anotación de conjuntos de datos, el entrenamiento de modelos y el despliegue.









