Token
Aprende cómo los tokens actúan como unidades fundamentales de información en IA. Explora su función en NLP, visión artificial y detección de vocabulario abierto con YOLO26.
En la sofisticada arquitectura de la inteligencia artificial moderna, un token representa la unidad de información fundamental y atómica que procesa un modelo. Antes de que un algoritmo pueda interpretar una frase, analizar un script de software o reconocer objetos en una imagen, los datos de entrada sin procesar deben descomponerse en estos elementos discretos y estandarizados. Esta segmentación es un paso crucial del preprocesamiento de datos, ya que transforma entradas no estructuradas en un formato numérico que las redes neuronales pueden calcular de forma eficiente. Mientras que los seres humanos perciben el lenguaje como un flujo continuo de pensamientos o las imágenes como escenas visuales uniformes, los modelos computacionales necesitan estos componentes granulares para realizar operaciones como el reconocimiento de patrones y el análisis semántico.
Token frente a tokenización#
Para comprender los mecanismos del aprendizaje automático, es esencial distinguir entre la unidad de datos y el proceso utilizado para crearla. Esta diferenciación evita confusiones al diseñar canalizaciones de datos y preparar material de entrenamiento en la plataforma Ultralytics.
- Tokenización: Es el proceso algorítmico (el verbo) de dividir los datos sin procesar en fragmentos. En el caso del texto, puede implicar el uso de bibliotecas como el Kit de herramientas de lenguaje natural (NLTK) para determinar dónde termina una unidad y comienza otra.
- Token: Es el resultado obtenido (el sustantivo). Se trata del fragmento de datos real —como una palabra, un subsegmento de palabra o un parche de imagen— que finalmente se asigna a un vector numérico conocido como embedding.
Tokens en distintos ámbitos de la IA#
La naturaleza de un token varía considerablemente en función de la modalidad de los datos que se procesan, especialmente entre los ámbitos textual y visual.
Tokens de texto en el PLN#
En el campo del procesamiento del lenguaje natural (NLP), los tokens son las entradas de los modelos de lenguaje de gran tamaño (LLMs). Los primeros enfoques se asociaban estrictamente a palabras completas, pero las arquitecturas modernas utilizan algoritmos de subsegmentos de palabra como la codificación por pares de bytes (BPE). Este método permite a los modelos gestionar palabras poco frecuentes dividiéndolas en sílabas con significado, equilibrando el tamaño del vocabulario con la cobertura semántica. Por ejemplo, la palabra "unhappiness" podría tokenizarse como "un", "happi" y "ness".
Tokens visuales en visión por ordenador#
El concepto de tokenización se ha extendido a la visión por ordenador con la llegada del Transformer de visión (ViT). A diferencia de las redes convolucionales tradicionales, que procesan los píxeles en ventanas deslizantes, los Transformers dividen una imagen en una cuadrícula de parches de tamaño fijo (por ejemplo, de 16x16 píxeles). Cada parche se aplana y se trata como un token visual independiente. Este enfoque permite al modelo utilizar mecanismos de autoatención para comprender la relación entre partes distantes de una imagen, de forma similar a cómo Google Research aplicó originalmente los Transformers al texto.
Aplicaciones en el mundo real#
Los tokens actúan como puente entre los datos humanos y la inteligencia artificial en innumerables aplicaciones.
-
Detección de objetos de vocabulario abierto: Los modelos avanzados, como YOLO-World, utilizan un enfoque multimodal en el que los tokens de texto interactúan con las características visuales. Un usuario puede introducir indicaciones de texto personalizadas (por ejemplo, "casco azul"), que el modelo tokeniza y compara con los objetos de la imagen. Esto permite el aprendizaje sin ejemplos, lo que facilita detectar objetos con los que el modelo no se ha entrenado explícitamente.
-
IA generativa: En sistemas de generación de texto, como los chatbots, la IA funciona prediciendo la probabilidad del siguiente token de una secuencia. Al seleccionar de forma iterativa el token posterior más probable, el sistema construye frases y párrafos coherentes, impulsando herramientas que van desde la atención al cliente automatizada hasta los asistentes virtuales.
Ejemplo de Python: uso de tokens de texto para la detección#
El siguiente fragmento de código muestra cómo el paquete ultralytics utiliza tokens de texto para guiar la detección de objetos. Aunque se recomienda el YOLO26, de última generación, para la inferencia de alta velocidad con clases fijas, la arquitectura YOLO-World permite de forma única que los usuarios definan las clases como tokens de texto durante la ejecución.
from ultralytics import YOLO
# Load a pre-trained YOLO-World model capable of understanding text tokens
model = YOLO("yolov8s-world.pt")
# Define specific classes; these text strings are tokenized internally
# The model will look specifically for these "tokens" in the visual data
model.set_classes(["bus", "backpack"])
# Run prediction on an image using the defined tokens
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Display the results showing only the tokenized classes
results[0].show()Comprender los tokens es fundamental para desenvolverse en el ámbito de la IA generativa y el análisis avanzado. Ya sea para permitir que un chatbot converse con fluidez o para ayudar a un sistema de visión a distinguir entre clases de objetos sutilmente diferentes, los tokens siguen siendo la moneda esencial de la inteligencia artificial utilizada por frameworks como PyTorch y TensorFlow.









